Macaron-V1:MoLで個人の経験をLoRAへ圧縮するオープンソースCoding大規模モデル

·Toolin 編集部

心洲科技 Mind Lab がオープンソース化した Macaron-V1(Venti/Coding-Venti/Tall の3段階)。GLM-5.2 744B + 1B LoRA エキスパート4つからなる Mixture-of-LoRA アーキテクチャで、無料 hosted API と UI4A プラグインも提供します。

Macaron-V1:MoLで個人の経験をLoRAへ圧縮するオープンソースCoding大規模モデル

「大きくする」が AI モデルの唯一の進化方向ではなくなったいま、心洲科技 Mind Lab は1つの具体的な答えを出しました:Macaron-V1。GLM-5.2 744B のベースを土台に、1B の LoRA エキスパート4つを組み合わせたオープンソースの Coding 大規模モデルです。開発者は今日から触れられます。重みは HuggingFace で完全オープンソース、無料の hosted API が用意され、インストールするだけで使える UI4A 可視化プラグインまであります。「個人のエンジニアリング経験を記憶として LoRA に圧縮する」オープンソースモデルを探しているなら、この記事で、それが何でありどう使うのかをつかんでください。

Macaron-V1 とは

Macaron-V1 は心洲科技(Mind Lab)がオープンソース化したモデルシリーズです。核心の売りはパラメータをさらに積むことではなく、「経験」をホットスワップ可能な小さなモジュールとして扱う点にあります。設計全体は Mixture-of-LoRA(MoL) と呼ばれます:固定された大きなベース(GLM-5.2 744B、Qwen3.6 35B バリアントもあり)に、1B クラスの LoRA エキスパート4つを重ね、推論時に必要に応じて組み合わせるのです。

この発想は「個人性 / ドメイン知識 / コーディングの癖」を軽量な LoRA の中へ押し込みます。作者はこれを LoRA-as-memory(経験学習) と呼びます。何兆パラメータ級の巨大モデルを再訓練するのではなく、「経験」を小さなモジュールの形で存在させ、更新させていくやり方です。Macaron(マカロン)の命名もここから来ています。大きなベースの間に、何層もの風味のクリームを挟む。

モデルのラインナップ(HuggingFace で公開済み)

重み一式の集合はこちら:https://huggingface.co/collections/mindlab-research/macaron-v1

バリアントパラメータ量用途
Macaron-V1-Preview-749B754Bプレビュー版ベース。テキスト生成
Macaron-V1-Preview-744B-Merged754Bマージ済みのプレビュー版ベース
Macaron-V1-Venti753B汎用の Venti 段階。全能力
Macaron-V1-Coding-Venti753BCoding 専用 Venti。開発者の第一候補
Macaron-V1-Tall36B軽量サイズ。Qwen3.6 35B バリアント基盤で、ローカル実行も可

コーディング用途の開発者は迷わず Coding-Venti へ。ローカル実行や低レイテンシが目的なら Tall を選びます。

3つの使い方

ルート1:無料の hosted API を直接呼ぶ(最速)

ローカルデプロイ不要で、最速の体験ルートは公式の hosted endpoint です:

OpenAI API 形式と互換があるので、既存の SDK からそのまま接続できます。

ルート2:重みをローカル / セルフホストで動かす

HuggingFace から重みを引き出し、GLM-5.2 / Qwen3 の標準的な推論スタックで走らせます(vLLM、SGLang、transformers のどれでも可)。Venti 段階には 744B を載せきれる推論ハードウェアが必要です。軽量なシーンなら Tall(36B)で足ります。

ルート3:UI4A 可視化プラグインを入れる(オープンソース)

UI4A は Macaron チームの可視化プラグインプロジェクトで、次の場所でオープンソース化されています:

git clone https://github.com/MindLab-Research/macaron-artifacts

リポジトリ:https://github.com/MindLab-Research/macaron-artifacts

UI4A はプラグインの manifest、WebUI runtime、GenUI ツールを提供し、Macaron を Claude Code、Codex、Kimi Code といった主要な Agent / Coding 環境の上で走らせられます。既存の Agent ワークフローの中で、「経験をホットスワップできる」モデルバックエンドへ差し替える、というイメージです。

なぜ MoL という道が開発者に注目されるのか

主流大規模モデルの進化の物語は「パラメータが大きいほど強い」ですが、これは開発者にとって2つのことを意味します。1つはデプロイのハードルがどんどん上がること、もう1つはモデルがあなたのプロジェクトの文脈を「覚えて」くれないことです。Macaron は別の道を選びました:

  • ベースは安定、エキスパートは交換可:GLM-5.2 744B を安定したベースとし、1B の LoRA エキスパート4つは独立に訓練・独立に差し替え可能です。
  • 経験はモジュールの形で存在:あなたのコードスタイル、プロジェクトの規約、呼び出しの作法は、理論上ひとつの LoRA モジュールへ圧縮でき、prompt に押し込んだり全パラメータモデルを再訓練したりする必要がありません。
  • オープンウェイトで監査可能:すべての重みは HuggingFace で公開されており、ブラックボックスの API ではありません。

このアーキテクチャが最も魅力的に映るのは、自分のコードベース / ナレッジベースを持つ開発者チームです。プロジェクトごとに専用の LoRA を訓練し、必要に応じてマウントする、という発想がそのまま成り立ちます。

活用シーン

  • 個人開発者の Coding Copilot:hosted API かローカルの Tall 段階で IDE に接続。無料で、カスタマイズ可能です。
  • チームレベルのコードスタイル / プロジェクト規約の記憶:チームの規約を LoRA モジュールへ圧縮し、メンバー全員が同じ「経験の記憶」を共有する。
  • Agent ワークフローのバックエンド:UI4A 経由で Claude Code / Codex / Kimi Code に接続し、ホットスワップ可能なモデル層にする。
  • MoL アーキテクチャの実験:研究者や熟練の LLM エンジニアは、オープンウェイトを土台に LoRA エキスパートの組み合わせ、経験学習、モジュール化推論を研究できます。

おわりに

Macaron-V1 は、また一つの「パラメータが大きく、ベンチも高い」オープンソース大規模モデルではなく、「経験をホットスワップ可能な記憶として扱う」試みのエンジニアリング実装です。開発者が今日手に取れる実物は3つあります。HuggingFace の完全オープンウェイト(5段階)、無料の hosted API(中国国内 / 海外の2線)、UI4A 可視化プラグイン。Coding をやる、Agent をやる、あるいは LoRA エキスパート組み合わせのアーキテクチャに興味があるなら、Coding-Venti を一度走らせてみてください。アーキテクチャ解説を10本読むより、そのほうがずっと直接的です。

公式リソース: