Macaron-V1:MoLで個人の経験をLoRAへ圧縮するオープンソースCoding大規模モデル
心洲科技 Mind Lab がオープンソース化した Macaron-V1(Venti/Coding-Venti/Tall の3段階)。GLM-5.2 744B + 1B LoRA エキスパート4つからなる Mixture-of-LoRA アーキテクチャで、無料 hosted API と UI4A プラグインも提供します。


Macaron-V1:MoLで個人の経験をLoRAへ圧縮するオープンソースCoding大規模モデル
心洲科技 Mind Lab がオープンソース化した Macaron-V1(Venti/Coding-Venti/Tall の3段階)。GLM-5.2 744B + 1B LoRA エキスパート4つからなる Mixture-of-LoRA アーキテクチャで、無料 hosted API と UI4A プラグインも提供します。
「大きくする」が AI モデルの唯一の進化方向ではなくなったいま、心洲科技 Mind Lab は1つの具体的な答えを出しました:Macaron-V1。GLM-5.2 744B のベースを土台に、1B の LoRA エキスパート4つを組み合わせたオープンソースの Coding 大規模モデルです。開発者は今日から触れられます。重みは HuggingFace で完全オープンソース、無料の hosted API が用意され、インストールするだけで使える UI4A 可視化プラグインまであります。「個人のエンジニアリング経験を記憶として LoRA に圧縮する」オープンソースモデルを探しているなら、この記事で、それが何でありどう使うのかをつかんでください。
Macaron-V1 とは
Macaron-V1 は心洲科技(Mind Lab)がオープンソース化したモデルシリーズです。核心の売りはパラメータをさらに積むことではなく、「経験」をホットスワップ可能な小さなモジュールとして扱う点にあります。設計全体は Mixture-of-LoRA(MoL) と呼ばれます:固定された大きなベース(GLM-5.2 744B、Qwen3.6 35B バリアントもあり)に、1B クラスの LoRA エキスパート4つを重ね、推論時に必要に応じて組み合わせるのです。
この発想は「個人性 / ドメイン知識 / コーディングの癖」を軽量な LoRA の中へ押し込みます。作者はこれを LoRA-as-memory(経験学習) と呼びます。何兆パラメータ級の巨大モデルを再訓練するのではなく、「経験」を小さなモジュールの形で存在させ、更新させていくやり方です。Macaron(マカロン)の命名もここから来ています。大きなベースの間に、何層もの風味のクリームを挟む。
モデルのラインナップ(HuggingFace で公開済み)
重み一式の集合はこちら:https://huggingface.co/collections/mindlab-research/macaron-v1
| バリアント | パラメータ量 | 用途 |
|---|---|---|
| Macaron-V1-Preview-749B | 754B | プレビュー版ベース。テキスト生成 |
| Macaron-V1-Preview-744B-Merged | 754B | マージ済みのプレビュー版ベース |
| Macaron-V1-Venti | 753B | 汎用の Venti 段階。全能力 |
| Macaron-V1-Coding-Venti | 753B | Coding 専用 Venti。開発者の第一候補 |
| Macaron-V1-Tall | 36B | 軽量サイズ。Qwen3.6 35B バリアント基盤で、ローカル実行も可 |
コーディング用途の開発者は迷わず Coding-Venti へ。ローカル実行や低レイテンシが目的なら Tall を選びます。
3つの使い方
ルート1:無料の hosted API を直接呼ぶ(最速)
ローカルデプロイ不要で、最速の体験ルートは公式の hosted endpoint です:
OpenAI API 形式と互換があるので、既存の SDK からそのまま接続できます。
ルート2:重みをローカル / セルフホストで動かす
HuggingFace から重みを引き出し、GLM-5.2 / Qwen3 の標準的な推論スタックで走らせます(vLLM、SGLang、transformers のどれでも可)。Venti 段階には 744B を載せきれる推論ハードウェアが必要です。軽量なシーンなら Tall(36B)で足ります。
ルート3:UI4A 可視化プラグインを入れる(オープンソース)
UI4A は Macaron チームの可視化プラグインプロジェクトで、次の場所でオープンソース化されています:
git clone https://github.com/MindLab-Research/macaron-artifactsリポジトリ:https://github.com/MindLab-Research/macaron-artifacts
UI4A はプラグインの manifest、WebUI runtime、GenUI ツールを提供し、Macaron を Claude Code、Codex、Kimi Code といった主要な Agent / Coding 環境の上で走らせられます。既存の Agent ワークフローの中で、「経験をホットスワップできる」モデルバックエンドへ差し替える、というイメージです。
なぜ MoL という道が開発者に注目されるのか
主流大規模モデルの進化の物語は「パラメータが大きいほど強い」ですが、これは開発者にとって2つのことを意味します。1つはデプロイのハードルがどんどん上がること、もう1つはモデルがあなたのプロジェクトの文脈を「覚えて」くれないことです。Macaron は別の道を選びました:
- ベースは安定、エキスパートは交換可:GLM-5.2 744B を安定したベースとし、1B の LoRA エキスパート4つは独立に訓練・独立に差し替え可能です。
- 経験はモジュールの形で存在:あなたのコードスタイル、プロジェクトの規約、呼び出しの作法は、理論上ひとつの LoRA モジュールへ圧縮でき、prompt に押し込んだり全パラメータモデルを再訓練したりする必要がありません。
- オープンウェイトで監査可能:すべての重みは HuggingFace で公開されており、ブラックボックスの API ではありません。
このアーキテクチャが最も魅力的に映るのは、自分のコードベース / ナレッジベースを持つ開発者チームです。プロジェクトごとに専用の LoRA を訓練し、必要に応じてマウントする、という発想がそのまま成り立ちます。
活用シーン
- 個人開発者の Coding Copilot:hosted API かローカルの Tall 段階で IDE に接続。無料で、カスタマイズ可能です。
- チームレベルのコードスタイル / プロジェクト規約の記憶:チームの規約を LoRA モジュールへ圧縮し、メンバー全員が同じ「経験の記憶」を共有する。
- Agent ワークフローのバックエンド:UI4A 経由で Claude Code / Codex / Kimi Code に接続し、ホットスワップ可能なモデル層にする。
- MoL アーキテクチャの実験:研究者や熟練の LLM エンジニアは、オープンウェイトを土台に LoRA エキスパートの組み合わせ、経験学習、モジュール化推論を研究できます。
おわりに
Macaron-V1 は、また一つの「パラメータが大きく、ベンチも高い」オープンソース大規模モデルではなく、「経験をホットスワップ可能な記憶として扱う」試みのエンジニアリング実装です。開発者が今日手に取れる実物は3つあります。HuggingFace の完全オープンウェイト(5段階)、無料の hosted API(中国国内 / 海外の2線)、UI4A 可視化プラグイン。Coding をやる、Agent をやる、あるいは LoRA エキスパート組み合わせのアーキテクチャに興味があるなら、Coding-Venti を一度走らせてみてください。アーキテクチャ解説を10本読むより、そのほうがずっと直接的です。
公式リソース:
- モデルコレクション:https://huggingface.co/collections/mindlab-research/macaron-v1
- UI4A プラグイン:https://github.com/MindLab-Research/macaron-artifacts
- hosted API(海外):https://mint.macaron.im
- hosted API(中国国内):https://mintcn.macaron.xin