心洲科技 Mind Lab 开源 Macaron-V1(Venti/Coding-Venti/Tall 三档),基于 GLM-5.2 744B + 四个 1B LoRA 专家的 Mixture-of-LoRA 架构,提供免费 hosted API 和 UI4A 插件。


心洲科技 Mind Lab 开源 Macaron-V1(Venti/Coding-Venti/Tall 三档),基于 GLM-5.2 744B + 四个 1B LoRA 专家的 Mixture-of-LoRA 架构,提供免费 hosted API 和 UI4A 插件。
阿里云推出移动端 AI Agent 产品 JVS Claw,基于 OpenClaw 架构,配备独立云电脑环境,支持手机遥控完成编程、信息整理等复杂任务
当「变大」不再是 AI 模型唯一的进化方向,心洲科技 Mind Lab 给出了一个具体答案:Macaron-V1——一套基于 GLM-5.2 744B 底座、用四个 1B LoRA 专家组合起来的开源 Coding 大模型。它面向开发者今天就能上手:权重在 HuggingFace 全开源、提供免费 hosted API、还有可直接装的 UI4A 可视化插件。如果你正在找一个"把个性化工程经验压进 LoRA 当作记忆"的开源模型,这篇带你搞清楚它是什么、怎么用。
Macaron-V1 是心洲科技(Mind Lab)开源的模型系列,核心卖点不是把参数堆到更大,而是把"经验"作为可热插拔的小模块。整套设计叫 Mixture-of-LoRA(MoL):一个固定的大底座(GLM-5.2 744B,另有 Qwen3.6 35B 变体),叠加四个 1B 量级的 LoRA 专家,再在推理时按需组合。
这个思路把"个性化 / 领域知识 / 编码习惯"塞进轻量的 LoRA 里,作者称之为 LoRA-as-memory(经验学习)——不是再训一个万亿参数的巨型模型,而是让"经验"以小模块形式存在和更新。Macaron(马卡龙)的命名也由此而来:大底座夹着几层风味夹心。
完整权重集合在:https://huggingface.co/collections/mindlab-research/macaron-v1
| 变体 | 参数量 | 用途 |
|---|---|---|
| Macaron-V1-Preview-749B | 754B | 预览版基座,文本生成 |
| Macaron-V1-Preview-744B-Merged | 754B | 已合并的预览版基座 |
| Macaron-V1-Venti | 753B | 通用 Venti 档,全能力 |
| Macaron-V1-Coding-Venti | 753B | Coding 专用 Venti,开发者首选 |
| Macaron-V1-Tall | 36B | 小杯档,基于 Qwen3.6 35B 变体,轻量可本地 |
做编码任务的开发者直接上 Coding-Venti;想本地跑或低延迟的选 Tall。
不用本地部署,最快的体验路径是官方 hosted endpoint:
兼容 OpenAI API 格式,可以直接用现有 SDK 接入。
把 HuggingFace 权重拉下来,按 GLM-5.2 / Qwen3 的标准推理栈跑(vLLM、SGLang、transformers 均可)。Venti 档需要能装下 744B 的推理硬件;轻量场景跑 Tall(36B)即可。
UI4A 是 Macaron 团队的可视化插件项目,开源在:
git clone https://github.com/MindLab-Research/macaron-artifacts仓库地址:https://github.com/MindLab-Research/macaron-artifacts
UI4A 提供插件 manifest、WebUI runtime 和 GenUI 工具,可以让 Macaron 跑在 Claude Code、Codex、Kimi Code 等主流 Agent / Coding 环境里,相当于在已有 Agent 工作流里换一个"经验可热插拔"的模型后端。
主流大模型的进化叙事是"参数越大越强",但这对开发者意味着两件事:一是部署门槛越来越高,二是模型不会"记住"你的项目上下文。Macaron 选了另一条路:
这种架构对有自己代码库 / 知识库的开发者团队最有吸引力——你可以想象给每个项目训一个专属 LoRA,再按需挂载。
Macaron-V1 不是又一个"参数更大、跑分更高"的开源大模型,而是一次把"经验作为可热插拔记忆"工程化的尝试。开发者今天能拿到的三件实物:HuggingFace 全开源权重(5 档)、免费 hosted API(国内/海外双线)、UI4A 可视化插件。如果你做 Coding、做 Agent、或者对 LoRA 专家组合架构感兴趣,挑 Coding-Venti 跑一次,比读十篇架构文章都直接。
官方资源: