爆改GLM-5.2!Macaron-V1混合LoRA开源,AI智能体新突破

type
status
date
slug
summary
tags
category
icon
password
网址
最近手头在测一个新模型,叫 Macaron-V1。说实话一开始没抱太大期待,打着「个人智能体」旗号的产品这两年太多了,大多数打开之后还是那套老配方:一个聊天机器人,外面挂几个插件。但测了三四天下来,发现这个模型的思路跟我预想的不太一样,值得认真写一篇。
先说说这是谁做的
Macaron-V1 是心洲科技旗下前沿实验室 Mind Lab 推出的最新模型,定位是面向个人智能体场景。权重、官方 API、配套工具都已经开源上线
V1 一共两个版本:
Macaron-V1-Venti:748B 参数(744B 基础模型加 4 个 1B 的 LoRA),是旗舰版本,官方的说法是全球首个基于 GLM-5.2 完成后训练的模型。原生支持 2M 超长上下文。
Macaron-V1-Tall:35B,基于通义千问 3.6 后训练而来,专门给本地部署用,适合对隐私和成本比较敏感的场景。
Venti 建立在 GLM-5.2 这个强悍的基座之上,却走了一条完全不同的后训练演化路线。它把重点放在了“个人智能体”这个定位上,试图做一个能真正融入我们日常生活的“最强强化学习模型”。
架构这块,挺有意思
Macaron V1 用的是一个叫 MoL(Mixture of LoRA)的架构,这是团队从 Preview 版本延续下来的路线。具体做法是,GLM-5.2 基座整个冻住不动,上面挂四个 1B 规模的 LoRA 专家,分别掌管对话 (Chat)、智能体 (Agent)、代码 (Coding) 和界面渲染 (UI):
L0 Chat,负责对话和指令遵循的主干;
L1 Agent,面向个人生活场景的重度工具使用,覆盖那种拖得比较长、变数比较多的复杂任务,V1 里把 Preview 版本 OpenClaw 相关的 LoRA 合并进了 L1;
L2 Coding,管代码理解、SWE 任务、终端操作;
L3 UI/A2UI,负责 UI4A 渲染和 UI 驱动的操作。
这就像是给一个知识渊博的底座,配上了四个专业领域的独立外脑。需要聊天时,L0 专家主导;需要写代码时,L2 专家接管。不同来源的技能在各自的适配空间里优化,互不打架。这种插件式的架构天然支持持续学习,未来想要加入新能力,只需再训练一个新的 LoRA 接入即可,完全不会动摇模型已有的知识体系。
实测
用了几天时间,把 Chat、Agent、Coding、UI4A 基本都测了一遍,挑几个印象比较深的说说。
API:
https://mintcn.macaron.xin/
建议大家在CC中使用
实测:UI4A 的魔法体验
在日常生活中使用 AI 时,我们常常面临一个痛点:很多时候我们想要的只是一目了然的图表或可以点按互动的工具,模型却往往却不能很好的实现。
Macaron V1 试图打破这种交互的边界。Mind Lab 团队在模型中内置了一个名为 UI4A 的生成式 UI 架构,并由专属的 L3 UI 专家来驱动它。简单来说,它兼顾了网页原生的极度灵活性与底层数据的精准控制,能够直接渲染出丰富的交互式视图。
为了验证这个能力到底有多强,我按照官方推荐在 Claude Code 中安装了 Macaron Artifacts 插件,并给它出了一道结合了自然语言处理与复杂前端渲染的难题。
Macaron Artifacts GitHub插件:
https://github.com/MindLab-Research/macaron-artifacts
我要求它为我生成一个“全能个人投资与财务分析控制台”。界面需要极简的暗黑风格,带有环形占比图、资产走势图,最重要的是必须有一个可以手动编辑的数据表格,且数据修改后图表必须跟着联动。随后,我抛了一堆记账流水:“上周五花了 2500 块买二手显示器,昨天把 500 股腾讯股票按每股 380 港币卖了,今天发工资 15000 元,顺便把两万块沪深300指数基金也算进总资产里。”
按下回车后的几分钟,Artifacts 可视化窗口里直接长出了一个带有精美很有质感的金融级 Dashboard,旁边的 Macaron 小助手还配上一句关于消费预警的幽默吐槽。
让人惊喜的还在后面。它不仅极其精准地从那堆口水话里剥离出了时间、资产类别并做好了港币换算,而且它生成的界面是真正“活”的。当我尝试在界面的表格里,新添加存款收入时,上方的环形占比图也随之产生动画,立刻做出了联动更新。
这意味着以后我需要的各种趁手工具,无论是健康打卡、塔罗牌游戏还是复杂的财务看板,都不用再去下载臃肿的 App,直接用一句话让 Macaron 当场为我“捏”出来即可。强烈建议大家试试
实测二:Coding
刚才的 UI 组件渲染让我看到了它在前端交互上的灵感,但硬核的代码编写往往需要极其严密的数理逻辑与空间想象力。在 Macaron V1 的 MoL 架构中,L2 Coding 专家专门负责啃这些硬骨头。
case1:
我给它出了一个基于 Three.js 物理与视觉渲染难题。我要求它写出一个复古蒸汽朋克风格的“机械太阳系仪”,所有内容必须封装在单个 HTML 文件里。它不能依赖任何外部的 3D 模型或贴图,必须纯靠数学公式和原生几何体构建出完整的黄铜支架与齿轮。同时,整个系统还得遵循合理的行星公转规律,并附带基于物理的真实材质渲染(PBR)与动态光影。
Macaron V1构建过程很有意思,它会在cc里一边构建一边调用浏览器获取屏幕截图实时测试渲染效果,找出故障直到最后成功,很明显给一个种从vibe coding到“氛围工程”的感觉,构建速度也非常快。
case2:
为了探探模型的底,我给它出了一个堪称“变态级”的难题。我要求它用 WebGL 纯手搓一幅包含十二个段落的“交互式水墨山水长卷”。不允许加载任何外部的图片素材或文件。它必须完全依靠数学公式去写出水墨晕染的 Shader,还要用严谨的状态机去管理排版,确保随着页面滚动触发的诗句绝对不能发生重叠。
这次花费的时间比较长,有半个小时左右,Macaron V1会不断的进行端到端的测试,截取屏幕找故障,单次效果:
扑面而来的东方美学质感着实让我起了一身鸡皮疙瘩。伴随着鼠标滚轮的推进,画面从大片留白的晨雾远山,一路推演到冷暖对比强烈的黄昏竹林,最终收束于极简的月夜孤舟。十二个段落的滚动阻尼、视差速度和墨色浓淡过渡得很有呼吸感。
Macaron V1 通过 L2 专家将代码能力放进专属的参数空间里独立优化。这种物理上的隔离使得它在写代码时心无旁骛,指令能精准遵循工程约束。
实测3:Agent
Agent 这块我测了一个更贴近真实工程现场的任务,让Macaron V1自己去 FastAPI 这个几十万星标的开源仓库里翻 issue,挑一个被很多用户反复提起、但一直没人推进实现的功能需求来做。
整个测试花了2小时左右,它最后选中的是一个关于同时使用多个 Query、Header、Cookie 参数模型的老问题,仓库里已经躺着一个 2024 年就提出的相关 PR,点赞和回复都不少,好几个用户明确说自己的项目被这个限制卡住了,维护者也表态认可这个方向,但两年过去,这个 PR 一直卡在反复解决合并冲突、迟迟排不上最终审查的状态。模型把它当成候选之后,先确认了问题在最新代码上依然成立,也没有被别的改动悄悄解决掉,还特意避开了另一个看起来类似、但维护者已经明确说要自己私下处理的功能点,没有去凑一个其实已经有人在做的伪需求。
这个 PR 我核实了一下(真实存在,#12481,从 2024 年 10 月开到现在还没合并),细节和你报告里对得上
定位根因这块,它给出的解释是,FastAPI 处理单个 Pydantic 模型作为参数时会把字段展开成一个个独立参数,但同时传入多个模型时只有第一个会被展开,其余的会被整体当成一个对象塞进接口文档,导致文档里写的调用方式和实际运行时能接受的调用方式对不上。代码里刚好有两处只处理单模型情况的判断逻辑,一处管接口文档生成,一处管运行时参数解析。它把这两处都改成能遍历处理所有模型的版本,抽出一个公共辅助函数复用,同时保证原来单模型场景的行为完全不受影响,新增了六个测试覆盖多模型场景,又给官方教程补了一个新例子和八个配套测试。跑完仓库里原有的三千多个测试,全部通过,唯一一个失败项跟这次改动完全无关,回退代码之后同样会失败,说明是环境本身的问题,不是它改坏的。
撑得起这些能力的,是几套基础设施
前面这些表现背后,团队在训练基础设施上做了不少工作,简单说两个。
一个是 2M 原生上下文的训练问题。推理端读百万级 token 不难,但强化学习训练要给同一个提示词评估多份回复、保留激活、累积梯度,训练端在固定硬件上很容易卡在二十多万 token。团队的解法叫 LongStraw:共享的长提示词只算一次存成可复用的常驻状态,后面只重放真正有学习信号的回复分支。官方数据是,8 张 H20 上把 Qwen3.6-27B 的 GRPO 训练推到 210 万 token,常驻前缀训练能到 446 万 token;32 张 H20 上用同样方法训练 GLM-5.2(78 层 MLA/DSA、256 专家 MoE),全模型训练也做到了 210 万 token。
另一个是模型自我进化的问题。MinT 管底层训练基础设施,Actor 和 Learner 之间只传 Adapter,配一个百万级的 Adapter 目录,端到端能撑到万亿参数模型,跟 MoL 的插件式架构正好契合。在这套设施上,HyperRSI 跑递归自我改进的闭环,训练框架 MindForge 把 Pi 和 Claude Code 生产环境的 Harness 直接接进强化学习,用同一套 HCP 协议对齐训练和线上环境看到的任务信息,保证练的和用的是一回事。闭环大致是:从种子任务生成更难的任务,筛掉没价值的,对生成的轨迹做审计,反复调整直到没有进一步收益,再把经验固化成新的模型参数,如此循环。
跑分
团队自己搭了两个个人化的评测集,ChatBench 看的是模型在长的智能体上下文里是否诚实,该说的说、该藏的藏、该认错的时候别硬撑;LivingBench 是一个能跨数周持续互动的纵向评测,搭在一个模拟沙盒里,里面有动态噪声、动态生存环境和动态用户三种机制,专门用来看模型在任务执行过程中偏离原计划之后,还能不能继续理解用户需求、验证信息、重新规划、处理意外,同时不侵犯隐私。自 Preview 版本以来,这个基准也一直在扩展,覆盖了更多不同文化背景下的案例。
除了这两个自建的,团队也在 VitaBench、PinchBench(个人生活智能体)、SWE-Verified、DeepSWE、TerminalBench 2.1(编程与终端)、UI4A-Bench(生成式 UI)这几条通用能力轴线上做了对比,同台竞技的还有 Opus 4.8、GPT 5.5 等几个前沿模型。官方给出的结论是,在个人生活和生成式 UI 这两条线上,Venti 能打平甚至超过这些前沿基线,同时还保留了开源和可自托管的优势;编程这条线上,V1 保持在跟前沿水平接近的位置,团队自己的说法是这是他们给「非个人生活类」能力轴线定的标准,没有硬说自己在编程上是最强,这点倒是挺实在的。
写在最后
测完这一圈,我个人的感受是,这个模型没有把力气花在「看起来什么都会」这件事上,反而是老老实实地把个人场景拆开,一块一块去啃。架构上用 MoL 把不同能力隔开训练,基础设施上死磕 2M 上下文和自我迭代的闭环,评测上专门搭了两个盯着诚实和长程稳定性的基准,这几个选择放在一起看,是一套挺连贯的思路。指令遵循更好,更安全,有些危险的东西会问用户再操作,GLM5.2 喜欢一股脑上,coding上幻觉比原版glm5.2小。
当然,这也就是几天的体验,长期用下去稳不稳、遇到复杂场景会不会翻车,还得再观察。如果你也对这类Agent方向的模型感兴趣,可以自己上手试试。
文章来自于微信公众号 “AI寒武纪”,作者 “AI寒武纪”
Loading...

没有找到文章