AI消息速览

Mind Lab发布Macaron-V1:LoRA强化学习与持续学习路线

事件日期 2026-07-15 · 产业观察 · 已接受

事件日期2026-07-15
信息日期2026-07-15
入库日期2026-07-25
通道产业观察
状态已接受
来源新智元

知识卡片:Mind Lab发布Macaron-V1:LoRA强化学习与持续学习路线

一句话结论
Mind Lab 发布的 Macaron-V1 采用 Mixture-of-LoRA(MoL)架构,通过四个独立 LoRA 模块分别掌管聊天、Agent、编程和生成式 UI,在 SWE-bench Verified 等评测中达到或超越 Opus 4.8、GPT-5.5 等闭源模型,同时坚持开放权重、可私有化部署,并被视为“经验时代”持续学习路线的重要落地案例。

事件概述

  • 2026 年 7 月 15 日,前 OpenAI CTO Mira Murati 发布 Thinking Machines Lab(TML)的 Inkling 模型(975B 参数,20亿美元融资)。同日,图灵奖得主 Richard Sutton 宣布创办 Oak Lab,强调要从根基重新审视深度学习。
  • DeepSeek 创始人梁文锋此前也提出:下一代模型必须具备持续学习能力,才能称为“下一代模型”。
  • 在太平洋对岸,中国实验室 Mind Lab(心洲科技旗下,成立于 2025 年 10 月)于同期发布 Macaron-V1。团队三十余人,年初完成 5000 万美元 A 轮融资(美团领投,蚂蚁、红杉中国、真格等跟投)。

方法/产品要点

  • 核心架构:Mixture-of-LoRA(MoL)。基座模型(GLM-5.2 或 Qwen-3.7)承载共性能力,四个独立 LoRA(各约 1B 参数)分别负责聊天、Agent、编程、GenUI,运行时由路由器动态切换,用户无感知。
  • 旗舰版 Venti:748B 参数(744B GLM-5.2 基座 + 4×1B LoRA),原生 2M 超长上下文。标准版 Tall:35B 参数(基于 Qwen-3.7),可在 Mac 上运行。
  • 训练策略:LoRA 强化学习在万亿参数规模上实现训推一致。Mind Lab 此前(2025 年 12 月)在 1.04 万亿 MoE 模型 Kimi K2 上跑通 LoRA 强化学习,算力仅为全参微调的十分之一。
  • 持续学习目标:模型部署后仍能在真实环境中通过 LoRA 写入经验(偏好、代码风格、业务逻辑),实现“越用越聪明”。LoRA 被视为可写入、可回滚、可独立演化的持久状态。
  • 群体智能:从相同基座训练不同数据顺序和 masking 的多个 adapter,单个在 AIME24 上准确率 36.44%,198 个不同 adapter 多数投票提升至 48.67%(同一 adapter 重复采样最高 43.78%)。Mind Lab 将此称为“第三条 Scaling 曲线”——Scale Number of Models。

主要结果或产业意义

  • 评测表现:SWE-bench Verified 85.6 分(第一名),甩开第二名 3 分;Deep-SWE 长程软件工程任务 58.4 分(基座 GLM-5.2 为 46.2 分,提升 12 点)。多数任务持平或超越 Opus 4.8、GPT-5.5、Gemini 3.1 Pro,尤其在生活场景、代码和 GenUI 方向突出。
  • 商业化:2026 年 7 月初开放 API,2 周内达到 1000 万美元 ARR(年化经常性收入),被描述为“模型公司从首个模型发布到千万美金 ARR 的最快纪录”。API 调用结构:20% 聊天,30% Agent,30% 代码,20% GenUI。
  • 开放权重:支持私有化部署,数据不出服务器。
  • 对比 TML:TML 自训基座(Inkling)耗费 20 亿美元,能力仍弱于 GLM-5.2;Mind Lab 依靠中国开源模型生态(GLM、Kimi、Qwen)做后训练,用不到 5000 万美元实现相近甚至更强的能力。

为什么重要

  • 验证了“持续学习”作为下一代模型核心能力的可行性。Richard Sutton、梁文锋、Mira Murati 等均押注此方向,Mind Lab 是中国团队中首个交出完整产品的案例。
  • Mixture-of-LoRA 架构为万亿参数模型的低成本后训练、任务解耦持续迭代提供了可复制的工程范式。
  • 商业验证速度(2 周千万 ARR)表明市场对“可持续迭代、数据不离开本地”的模式有强烈需求。
  • 相较于已有卡片(如 AlphaEvolve 关注进化式编码智能体),本条焦点在“持续学习 + LoRA 强化学习 + 群体智能”的整体路线,而非单一算法创新。

局限与不确定性

  • 材料未披露 Macaron-V1 在更多通用基准(如 MMLU、GSM8K、HellaSwag 等)上的全面对比,仅重点突出代码和特定场景成绩。待核实其在所有闭源模型上的相对位置。
  • 持续学习能力的实际效果(如部署后长期演化后的稳定性、遗忘问题)尚未公开长期验证。待核实
  • 群体智能中“200 个 adapter 多数投票”的协作增益是否适用于更大规模(2 万或 200 万)尚处于假设阶段。
  • 融资额及商业化数据来自文章单方陈述,待核实其他独立来源。

可用于图书/PPT/简报的角度

  • 技术路线对比:将 TML(自研底座)与 Mind Lab(借力开源)的投入产出比做成图表,突出“站在巨人肩上”策略。
  • 持续学习 vs. 静态模型:用 LoRA 作为“可写入记忆”的比喻,解释模型从“一次性训练”到“终身学习”的转变。
  • 群体智能曲线:展示从 1 个到 200 个 adapter 性能线性提升的实验数据,作为“第三 Scaling 曲线”的案例。
  • 商业化速度:2 周千万 ARR 可作为“技术+市场匹配”的典型素材,与行业平均模型变现周期对比。

原始材料

  • 来源:新智元《梁文锋押注的方向,中国00后团队先交卷了!性能直逼Opus 4.8》
  • URL: https://aiera.com.cn/2026/07/25/other/admin/105777/%e6%a2%81%e6%96%87%e9%94%8b%e6%8a%bc%e6%b3%a8%e7%9a%84%e6%96%b9%e5%90%91%ef%bc%8c%e4%b8%ad%e5%9b%bd00%e5%90%8e%e5%9b%a2%e9%98%9f%e5%85%88%e4%ba%a4%e5%8d%b7%e4%ba%86%ef%bc%81%e6%80%a7%e8%83%bd%e7%9b%b4
  • 英文关键词:Macaron-V1, Mixture-of-LoRA, continuous learning, swarm intelligence, LoRA reinforcement learning, Mind Lab