AI消息速览

蚂蚁开源LLaDA2.2,全球首个大规模Agentic扩散语言模型

事件日期 2026-07-29 · 产业观察 · 已接受

事件日期2026-07-29
信息日期2026-07-29
入库日期2026-07-29
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:蚂蚁开源LLaDA2.2,全球首个大规模Agentic扩散语言模型

英文标题:Ant Group Open-Sources LLaDA2.2 – First Large-Scale Agentic Diffusion Language Model
英文关键词:Agentic AI, Diffusion Language Model, Reinforcement Learning, SWE-bench, Open Source
原始来源:https://m.sohu.com/a/1055942829_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=6(腾讯研究院AI速递 20260729)

一句话结论

蚂蚁团队开源的LLaDA2.2是全球首个大规模Agentic扩散语言模型,通过四种编辑原子操作与L-EBPO强化学习实现生成中途自我修正,在SWE-bench上提升8.6个百分点,吞吐量达同规模自回归模型的1.64倍,将扩散语言模型路线正式推入智能体时代。

事件概述

2026年7月29日,蚂蚁团队宣布开源LLaDA2.2,这是全球首个专为智能体(Agent)设计的大规模扩散语言模型。该模型基于扩散语言模型路线,通过改造训练和推理范式,使其能够像自回归模型一样执行交互式任务,并具备中途自我修正能力。

方法/产品要点

  • 编辑原子操作:引入保留、替换、删除、插入四种基础操作,使模型在生成过程中可以局部修改生成内容,而非一次性生成全部。
  • L-EBPO强化学习:一种针对扩散模型的长程回滚策略优化,训练模型学会在生成中途主动修正错误。
  • 原生128K上下文:支持长序列输入,无需额外分段或压缩。
  • 基准对比:在17项基准上与同规模自回归模型Ling-2.6-flash表现相近,且在多项交互任务中领先。

主要结果或产业意义

  • SWE-bench:相比基线模型提升8.6个百分点,表明在软件工程任务上的代码修复和自主编程能力显著增强。
  • 吞吐量:达到Ling-2.6-flash的1.64倍,推理效率更高。
  • 将扩散模型从单纯文本生成扩展到具备代理行为的智能体场景,验证了扩散路线在Agent任务上的可行性。

为什么重要

  • 此前Agent模型几乎全部基于自回归架构(如GPT、Claude),LLaDA2.2证明扩散模型同样可以胜任智能体任务,且拥有更灵活的生成修正能力和更高的推理吞吐。
  • 开源策略降低了Agent研发门槛,使得社区可以基于该模型二次开发专用Agent。
  • 与已有相关卡片(如SIMA 2、Cursor Design Mode)不同,本卡片关注的是底层模型架构转变:从自回归到扩散,为Agent提供新的技术路径。

局限与不确定性

  • SWE-bench提升8.6个百分点的具体基准版本和测试设置需进一步核实(材料未提供详细比对基线)。
  • 在错误恢复方面仍有短板(材料指出“RL让模型更倾向选用专用工具、提升自我验证等可靠性,但错误恢复仍是短板”),这是当前Agent通用痛点。
  • 与最强闭源自回归模型(如GPT-5.5、Opus 4.8)的全面对比数据未提供,仅与开源同规模模型Ling-2.6-flash对比。
  • 实际Agent部署中的鲁棒性、安全性和延迟表现待更多第三方验证。

可用于图书/PPT/简报的角度

  1. 技术路线演进:从扩散文本生成到Agentic扩散模型的跨越,适合作为“AI模型架构创新”案例。
  2. 开源生态价值:蚂蚁开源LLaDA2.2对中小企业Agent研发的推动作用。
  3. 强化学习在Agent训练中的应用:L-EBPO方法的原理与效果示例。
  4. 对比图:LLaDA2.2 vs 同规模自回归模型在吞吐、SWE-bench、上下文长度等维度的对比表。

原始材料

来源:腾讯研究院AI速递 20260729
URL:https://m.sohu.com/a/1055942829_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=6
关键原文摘录:

“蚂蚁团队开源LLaDA2.2,为全球首个大规模Agentic扩散语言模型,将扩散语言模型路线正式推入智能体时代;其引入保留、替换、删除、插入四种编辑原子操作与L-EBPO强化学习,可生成中途自我修正,SWE-bench上提升8.6个百分点,原生支持128K上下文;在17项基准上与同规模自回归模型Ling-2.6-flash表现相近且多项交互任务领先,吞吐达其1.64倍。”