知识卡片:蚂蚁开源LLaDA2.2,全球首个大规模Agentic扩散语言模型
英文标题:Ant Group Open-Sources LLaDA2.2 – First Large-Scale Agentic Diffusion Language Model
英文关键词:Agentic AI, Diffusion Language Model, Reinforcement Learning, SWE-bench, Open Source
原始来源:https://m.sohu.com/a/1055942829_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=6(腾讯研究院AI速递 20260729)
一句话结论
蚂蚁团队开源的LLaDA2.2是全球首个大规模Agentic扩散语言模型,通过四种编辑原子操作与L-EBPO强化学习实现生成中途自我修正,在SWE-bench上提升8.6个百分点,吞吐量达同规模自回归模型的1.64倍,将扩散语言模型路线正式推入智能体时代。
事件概述
2026年7月29日,蚂蚁团队宣布开源LLaDA2.2,这是全球首个专为智能体(Agent)设计的大规模扩散语言模型。该模型基于扩散语言模型路线,通过改造训练和推理范式,使其能够像自回归模型一样执行交互式任务,并具备中途自我修正能力。
方法/产品要点
- 编辑原子操作:引入保留、替换、删除、插入四种基础操作,使模型在生成过程中可以局部修改生成内容,而非一次性生成全部。
- L-EBPO强化学习:一种针对扩散模型的长程回滚策略优化,训练模型学会在生成中途主动修正错误。
- 原生128K上下文:支持长序列输入,无需额外分段或压缩。
- 基准对比:在17项基准上与同规模自回归模型Ling-2.6-flash表现相近,且在多项交互任务中领先。
主要结果或产业意义
- SWE-bench:相比基线模型提升8.6个百分点,表明在软件工程任务上的代码修复和自主编程能力显著增强。
- 吞吐量:达到Ling-2.6-flash的1.64倍,推理效率更高。
- 将扩散模型从单纯文本生成扩展到具备代理行为的智能体场景,验证了扩散路线在Agent任务上的可行性。
为什么重要
- 此前Agent模型几乎全部基于自回归架构(如GPT、Claude),LLaDA2.2证明扩散模型同样可以胜任智能体任务,且拥有更灵活的生成修正能力和更高的推理吞吐。
- 开源策略降低了Agent研发门槛,使得社区可以基于该模型二次开发专用Agent。
- 与已有相关卡片(如SIMA 2、Cursor Design Mode)不同,本卡片关注的是底层模型架构转变:从自回归到扩散,为Agent提供新的技术路径。
局限与不确定性
- SWE-bench提升8.6个百分点的具体基准版本和测试设置需进一步核实(材料未提供详细比对基线)。
- 在错误恢复方面仍有短板(材料指出“RL让模型更倾向选用专用工具、提升自我验证等可靠性,但错误恢复仍是短板”),这是当前Agent通用痛点。
- 与最强闭源自回归模型(如GPT-5.5、Opus 4.8)的全面对比数据未提供,仅与开源同规模模型Ling-2.6-flash对比。
- 实际Agent部署中的鲁棒性、安全性和延迟表现待更多第三方验证。
可用于图书/PPT/简报的角度
- 技术路线演进:从扩散文本生成到Agentic扩散模型的跨越,适合作为“AI模型架构创新”案例。
- 开源生态价值:蚂蚁开源LLaDA2.2对中小企业Agent研发的推动作用。
- 强化学习在Agent训练中的应用:L-EBPO方法的原理与效果示例。
- 对比图:LLaDA2.2 vs 同规模自回归模型在吞吐、SWE-bench、上下文长度等维度的对比表。
原始材料
来源:腾讯研究院AI速递 20260729
URL:https://m.sohu.com/a/1055942829_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=6
关键原文摘录:
“蚂蚁团队开源LLaDA2.2,为全球首个大规模Agentic扩散语言模型,将扩散语言模型路线正式推入智能体时代;其引入保留、替换、删除、插入四种编辑原子操作与L-EBPO强化学习,可生成中途自我修正,SWE-bench上提升8.6个百分点,原生支持128K上下文;在17项基准上与同规模自回归模型Ling-2.6-flash表现相近且多项交互任务领先,吞吐达其1.64倍。”