郭震 AI公众号:郭震AI

实时 AI 消息

蚂蚁inclusionAI开源LLaDA 2.2:全球首个千亿参数Agentic扩散模型,128K上下文追平自回归

蚂蚁集团旗下inclusionAI团队正式开源LLaDA 2.2,这是全球首个大规模Agentic扩散语言模型,采用千亿参数MoE架构并原生支持128K上下文。该模型首次将Levenshtein编辑、强化学习与长上下文工程整合进扩散模型Agent系统,在七大Agent基准测试中与顶尖自回归模型差距缩小至2分以内。

发布时间
蚂蚁inclusionAI开源LLaDA 2.2:全球首个千亿参数Agentic扩散模型,128K上下文追平自回归
图源: ant.design

自回归模型在Agent赛道一家独大的局面正在被打破。7月28日,蚂蚁集团旗下inclusionAI团队正式开源LLaDA 2.2,这是一款千亿参数的MoE扩散语言模型,也是全球首个大规模Agentic扩散模型,原生支持128K上下文。

模型不仅能够并行生成文本,还能在生成过程中自我增删和动态修正。团队将Levenshtein编辑范式引入扩散模型的去噪过程,支持KEEP(保留)、SUBSTITUTE(替换)、DELETE(删除)和INSERT(插入)四种原子操作,让模型具备修改自身输出的能力。在SWE-bench Verified上,仅开启Levenshtein编辑一项,就带来了从35.8到44.4的绝对提升。

为了解决长程Agent交互中模型崩溃的问题,LLaDA 2.2提出L-EBPO算法,将多轮交互中的编辑决策建模为强化学习问题,使模型能根据环境反馈实时决定何时删除冗余内容、何时填补缺失信息。

在工程架构方面,LLaDA 2.2通过渐进式长上下文训练将上下文窗口从8K扩展至128K。团队设计BlockRouting机制在block层面筛选专家池后再执行Token级路由,显著降低HBM流量和通信开销。

性能方面,LLaDA 2.2-flash在七大Agent基准上的平均分为53.83,与顶尖自回归模型Ling-2.6-flash的55.74差距不到2分。在τ²-Bench、PinchBench和MCP-Atlas三项交互式任务上实现反超,表明其在真实交互场景中已开始展现竞争力。

效率优势更加突出:在11类工作负载上,BF16平均吞吐量达Ling-2.6-flash的1.64倍,量化至FP8后可再提升18.6%。这意味着在Agent部署场景中,扩散架构能同时提供更快的响应速度和更低的推理成本。

从2.0版本的规模化尝试到2.1版本的边写边改,再到2.2版本的Agent觉醒,蚂蚁团队在半年内完成三代模型迭代。LLaDA 2.2的技术报告、模型权重和代码均已开源。

行业观察人士指出,LLaDA 2.2的意义不在于取代自回归模型,而在于证明了扩散模型同样可以站在Agent赛道的起跑线上。未来Agent系统可能同时需要自回归与扩散两种机制,根据任务阶段动态切换。

为什么重要

这标志着扩散模型首次大规模进入智能体长程任务领域,打破了自回归模型在Agent赛道的一统局面,为Agent架构设计提供了新的技术路径选择,尤其在端侧部署和实时响应场景中具有独特优势。

微博邮件

Ant GroupinclusionAILLaDADiffusion ModelAgentOpen Source
返回实时消息

附近消息

全部