实时 AI 消息
蚂蚁inclusionAI开源LLaDA 2.2:全球首个千亿参数Agentic扩散模型,128K上下文追平自回归
蚂蚁集团旗下inclusionAI团队正式开源LLaDA 2.2,这是全球首个大规模Agentic扩散语言模型,采用千亿参数MoE架构并原生支持128K上下文。该模型首次将Levenshtein编辑、强化学习与长上下文工程整合进扩散模型Agent系统,在七大Agent基准测试中与顶尖自回归模型差距缩小至2分以内。
自回归模型在Agent赛道一家独大的局面正在被打破。7月28日,蚂蚁集团旗下inclusionAI团队正式开源LLaDA 2.2,这是一款千亿参数的MoE扩散语言模型,也是全球首个大规模Agentic扩散模型,原生支持128K上下文。
模型不仅能够并行生成文本,还能在生成过程中自我增删和动态修正。团队将Levenshtein编辑范式引入扩散模型的去噪过程,支持KEEP(保留)、SUBSTITUTE(替换)、DELETE(删除)和INSERT(插入)四种原子操作,让模型具备修改自身输出的能力。在SWE-bench Verified上,仅开启Levenshtein编辑一项,就带来了从35.8到44.4的绝对提升。
为了解决长程Agent交互中模型崩溃的问题,LLaDA 2.2提出L-EBPO算法,将多轮交互中的编辑决策建模为强化学习问题,使模型能根据环境反馈实时决定何时删除冗余内容、何时填补缺失信息。
在工程架构方面,LLaDA 2.2通过渐进式长上下文训练将上下文窗口从8K扩展至128K。团队设计BlockRouting机制在block层面筛选专家池后再执行Token级路由,显著降低HBM流量和通信开销。
性能方面,LLaDA 2.2-flash在七大Agent基准上的平均分为53.83,与顶尖自回归模型Ling-2.6-flash的55.74差距不到2分。在τ²-Bench、PinchBench和MCP-Atlas三项交互式任务上实现反超,表明其在真实交互场景中已开始展现竞争力。
效率优势更加突出:在11类工作负载上,BF16平均吞吐量达Ling-2.6-flash的1.64倍,量化至FP8后可再提升18.6%。这意味着在Agent部署场景中,扩散架构能同时提供更快的响应速度和更低的推理成本。
从2.0版本的规模化尝试到2.1版本的边写边改,再到2.2版本的Agent觉醒,蚂蚁团队在半年内完成三代模型迭代。LLaDA 2.2的技术报告、模型权重和代码均已开源。
行业观察人士指出,LLaDA 2.2的意义不在于取代自回归模型,而在于证明了扩散模型同样可以站在Agent赛道的起跑线上。未来Agent系统可能同时需要自回归与扩散两种机制,根据任务阶段动态切换。
为什么重要
这标志着扩散模型首次大规模进入智能体长程任务领域,打破了自回归模型在Agent赛道的一统局面,为Agent架构设计提供了新的技术路径选择,尤其在端侧部署和实时响应场景中具有独特优势。
附近消息
全部07/28 12:30
AI编程工具Cursor加大印度市场投入,推出本地化定价并扩大团队
Cursor表示印度已成为其全球第三大市场,并计划通过本地化定价、扩大招聘和加强企业销售来进一步拓展印度业务。这家AI编程工具初创公司正在加速其国际化布局。
07/28 12:03
Kimi K3 API登陆阿里云,多模态能力显著增强
月之暗面(Moonshot AI)旗下Kimi K3大模型API已正式上线阿里云平台,大幅提升了多模态理解能力。此次集成意味着开发者和企业用户可通过阿里云直接调用Kimi K3的API服务,进一步扩展了该2.8万亿参数开源模型的商业化落地场景。
07/28 12:44
Kimi K3技术细节公开,商业使用需获授权
月之暗面(Moonshot AI)旗下的Kimi K3模型技术细节正式对外公开,但商业使用需要获得授权。这一消息让外界得以一窥这款国产大模型的技术架构。
07/28 11:49
AI主机与沙盒需求拯救英特尔数据中心CPU业务,Q2营收同比大增59%
受生成式AI和智能体AI(Agentic AI)驱动,英特尔数据中心与AI部门(DCAI)2026年Q2销售额达62.6亿美元,同比增长59%,创下十五年来服务器CPU最高增速。AI主机CPU的旺盛需求以及AI沙盒(Sandbox)执行环境对通用计算资源的消耗,正成为英特尔数据中心业务复苏的核心驱动力。