全球首个Agentic扩散模型来了:边行动边纠错,128K上下文追平自回归
Agent赛道长期被自回归模型垄断的局面正在被打破。蚂蚁旗下inclusionAI团队最新开源LLaDA2.2,是全球首个大规模Agentic扩散模型——千亿参数MoE架构,原生支持128K上下文,首次将扩散模型带入智能体长程任务。
扩散模型破局自回归垄断
传统扩散模型可以并行处理多个位置,速度比自回归快,但Token之间缺乏严格的序列条件约束。这在Agent场景中是致命的——Agent的输出要被真实执行,再小的bug也会影响整个流程,一步错步步错。蚂蚁团队通过三大技术拼图解决这一问题。
LLaDA2.2采用Levenshtein编辑范式,在块内支持KEEP(保留)、SUBSTITUTE(替换)、DELETE(删除)、INSERT(插入)四种原子操作,模型能对自己的生成结果进行自我修正。实验显示,仅开启Levenshtein编辑一项就在SWE-bench Verified上带来8.6个百分点的绝 对提升。
三大技术拼图集中发力
LLaDA2.2提出的L-EBPO算法,将多轮交互中的编辑决策建模为强化学习问题,模型根据环境反馈自主决策什么时候切除错误、什么时候填补缺失。如果说Levenshtein编辑范式是给了扩散模型一双手,L-EBPO就是添上了眼睛。
在工程层面,LLaDA2.2通过渐进式长上下文训练,将原生上下文窗口从8K逐步扩展到128K。同时采用BlockRouting机制——先在block层面筛选top-C个专家形成固定专家池,再内部执行Token级路由,大幅降低推理成本。128K原生上下文+BlockRouting让Agentic扩散模型真正具备了工程部署价值。
Agent时代需要自回归与扩散双轨并行
在七大Agent基准上,LLaDA2.2-flash与顶尖自回归模型Ling-2.6-flash正面竞技,平均分53.83 vs 55.74,差距缩小到2分以内。在τ²-Bench、PinchBench、MCP-Atlas三项交互式任务上实现反超。效率方面,BF16平均吞吐量达到自回归模型的1.64倍。
LLaDA2.2证明扩散模型同样可以和自回归模型站在同一条起跑线上。对于真正进入物理世界的Agent来说,响应延迟和推理成本才是大规模落地的关键瓶颈——而这恰恰是扩散架构的优势。后Agent时代可能需要两种机制融合:需要生成严格工具参数时由自回归稳步推进,需要快速探索时让扩散介入,最终双轨并行。