数码影音频道 频道

全球首个Agentic扩散模型来了:边行动边纠错,128K上下文追平自回归

“AI摘要”

蚂蚁旗下inclusionAI团队开源了全球首个大规模Agentic扩散模型LLaDA2.2,采用千亿参数MoE架构,原生支持128K上下文,打破了自回归模型在Agent赛道的垄断。该模型通过Levenshtein编辑范式、L-EBPO强化学习算法和渐进式长上下文训练三大技术,解决了扩散模型在Agent场景中缺乏序列约束的问题。在七大Agent基准测试中,LLaDA2.2与顶尖自回归模型差距缩小至2分以内,并在三项交互式任务上实现反超,吞吐量达到自回归模型的1.64倍。这标志着扩散模型在Agent时代可与自回归模型互补,未来可能实现双轨并行。

  Agent赛道长期被自回归模型垄断的局面正在被打破。蚂蚁旗下inclusionAI团队最新开源LLaDA2.2,是全球首个大规模Agentic扩散模型——千亿参数MoE架构,原生支持128K上下文,首次将扩散模型带入智能体长程任务。

  扩散模型破局自回归垄断

  传统扩散模型可以并行处理多个位置,速度比自回归快,但Token之间缺乏严格的序列条件约束。这在Agent场景中是致命的——Agent的输出要被真实执行,再小的bug也会影响整个流程,一步错步步错。蚂蚁团队通过三大技术拼图解决这一问题。

  LLaDA2.2采用Levenshtein编辑范式,在块内支持KEEP(保留)、SUBSTITUTE(替换)、DELETE(删除)、INSERT(插入)四种原子操作,模型能对自己的生成结果进行自我修正。实验显示,仅开启Levenshtein编辑一项就在SWE-bench Verified上带来8.6个百分点的绝 对提升。

  三大技术拼图集中发力

  LLaDA2.2提出的L-EBPO算法,将多轮交互中的编辑决策建模为强化学习问题,模型根据环境反馈自主决策什么时候切除错误、什么时候填补缺失。如果说Levenshtein编辑范式是给了扩散模型一双手,L-EBPO就是添上了眼睛。

  在工程层面,LLaDA2.2通过渐进式长上下文训练,将原生上下文窗口从8K逐步扩展到128K。同时采用BlockRouting机制——先在block层面筛选top-C个专家形成固定专家池,再内部执行Token级路由,大幅降低推理成本。128K原生上下文+BlockRouting让Agentic扩散模型真正具备了工程部署价值。

  Agent时代需要自回归与扩散双轨并行

  在七大Agent基准上,LLaDA2.2-flash与顶尖自回归模型Ling-2.6-flash正面竞技,平均分53.83 vs 55.74,差距缩小到2分以内。在τ²-Bench、PinchBench、MCP-Atlas三项交互式任务上实现反超。效率方面,BF16平均吞吐量达到自回归模型的1.64倍。

  LLaDA2.2证明扩散模型同样可以和自回归模型站在同一条起跑线上。对于真正进入物理世界的Agent来说,响应延迟和推理成本才是大规模落地的关键瓶颈——而这恰恰是扩散架构的优势。后Agent时代可能需要两种机制融合:需要生成严格工具参数时由自回归稳步推进,需要快速探索时让扩散介入,最终双轨并行。

0
相关文章