数码影音频道 频道

腾讯混元开源HiLS-Attention:稀疏注意力首次在数学上被做对,外推512倍

“AI摘要”

腾讯混元团队于2026年7月20日开源HiLS-Attention(分层地标稀疏注意力),这是一种全新的分块稀疏注意力范式,旨在解决长上下文建模中计算量平方级增长、长度外推差和KV Cache膨胀三大瓶颈。该技术通过一阶泰勒展开引入“熵偏置”项,自适应估计chunk重要性,并利用分层softmax实现端到端可训练。在345M至7B参数规模上验证,HiLS-Attention仅用8K训练即可实现4M上下文免训外推,512K下prefill快13.5倍、decode快15.7倍,部分长上下文检索任务效果甚至超越全注意力。存量模型仅需续训50B token即可切换,短任务不掉点。

2026年7月20日,腾讯混元团队正式开源HiLS-Attention(分层地标稀疏注意力),提出了一种全新的分块稀疏注意力范式。该方法首次在数学层面上同时解决了chunk重要性估计的"表达力不足"和选择过程的"端到端不可导"两大根本难题,在345M至7B参数规模上全面验证,真正将稀疏注意力做到了"Done Right"。

长上下文建模的"三座大山"被一举突破

让大模型读得更长,一直是Agent、深度推理和海量资料整合等场景的刚需。但标准全注意力机制面临三个核心瓶颈:计算量呈平方级增长、长度外推能力差、KV Cache随长度线性膨胀。现有分块稀疏注意力方案虽然将计算和显存控制在常数范围,却长期无法追平全注意力的效果——根源在于chunk选不准。

腾讯混元团队发现,现有方法(如NSA、InfLLM v2、MoBA等)普遍使用均值池化或最大logits来估计chunk重要性,但均值只在注意力均匀分布时才准,最大值只在单token独占注意力时才准。真实场景中logit分布随query、head和数据剧烈变化,导致系统性地错估chunk重要性。

泰勒展开+分层softmax:打通端到端训练

HiLS-Attention的核心创新分为两步。第 一步,团队利用一阶泰勒展开构造chunk重要性估计函数,通过引入了"熵偏置"项,在任意logit分布下都能自适应地贴合真实重要性——集中分布时趋近max logits,均匀分布时趋近mean logits,两种极端被一次性统一。

第二步,HiLS将注意力权重分层因式分解为两级softmax:chunk间softmax决定每个chunk整体能分到多少注意力,chunk内softmax决定token间的相对权重。关键突破在于代理质量直接出现在前向的注意力权重中,LM loss的梯度因此可以一路反传到summary key和地标token——chunk选择首次成为端到端可学习的过程。

实验全面验证:效率与效果首次同时打破

在345M到7B三个参数规模上,HiLS-Attention展现了惊人的一致性表现。短文本场景下,语言建模困惑度与全注意力几乎重合;仅用8K训练即可实现4M上下文(512倍)的免训外推,大海捞针准确率仍保持90%以上;512K上下文下prefill快13.5倍、单步decode快15.7倍。

更反直觉的是,HiLS在部分长上下文检索任务上反超了全注意力本身——变量追踪等多跳任务上比全注意力高出多达50%。研究团队解释,这可能是因为压缩本身具有去噪效果:无关token的微小噪声在压缩中相互抵消,共享语义信号被保留,检索反而更干净。

对于存量模型,将OLMo3-7B这类全注意力模型转成HiLS只需续训50B token即可实现切换,短程任务不掉点,长序列任务在域内长度甚至能超越全注意力基线。

0
相关文章