AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年9月2日 · Declarative Attention

Language Models Can Control Their Own Attention

发生了什么

Declarative Attention (DA) 协议让模型在思维链中声明注意力范围,推理引擎据此跳过大部分 KV cache 读取。在 15 个长上下文任务上,Gemma-4-31B 和 Qwen-3.6-27B 的注意力 token 数分别减少 52.0% 和 31.1%,准确率下降 1.27pp 和 2.75pp。

EVENT STORY

发展脉络

  1. 首次出现Language Models Can Control Their Own AttentionHugging Face Daily Papers
  2. 行业反馈Language Models Can Control Their Own AttentionarXiv cs.CL
  3. 当前判断DA 表明模型自身可以声明注意力需求,可能改变长上下文推理的成本结构,对依赖 KV cache 的推理优化有潜在影响。Agent Pulse · 分析
改变了什么

论文提出 Declarative Attention (DA) 协议,让语言模型在思维链中声明需要关注的上下文区域,推理引擎像解析工具调用一样解析这些声明,从而跳过大部分 KV cache 读取。在零样本评估中,DA 在 15 个长上下文任务上显著减少了 Gemma-4-31B 和 Qwen-3.6-27B 的解码注意力 token 数(分别减少 52.0% 和 31.1%),准确率仅有小幅下降(1.27pp 和 2.75pp)。

能力边界怎么变了

DA 将生成划分为三种模式:全局、聚焦和局部,模型在思维链中声明模式,推理引擎据此跳过 KV cache 读取。这避免了外部代理评分带来的 O(N) 开销,实现了内在的注意力选择。

为什么重要

DA 表明模型自身可以声明注意力需求,可能改变长上下文推理的成本结构,对依赖 KV cache 的推理优化有潜在影响。

对谁有影响

DA 可能降低长上下文推理的延迟和成本,对提供长上下文 API 的服务商有商业价值,但需验证实际部署效果。

接下来观察

后续可验证信号包括:DA 在更大模型和更长上下文上的效果,以及是否被主流推理框架采纳。