AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Sep 2, 2026 · Declarative Attention

Language Models Can Control Their Own Attention

What Happened

Declarative Attention (DA) 协议让模型在思维链中声明注意力范围,推理引擎据此跳过大部分 KV cache 读取。在 15 个长上下文任务上,Gemma-4-31B 和 Qwen-3.6-27B 的注意力 token 数分别减少 52.0% 和 31.1%,准确率下降 1.27pp 和 2.75pp。

EVENT STORY

Development

  1. First ReportLanguage Models Can Control Their Own AttentionHugging Face Daily Papers
  2. Industry ResponseLanguage Models Can Control Their Own AttentionarXiv cs.CL
  3. Current AssessmentDA 表明模型自身可以声明注意力需求,可能改变长上下文推理的成本结构,对依赖 KV cache 的推理优化有潜在影响。Agent Pulse · analysis
What Changed

论文提出 Declarative Attention (DA) 协议,让语言模型在思维链中声明需要关注的上下文区域,推理引擎像解析工具调用一样解析这些声明,从而跳过大部分 KV cache 读取。在零样本评估中,DA 在 15 个长上下文任务上显著减少了 Gemma-4-31B 和 Qwen-3.6-27B 的解码注意力 token 数(分别减少 52.0% 和 31.1%),准确率仅有小幅下降(1.27pp 和 2.75pp)。

How the Capability Boundary Shifted

DA 将生成划分为三种模式:全局、聚焦和局部,模型在思维链中声明模式,推理引擎据此跳过 KV cache 读取。这避免了外部代理评分带来的 O(N) 开销,实现了内在的注意力选择。

Why It Matters

DA 表明模型自身可以声明注意力需求,可能改变长上下文推理的成本结构,对依赖 KV cache 的推理优化有潜在影响。

Who It Affects

DA 可能降低长上下文推理的延迟和成本,对提供长上下文 API 的服务商有商业价值,但需验证实际部署效果。

What to Watch Next

后续可验证信号包括:DA 在更大模型和更长上下文上的效果,以及是否被主流推理框架采纳。