AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月29日 · Qwen2.5-7B-Instruct

Same Evidence, Different Target: Decoding How Diagnostic Evidence Bears on Causal Questions from Language-Model States

发生了什么

论文《Same Evidence, Different Target》提出配对提示方法,重复相同诊断证据但改变因果目标,并标注为Favors、Challenges、Unresolved或Wrong Target。在49对基准上,Qwen2.5-7B-Instruct、Qwen3-8B和Llama-3.1-8B-Instruct的平衡准确率为0.654-0.659,恢复18-21对。人类评审一致性96.9%。

EVENT STORY

发展脉络

  1. 首次出现Same Evidence, Different Target: Decoding How Diagnostic Evidence Bears on Causal Questions from Language-Model StatesarXiv cs.CL
  2. 当前判断该研究揭示当前语言模型在因果推理上的局限,可能影响依赖因果判断的AI应用(如医疗诊断、科学发现)。模型需改进证据与目标匹配能力,而非仅优化表面模式。Agent Pulse · 分析
改变了什么

该研究针对语言模型在因果推理中可能依赖表面线索而非证据与目标匹配的问题,提出配对提示方法:相同诊断证据,改变因果目标,要求模型判断证据对因果问题的作用。在49对基准上,三个8B模型平衡准确率仅0.654-0.659,恢复18-21对,表明模型表现接近随机,且可能受措辞或词汇重叠影响。人类评审一致性96.9%,说明任务对人类可解。研究使用线性探针分析最终token隐藏状态,揭示模型内部表征。

能力边界怎么变了

线性探针分析显示,模型在因果推理任务中可能编码表面特征而非深层因果结构。配对提示设计可有效控制证据内容,隔离目标变化的影响。未来可探索更大模型或训练方法改进,以提升证据-目标匹配能力。

为什么重要

该研究揭示当前语言模型在因果推理上的局限,可能影响依赖因果判断的AI应用(如医疗诊断、科学发现)。模型需改进证据与目标匹配能力,而非仅优化表面模式。

对谁有影响

对AI公司而言,提升因果推理能力可增强产品在专业领域的可靠性,减少错误判断带来的风险。

接下来观察

后续可扩展基准规模,测试更多模型和训练策略,并探索因果推理的可解释性方法。