2026年8月6日 · Reasoning Errors Have a Region and a Direction in the Residual-Stream Trajectory of LLMs
Reasoning Errors Have a Region and a Direction in the Residual-Stream Trajectory of LLMs
arXiv 论文 2608.05660v1 提出一种三流检测器,结合运动与受限位置视图,在未见推理基准上选择准确率比仅位移方法提升最多 12%,比单层探测基线提升 21%。
EVENT STORY
发展脉络
- 首次出现Reasoning Errors Have a Region and a Direction in the Residual-Stream Trajectory of LLMsarXiv cs.CL
- 当前判断推理错误检测的进步可能提升 LLM 在需要可验证推理任务中的可靠性,对 AI 安全与评估领域有潜在影响。Agent Pulse · 分析
该论文指出,基于残差流轨迹的推理错误检测方法中,位移(displacement)忽略了更新来源的状态,而恢复完整状态可能重新引入捷径信息。作者提出三流检测器,结合运动(motion)与两种受限位置视图:基于向量量化的粗粒度区域读取器和基于归一化多层状态的细粒度方向读取器。该方法在训练中未见过的推理基准上,选择准确率比仅位移的最先进方法提升最多 12%,比单层探测基线提升 21%。尽管仅在推理基准上训练,该方法也能读取事实补全和事实验证任务,优于所有检测器。
该工作表明,残差流轨迹中的推理错误具有区域和方向特征,通过结合运动与受限状态上下文,可以提升检测性能。这提示我们,在解释模型行为时,状态信息与运动信息互补,但需谨慎避免引入捷径。
推理错误检测的进步可能提升 LLM 在需要可验证推理任务中的可靠性,对 AI 安全与评估领域有潜在影响。
该技术可提升 LLM 在关键推理任务中的可信度,对依赖模型推理能力的应用(如代码生成、数学解题)有商业价值。
未来可能看到更多基于轨迹的检测方法,结合状态与运动信息,并扩展到更广泛的推理任务。