Intertemporal Preference Steering in Qwen3 via Contrastive Activation Addition
Qwen3-32B 模型存在可测量的时间偏好线性表征。研究者用对比线性探针在残差流中找到短期与长期方向,并通过对比激活加法(CAA)进行干预。在分布外货币跨期选择任务上,干预双向显著改变模型对较小即时奖励与较大延迟奖励的无差异阈值;在 TravelPlanner 规划能力基准上,适度干预带来能力指标提升。
发展脉络
- 首次出现Qwen3-ASR-1.7B-hf通义千问 模型发布(Hugging Face)
- 行业反馈Qwen3-ASR-0.6B-hf通义千问 模型发布(Hugging Face)
- 行业反馈AI system Locus posttrains a model better than Qwen3Hacker News · AI
- 行业反馈Intertemporal Preference Steering in Qwen3 via Contrastive Activation AdditionarXiv cs.AI
- 行业反馈Fine-Tuning Tool-Calling LLMs: A Complete Guide Using XYZ-Aquila-SFT and Qwen3MarkTechPost
- 行业反馈Local+privacy+focus on cache AI CLI and llama.cpp branch + Qwen3.xHacker News · AI
- 行业反馈Ultrafast Qwen3-TTS at 34 ms Time-to-First-Audio, Handling 10 Requests Per Second [OSS]Reddit r/LocalLLaMA
- 行业反馈I'm really hoping we're in 2026's 2-month-gap between QwQ and Qwen3 right nowReddit r/LocalLLaMA
- 当前判断该研究提示模型时间偏好可被外部干预,可能影响涉及延迟后果的 AI 建议系统(如金融、健康、规划)的可靠性与对齐策略。Agent Pulse · 分析
一项针对 Qwen3-32B 的研究发现,大语言模型的时间偏好(intertemporal preference)存在可测量的线性表征,并可通过对比激活加法(CAA)进行双向干预。研究者训练对比线性探针,在模型残差流中定位短期与长期方向,并在保留的二元时间选择任务、分布外货币跨期选择任务及 TravelPlanner 规划基准上评估干预效果。结果显示,干预能大幅双向改变模型在较小即时与较大延迟奖励之间的无差异阈值,并在适度干预下提升规划相关能力指标。该研究提示模型的时间偏好可测量且可干预,对涉及延迟后果的 AI 建议系统具有相关性。
该研究证明时间偏好方向可通过简单对比线性探针在残差流中识别,且 CAA 干预能产生大且双向的偏好变化,说明模型内部存在可操作的时间尺度表征。
该研究提示模型时间偏好可被外部干预,可能影响涉及延迟后果的 AI 建议系统(如金融、健康、规划)的可靠性与对齐策略。
对依赖模型长期建议(如财务规划、健康管理)的产品,该技术可能提供偏好校准手段,但需谨慎评估干预的鲁棒性与伦理边界。
后续可验证信号:该方向是否被复现于其他模型规模或架构,以及干预在真实世界长时任务中的稳定性与副作用。