Rolling With Resistance: Preference-Optimized LLM Counselors Can Trade Goal Persistence for Relational Attunement in Motivational Interviewing
arXiv 论文 2607.28814v1 提出在动机性访谈(MI)中,用双轴评估(目标坚持 GP 与关系协调 RA)来刻画咨询师对阻抗的反应,并基于 AnnoMI 语料构建偏好优化数据,测试偏好优化是否教会模型“随阻力而动”或引发相反行为。
Development
- First ReportRolling With Resistance: Preference-Optimized LLM Counselors Can Trade Goal Persistence for Relational Attunement in Motivational InterviewingarXiv cs.CL
- Current Assessment该研究为对话 AI 的偏好优化提供了新的评估维度,表明优化目标的选择可能引发非预期的行为偏移。对构建心理咨询等敏感领域 AI 的团队有参考价值,提示需谨慎设计偏好信号以避免模型走向极端。Agent Pulse · analysis
该研究针对动机性访谈中咨询师应对来访者维持性谈话(sustain talk)的“随阻力而动”(rolling with resistance)技巧,指出失败有两种相反模式:屈服(放弃改变议程以维持关系)或对抗(争辩或指导,侵犯自主性)。作者引入基于 MITI 编码的双轴评估——目标坚持(GP)与关系协调(RA),形成四象限框架,其中“随阻力而动”要求两者都高。研究从专家标注的 AnnoMI 语料构建主题不相交的 DPO 数据,偏好集仅在被拒绝的失败类型上不同,并使用 on-policy 负样本。自动评判器经 AnnoMI 专家标签验证并由训练过的人类编码员复核,在模型族、生成、标注、评判分离的防火墙下,对三个对齐指令模型进行盲测成对胜率。
该研究将偏好优化中的失败模式细化为两种相反类型,并构建仅在被拒绝样本上不同的 DPO 数据,以隔离优化目标的影响。这种“防火墙”设计(模型族、生成、标注、评判分离)提高了评估的可靠性。未来可关注:该方法能否推广到其他对话任务,以及 GP 与 RA 的权衡是否在更大模型上呈现不同模式。
该研究为对话 AI 的偏好优化提供了新的评估维度,表明优化目标的选择可能引发非预期的行为偏移。对构建心理咨询等敏感领域 AI 的团队有参考价值,提示需谨慎设计偏好信号以避免模型走向极端。
对提供对话式 AI 服务的公司,该研究提示偏好优化可能引入行为风险,需在部署前进行多维度评估。对心理咨询 AI 产品,可借鉴其评估框架以提升安全性与有效性。
后续可验证信号:该方法是否被应用于其他对话系统或临床场景,以及是否出现基于 GP/RA 的自动评估工具。