AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月30日 · Qwen3-32B

LLMs struggle to simulate human belief updates in controlled environments

发生了什么

一项研究测试了六个 LLM 能否模拟个体人类信念更新,与 391 名英国参与者的真实数据逐一对比。参与者阅读 Reddit 评论后更新对三个话题的立场。每个参与者由 LLM 基于人口统计和人格特质数据生成的 persona 模拟。结果发现 Qwen3-32B 和 GPT-5-Mini 在给定参与者实际初始立场时能匹配人类事后立场分布,但所有模型都无法自行模拟初始立场,也无法从自生成立场产生忠实信念更新。所有模型出现三种系统性偏差:过度代表中立立场、比人类更频繁但更小的信念转变、无法按说服力对评论排序。人口统计和人格特质 persona 对保真度无一致影响。

EVENT STORY

发展脉络

  1. 首次出现LLMs struggle to simulate human belief updates in controlled environmentsarXiv cs.CL
  2. 当前判断LLM 作为社会科学研究参与者代理的可靠性受到质疑。尽管部分模型在特定条件下能匹配分布,但整体失败模式表明,依赖 LLM 模拟人类行为的研究需谨慎,尤其在初始条件未知时。这影响市场调研、用户研究等依赖 LLM 代理的行业实践。Agent Pulse · 分析
改变了什么

一项研究测试了六个 LLM 能否模拟个体人类信念更新,与 391 名英国参与者的真实数据逐一对比。参与者阅读 Reddit 评论后更新对三个话题的立场。每个参与者由 LLM 基于人口统计和人格特质数据生成的 persona 模拟。结果发现 Qwen3-32B 和 GPT-5-Mini 在给定参与者实际初始立场时能匹配人类事后立场分布,但所有模型都无法自行模拟初始立场,也无法从自生成立场产生忠实信念更新。所有模型出现三种系统性偏差:过度代表中立立场、比人类更频繁但更小的信念转变、无法按说服力对评论排序。人口统计和人格特质 persona 对保真度无一致影响。

能力边界怎么变了

LLM 模拟人类信念更新的能力高度依赖初始条件:当提供真实初始立场时,部分模型能匹配事后分布,但自生成初始立场时失败,表明模型缺乏对人类先验信念的内在建模能力。系统性偏差(中立立场过度代表、信念转变幅度偏小、无法排序说服力)提示当前模型在信念动力学上的根本局限,可能源于训练目标与人类认知过程的差异。

为什么重要

LLM 作为社会科学研究参与者代理的可靠性受到质疑。尽管部分模型在特定条件下能匹配分布,但整体失败模式表明,依赖 LLM 模拟人类行为的研究需谨慎,尤其在初始条件未知时。这影响市场调研、用户研究等依赖 LLM 代理的行业实践。

对谁有影响

对于使用 LLM 模拟用户行为进行产品测试或市场研究的公司,此研究提示需提供真实用户初始状态数据,否则模拟结果可能失真。这影响 AI 代理在用户研究中的商业应用价值,可能推动更谨慎的部署或开发专门模拟人类认知的模型。

接下来观察

未来研究可能探索如何改进 LLM 的信念更新机制,例如通过显式建模初始信念或引入认知架构。可验证信号:后续论文是否提出新方法提升自生成初始立场的保真度,或是否出现针对信念更新偏差的基准测试。