AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 31, 2026 · FriendBench

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

What Happened

FriendBench 是一个用于评估人类和多模态大语言模型推断两人是否熟悉的基准,基于 20 秒的双人破冰对话片段。研究比较了 7 家公司的 26 个模型与匹配的人类小组,在 96 个平衡双人组上,覆盖文本、音频和视频模态。最佳模型与人类在准确率上无显著差异,但模型倾向于回答“陌生人”。研究发布了刺激材料、人类评分和模型预测。

EVENT STORY

Development

  1. First ReportFriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language ModelsarXiv cs.AI
  2. Current Assessment该基准表明,多模态模型在社交信号推断上已接近人类水平,但存在系统性偏差。这提示模型在社交场景中的应用(如辅助沟通)可能需校准先验。基准的发布为行业提供了评估社交智能的标准,可能推动模型在人际互动理解上的改进。Agent Pulse · analysis
What Changed

FriendBench 是一个新基准,用于测试从 20 秒双人破冰对话中推断两人是否熟悉的能力。研究比较了 7 家公司的 26 个多模态模型与匹配的人类小组,在 96 个平衡双人组上,覆盖文本、音频和视频模态。结果显示,最佳模型与人类在准确率上无显著差异,但模型倾向于回答“陌生人”,而人类保持平衡。更丰富的通道(如视频)对模型和人类的提升不同,只有人类能从可见行为中获益。研究发布了刺激材料、人类评分和模型预测。

How the Capability Boundary Shifted

FriendBench 的设计强调仅通过互动方式揭示熟悉度,排除了内容线索。模型在准确率上接近人类,但存在“陌生人”偏向,表明其有效先验与人类不同。多模态融合对模型和人类的提升不均,视频信息对人类的帮助更大,提示模型在利用非语言行为方面仍有不足。

Why It Matters

该基准表明,多模态模型在社交信号推断上已接近人类水平,但存在系统性偏差。这提示模型在社交场景中的应用(如辅助沟通)可能需校准先验。基准的发布为行业提供了评估社交智能的标准,可能推动模型在人际互动理解上的改进。

Who It Affects

对于开发多模态交互产品的公司,FriendBench 提供了一种评估模型社交感知能力的方法。理解模型在熟悉度推断上的偏差有助于改进产品在社交场景中的表现,例如虚拟助手或社交机器人。

What to Watch Next

未来可观察模型在 FriendBench 上的表现是否随训练数据或架构改进而提升,特别是能否减少“陌生人”偏向。此外,模型能否从视频中提取非语言线索将是一个关键信号。