知识卡片:FriendBench——人类与多模态大模型的双人熟悉度推断基准
英文标题:FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models
关键词:FriendBench; Dyadic Familiarity Inference; Multimodal Large Language Models; Social Cognition; Benchmark
一句话结论
FriendBench 论文摘要指出:在从 20 秒双人对话片段推断“熟人还是陌生人”的任务上,最佳多模态大模型与人类总体的准确率在每种模态下统计上不可区分;但人类在两个答案类别上保持均衡,而最强模型系统性地倾向于回答“陌生人”——这被归因于有效先验的差异,而非判别能力的高低。
研究问题(事件概述)
已有的社交常识基准多关注语言内容,FriendBench 则关注“互动方式”。研究问题:仅凭一段 20 秒的“破冰”式双人对话片段,人类和模型能否判断这两人是早已熟悉还是初次见面?由于每一组双人对话都被给予相同类型的提示,只有互动方式本身能揭示答案。
方法/产品要点
- 新基准:FriendBench,覆盖“双人熟悉度推断”。
- 数据:共 96 个平衡双人对话片段(具体场景、人员构成待核实)。
- 模态:文本、音频、视频三种条件。
- 模型:来自 7 家公司的 26 个多模态大语言模型。
- 人类对照:匹配的人类评审组;具体人数、招募方式待核实。
- 发布:刺激物、人类评分、模型预测均已发布(获取方式与细节待核实)。
主要结果或产业意义
- 在文本、音频、视频每种模态下,最佳模型与人类群体的准确率在统计上无法区分。
- 人类回答在“熟悉/陌生”两类上保持均衡;最强模型则偏向“陌生人”。作者认为这不是判别力不足,而是模型使用了不同的有效先验。
- 更丰富的通道对模型和人类的提升并不一致:只有人类在语音之外还能从可见行为中获得额外收益;模型没有表现出同样的增益(具体数值待核实)。
- 产业意义:如果要在社交陪伴、面试辅助、具身机器人等场景中模拟人际感知,FriendBench 提示我们不能只优化“内容理解”,还要关注非内容性的行为线索,以及模型的回答偏置。
为什么重要
FriendBench 将社交认知中非常细微的“熟悉度”判断引入多模态大模型评估,补充了现有基准偏重任务型/知识型能力的缺口。它也揭示了人类与模型在准确率相当的情况下,可能通过完全不同的决策机制达到同样表现;这对“以准确率对齐人类”的评估方式提出了警示。
与既有脉络的关系
与 DataGovBench(数据分析)、SciVis(科学可视化素养)等已有卡片不同,FriendBench 属于“多模态社交常识”方向。其增量信息在于:以“双人熟悉度”作为任务对象,并明确指出模型与人类在回答分布上的系统性差异(陌生人偏置),而非仅是整体分数差距。
局限与不确定性
- 本文基于 arXiv 摘要元数据生成,未能抓取全文;具体模型名称、人类评审规模、准确率数值、统计检验方法、数据来源与构建细节均待核实。
- 摘要中“最佳模型”未给出具体名称;不同公司 26 个模型的列表待核实。
- “平衡双人组”的具体平衡方式、视频中的行为线索类型、是否包含文化/语言多样性等,均待核实。
- 结论是否在更广泛社会场景中成立,待原文进一步验证。
可用于图书/PPT/简报的角度
- 社交 AI 不能只看“说什么”,还要看“怎么说”。
- 多模态大模型在准确率上可能接近人类,但内部决策偏置可能完全不同。
- “熟悉 vs 陌生”是一种低成本、可扩展的社交认知探针;FriendBench 可作为示例引证。
- 评估模型社交能力时,除了平均准确率,还应报告回答分布/先验偏置。
原始材料
- 英文标题:FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models
- arXiv: 2607.29602v1
- URL: https://arxiv.org/abs/2607.29602v1