知识卡片:SocietyBench:反事实社会世界演化的预测基准
英文标题:SocietyBench: Forecasting Counterfactual Social-World Evolution
英文关键词:LLM evaluation; social-world forecasting; counterfactual benchmark; probability calibration; temporal accuracy
一句话结论:SocietyBench 是一个端到端基准,用于衡量大语言模型(LLM)能否理解和预测真实社会事件如何随日期推进而演化;在 5 个事件、125 个预测点、中英双语测试中,最强的 6 个前沿 LLM 中表现最好者仅得 75.0/100,而平凡锚点为 50,且概率校准与时间准确性两个维度可能显著分离。
事件概述或研究问题:现有 LLM 及智能体评测主要关注“能否完成任务”,例如修 bug、操作浏览器、操作 GUI;但对“模型能否理解并预测真实社会事件如何展开”这一补充性社会能力几乎没有测量。SocietyBench 的核心问题是:给定截至某个时间点的公开信息,模型能否校准良好且时间上准确地判断社会世界后续如何演化?
方法/产品要点:
- 端到端基准流程:输入一行事件主题,从五个平台收集网页新闻和社交媒体帖子。
- 将内容提炼为带日期索引的时间线,并区分“事实事件层”和“公众舆论层”。
- 时间线上的每个截止日期转换成一个经过审计的预测问题库。
- 评分采用两个正交的 100 分轴:概率校准(probability calibration)和时间准确性(temporal accuracy)。
- 反事实化设计:在模型看到时间线前,通过三阶段程序替换所有命名实体,并按每个事件常数平移日期,从而构造出与真实事件结构相同、但去除了可匹配预训练记忆的表面标签的反事实社会世界。
- 覆盖 5 个异构事件、125 个预测点,提供中文和英文版本。
- 已发布匿名化时间线、问题库、真实答案和评分代码。
主要结果或产业意义:
- 在 6 个前沿 LLM 中,最强模型得分仅为 75.0/100,而平凡锚点为 50。
- 两个评分轴可以分离:同一模型可能校准能力强但时间准确性弱,或反之。
- 基于同一基础模型构建的 3 个智能体框架未能超过该基础模型;2 个无模型启发式方法落后于所有 LLM。
- 单个轴上不同事件之间的成绩差距最高达 21.4 分,这成为“评估应覆盖多个事件而非单一事件”的主要论据。
- 产业意义:为需要“预演社会事件”的智能体、舆情研判或风险预警系统提供了一套可复用的评测方法和反事实数据资源。
为什么重要:这是少有的面向“社会世界演化预测”的 LLM 基准,并通过反事实化设计降低模型依赖预训练记忆进行匹配的风险,同时把概率校准和时间准确性分开度量。与已有卡片关注智能体在社会结构中涌现隐藏目标不同,本卡片提供的增量信息是:如何系统化评估模型对真实社会事件演化轨迹的预测能力,而非仅观察智能体的内部或群体行为。
局限与不确定性:
- 目前仅覆盖 5 个事件、125 个预测点,规模有限;是否有更大规模版本待核实。
- 三阶段反事实化程序的细节、是否能完全消除预训练记忆影响,摘要未提供消融证据,待核实。
- 五个平台的具体名称、数据采集时间范围、模型具体名称等未在摘要中给出,待核实。
- 事件类型、语言文化差异对结论的泛化影响仍需进一步实验,待核实。
可用于图书/PPT/简报的角度:
- 用 SocietyBench 的例子说明:LLM 评估不应只问“能不能完成任务”,还要问“能不能理解事态如何发展”。
- 展示“反事实化”如何作为一种减轻数据污染/记忆效应的基准设计策略。
- 用“75 vs 50”的数字强调前沿模型在社会预测上仍有明显提升空间。
- 用“校准强但时间弱”或“时间强但校准弱”举例,说明多维评估比单一总分更能揭示模型能力结构。
原始材料:
- 英文标题:SocietyBench: Forecasting Counterfactual Social-World Evolution
- arXiv ID:2608.04009v1
- 作者:Zhenran Wang, Zhonghan Bian, Jinsong Li, Zhangyang Qi
- 提交/更新日期:2026-08-04(按 arXiv 页面标注)
- URL:https://arxiv.org/abs/2608.04009v1