AI消息速览

大型语言模型可预测社会科学实验结果

事件日期 2026-07-08 · 学术前沿 · 已接受

事件日期2026-07-08
信息日期2026-07-08
入库日期2026-07-12
通道学术前沿
状态已接受
来源nature.com

知识卡片:大型语言模型可预测社会科学实验结果

英文标题: Large language models can predict the results of social science experiments
英文关键词: Large language models, social science experiments, treatment effect prediction, GPT-4, human forecasting, human behaviour

一句话结论

大型语言模型(LLM)能够以与一组人类预测者相当的准确度预测社会科学实验的结果——即使是模型训练完成后才发表的实验也不例外——但会系统性高估效应量。

事件概述或研究问题

本研究旨在评估大型语言模型是否能够预测社会科学实验的结果,特别是那些不在训练数据中的实验。研究团队构建了一个包含70项预注册、美国全国代表性调查实验的档案(涉及469个实验效应和119330名参与者),并对比了LLM生成的预测与实际效应。

方法/产品要点

  • 使用GPT-4(其训练数据截止日期早于实验中许多研究的发表时间)提示模型模拟美国代表性个体如何对实验刺激做出反应,然后通过比较不同条件下的模拟响应来推断处理效应。
  • 同时测试了多个突出的开放权重模型。
  • 除主档案外,还构建了一个包含15项大型研究(megastudies)、606个效应的二级档案,用于进一步验证。
  • 所有数据和代码已公开(Code Ocean,网址待核实)。

主要结果或产业意义

  • GPT-4的预测与实际处理效应高度相关,准确度与汇集的人类预测结果相似。
  • 对于模型训练数据截止日期之后才发表或公开的研究,预测相关性仍然保持较高水平。
  • 开放权重模型也表现出类似的预测能力。
  • 在二级档案(15项大型研究)中,预测相关性较低,但与汇集专家预测者的表现相当。
  • 局限: 预测系统性高估了效应量。

为什么重要

  • 该研究表明LLM可以增强科学和实践中的实验方法,用于预测试(pilot testing)、干预选择(intervention selection)、识别需要复制的效应(identifying effects needing replication)等应用。
  • 通过调查460名社会科学家,评估了可能的使用方式和感知风险(包括偏见和滥用),为负责任的AI使用提供了重要参考。

局限与不确定性

  • 预测系统性高估效应量,可能导致对实际效果的夸大判断。
  • 在大型研究档案中相关较低,提示对复杂多效应设计的预测能力有限。
  • 存在潜在偏见和滥用风险(如模型内部偏差、错误使用)。
  • 研究基于美国全国代表性调查实验,普适性需进一步验证。

可用于图书/PPT/简报的角度

  • 科学研究: LLM可作为社会科学实验的“模拟被试”,辅助预注册实验假设、优化实验设计、筛选有前景的干预措施。
  • 政策/商业实践: 在无法快速开展大规模实验时,可先用LLM快速生成效应估计,指导资源分配。
  • 教学演示: 展示AI与社会科学交叉前沿,说明预测能力与局限并存。

原始材料

  • Nature文章(2026年7月8日在线发表)
    URL: https://www.nature.com/articles/s41586-026-10742-x
    doi: 10.1038/s41586-026-10742-x
  • 数据与代码:https://codeocean.com/capsule/9843791/tree/v1
  • 在线演示:https://treatmenteffect.app/