知识卡片:大型语言模型可预测社会科学实验结果
英文标题: Large language models can predict the results of social science experiments
英文关键词: Large language models, social science experiments, treatment effect prediction, GPT-4, human forecasting, human behaviour
一句话结论
大型语言模型(LLM)能够以与一组人类预测者相当的准确度预测社会科学实验的结果——即使是模型训练完成后才发表的实验也不例外——但会系统性高估效应量。
事件概述或研究问题
本研究旨在评估大型语言模型是否能够预测社会科学实验的结果,特别是那些不在训练数据中的实验。研究团队构建了一个包含70项预注册、美国全国代表性调查实验的档案(涉及469个实验效应和119330名参与者),并对比了LLM生成的预测与实际效应。
方法/产品要点
- 使用GPT-4(其训练数据截止日期早于实验中许多研究的发表时间)提示模型模拟美国代表性个体如何对实验刺激做出反应,然后通过比较不同条件下的模拟响应来推断处理效应。
- 同时测试了多个突出的开放权重模型。
- 除主档案外,还构建了一个包含15项大型研究(megastudies)、606个效应的二级档案,用于进一步验证。
- 所有数据和代码已公开(Code Ocean,网址待核实)。
主要结果或产业意义
- GPT-4的预测与实际处理效应高度相关,准确度与汇集的人类预测结果相似。
- 对于模型训练数据截止日期之后才发表或公开的研究,预测相关性仍然保持较高水平。
- 开放权重模型也表现出类似的预测能力。
- 在二级档案(15项大型研究)中,预测相关性较低,但与汇集专家预测者的表现相当。
- 局限: 预测系统性高估了效应量。
为什么重要
- 该研究表明LLM可以增强科学和实践中的实验方法,用于预测试(pilot testing)、干预选择(intervention selection)、识别需要复制的效应(identifying effects needing replication)等应用。
- 通过调查460名社会科学家,评估了可能的使用方式和感知风险(包括偏见和滥用),为负责任的AI使用提供了重要参考。
局限与不确定性
- 预测系统性高估效应量,可能导致对实际效果的夸大判断。
- 在大型研究档案中相关较低,提示对复杂多效应设计的预测能力有限。
- 存在潜在偏见和滥用风险(如模型内部偏差、错误使用)。
- 研究基于美国全国代表性调查实验,普适性需进一步验证。
可用于图书/PPT/简报的角度
- 科学研究: LLM可作为社会科学实验的“模拟被试”,辅助预注册实验假设、优化实验设计、筛选有前景的干预措施。
- 政策/商业实践: 在无法快速开展大规模实验时,可先用LLM快速生成效应估计,指导资源分配。
- 教学演示: 展示AI与社会科学交叉前沿,说明预测能力与局限并存。
原始材料
- Nature文章(2026年7月8日在线发表)
URL: https://www.nature.com/articles/s41586-026-10742-x
doi: 10.1038/s41586-026-10742-x - 数据与代码:https://codeocean.com/capsule/9843791/tree/v1
- 在线演示:https://treatmenteffect.app/