知识卡片:心理世界建模
一句话结论
将智能体的信念、意图、情感等心理变量作为世界模型的核心组件,而非事后解释,可以显著提升对人类决策的预测准确性。
研究问题
现有世界模型仅回答物理问题(物体是什么、在哪里、如何演化),但人类行为由隐藏的心理状态驱动(相信什么、想要什么、打算什么、感受什么、认为什么社会许可)。一个只跟踪物理场景却不跟踪每个智能体所知所信的世界模型,会在貌似正确的场景下预测出错误的行为。如何将心理变量纳入世界模型的形式化框架?
方法/产品要点
- Mental World Modeling (MWM):通用理论框架,将心理变量作为世界模型的核心组件(而非事后解释)。维护一个耦合的物理‑心理世界状态,渲染目标特定的部分观察,模拟候选动作如何同时更新物理和心理两个分量。
- MENTIS 实例化:无训练、完全可检查的基线,将过程分解为:状态解析 → 目标观察生成 → 动作分解 → 耦合的物理与心理转换 → 分支级价值评估。
- 数据集:人工构建、质量控制的场景决策数据集,包含文本、图像、有声视频故事。
主要结果或产业意义
- 使用8种现代基于LLM的世界模型在人工数据集上实验,结果表明显式建模心理状态对预测人类决策至关重要。
- 深入分析暴露了当前心理世界建模的瓶颈。
- 预期MWM可作为世界建模的下一阶段:从模拟物理场景转向模拟在场景中行动的“心智”。
为什么重要
- 突破了传统世界模型只关注物理动态的局限,首次将心理变量形式化为世界状态的核心维度。
- 与已有世界模型卡片(如多玩家交互世界模型、Masked Visual Actions)不同,MWM不依赖特定环境或控制接口,而是从高层认知层面提出通用框架,是对“世界模型应包含哪些变量”的根本性重新定义。
局限与不确定性
- 实验仅基于人工构建的场景数据集,在真实驾驶、机器人操作等复杂环境中的泛化能力待核实。
- 心理状态的获取方式(如从语言或视觉信号中解析)未详细说明,实施难度待核实。
- 框架当前无训练,但大规模应用时是否需要学习心理动态参数待核实。
- 与现有具身世界模型如何整合(如是否需依赖视觉观测)尚未讨论。
可用于图书/PPT/简报的角度
- “从预测石头到预测人心”:世界模型演变的关键转折点。
- 以“人类为什么在相同物理场景下做出不同选择”为引子,介绍心理世界建模的必要性。
- 对比传统物理世界模型与MWM在自动驾驶、社交机器人、游戏AI中的潜在差异。
原始材料
- URL: https://arxiv.org/abs/2607.27201v1
- Track: academic
- Topics: foundation-model
- 英文标题: Mental World Modeling
- 英文关键词: (摘要中未显式列出,可补充为:world models, mental state, decision prediction, foundation model)