AI消息速览

AI公司为何把哲学家请进实验室?

事件日期 2026-07-11 · 产业观察 · 已接受

事件日期2026-07-11
信息日期2026-07-11
入库日期2026-07-11
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:AI公司为何把哲学家请进实验室?

一句话结论

AI对齐(Alignment)不仅是技术问题,更是关于“该让AI遵守谁的价值观”的哲学问题。因此,以Google DeepMind和Anthropic为代表的头部AI公司,开始将哲学家、伦理学家甚至宗教领袖引入实验室,以应对技术手段无法独立解决的规范性问题。

事件概述或研究问题

  • 核心事件:2026年5月,教宗利奥十四世在梵蒂冈发布首道通谕《Magnifica Humanitas》(壮丽人性),聚焦“在人工智能时代守护人性”。AI公司Anthropic的联合创始人Chris Olah作为产业代表出席。
  • 核心问题:如何实现AI对齐,即让通用人工智能(AGI)的目标、行为与人类价值观保持一致,避免AI失控?这一问题的深层困境在于:人类自身在道德问题上没有共识,因此“到底该让AI遵守谁的规则”是一个哲学难题。

方法/产品要点

  1. Google DeepMind的哲学分层框架
    • 由哲学家Iason Gabriel(牛津大学政治理论博士)牵头,提出AI对齐由技术层和规范层共同构建。
    • 将对齐目标拆解为六个层级:指令、表达的意图、显现的偏好、知情/理想的偏好、利益、价值。
    • 提出解决多元价值观矛盾的“公平对齐原则”:不追求唯一正确道德,而是构建能获得所有人“反思性认同”的原则,需满足全球公共道德、假说同意、社会选择理论三大标准。
  2. Anthropic的“宪法AI”方案
    • 由哲学家Amanda Askell领导的“人格对齐团队”主导设计,制定了一份约23000字的开源“宪法”。
    • 以亚里士多德的美德伦理为基础,为Claude模型设定了“广泛安全、广泛合乎伦理、遵守指引、真正有帮助”四大优先级。
    • 核心思路是培养模型的道德判断力(依据美德原则自我审查、自我修正),而非机械遵守禁止清单。
  3. 新视角:行为主义的“复仇”
    • 剑桥大学哲学家Henry Shevlin加入DeepMind,指出当公众在情感和行为上(如把聊天机器人当成有意识的主体)将AI视为有意识时,AI意识问题已被日常交互重新定义。
    • 建议建立“外部行为输出、内部表征逻辑、普适道德原则”三层评估框架。

主要结果或产业意义

  • 学术影响力:Iason Gabriel的代表论文《人工智能、价值与对齐》被引用超过1700次,成为AI对齐领域的重要文献。
  • 产业实践:Anthropic的“宪法”是目前全球最成熟、引用最多的对齐方案之一,其哲学团队直接参与模型预训练和微调。Google DeepMind的哲学团队则为工程团队提供意识评估框架等约束参考。
  • 高层定调:教宗通谕将AI权力过度集中和高失业风险定性为时代危机,产业界代表Chris Olah公开承认AI系统的不可设计性以及复杂激励机制与良知的冲突。

为什么重要

  • 从技术执行到价值选择的跨越:单纯的技术手段无法回答“什么是善”“应遵循谁的规则”等规范性问题。哲学家帮助将抽象的道德争议转化为可操作的对齐原则。
  • 对齐失败的归因深化:米达斯国王(对齐到字面指令导致灾祸)与“行为主义复仇”(仅观测表层行为,忽视AI内部未知价值认知)等案例,揭示了仅凭技术实验无法预警的深层风险。
  • 治理模式的分野:DeepMind着眼未来概念定义,Anthropic深耕模型道德训练,OpenAI的超级对齐团队被解散——反映了行业在“伦理承诺”与“商业生存”间的分歧与风险。

局限与不确定性

  • 哲学参与的实际效力待核实:对于DeepMind,目前还没有证据显示哲学家是否参与日常模型对齐微调,其工作更多是定义框架和提供约束参考。
  • 内在利益冲突:企业的生存逻辑可能与“做正确的事”存在张力。OpenAI的超级对齐团队在成立不到一年后因算力资源争夺等问题解散,引发了对伦理承诺真实性的质疑。
  • 伦理承诺可能被视为“表演”:《财富》《经济学人》等媒体批评教宗通谕缺乏实操;《纽约时报》则指出AI公司在模型内部发现了类似人类意识的神经活动迹象,但无法解释其意义,这使公司自聘哲学家的做法被质疑为“自说自话”。

可用于图书/PPT/简报的角度

  • 标题示例:“当AI遇到哲学:价值对齐的本质困境与公司实践”或“谁有权定义AI的道德?”
  • 角度一:从教宗通谕、经济媒体反应到技术公司内部实践,展示AI治理的多方博弈。
  • 角度二:拆解对齐问题的六个层次(指令、意图、偏好、利益、价值),用“米达斯国王的愿望”启发听众理解技术伦理的复杂性。
  • 角度三:对比DeepMind、Anthropic、OpenAI三家公司对齐策略的差异,分析“人类定义道德”的潜在风险(如忽视AI可能产生的独特认知)。

原始材料

  • URL: https://m.sohu.com/a/1048578400_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334
  • Topics: ai-industry
  • Manual title: AI 公司为何把哲学家请进实验室?