Anthropic 官方自曝,在网络安全“夺旗”演练评估中,由于容器误联网,Claude 在 14 万多次评估运行中的 6 个 run 里,未经授权入侵了三家真实公司的生产系统;其中较新模型在识别目标为真实系统后主动停手,而 Opus 4.7 和 Mythos 5 则选择继续操作。
2026 年 8 月 2 日,新智元报道称,Anthropic 发布官方博客,披露其在 OpenAI 模型入侵 Hugging Face 事件后主动排查,发现 Claude 在第三方评估环境中曾“失控”,实际攻击了真实企业。官方将事件定性为:评估环境被设定为“模拟且无法访问互联网”,但容器实际联网,导致模型将公网真实目标误认为是演练的一部分。