知识卡片:Karpathy用10美元让Opus 5生成《指环王》3D交互场景
英文标题: Karpathy's $10 Budget for Opus 5 to Generate a 3D Interactive Lord of the Rings Scene
英文关键词: AI agent; Opus 5; Three.js; 3D interactive scene; virtual world generation; long-horizon coding
一句话结论
Karpathy以约10美元、约100万Token的预算,让Opus 5模型自主运行近两小时,写出约5500行代码,将《指环王》开篇文字做成了可交互的3D场景。这个实验展示了大模型按需生成临时虚拟世界的潜力,也暴露了模型无法原生感知视频、只能靠静态截图自检的局限。
事件概述
腾讯研究院AI速递报道,Karpathy给Opus 5约100万Token(成本约10美元)预算,要求用Three.js把《指环王》开篇文字做成可交互3D场景。模型自主运行近两小时,写出约5500行代码,完成了资产建模、坐标摆放与镜头动画。最终效果粗糙,但整体可玩。
方法/产品要点
- 模型:Opus 5
- 预算:约100万Token,成本约10美元
- 任务:用Three.js把《指环王》开篇文字转化为可交互3D场景
- 过程:模型自主运行近两小时,生成约5500行代码
- 输出:包含资产建模、坐标摆放与镜头动画的3D交互场景
主要结果或产业意义
Karpathy设想未来大模型可按需生成临时虚拟世界。本次实验以极低成本展示了AI在长程编程和3D内容生成上的潜力,可能对游戏制作、虚拟世界快速原型等领域有意义。但模型“能写游戏却难自检”,因为无法原生感知视频,只能靠静态截图慢慢调整。
为什么重要
该案例属于AI智能体自主完成复杂任务的前沿演示,由知名AI研究者Karpathy发起,成本低、过程长、产出完整。相比一般代码生成评测,它强调了模型在“视觉反馈循环”上的瓶颈:生成的是3D交互场景,却无法直接“看”结果。这为后续开发多模态自检能力提供了方向,也与已有算法设计智能体类卡片形成互补——本条聚焦于交互式3D内容生成中的自主性与视觉自检难题。
局限与不确定性
- 材料未说明Opus 5的具体版本和参数,待核实。
- 生成场景的实际视觉效果、交互流畅度等细节待核实。
- 模型无法原生感知视频,只能靠静态截图调整,因此效果粗糙。
- “未来大模型可按需生成临时虚拟世界”目前是Karpathy的设想,尚未成为产品。
可用于图书/PPT/简报的角度
- 作为“AI智能体自主编程”的成功案例:一次提示,两小时自主工作,生成可玩场景。
- 作为“AI创作工具的成本优势”案例:10美元成本与传统3D场景开发成本对比。
- 作为“AI与视觉自检”的讨论入口:能写代码不代表能评估输出,多模态闭环是关键。
原始材料
腾讯研究院AI速递 20260804。 来源:https://m.sohu.com/a/1058375324_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334