昨晚刷到了 andrej karpathy 的一条推文,愣神了几秒。
他把《指环王》第一章开篇文字丢给了 Claude Opus 5,配上约 10 美元(对应 100 万 Token)的预算,只提了一个要求:
用 Three.js 将这段文字渲染成一个三维场景。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

随后,Opus 5 开始执行。
持续运行近两小时,最终输出约 5500 行代码,硬是从一段小说文本中“手搓”出一个可交互的 3D 中土世界。
注意,这不是视频生成,也不是图像合成——而是纯代码构建的实时可运行程序!
每棵树的位置、每块岩石的几何体、道路的曲率、房屋的结构、角色的初始站位……全部由模型通过代码定义;镜头推进、时间轴动画、光照变化,也均由程序逻辑驱动。
你可以在浏览器中打开它:河流缓缓流淌,夏尔丘陵起伏,林木错落分布。虽略显简陋(Karpathy 坦言其“janky”,即粗糙、不稳定),但它确确实实是一个能加载、能渲染、能随时间演进的 Three.js 场景。
Karpathy 还为这个项目单独搭建了体验页面:

地址:https://www.php.cn/link/856b909fc5eb9119e36a007b4ebeb72b
在过去,实现类似效果需编剧拆解叙事、美术制作资产、程序员编写引擎逻辑与动画系统,耗时数月、成本动辄数十万美元。如今,10 美元、两小时,搞定。
正如 Karpathy 所言:“没有一个正常人会愿意花时间写这种高度定制化的程序,但大语言模型拥有全世界最不值钱、也最取之不尽的耐心。”
曾经被判定为“不值得投入”的任务——专属剧情的虚拟世界、一次性使用的交互式叙事、仅服务于某段文本的 3D 演绎——如今 AI 都能一键生成。
他的设想更进一步:将用户直接置入这类即时生成的世界,作为旁观者参与《指环王》开场,或化身霍比特人踏上旅程。他称之为“按需生成的临时 GTA”。
在 Opus 5 能连续两小时稳定输出 5500 行结构化代码的当下,这已非科幻畅想。
顺带提一句“彩蛋”。一年前,马斯克曾在 X 上公开喊话 Karpathy:“Andrej, my long lost brother, let us work together again!”(安德烈,我失散多年的兄弟,让我们再次并肩作战吧!)

而今年 5 月,这位“失散已久的兄弟”正式加入 Anthropic。
就在 Karpathy 使用 Anthropic 自家模型完成这项刷屏实验的帖子下方,马斯克只回了一个词:Yah。

八卦暂且按下,回到正题。
真正让我盯着屏幕沉默良久的,是 Karpathy 在总结中点出的关键矛盾:
LLM 具备惊人的构建能力,却缺乏原生的验证能力——它既无法高效观看连续帧构成的视频流,也无法进入自己生成的三维空间中进行沉浸式体验与调试。
Opus 5 创造了一个中土世界,却无法走进去走一走、看一看、试一试。
整整两个小时里,它只能依赖最原始的方式自查:在关键时间节点截取静态画面,逐张比对、推测逻辑是否正确。过程中多次出错,那些“粗糙感”与 Bug 正源于此。
你甚至能感受到一丝微妙的悲凉?。
就像一位技艺精湛的装修师傅,刷墙快、贴砖准、电路布得清清楚楚——唯独全程蒙着眼,只能靠敲击声和指尖触感判断墙面是否平整。
细想之下,这颇具反讽意味:一个模型能凭空生成完整三维宇宙,却无法以第一视角踏入其中确认自己有没有把门装反。
而这远不止是 3D 渲染领域的局限。
当前前沿模型在代码生成、长文撰写、逻辑推理等维度已飞速跃升,10 美元即可交付过去需团队协作数周的成果。
但问题在于——产出之后呢?它无法自主评估质量。编码能力狂飙突进,验证能力却仍滞留在原地。
这是一种奇特的失衡:一端是近乎无限的生产力与耐心,另一端却是缺席的“自我感知”与“成果反馈闭环”。

因此,下一阶段的竞争焦点,或将聚焦于——谁能率先让 AI 实现丝滑、低延迟、多模态的自我审查。
写到这里,我突然意识到:这不正是递归式自我改进(Recursive Self-Improvement, RSI)落地的第一块真实跳板吗?
嘿!这事,真成了。
参考资料:https://www.php.cn/link/19b8457afbfcf6a6e0e8731c72a0021d
本文来自微信公众号“新智元”,作者:ASI启示录;编辑:所罗门,36氪经授权发布。











