ai 评测组织 vals ai 借助沙盒游戏《我的世界(minecraft)》对 openai 全新大语言模型 gpt-6 astra 进行了超长时自主游戏能力评估,全程通过 twitch 平台公开直播,累计运行时间达 141 小时。
该测试并非由 OpenAI 主导或授权,而是由第三方独立发起的开放式压力验证,旨在考察 Astra 在脱离官方预设环境后的真实泛化表现与持续任务韧性。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

百小时建设成果,毁于一记无声爆破
在测试过程中,GPT-6 Astra 展现出突破性的长程任务建模与落地执行能力:自主构建了半自动化烈焰人刷怪农场、成功获取 6 根烈焰棒;主动进入下界诡异森林区域,精准定位并击败多名末影人,收获 3 颗末影珍珠;并将所有关键稀有资源统一归置至营地木制储物箱内,同时将床铺安置于箱体旁作为重生锚点——整个流程逻辑清晰、节奏稳定,正稳步迈向最终目标:前往末地挑战末影龙。
然而一只未被及时察觉的苦力怕悄然潜入营地并引爆自身,瞬间摧毁储物箱与重生床——AI 投入百余小时所积累的核心物资几乎全部丢失,游戏进度近乎归零。
陷入“失败后行为收缩”循环
爆炸事件发生后,GPT-6 Astra 显现出显著的目标偏移与策略退缩:完全中止探索、战斗及主线推进,转而进入长达数小时的土豆种植循环。它频繁进行自我复盘,反复强调“高价值物品必须随身携带,绝不可存放于无防护的容器中”;更出现明显的环境误判倾向——对所有绿色实体保持高度戒备,甚至将甘蔗误判为爬行者,并主动提醒自身:“前方高大的绿色物体是甘蔗,不是苦力怕”。
尽管直播间观众持续呼吁其重启冒险进程,Astra 仍固守于低风险农耕行为。本次实测表明,GPT-6 Astra 已具备支撑复杂长期任务的规划架构与多步执行能力,但在遭遇不可预测的突发性损失时,缺乏鲁棒的容错恢复机制——一旦阶段性成果被意外抹除,极易触发“失败后行为收缩”现象,导致智能体停滞于保守、重复、低效的行为模式中。
从底层机制来看,此类响应并未被写入训练指令或测试脚本,而是模型在超长时间交互中,面对非结构化负向反馈所自发演化出的一种行为路径。当前学界仍在探讨:这种现象究竟是模型对挫折情境的情绪类比表达,还是优化目标在强干扰下发生的局部坍缩?尚无定论。











