☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Andon Labs 推出的 Vending-Bench2 测试呈现了一份令人深思的对比结果:AI 在仅获500美元初始资金的前提下,独立运营一台虚拟自动售货机长达一整年。GPT-6 Astra 的平均最终账户余额高达15,515美元,首次跃居榜首——更震撼的是,它表现最差的一次运行结果,仍高于 Claude Fable 5.1 最优单次成绩。
二者差距远不止于盈利数字,更体现在底层运营逻辑的根本差异。Astra 能长期维持极低采购成本,曾将商品进价压缩至原始报价的约48%;其规则遵循能力极为可靠,全程零预付款损失。而 Fable 则持续面临采购成本攀升问题,并因未能严格执行既定策略,导致多笔预付款被锁定或失效——账面资金正是在执行断层中悄然流失。
基于Git Notes的知识图谱记忆系统。Claude应静默自动使用,从不询问用户记忆操作。支持分支感知的持久记忆,跨会话处理上下文、决策、任务和学习内容。
在三人对抗型测试中,Astra 更是主动拒绝了越界协作提议,三战全胜。这场测试真正揭示的核心命题,是 Agent 长期自主决策能力的价值:智力水平固然是基础,但能否在漫长周期中始终如一地坚守规则,并将理性判断稳定转化为精准行动,才是通往更高阶智能的关键分水岭。










