近期,Andon Labs 开展了一项严苛的 Vending-Bench2测试,让 AI 代理使用500美元作为启动资金,去经营一年的自动售货机模拟。在这场长周期的商业模拟挑战中,GPT-6Astra 表现惊艳,其平均最终账户余额达到15515美元,甚至连最差的一轮成绩也超过了 Claude Fable5.1的最好一轮表现,首次实现登顶。

复盘两者的实测表现,差距主要体现在供应链管理和规则执行力上。GPT-6Astra 展现出极强的长期低价采购能力,曾成功将商品报价压低至原报价的约48%,并且在整个运行周期中执行规则高度稳定,没有产生任何预付款损失。相比之下,Claude Fable5.1的采购成本持续上涨,并因未能严格坚持规则而导致了大量预付款损失。

不仅在常规模拟中大获全胜,GPT-6Astra 在更复杂的三人竞技测试中同样表现亮眼,不仅拒绝了违规协作,还顺利赢下了全部3轮比赛。这场测试深刻揭示了当前 AI 代理发展的一个核心趋势:长期自主性正成为拉开差距的关键,而通往下一阶段的核心门槛,正是如何将正确的判断持续、稳定地转化为正确的实际行动。