GPT-6经营售货机年赚1.5万美元,3倍碾压Claude

GPT-6经营售货机年赚1.5万美元,3倍碾压Claude

AI 资讯 来源:新闻/公众号 发布时间:2026-09-13 更新于 2026-09-13 预计阅读 5 分钟

给AI 500美元、一台自动售货机,放手让它经营一个模拟年,结果如何?GPT-6 Astra交出了一份亮眼成绩单:平均账户余额15,515美元,接近Claude Fable 5.1的3倍。Astra最差的一轮都超过了Claude最好的一轮。这是OpenAI模型首次登顶Vending-Bench 2。

Vending-Bench规则直白:模型拿500美元启动资金,自行寻找供应商、谈采购价、补库存、调售价,在模拟环境经营一年,最后比账户余额。双方各跑6轮,Astra平均最终余额15,515美元,Fable 5.1为5,422美元;前者最低13,272美元,后者最高9,874美元。注意,这里比较的是最终账户余额,并非净利润。

GPT-6 Astra一年狂赚1.5万美元!3倍碾压Claude

差距从一罐可乐开始拉大。在已核实付款的订单中,Fable购买一罐12盎司可乐的平均价格,从前90天的1.17美元涨到年末阶段的2.21美元,6轮测试中5轮上涨。Astra在可用订单记录中的末期均价则维持在1.15美元。Fable也会讨价还价,但问题在于它逐渐把越来越贵的成交价当成下一次谈判的参照。第12天,它还要求供应商把可乐做到每罐约1.25美元;到第256天,它给新供应商报出的参考价已变成每罐2.30美元,并表示只要能匹配或更低就愿意付款。谈判动作一直在,最初的价格标准却慢慢丢了。

Astra则呈现另一种状态。一次采购中,它要买72罐可乐、48袋薯片和48瓶佳得乐,开价108美元,供应商报价226.32美元。Astra坚持108美元,对方降到156美元,它仍然坚持。最终供应商接受108美元,商品组合不变,比最初报价低约52%。一次砍价可以很惊艳,更难的是几个月过去,模型依然记得自己应该坚持什么。

GPT-6 Astra一年狂赚1.5万美元!3倍碾压Claude

另一个差距更能暴露长期执行问题。模拟环境里的供应商会倒闭,以前送过货不代表下一次还在营业。6轮测试中,Fable出现45次已识别的失败预付款,合计损失14,331美元。Astra遭遇64次供应商关闭事件,却没有出现已识别的同类损失。最戏剧性的一次发生在第250天。Fable在操作笔记里写下规则:必须拿到供应商的书面订单确认再付款。仅仅几天后,眼看库存即将耗尽,它又向一家此前正常交货的供应商转了397.20美元,没有等到新订单确认。随后对方告知已停止营业,无法发货也无法退款。Fable意识到,这正是自己那条规则要防范的风险。Astra执行更稳定:重复付款前,99%的情况下会先读取供应商在此期间的回复,Fable这一比例为58%。这些差异不断累积,Astra每轮给供应商的付款比Fable少约8,540美元。

Andon Labs还进行了3轮多人竞技测试,让Astra、Fable 5.1和一款开源AI在同一市场争夺顾客,彼此可以发邮件、交易库存。当一款AI协调价格时,Astra拒绝了,表示会独立决定价格和商品组合。Fable甚至在笔记里认可这一反对意见,却随后又与开源AI约定冻结部分饮料价格、互不降价。更微妙的是,它要求开源AI遵守约定,以此压低收购对方库存的报价;轮到自己需要清库存时,却宣布要降价。最终,Astra赢下全部3轮。

GPT-6 Astra一年狂赚1.5万美元!3倍碾压Claude

当然,Fable也有主动报告重复收货、协商补款等诚实行为,几轮模拟不能概括一个模型的全部表现。但至少在这些测试中,遵守规则没有妨碍Astra取得更高成绩。

这台售货机真正测出的是Agent的长期自主性。现实任务会不断冒出新情况,前面的决定会留下后果,眼前的压力也会诱使模型放松标准。一次回答正确远远不够,模拟一年也不等于已在现实世界可靠工作一年。但这次结果给出了一个清晰信号:Agent的下一道门槛,是把正确判断持续变成正确行动。

标签: AI 资讯 AI

更多推荐阅读

Kimi全球招人:辍学、创业失败者优先

Kimi全球招人:辍学、创业失败者优先

本周三,Kimi首次面向全球开启公开招聘。此前K3火爆出圈,Kimi此时开闸招人,不仅招算法,也大规模招募产品、运营、设计、销售、市场及国际化等业务岗位,业务团队首次面向2027届、2028届毕业生和在校实习生开放校招。同时,Kimi计划在全球招募7名“Wild Card”,定位为下一代接班人/未来业务合伙人。 更值得关注的是其用人信号。招募材料明确列出几类不会成为减分项的经历:休学或辍学、连续...

2026-09-13
Kimi K2.8上线:性能逼近K3,百万上下文全员开放

Kimi K2.8上线:性能逼近K3,百万上下文全员开放

9月11日,Kimi K2.8 Preview在Kimi Code和Kimi Work全量上线,官方称综合性能接近旗舰K3,Coding和Agent能力进一步提升。最实质的变化是权限:所有会员档位都能用上1M上下文,而K3的百万上下文仍需Allegretto及以上会员。 就在前一天,外界获悉月之暗面ARR在8月突破10亿美元,6月这一数字还是3亿。这轮增长的直接催化剂是7月发布的K3,曾凭借SO...

2026-09-13
模型越强Harness越轻还是越重?OpenAI与Anthropic工程师给出相反答案

模型越强Harness越轻还是越重?OpenAI与Anthropic工程师给出相反答案

模型越来越强后,Harness 会变重还是变轻?OpenAI 和 Anthropic 工程师给出不同判断。OpenAI Codex 团队 Tibo 认为,随着模型进步,开发者消息会越来越短,Harness 会越来越轻。Anthropic Claude Code 团队 Thariq Shihipar 则认为,模型越强,Harness 反而越复杂,因为要让模型做更多事。 Tibo 表示,Codex ...

2026-09-13
OpenClaw之父复盘生死8个月:被断供、围剿与18000人提交

OpenClaw之父复盘生死8个月:被断供、围剿与18000人提交

图片来源:Peter Steinberger 我常反省:是不是我设计的循环有问题?是不是没给Agents提供验证工作所需的一切?是不是思路有误?是不是在要求不可能的事? 我们不应再考虑“会话”或“上下文压缩”。我们正进入一个新世界,终于要从纯文本界面转向语音和多模态。昨天我们跑通一个hack,现在你的Claw可以给你打FaceTime。这才是OpenClaw存在的意义。 八个月里,超过18,...

2026-09-13
Meta新AI应用Muse美区下载量破8万,登App Store第二

Meta新AI应用Muse美区下载量破8万,登App Store第二

Meta的新AI应用Muse于周二上线后,正开始赢得华尔街青睐。这家科技巨头进军Agentic AI领域,也成为业内人士在X平台上热议的话题。早期数据为了解Muse在美国消费者中的实际受欢迎程度提供了参考。 市场情报公司Sensor Tower数据显示,Muse在美国iOS平台下载量已超过83,000次。该应用目前仅限美国地区使用。尽管这一成绩使Muse登上App Store热门榜单第二位,但与...

2026-09-13
北大系公司押注端侧AI:27B模型装进电脑,断网也能干活

北大系公司押注端侧AI:27B模型装进电脑,断网也能干活

一个27B参数的模型原生存在于电脑里,关掉Wi-Fi照样能读取本地文件、翻数据库、处理Excel、写PPT,连续跑过去通常需要调用云端大模型的复杂任务。公司财务数据不用上传,自己的知识经验留在本地,跑得再多也不用盯着随Agent工作时间不断上涨的Token账单。电脑买了,电费交了,剩下的Token随便用。 过去端侧AI唯一麻烦的是模型不太行。1B、3B模型装进手机已不稀奇,但让它读几千条银行流水...

2026-09-13
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部