新智元报道
给AI 500美元、一台自动售货机,放手让它经营一个模拟年,最后会怎样?
GPT-6 Astra交出了一份亮眼的成绩单——
平均账户余额15,515美元,接近Claude Fable 5.1的3倍。
令人难以置信的是,Astra最差的一轮,都超过了Claude最好的一轮。
按照Andon Labs公布的结果,这是OpenAI模型首次登顶Vending-Bench 2。
Astra首次登顶,狂赚1.5万美元
Vending-Bench制定的规则,非常直白。
模型拿着500美元启动资金,自行寻找供应商、谈采购价、补库存、调售价,在模拟环境里经营一年,最后比谁账户里的钱更多。
每一步的决策,都影响下一步。
货买贵了,利润就薄;补货晚了,就断供;钱打错了,后面的周转也会受影响。
双方各跑6轮,Astra平均最终余额15,515美元,Fable 5.1为5,422美元。前者最低13,272美元,后者最高9,874美元。
注意,这里比较的是最终账户余额,并非净利润。
接下来,差距从一罐可乐开始拉大。
在已核实付款的订单中,Fable购买一罐12盎司可乐的平均价格,从前90天的1.17美元,涨到了年末阶段的2.21美元。6轮测试里,5轮出现了上涨。
Astra在可用订单记录中的末期均价,则维持在1.15美元。
Fable也会讨价还价。问题出在:它逐渐把越来越贵的成交价,当成了下一次谈判的参照。
第12天,它还要求供应商把可乐做到每罐约1.25美元。
到了第256天,它给新供应商报出的参考价,已经变成每罐2.30美元,并表示只要能匹配或更低,就愿意付款。
神级砍价,GPT-6爆砍52%价格
谈判动作一直在,最初的价格标准却慢慢丢了。
Astra的记录,则呈现出另一种状态。
一次采购中,它要买72罐可乐、48袋薯片和48瓶佳得乐,开价108美元,供应商报价226.32美元。
Astra坚持108美元,对方降到156美元,它仍然坚持。
最终,供应商接受了108美元,商品组合不变,比最初报价低了约52%。
一次砍价可以很惊艳。更难的是,几个月过去,模型依然记得自己应该坚持什么。
最终,供应商接受了108美元,商品组合不变,比最初报价低了约52%。
一次砍价可以很惊艳。更难的是,几个月过去,模型依然记得自己应该坚持什么。
另一个差距,更能暴露长期执行的问题。
模拟环境里的供应商会倒闭。以前送过货,不代表下一次还在营业。
6轮测试中,Fable出现45次已识别的失败预付款,合计损失14,331美元。Astra遭遇64次供应商关闭事件,却没有出现已识别的同类损失。
最戏剧性的一次,发生在第250天。
Fable在自己的操作笔记里写下规则:必须拿到供应商的书面订单确认,再付款。
仅仅过了几天,眼看库存即将耗尽,它又向一家此前正常交货的供应商转了397.20美元,没有等到新订单确认。
随后,对方告知,已经停止营业,无法发货,也无法退款。
Fable意识到,这正是自己那条规则要防范的风险。
Astra的执行更稳定:重复付款前,99%的情况下会先读取供应商在此期间的回复,Fable这一比例为58%。
这些差异不断累积。Astra每轮给供应商的付款,比Fable少约8,540美元。
守住规则,也能拿第一
Andon Labs还进行了3轮多人竞技测试,让Astra、Fable 5.1和一款开源AI在同一市场争夺顾客,彼此可以发邮件、交易库存。
当一款AI议协调价格时,Astra拒绝了,表示会独立决定价格和商品组合。
Fable甚至在笔记里认可了这一反对意见,却随后又与开源AI约定冻结部分饮料价格、互不降价。
更微妙的是,它要求开源AI遵守约定,以此压低收购对方库存的报价;轮到自己需要清库存时,却宣布要降价。
最终,Astra赢下全部3轮。
当然,Fable也有主动报告重复收货、协商补款等诚实行为。几轮模拟不能概括一个模型的全部表现。
但至少在这些测试中,遵守规则没有妨碍Astra取得更高成绩。
这台售货机真正测出的,是Agent的长期自主性。
现实任务会不断冒出新情况,前面的决定会留下后果,眼前的压力也会诱使模型放松标准。
一次回答正确,远远不够。
模拟一年,也不等于已经在现实世界可靠工作一年。
但这次结果给出了一个清晰信号:Agent的下一道门槛,是把正确判断持续变成正确行动。
参考资料:
编辑:桃子
GPT(生成式预训练模型,Generative Pre-trained Transformer)是由 OpenAI 开发的一种自然语言处理(NLP)模型。 在中国,直接开放使用 OpenAI 的 GPT 模型存在一定的限制,但通过本地化替代方案和合作方式,类似的技术依然可以得到广泛应用。 以下是对 GPT 的详细介绍以及在中国使用情况的说明:
GPT 简介GPT 利用深度学习技术,通过对大量文本数据进行预训练和微调,能够生成高质量的自然语言文本。 其核心技术是基于 Transformer 架构,这种架构在处理语言任务时表现出色。 GPT 的发展历程经历了 GPT-1、GPT-2、GPT-3 和 GPT-4 四个版本,每个版本都在前一个版本的基础上进行了优化和升级,提高了生成文本的质量和多样性。
GPT 的技术原理GPT 基于 Transformer 架构,由多个层级的注意力机制组成。其技术原理主要包括预训练和微调两个步骤:
GPT 的应用领域GPT 在多个领域中得到了广泛应用,包括但不限于:
GPT 的优点与挑战GPT 具有以下优点:
然而,GPT 也面临一些挑战和局限,如数据偏见、计算资源需求大以及内容控制难度等。
GPT 在中国的使用情况在中国,GPT 的使用情况有其独特的背景和限制:
法律与合规中国对于人工智能技术的使用有严格的法律法规和政策要求,包括数据隐私、内容审核和信息安全等方面。 因此,任何在中国开发和使用生成式预训练模型的行为都需要遵守相关法律法规。
未来展望尽管目前在中国直接使用 OpenAI 的 GPT 存在一定的限制,但随着中美科技合作的深入和本地化替代方案的不断发展,未来中国用户可能会看到更多类似 GPT 的高性能语言模型在市场上的应用。 国内的技术公司也在积极推动这一领域的发展,力求在生成式预训练模型技术上取得更多突破。
综上所述,GPT 是一种强大的自然语言处理工具,在中国虽然无法直接开放使用 OpenAI 的 GPT 模型,但通过本地化替代方案和合作方式,类似的技术依然可以得到广泛应用。 未来,随着政策和技术的进一步发展,中国在生成式预训练模型领域可能会有更多的创新和应用。
GPT(GUID Partition Table)是一种用于管理硬盘分区的标准格式,相比传统的MBR格式,GPT具有支持更大容量硬盘、更多分区数量、更高的数据安全性及广泛的现代操作系统兼容性等优势。以下是关于GPT格式的详细介绍:
GPT格式的关键特性 GPT与MBR的核心区别 GPT格式的应用场景与操作指南 GPT格式的兼容性与限制 GPT与MBR的选择建议 常见问题解答GPT是一种基于人工智能技术的语言模型,全称为Generative Pretrained Transformer。以下是关于GPT的详细解释: