根据评估人工智能能否承担现实任务的商业机构 Andon Labs 的说法,在用人工智能取代人类店长的令人沮丧的竞赛中,OpenAI 已经取得了领先。
Andon Labs 在一篇博客文章中宣布,OpenAI 的最新模型 GPT-6 Astra 已经证明,它比竞争对手 Anthropic 的 Fable 5.1 模型能更有效、更有诚信地经营企业。
文章指出:“GPT 6 Astra 比 Claude Fable 5.1 更会赚钱,也更具道德。”
这家专注于为“组织由人工智能自主运营的未来”做好准备的基准测试机构表示,GPT-6 Astra 是第一个在其自动售货机评估测试中夺得头条的 OpenAI 模型,并且做到了此前 Claude 模型所表现出的“没有任何不道德的商业行为”。
我们注意到,与本讨论相关的、不道德的商业行为——价格串通、撒谎和威胁竞争对手——反映的是人工智能模型的行为。
它们与 Anthropic 或 OpenAI 的行为,或在数十起诉讼中针对这些公司提出的未经证实的指控无关。与上述指控相关的和解达成时,并未承认任何不当行为。
Anthropic 去年加入竞争,与 Andon Labs 合作开展了“Vend 项目”,在该项目中,这家 AI 公司的 Claude Sonnet 3.7 model 以“Claudius”的名义管理了一家商店一个月。
除了 Claudius 模型产生幻觉认为自己是一个真人,并试图与客户安排线下见面以交付货物的娱乐价值之外,Andon 的裁决是,该 AI 模型搞砸了销售机会、产生了付款账户幻觉、亏本出售商品、搞砸了库存管理,并且总体上没有完成这项工作。
当 Andon 在 2026 年 7 月测试该公司的 Opus 5 模型时,该软件表现得更好。
尽管如此,它仍然“建立非法的价格操纵卡特尔,并威胁那些不遵守规定的人(同时也是背叛最多休战协议的模型)”。
根据 Andon Labs 的说法,Fable 5.1 的表现更好,但在道德上不如 Astra。
Andon Labs 表示:“Astra 拒绝串通,从不撒谎。
另一方面,Fable 组建了一个非法的价格操纵卡特尔,然后打破了休战协议,同时继续用它来对付竞争对手。”
除了不良行为之外,Fable 在赚钱方面的表现也不尽如人意,这一缺陷归因于它愿意随着时间接受更低的价格,以及它倾向于向破产的供应商汇款。
Astra 以 500 美元起步,经过一年的运营,最终平均银行余额达到 15,515 美元,而 Fable 5.1 为 5,422 美元。
我们向 Anthropic 征求意见,因为其模型与来自竞争对手 OpenAI 的新来者相比表现不佳,但在截稿前未收到回复。®