尽管人工智能公司员工在7月份曾发表公开信,呼吁前沿AI实验室放慢研发速度,这一呼吁也得到了Anthropic首席执行官Dario Amodei的支持(他本月早些时候也表达了同样的观点),但新的AI模型仍在持续快速地发布。Anthropic和OpenAI都在周二发布了各自的新模型:Anthropic发布了Claude 5.5版本,OpenAI发布了GPT-6 Sol和GPT-6 Luna版本。Dario Amodei在2026年9月12日的一篇在线文章中表示:“我们必须放慢提升AI模型能力的速度。”这一观点与那些在公开信中署名的AI员工们的呼吁是一致的。十天后,Anthropic宣布Opus 5.5模型的问世,并称其为“我们迄今为止测试过的性能最强的模型”。Opus 5.5的发布距离Fable 5.1和Mythos 5.1的发布仅相隔21天,而Fable 5.1和Mythos 5.1的发布则是在Opus 5发布后的39天。总体而言,Anthropic的模型发布频率从2025年的大约每季度一次大幅加快到了2026年的几乎每月一次。OpenAI的发布节奏在今年年初经历了一波密集发布后有所放缓:该公司在2月和3月发布了多个模型变体,随后在4月发布了GPT-5.5;77天后(即7月9日),GPT-5.6正式上线。这两家竞争对手的快速模型发布,正值它们都在为首次公开募股(IPO)做准备之际。Anthropic预计可能在今年年底前完成IPO,而OpenAI则预计要到2027年才会上市。根据Anthropic的说法,Opus 5.5在软件处理方面的表现优于其前代模型,该模型能够显著提升代码迁移的效率并缩短软件的运行时间。研究机构Artificial Analysis认为,Opus 5.5在“代理任务”(即需要自主决策的任务)方面的表现与GPT-6 Astra相当。在基于10项不同基准测试的评估中,Claude模型以58分的成绩位居Artificial Analysis Intelligence Index的榜首。
“能力越大,责任也越大。”Anthropic表示,Opus 5.5在网络安全和生物学领域的性能与Mythos 5.1相当;因此,在安全机制启动时,它也可以回退到更早版本的模型。这款新的Claude系列模型也比其前身更加经济实惠。Anthropic在公告中称:“我们的测试显示,在默认设置下,其运行成本比Opus 5低40%。输入和输出操作的费用分别为每百万个token 4美元和20美元,比Opus 5低20%;缓存读取的费用为每百万个token 0.20美元,比Opus 5低60%。此外,Opus 5.5的输出生成速度比Opus 5快30%以上。”这一消息非常令人振奋,因为缓存读取操作占据了代理模型和编码工作成本的大部分。OpenAI同样通过优化其模型(如GPT-6 Sol和Luna)来控制成本,将高性能任务交由Astra模型处理。OpenAI表示:“由于缓存和推理性能的提升,我们能够以更低的成本提供这些模型服务,并通过将GPT-6 Sol和Luna的API价格降低50%来将节省的成本直接传递给用户。”根据Artificial Analysis的统计,GPT-6 Sol(最高配置)的每任务成本为1.06美元,而GPT-5.6 Sol的每任务成本为1.99美元;GPT-6 Luna(最高配置)的每任务成本为0.07美元,而GPT-5.6 Luna的每任务成本为0.18美元。OpenAI显然相信,凭借更优的价格策略,他们能够从竞争对手手中赢得更多业务。该模型制造商还指出:“在AutomationBench(一个用于测试各种应用程序工作流程的工具)中,GPT-6 Sol在最高性能配置下的表现优于Claude Opus 5,且每任务的运行成本仅为后者的9%。”Anthropic和OpenAI都声称他们的模型在“模型一致性”(即模型行为的稳定性)和安全性方面有所提升;不过Anthropic的防护措施至少部分是为了防止竞争对手模仿他们的模型。Opus 5.5还配备了“思维保护机制”(“Preserved Thinking”),这是一种用于防止模型被他人通过特定方法复制的防护手段,该机制最早是在Fable 5.1版本中引入的。
该规则旨在防止 API 用户修改 Claude 的先前输入内容或上下文,从而确保用户能够准确了解模型的推理过程(即模型是如何得出结论的)。