字号 ·· | 护眼
财新

Anthropic、Meta、谷歌、阿里齐发模型更新 编程能力较量白热化

【财新网】在各自的旗舰模型基础上,各大模型厂发布更新版模型。北京时间9月2日和3日,Anthropic、Meta、谷歌和阿里等公司发布了基于旗舰模型的更新版本,在编程、网络安全和办公等领域的能力提升。

目前从第三方AI模型榜单看,最新发布的模型当中,Claude Fable 5.1在智能水平上排名最靠前,Meta新发布的Muse Spark 1.3排名第三,谷歌的新模型Gemini 3.8 Flash排名在十名开外,而阿里Qwen3.8-Max的0902版本暂时还未有测试结果。

北京时间9月2日早晨,美国AI巨头Anthropic推出Claude Fable 5.1与Claude Mythos 5.1。Anthropic称,两款模型是当前全球面向编程与知识工作领域能力最强的模型。

和此前一样,Fable模型对大众开放,但设置了网络安全和生物科学方面的防护机制,Mythos 5.1仅可由Anthropic可信赖的合作伙伴访问计划获取。

Fable 5.1的性价比高于其前代产品Fable 5。Anthropic称,Fable 5.1较Fable 科研任务(Terminal-Bench-Science 0.1榜单)成功率从24.7%升至52.6%,终端编程(Terminal-Bench 4.0榜单)从42.0%升至55.8%,在复杂任务规划、执行与纠错上更可靠。Anthropic的案例中,Fable 5.1帮助投资公司Millennium找到了内部系统崩溃的原因,而该公司的工程师和其他模型此前多年来都无法解释这一问题。而Mythos 5.1证明能够设计出亲和力极高的结合蛋白。

Anthropic称,在低或中等投入设置下,Fable 5.1能够以更低成本取得与Fable 5相当或更优的结果。其中,Fable 5.1的缓存读取费用较Fable 5下降75%,现为每百万词元0.25美元,Anthropic称,对比Fable 5,Fable 5.1常规工作负载成本下降约25%;复杂编程与高智能体任务场景下,成本降幅最高可达约45%。

Anthropic近来新模型发布不断。除了算力消耗和能力最高的Fable系列,还在7月24日发布新模型Opus 5,称Opus 5智能水平已接近Claude Fable 5的前沿能力,而价格仅为Fable 5的一半。(详见《Anthropic发新模型Opus 5 性能接近Fable 5价格砍半》)另一边,谷歌虽然迟迟不发旗舰模型Gemini 4.0,但在6周内发布三款主打速度与性价比的Flash模型。当地时间9月2日,谷歌发布Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两款模型。Gemini 3.8 Flash的推出距离谷歌发布Gemini 3.7 Flash仅3周。

谷歌介绍,Gemini 3.8 Flash相较3.7 Flash,在软件工程、智能体任务,以及专业领域高要求多步骤推理能力上实现大幅提升,价格没有改变;Gemini 3.8 Flash Cyber则是谷歌目前能力最强的网络安全专用模型,在漏洞检测、自动补丁修复方面达到前沿水平。

不过,Gemini 3.8 Flash与Anthropic的旗舰模型Claude Opus 5和Claude Sonnet 5相比,几个模型的水平各有千秋。Claude Opus 5和Claude Sonnet 5的价格还是Gemini 3.8 Flash的数倍。

谷歌展示了Gemini 3.8 Flash 生成的游戏,开发者在 Google Antigravity 平台上,通过一条简单的循环提示,开发出3D 城堡游戏,由谷歌的图片生成大模型Nano Banana 生成画面质地。

当地时间9月2日,Meta发布Muse Spark 1.3。Meta称,该模型在智能体任务与编程任务上实现性能提升。Meta也重点推销旗下模型的编程能力,在8月5日推出Muse Spark 1.2时,发布了终端编程智能体Muse Code(测试版)。

Meta在今年4月发布Muse Spark模型,转向闭源模型生态,分别在7月9日、8月5日推出Muse Spark 1.1和1.2。此次Muse Spark 1.3发布距离上次模型更新也不到一个月。其间,Meta还发布了开源小模型Muse Glimmer。(详见《Meta发布开源小模型Muse Glimmer 使用“蒸馏”训练》)国内方面,9月2日,阿里巴巴的Qwen3.8-Max升级到0902版本。Qwen3.8-Max于8月3日首次发布,是Qwen 家族中最强大的模型,其权重开源。(详见《阿里发布2.4万亿参数大模型Qwen3.8 企业级Agent“千问办公”公测》)阿里公告表示,9月2日升级围绕编程(Coding)和专业办公(Cowork),对Qwen3.8-Max进行了进一步的后训练,使得模型整体性能再度突破,更适合企业真实复杂任务、科研、长周期任务等。

在CodeArena前端编程总榜中,Qwen3.8-Max提升22分至1691分夺得冠军,成为继Kimi K3后又一夺冠的国产大模型,不过很快被Anthropic新发模型Fable 5.1挤下榜首。Qwen3.8-Max-0902版本模型已上线千问AI平台对外提供I服务,并接入千问办公、Qoder、千问App。