字号 ·· | 护眼
theregister

OpenAI将Astra推入顶级模型竞争行列

在短暂暂停训练以反思其AI安全措施不足之后,OpenAI发布了GPT-6 Astra,最初面向其可信访问计划的成员。

假设一切顺利,且不再发生类似Hugging Face遭黑客攻击的事件,这家AI公司将在几天后允许Plus、Pro、Business和Enterprise用户试用其所称的“我们迄今为止最智能的模型,在计算机使用、浏览、软件工程、科学和专业工作方面具有最先进的性能”。

GPT-6 Astra发布仅两天前,竞争对手Anthropic推出了Fable 5.1,定价同样令人咋舌:每百万输入token 10美元,每百万输出token 50美元。

OpenAI表示,Astra是其模型中有史以来第一个在其准备框架下达到网络安全能力“关键”级别的模型。

这份22页的政策文件被研究人员批评[PDF],他们认为该框架“允许OpenAI的首席执行官部署更危险的能力,尤其是在其他AI开发者这样做的情况下”。而我们现在就处于这种局面。

OpenAI对Astra的谨慎但乐观的评估将其描述为“网络能力的一次重大飞跃”。

该公司表示:“这意味着,借助合适的工具和访问权限,GPT-6 Astra能够发现以前未知的安全漏洞,并开发新的利用方法,在无需人工逐步指导的情况下,攻击许多受良好保护的系统。”

OpenAI接着辩称不必担心,因为Astra比之前的模型更强大、对齐更好、监控更全面,并且在高风险场景中更安全。

OpenAI表示:“我们基于Hugging Face事件构建了一项新的评估,用于测试模型在面对困难或不可能完成的任务时,是否会超出其预期范围。

与在没有生产防护措施的情况下有48%的时间超出授权目标的GPT-5.6 Sol相比,GPT-6 Astra在0%的情况下这样做。”其他长期存在的AI模型问题据称也得到了缓解。

在OpenAI的内部幻觉基准测试中,Astra的得分从GPT-5.6 Sol的9.4%降至2%。

此外,Astra在错误陈述自身能力方面的可能性据称比GPT-5.6 Sol低三倍。

ARC奖基金会主席Greg Kamradt在一篇博客文章中表示:“GPT-6 Astra在ARC-AGI-3上的行动效率超过了人类基线。在96%的关卡中,它使用的行动次数少于测试人类的中位数。”

但这样做代价要高得多——每局游戏消耗约360美元的GPU生成token,而如果从电网购买电力来运行人脑,每局游戏仅需0.00067美元。

Fable 5.1尚未在ARC-AGI-3上公开评估,但在该测试的第二版中,它得分90%,而Astra为95%。

根据Artificial Analysis的数据,GPT-6 Astra在智能指数上与GPT-5.6 Sol持平,得分为61分,比Claude Fable 5.1低5分,也落后于Meta Muse Spark 1.3。

在编码代理能力方面,Astra得分为67分,与Opus 5、Fable 5和Muse Spark 1.3相当。

但Fable 5.1在Claude Code中的当前编码代理得分最高,为70分。然而,Fable 5.1在每任务成本方面似乎明显更贵。

Artificial Analysis的数据显示,Fable 5.1每任务成本为9.18美元,而GPT-6 Astra为4.72美元。

Astra还带来了Codex框架的改进,OpenAI声称这使任务完成速度提高了1.9倍。

Codex还引入了一种新的上下文维护方法——保留之前的会话文本以指导后续工作。

OpenAI解释说:“在Codex中,Astra可以跨上下文窗口保留笔记,保存累积的细节,而无需反复将其压缩为单一摘要。

较早的上下文窗口仍然可搜索,因此Astra可以找到来自先前消息和工具输出的需求或测试结果——即使这些信息未包含在其笔记中。”

此功能目前处于实验阶段,必须通过Codex的config.toml文件启用,直到几周后成为默认设置。®