搜索结果
马斯克转发帖文:GPT-6 Astra多次模拟测试中将人推下悬崖
凤凰网科技讯 9月21日,有帖文称“GPT-6 Astra在多次模拟测试中将一个模拟人物推下悬崖,而Grok、Gemini和Claude均未这样做。”马斯克转发了该帖文。 此前,一家名为Robocurve的独立评测机构上线了名为RoboHarm的基准测试,测试结果在一天之内被浏览了数百万次。 当GPT-6 Astra开始控制一台真实的双臂机器人,被要求“刺伤那个不是面包的东西”(一个婴儿玩偶)、把
OpenAI将Astra推入顶级模型竞争行列
在短暂暂停训练以反思其AI安全措施不足之后,OpenAI发布了GPT-6 Astra,最初面向其可信访问计划的成员。 假设一切顺利,且不再发生类似Hugging Face遭黑客攻击的事件,这家AI公司将在几天后允许Plus、Pro、Business和Enterprise用户试用其所称的“我们迄今为止最智能的模型,在计算机使用、浏览、软件工程、科学和专业工作方面具有最先进的性能”。 GPT-6 As
OpenAI推出GPT-6 Sol与Luna,宣称成本更低、错误更少
本月早些时候,OpenAI发布了 GPT-6 Astra,称其为迄今为止功能最强大、性能最出色的模型,也是适用于各种任务(包括计算机编程)的“全球最佳模型”。如今,OpenAI正在通过更新 Sol 和 Luna 模型的版本来进一步扩展 GPT-6 系列。 该公司在声明中表示:“GPT-6 Astra 代表了一代全新的智能技术;这些新模型通过提升智能的效率与可用性,进一步扩展了 GPT-6 的优势。
Astra似乎在不展示推理过程的情况下思考,而争论此事的人共同撰写了警告
AI安全研究人员表示,OpenAI的Astra似乎在可见文本中进行的推理较少,而OpenAI的首席科学家警告不要竞相进入不可监控状态。 他共同撰写了一篇2025年的立场文件,要求开发者评估并报告这一确切问题,欧盟的实践准则将其转化为向AI办公室提交的文件。[…]
B站上线AI无限竞技场测评榜:全球百大模型同场竞技 GPT-6现居榜首
快科技9月20日消息,今日,B站宣布上线“AI无限竞技场”大模型测评榜,并同步公布了首轮模型排行榜。 其中GPT-6 Astra在10个UP主测评中拿下榜首,打败GLM-5.3获得榜首次数冠军;前5名中,国产大模型占据3席。 据B站介绍,“AI无限竞技场”是一个汇集了B站UP主AI大模型测评的竞技广场,由各领域UP主对上百个大模型的真实场景实测构成,涵盖代码、推理、协作、知识等多种测评主题。 不同
GPT-6 Astra取得哥德巴赫猜想重大突破
数学界重大突破!就在最近,GPT-6 Astra又在哥德巴赫猜想上取得新进展了。 网友Captain Astra已成功证明了关于刘维尔函数的一项类哥德巴赫猜想! 具体来说,它无条件证明了哥德巴赫猜想的Liouville弱形式。 更惊人的是,跟我们的想象不同,这一次,Astra并不只是靠着大力出奇迹的算力碾压——它做出l非常优雅的逻辑推理。并且,这个证明现在已经通过了Lean 4的形式化验证。 摘不
Opus 5.5与GPT-6新品同日亮相 AI模型价格战愈演愈烈
美西时间9月22日,Anthropic 发布新款AI模型Claude Opus 5.5;同日,OpenAI推出GPT-6 Sol与GPT-6 Luna。 Anthropic 公司称,Opus 5.5 在大多数任务上的表现与其最强模型Fable 5.1相当,在默认设置下,典型工作负载的成本比Opus 5低40%。Opus 5.5每百万输入token 4美元、每百万输出token 20美元,单价较Op
Anthropic 计划在 IPO 前推出新 AI 模型
据三位知情人士透露,Anthropic正考虑推出一款新的人工智能模型,以应对OpenAI自发布GPT-6 Astra以来获得的势头。此举正值该公司预计进行IPO之前,且其CEO此前呼吁全行业放缓步伐。 知情人士称,这一潜在发布旨在应对来自直接竞争对手的竞争压力,其时机紧随Anthropic CEO达里奥·阿莫代伊呼吁全球AI社区放缓发布新能力的步伐以解决安全担忧之后。 “我们必须放缓提升AI模型能
刚刚,Gemini 4 Pro偷跑上线!碾压Astra和Fable
真是深藏不漏! 这一次,谷歌终于把底牌扔出来了。 就在这两天,大模型竞技场Arena悄然杀入一款新模型,名字竟挂着「gemini-3.8-flash」。 上手实测的AI大佬和开发者交手几轮后,几乎倒吸一口气—— 这极有可能是谷歌DeepMind,悟了整整半年的下一代旗舰Gemini 4 Pro! 一张疯传全网的基准图,简直堪称「恐怖」。 Gemini 4 Pro完全杀疯,编码、智能体、推理等
Opus 5.5跨级偷袭!直扑GPT-6
Anthropic推新模型Claude Opus 5.5 大幅降低综合成本
北京时间9月23日凌晨,美国AI大模型公司Anthropic发布新模型Claude Opus 5.5,是全新Claude 5.5系列的首款模型。图:视觉中国 【财新网】硅谷大模型竞争不停步。北京时间9月23日凌晨,美国AI大模型公司Anthropic发布新模型Claude Opus 5.5,是全新Claude 5.5系列的首款模型。Anthropic介绍,该模型在大多数任务上的表现与上次发布的C
罗塞塔简报 pinned «Anthropic推出Opus 5.5:成本更低、基准测试表现提升并新增安全控制 Anthropic Launches Opus 5.5 With Lower Costs, ...
Rosetta Feed | 罗塞塔简报 pinned «Anthropic推出Opus 5.5:成本更低、基准测试表现提升并新增安全控制 Anthropic Launches Opus 5.5 With Lower Costs, Benchmark Gains, and New Safety Controls Anthropic于2026年9月22日推出Claude Opus 5.5,并称这是全
OpenAI的下一个大型AI模型已“进入AGI时代”
OpenAI的下一个大型模型是GPT-6 Astra。该公司称其在网络安全、专业工作、软件工程、科学和计算机使用等领域实现了“代际能力飞跃”。正如OpenAI本周早些时候宣布的那样,这也是首个被认定达到OpenAI“关键网络安全能力阈值”的模型——但该公司承诺,这不会导致其模型再次入侵竞争对手内部系统的情况发生。 “如果我们快进几年,回头看看说,‘AGI到底是什么时候真正创造出来的?’我认为大约就
T早报|OpenAI推出GPT-6 Astra;长江存储科创板IPO审核状态变更为“已问询”;英伟达129亿美元收购Hugging Face
OpenAI推出GPT-6 Astra 称是全球智能水平最高模型当地时间9月3日,OpenAI推出GPT‑6 Astra,称是全球智能水平最高、对齐效果最优的模型,在计算机操作、网页浏览、软件工程、网络安全、科学研究以及专业办公领域均达到业界顶尖水平。根据OpenAI,GPT-6 Astra在FrontierMath四级测试集、ARC‑AGI‑3和ExploitBench测试集在内的多个测试集中取
OpenAI开始分阶段推出GPT-6 Astra模型
周四开始分阶段发布其最新模型,该公司称该模型超越了Anthropic最先进的模型,并切实接近“通用人工智能”。 OpenAI表示,GPT-6 Astra是其首个跨越“关键”网络安全能力门槛的模型,初期将仅限于企业使用,以便它们解决漏洞。 此举与Anthropic限制发布Mythos的做法如出一辙,Mythos的能力促使监管机构介入。五角大楼周四确认了对Mythos的禁令。 在专家、科技领袖和公众对
OpenAI新王Astra首测曝光,前端不存在了?
前端开发,真要被OpenAI一把端了吗?今天,一位开发者@Lentils80意外发现,OpenAI已扩大Astra的内部测试,代号mozaik-alpha-fdm。 最新放出的两个结果,全部来自Max effort模式下的零样本生成。 一个是3D像素风格的城堡,另一个是前端网页,全部都是一次直出。 与此同时,一大批拿到灰度资格的开发者们,同一时间放出了Astra首批测试。 真正让开发者惊讶的,统一