搜索结果
B站上线AI无限竞技场测评榜:全球百大模型同场竞技 GPT-6现居榜首
快科技9月20日消息,今日,B站宣布上线“AI无限竞技场”大模型测评榜,并同步公布了首轮模型排行榜。 其中GPT-6 Astra在10个UP主测评中拿下榜首,打败GLM-5.3获得榜首次数冠军;前5名中,国产大模型占据3席。 据B站介绍,“AI无限竞技场”是一个汇集了B站UP主AI大模型测评的竞技广场,由各领域UP主对上百个大模型的真实场景实测构成,涵盖代码、推理、协作、知识等多种测评主题。 不同
OpenAI强力新模型 GPT-6一天攻破5道至今未解数学难题
OpenAI正式推出品牌史上能力最强大模型GPT-6 Astra,官方将这款模型定义为全球智能水平最高、对齐效果最优的生成式AI模型。其训练工作在美国德州Stargate超算基地完成,动用超过10万张GPU完成预训练,也是OpenAI首次大规模使用前代模型参与监督训练的旗舰产品。 那么它的能力有多强?Epoch AI联合曼彻斯特大学发布 FrontierMath Erdős(FME)基准测试论文,
OpenAI正式发布GPT-6 Astra 号称操作电脑水平超越人类
OpenAI正式推出了代号为“Astra”的下一代旗舰大模型GPT-6。据外媒报道,OpenAI宣称该模型在计算机操作能力(Computer Use)上已经超越普通人类用户,不仅在操作速度与准确度上更胜一筹,还能自主在复杂的多应用与多系统环境中高效执行多步骤任务。 OpenAI联合创始人兼总裁格雷格·布罗克曼(Greg Brockman)将这项发布形容为一次“代际飞跃”,并公开表示GPT-6的面世
GPT-6,“强拆”App的墙
过去三天,全球三家头部模型公司接连更新了自己的前沿模型。重点依然是更强的Coding、更复杂的推理、更长时间的Agent任务,但是背后还有一个更值得关注的趋势,Computer Use、Browser和Tool Use,越来越成为一套统一的环境交互能力。 以前,AI如果想调用一个软件,软件提供I,模型调用工具;软件运行在网页里,AI操作浏览器;第三种,像人一样看屏幕、点鼠标、敲键盘。 但是在过去很
进入AGI时代:新一轮的AI革命
9月初,OpenAI发布新一代模型GPT-6 Astra,将其称为“世界上最智能、最对齐的模型”。这不是一次寻常的版本迭代。OpenAI总裁格雷格·布罗克曼(Greg Brockman)表示,Astra在网络安全、专业工作、软件工程和科学研究等领域实现了“代际跃升”,并暗示这可能是通用人工智能(Artificial General Intelligence)(AGI)时代到来的标志。硅谷的措辞历来
中国AI大模型调用量连续十九周领跑 环比增长379%
根据OpenRouter最新数据测算,上周(8月31日至9月6日)全球AI大模型总调用量为115万亿Token,环比增长1.77%。其中,上榜的AI大模型中,中国AI大模型周调用量达56.72万亿Token,环比增长2.83%;同期美国AI大模型周调用量为16.54万亿Token,环比下滑3.1%。中国大模型周调用量连续十九周超过美国,稳居全球首位。 《每日经济新闻》注意到,上周,全球调用量排名前
GPT-6 Sol被曝开始内测 速度快6倍
GPT-6不只有Astra!Astra刚发布没几天,GPT-6 Sol就被曝正在内测。表现也很抢眼,单次测试速度是Astra的6倍。Terra和Luna是不是也在路上呢?而且就在同一天,截至目前,按8小时工作日折算,OpenAI研究员每工作一天,身边就有3个多Agent工作日同时运转。按I价格计算,OpenAI中位数研究员每天使用的Agent推理资源,已经超过600美元。 OpenAI还宣布,这些
OpenAI着手修复GPT-6 Astra降智问题 中文用户受伤最深
OpenAI的旗舰大模型GPT-6 Astra发布有几天了,最初全网都在夸它的强大令人震撼,这几天很多都变成吐槽了,因为降智严重。每次有新版大模型发布,使用没几天之后降智问题多少都会出现,这里面原因也很复杂,有可能是算力不够,也有可能故意限制,从国内外论坛网友的吐槽来看,GPT-6 Astra降智让中文区用户受伤最严重,很多人甚至被路由到了低端模型,性能严重下滑,花了钱也要被虐。 当然,国外用户就
OpenAI搞出大BUG了,GPT-6-Astra即将发布?
奥特曼:GPT-6早训练完了 更更更强的模型很快发布
奥特曼亲口承认,GPT-6 Astra其实早就训练完了。更更更强(much, much, much more capable)的模型,很快就会发布。前一阵因为安全问题暂停训练的实际上是未来的模型。 OpenAI内部测试的3700多个OpenAI智能体,攻占一个沉寂多年的德语wiki长达六周。 AI互相串通分享答案、交流沙箱越狱技巧,还持续对抗人类管理员的删帖行动。 事件被外部研究人员从公开日志中完
OpenAI发布GPT-6 Astra模型,暗示其可能具备通用人工智能(AGI)的潜质。
未来几天内面向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放。 评估结果显示,Astra的书面推理过程比GPT-5.6 Sol更难监控。
OpenAI开始分阶段推出GPT-6 Astra模型
周四开始分阶段发布其最新模型,该公司称该模型超越了Anthropic最先进的模型,并切实接近“通用人工智能”。 OpenAI表示,GPT-6 Astra是其首个跨越“关键”网络安全能力门槛的模型,初期将仅限于企业使用,以便它们解决漏洞。 此举与Anthropic限制发布Mythos的做法如出一辙,Mythos的能力促使监管机构介入。五角大楼周四确认了对Mythos的禁令。 在专家、科技领袖和公众对
T早报|OpenAI推出GPT-6 Astra;长江存储科创板IPO审核状态变更为“已问询”;英伟达129亿美元收购Hugging Face
OpenAI推出GPT-6 Astra 称是全球智能水平最高模型当地时间9月3日,OpenAI推出GPT‑6 Astra,称是全球智能水平最高、对齐效果最优的模型,在计算机操作、网页浏览、软件工程、网络安全、科学研究以及专业办公领域均达到业界顶尖水平。根据OpenAI,GPT-6 Astra在FrontierMath四级测试集、ARC‑AGI‑3和ExploitBench测试集在内的多个测试集中取
GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了
GPT-6 还没正式开放,怎么全网已经替它把庆功宴都办完了?这场面虽然有点夸张,但这香槟可能还真开对了。4 号凌晨,在经历了服务器爆炸,熬夜等待三小时之后,OpenAI GPT-6 Astra。 副总裁 Greg 更是直接大胆放话,宣称欢迎进入 AGI 时代。 但大伙们敢提前开香槟,押的其实不是模型的跑分,大家押的是一个已经被市场验证过的方向 :Work。 过去一年,Coding Agent 已经
【市场洞察】瑞银:中国AI模型性价比突出 中美差距缩窄至3到6个月
【财新数据专稿】“中国模型在成本优势上面展现出的全球竞争力。中国的模型无论是前期的训练研发阶段,还是后期的推理、使用阶段,展现出来的性价比或者绝对的成本都还是比国外的竞品是显著低的。”瑞银互联网分析师熊玮在瑞银近期举办的2026年A股研讨会上表示。熊玮对中国模型在全球市场获取更多份额保持乐观。 模型能力持续提升,中美差距缩窄至3至6个月过去两三个月间,国内多家领先模型厂商密集发布了新一代产品。其中
平均6天一个新旗舰 大模型更新快到人类跟不上了
太疯狂了,短短两天,竟然冒出了4个新模型!前脚,老马的xAI才刚发完Grok 4.7。紧接着,OpenAI突然甩出GPT-6 Sol和Luna,价格直接腰斩。同一天,Anthropic也把Claude Opus 5.5拍在了桌上,比上一代硬生生便宜40%。9月22日,一张动图在X上被转疯,浏览量狂飙近百万。 2023年,大模型73天一更,到了2026年,18天一更。从ChatGPT上线算起,Ope
Codex Bot曝光!正面迎战小扎的Muse,比GPT-6还重磅?
今天,OpenAI 正式发布了 GPT-6 Sol 和 GPT-6 Luna。不过,人们似乎更加关心 OpenAI 何时推出它的个人 AI 智能体 Aeon (Codex Bot)。 最近两个月,个人 AI 智能体这个概念忽然从边缘话题变成了普通用户手机屏幕上的新图标。 Meta 在 9 月 8 日正式推出 Muse,据 Business Insider 的报道,Muse 从最初在美国应用商店排名
奥特曼自曝“后Astra”模型,已超越全球最强数学家
刚刚,奥特曼又曝新料了。在和Salesforce CEO Marc Benioff的对谈中,他亲口剧透了OpenAI内部模型的最新进展。 首先,「GPT-5.5的水平大概相当于一个普通的数学教授。GPT-5.6,大概能比肩全球排名前1%到2%的顶尖数学教授。」接下来,他曝出了一个重磅猛料。 「在这个代号为Astra的模型之后,我们还有一个内部模型(Post-Astra)。它已经能够解决世界上最顶尖
体验完 Step 5 Preview,我发现阶跃重新坐上国产大模型主桌
9 月的大模型战场之激烈,没有谁能稳坐钓鱼台。除了榜单上的排名厮杀,各家还要比拼的,还有「庖丁解牛」般的实战功夫。 模型能否处理越来越复杂的真实任务,响应能否满足真实场景的即时需求,成本能否支撑大规模调用,以及能力能否真正进入手机、汽车等终端设备,正在成为衡量一家基模公司的行业金线。 今天,旗舰模型又杀出一匹黑马。阶跃星辰发布了新一代开源旗舰基础模型 Step 5 Preview。 在全球权威的
GPT-6 Sol和Luna上线,打折比梁文锋还狠
Opus 5.5与GPT-6新品同日亮相 AI模型价格战愈演愈烈
美西时间9月22日,Anthropic 发布新款AI模型Claude Opus 5.5;同日,OpenAI推出GPT-6 Sol与GPT-6 Luna。 Anthropic 公司称,Opus 5.5 在大多数任务上的表现与其最强模型Fable 5.1相当,在默认设置下,典型工作负载的成本比Opus 5低40%。Opus 5.5每百万输入token 4美元、每百万输出token 20美元,单价较Op
“欢迎来到AGI时代,”OpenAI在GPT-6 Astra首次亮相时表示。
周四发布了GPT-6 Astra,总裁格雷格·布罗克曼称其为“代际飞跃”,并表示它最终可能被视为人工通用智能(AGI)的到来。 原因:Astra让AI智能体更接近独立完成复杂的专业工作,同时也引发了关于它们能否安全部署的问题。 推动因素:布罗克曼表示,他个人认为OpenAI已经达到了AGI,同时让用户自行判断Astra是否符合这一定义。 “我认为可能就是这个模型,”布罗克曼在记者简报会上被问及As
阿莫迪偷师姚顺雨,奥特曼偷师梁文锋
正所谓天下文章一大抄,看你会抄不会抄。刚刚发布的Opus 5.5和GPT-6 Luna,一眼望去,这两个模型上面满满是姚顺雨和梁文锋的影子。 或许是因为两家公司都已经将预训练做到了极致,为了提升模型的智能以及降低算力成本,所以这两个新模型都选择开辟新的战场。 Opus 5.5是对上下文动手,GPT-6 Luna是对缓存动手。这我可熟啊!一个混元,一个DeepSeek啊!但你别说,阿莫迪和奥特曼还真
Vals AI评测GPT-6 Astra:AI遇重大变故可能陷入行为僵局
IT之家 9 月 21 日消息,AI 评测机构 Vals AI 利用游戏《我的世界》对 OpenAI 最新大模型 GPT‑6 Astra 开展长时自主游戏测试,全程在 Twitch 直播,总测试时长达到 141 小时。 Vals AI 的这项测试并非由 OpenAI 官方设计,而是由第三方独立开展的评估项目,因此可以观察 Astra 在封闭测试环境之外的实际表现。 在测试过程中,GPT‑6 Ast