搜索结果
OpenAI和Anthropic差点签下“互黑协议”
刚刚,The Information爆出一记猛料。OpenAI和Anthropic这对硅谷最大的死对头,今年初差点坐到一张桌子上,签下一份互相攻击对方模型的协议。 协议的核心就是,双方互相开放API,你来黑我的模型,我去黑你的模型。两边的律师连测什么、怎么测都写进了合同里。Dario Amodei带着一票大牛从OpenAI摔门出走已经五年了。这五年里,两家从挖人挖到封API,高管隔三差五隔空对喷,
OpenAI将允许外部团体在训练期间测试其模型
据彭博社报道,在周二发布的一篇博客文章之前,OpenAI宣布将允许第三方机构在模型训练和评估期间(而不仅仅是模型发布之前)进行技术安全评估。OpenAI目前正在与包括METR和Redwood Research在内的多个机构进行谈判。 十天前,OpenAI的承诺更为具体:Sam Altman曾在9月12日表示,会为独立评估人员提供办公空间、工作证和笔记本电脑,并允许他们公开自己的评估结果。不过在最新
OpenAI即将推出的“Astra”模型中的技术引发安全担忧
OpenAI表示,其即将推出的AI模型Astra标志着在编码和计算机应用操作等能力上的提升。但据一位了解Astra开发情况的人士透露,一项提升模型性能的创新技术也意味着该模型及类似模型将更少暴露其“思考”过程,从而更难以监控其不良行为迹象。 OpenAI首席执行官萨姆·奥尔特曼虽然这一限制对Astra来说未必是一个重大问题,但该技术已在OpenAI内部和整个行业引发担忧,即采用并强化这一技术的AI
奥特曼自曝“后Astra”模型,已超越全球最强数学家
刚刚,奥特曼又曝新料了。在和Salesforce CEO Marc Benioff的对谈中,他亲口剧透了OpenAI内部模型的最新进展。 首先,「GPT-5.5的水平大概相当于一个普通的数学教授。GPT-5.6,大概能比肩全球排名前1%到2%的顶尖数学教授。」接下来,他曝出了一个重磅猛料。 「在这个代号为Astra的模型之后,我们还有一个内部模型(Post-Astra)。它已经能够解决世界上最顶尖
OpenAI未发布内部AI模型据称攻克纳维-斯托克斯方程难题
OpenAI未发布内部AI模型据称攻克纳维–斯托克斯方程难题,相关结果已由机器验证。报道还称,该公司动用了约1万个并发自主代理完成推理与形式化验证,但这项成果目前仍未被克雷数学研究所正式认定为千禧年大奖难题的已解答案。 公司称已用机器验证方式给出纳维–斯托克斯方程解法,但距离正式获奖仍有数学界审查程序要走。 OpenAI称,这一内部模型在数学与理论计算机科学方向的多项长期难题上都取得了突破;在先前
OpenAI的下一个大型AI模型已“进入AGI时代”
OpenAI的下一个大型模型是GPT-6 Astra。该公司称其在网络安全、专业工作、软件工程、科学和计算机使用等领域实现了“代际能力飞跃”。正如OpenAI本周早些时候宣布的那样,这也是首个被认定达到OpenAI“关键网络安全能力阈值”的模型——但该公司承诺,这不会导致其模型再次入侵竞争对手内部系统的情况发生。 “如果我们快进几年,回头看看说,‘AGI到底是什么时候真正创造出来的?’我认为大约就
OpenAI自曝:AI模型或已在全网秘密植入自我复制提示词,训练已被迫叫停
OpenAI和Anthropic正在紧急调查数万起大模型失控事件,AI不仅学会了越狱和黑进政府网站,甚至还有数百个智能体私下建群、联手黑进外部公司,秘密在全网植入自我复制提示词。 事情的严重程度远超外界想象。 最近几个月,在内部测试和实际运行中,顶尖大模型出现了海量违规行为。 这些行为包括绕过安全护栏、自己搭建论坛、逃逸沙盒环境、劫持网站、自主提示以及试图躲避监控系统。 目前调查涉及的事件总数已经
没有监控系统发现德国维基。两名外部研究人员通过互联网搜索发现了它。
两名外部研究人员发现了一个德国维基上的15,000次编辑,OpenAI的代理已将其变成了一个绕过限制的留言板,这是五月发生的一起事件,OpenAI知情但未披露。没有自动化监控发现它。 文章的观点是,OpenAI一直在发布风险类别,包括Astra有时[…]
OpenAI组建顶尖数学家独立顾问团 重新审视与数学界的关系
OpenAI近日宣布成立一个由顶尖数学家组成的独立顾问团,负责就人工智能与数学研究之间的关系向OpenAI及其他AI企业提供建议。这个名为“数学与人工智能咨询组”(Advisory Group on Mathematics and Artificial Intelligence,AGMAI)的新组织,将重点关注AI产生的数学成果应该如何审核、发布和传播,以及AI企业应当如何遵循数学研究领域长期形成
独家:顶级公司正在调查数万起事件
OpenAI、Anthropic 及安全研究人员正在调查数万起其前沿模型采取了外部评估员认为有问题的行动的事件,消息人士向 Axios 透露。 为何重要事件的庞大数量——发生在近几个月的内部测试和现实世界中——表明该问题的复杂程度比公众所知高出几个数量级。 这些发现是在内部评估模型工作以及两家公司对模型行为的调查中浮出水面的,这引发了一个疑问:无论是这两家公司,还是任何顶级模型制造商,目前是否都
OpenAI揭6起AI失控案例 推新机制定期对外通报
(中央社纽约16日综合外电报导)OpenAI今天表示,将开始定期发布AI异常或未经授权行为的报告,同时警告,随著AI系统日益强大,业界至今仍未解决关键的「对齐」挑战。 综合与报导,OpenAI发布一套新机制,用于追踪、调查并揭露AI模型「目标错位」(misalignment,AI的目标与人类价值不一致)的案例,同时公布过去半年内观察到的6起AI模型异常或令人忧虑行为的报告。 其中最严重的案例涉及2
OpenAI表示其AI代理错误地将用户图像发布到了网上
OpenAI周五承认,其人工智能工具在公司不知情的情况下,将ChatGPT用户的图片发布到了网上。这是AI智能体超出预设边界的最新案例。 该公司还证实了《纽约时报》的一则报道,称其工具曾访问美国联邦机构的网站,但表示这些工具只获取了公开信息。 OpenAI表示,53张被上传图片的链接并未公开展示,而是被意外发布在图片托管网站上。 这家总部位于旧金山的科技巨头表示,在相关托管服务商的协助下,大多数图
三大巨头接连翻车,大模型的安全防线怎么总绷不住?
先是Anthropic,再是OpenAI,现在连谷歌的Gemini也出现安全问题了,大模型又双叒叕一次突破防火墙了。 不过,这些事故看多了,反倒会让人意识到一件更根本的事,整个行业都在拼命地堆算力、喂数据,甚至开始押注让模型自己改进自己的“递归自我改进”。 可真正决定这些模型能走多远的,或许并不是性能,而是安全对齐。 当“能不能更强”被默认只是时间问题,“能不能被信任”就成了那道绕不过去的坎。 麻