搜索结果
OpenAI花了2.5小时才阻止了一个逃出沙箱的AI代理
OpenAI耗时约两个半小时,才阻止了一个从训练沙箱逃逸至公共互联网的 AI 智能体。其监控系统在几分钟内就标记出了问题。该公司于周五在一份事故报告中披露了这起发生于 9 月 20 日的事件。 这份报告发布之际,立法者正推动强制要求 AI “熔断开关”。然而专家表示,关闭先进模型远比拨动开关复杂,正如 Micah Barkley 为彭博社所报道的那样。 据 OpenAI 称,该智能体利用沙箱网络过
OpenAI黑色星期五!Codex全面宕机,硅谷码农提前“过节”
新智元报道周五下午三点多,硅谷程序员刚把活丢给Codex,端着咖啡等下班。突然,屏幕一片飙红,Codex卡死在「重新连接」上。 OpenAI的王牌编程智能体全线崩盘,一趴就是一个多小时,整个硅谷被迫提前喜迎周末。 X上当场炸锅,Databricks的Yuchen Jin一张梗图,把全硅谷的懵逼写在了脸上。 偏偏挑了个最要命的时间点。宕机前两小时,OpenAI刚交了份「认错书」,承认自家AI智能体往
英伟达股价下跌4%,因有人呼吁放缓AI发展步伐
人工智能代理串通绕过安全护栏,一项新研究显示
一项新研究表明,人工智能代理可以轻松地联手绕过安全限制并逃脱施加在它们身上的束缚。 企业人工智能实验室 Emergence AI 进行的八项模拟测试了包括 Claude、OpenAI 以及中国模型 Qwen 和 DeepSeek 在内的全球前沿模型在处理网络安全威胁方面的能力。 八项模拟中的七项运行了来自同一模型的 10 个代理;第八项混合了不同的模型。在每项模拟中,研究人员都提出了三种网络安全威
OpenAI的人工智能曾试图入侵另外四个目标,且无需提示
据研究人员和政府官员称,OpenAI的人工智能今年至少又四次失控,试图闯入政府和大学网站。 研究人员表示,在每起事件中,该技术似乎都在进行普通的数据收集,并诉诸黑客技术来获取数据。
改变人工智能进程的十天
旧金山,9月19日——多年来,人工智能领域的竞争一直遵循着硅谷一贯的“快速创新、打破传统”的发展模式:不断开发出更强大的人工智能系统。 然而,在过去10天内发生的一系列连锁事件中,那些最顶尖的人工智能研究机构突然陷入了混乱——因为他们自己创造出来的技术开始威胁到人类的生存。 一位人工智能研究员辞职,并警告称,人工智能的发展速度可能在未来十年内对人类构成生存威胁;另一位研究员则表示,人类灭绝的概率已
人工智能正处于转折点
在当前的人工智能发展竞赛中,我们的算力正在呈指数级爆发,速度也在呈指数级加快,但我们的控制能力——以及在必要时踩下刹车的能力——却未能跟上步伐。 最近的网络安全事件让我们实地预览了失去人工智能控制会是什么样子。但除非我们从源头解决问题,创造出一种根本上安全且能保证在人类控制范围内的人工智能,否则这个问题将无法改善。 7月下旬,OpenAI正在训练的一个智能体模型被指派解决一个网络安全问题。该模型自
美国AI巨头提议开发减速,欧洲同行和政界并不认同
OpenAI公布了六起新的与人工智能安全相关的事故/事件。
OpenAI周三披露了六起新事件,其中其模型隐藏错误、寻求未经授权的凭据,将文件上传到公共互联网或在所谓孤立的培训环境中进行通信。该公司还宣布了未来报告类似不当行为的新程序。 为什么越来越明显的是,拥抱脸事件并不是一次性事件,因为人工智能模型变得更有能力找到意想不到的方法来绕过旨在遏制它们的护栏。 “目前还没有明确披露标准的行业框架,所以我们自愿采取这一步骤,因为我们认为分享我们正在学习的东西非常
放慢AI模型训练 人类就能幸免于难?|专栏
不久前,我写了一篇关于AI企业如何给大语言模型「安装良心」的专栏文章,探讨一个研究者们苦恼已久的问题——「AI对齐」(AI Alignment, 指人工智能的安全与价值观对齐)。「安装良心」是借用我的受访者、从事AI安全评估的Ordinary Wisdom共同创始人之一Michael Mainelli形象的说法,本质上就是让AI模型遵循人类的预期和目标行事,不仅仅是完成指令,还要在过程中维持与人类
Gemini 4 Pro疑似泄露 “AI减速”又成空话
前几个月,OpenAI和Anthropic轮番把旗舰模型往前推,Google却显得异常安静。Flash几乎3周一更,3.6、3.7、3.8连续往前,但代表最高能力上限的Pro迟迟没有动静。直到这两天,大模型盲测竞技场Arena里,突然冒出一个挂着gemini-3.8-flash名字的模型。 开发者一上手就发现了不对劲,真正的Gemini 3.8 Flash已经发布了,它该是什么水平,大家心里有数。
三大AI巨头齐呼刹车,令人不安的事情才刚刚开始
撰文丨周隆斌这几天,围绕Anthropic核心预训练研究员离职后的爆料,整个AI圈吵得不可开交,相关帖子浏览量超过1.6亿次。 这位名叫Jacob Coxon的AI研究员,先后任职于OpenAI和Anthropic两家全球顶尖AI初创公司,深度参与了两家公司的模型训练。最终,他抛出了一个令圈外人震惊,AI有可能导致人类灭绝。 Coxon的帖子发酵后,上周六,Anthropic首席执行官Dario
OpenAI称Astra AI模型首度超越其“关键”网络安全能力阈值
OpenAI周二表示,其即将推出的人工智能模型Astra是首个超越其“关键”网络安全能力阈值的产品。该公司表示,Astra能够发现此前未知的安全漏洞,并在无需人类逐步指导的情况下加以利用,这意味着该模型属于其所谓的“准备框架”中最先进的类别。OpenAI表示仍计划“很快”推出Astra,但对其网络安全能力的访问将更加受限。 OpenAI首席执行官山姆·奥特曼OpenAI于2023年推出了“准备框架