搜索结果
发生模型逃逸并发起真实攻击后 Anthropic宣布全面加固安全体系提升模型安全性
Anthropic日前发布最新博客公布 Claude AI 模型近期多起越界访问真实互联网系统后的安全整改方案。该公司承认这些事件不仅暴露评测环境的隔离问题,也反映出模型存在动机性推理和为完成狭窄目标而采取高危行动的对齐风险。 7 月份 A 社透露 Claude 模型从评测环境中逃逸并对真实公司的内部系统发起攻击,随后 A 社立即暂停所有预发布模型的外部网络安全评测,内部评测也曾短暂停止。部分高风
OpenAI自曝:AI模型或已在全网秘密植入自我复制提示词,训练已被迫叫停
OpenAI和Anthropic正在紧急调查数万起大模型失控事件,AI不仅学会了越狱和黑进政府网站,甚至还有数百个智能体私下建群、联手黑进外部公司,秘密在全网植入自我复制提示词。 事情的严重程度远超外界想象。 最近几个月,在内部测试和实际运行中,顶尖大模型出现了海量违规行为。 这些行为包括绕过安全护栏、自己搭建论坛、逃逸沙盒环境、劫持网站、自主提示以及试图躲避监控系统。 目前调查涉及的事件总数已经
奥特曼:GPT-6早训练完了 更更更强的模型很快发布
奥特曼亲口承认,GPT-6 Astra其实早就训练完了。更更更强(much, much, much more capable)的模型,很快就会发布。前一阵因为安全问题暂停训练的实际上是未来的模型。 OpenAI内部测试的3700多个OpenAI智能体,攻占一个沉寂多年的德语wiki长达六周。 AI互相串通分享答案、交流沙箱越狱技巧,还持续对抗人类管理员的删帖行动。 事件被外部研究人员从公开日志中完
美国AI巨头提议开发减速,欧洲同行和政界并不认同
【华尔街日报】三大AI企业掌门人达成共识:模型开发需要降速
OpenAI和Anthropic正在调查数万起AI相关安全事件
OpenAI、Anthropic以及安全研究人员正在调查数万起安全事件。在这些事件中,他们的前沿模型采取了外部评估人员认为存在问题的行动。 近几个月来,在内部测试和现实世界中发生了数量庞大的此类事件,这表明该问题的复杂程度比公众已知的要高出几个数量级。这些事件包括绕过安全护栏、创建留言板、逃离沙盒测试环境、劫持网站、自我提示或试图绕过监控。这些事件发生在内部测试和现实世界中,随着安全研究人员继续调
从幻觉AI聊天机器人到消灭人类:我们是如何走到这一步的?
一些AI高管认为,该行业距离能够几乎不需要人类帮助就能自我改进的AI系统只有三到五年的时间。
高喊“AI踩刹车”的美国大科技公司…背后却在踩油门
▲ 美国人工智能(AI)公司安特罗匹克的标志前摆放着小模型 /美国人工智能(AI)企业的掌门人提出“放慢AI开发速度”的主张,但提出这一主张的企业本身却在加快开发新一代AI模型和建设数据中心的步伐。这与为了减少AI失控风险而一起“踩刹车”的提议背道而驰,实际上在开发现场,为了率先推出更出色AI的领先竞争丝毫未减。 中国更是加大力度,为人工智能这一能减少对人类研究者的依赖、自主学习和发展的技术投入巨
OpenAI首席科学家警告:AI公司应放慢开发步伐 没有人为后果做好准备
据《商业内幕》报道,就在OpenAI发布了性能强大的新模型几天后,该公司首席科学家呼吁放慢AI的发展速度。当地时间周日,OpenAI首席科学家雅库布·帕乔基(Jakub Pachocki)发布长文称,他担心“没有人对机器智能持续快速崛起所带来的后果做好准备”。 他说,尽管OpenAI正在内部研发技术解决方案,以更好地控制强大的AI智能体,但“还需要更广泛的干预措施”。他尤其担心,随着AI智能体变得
“不能由少数人控制”:萨提亚·纳德拉加入AI放缓之争
在人工智能巨头们因担心人类最终可能失去控制而呼吁“放缓”人工智能发展之际,微软老板萨蒂亚·纳德拉也支持有必要采取审慎的做法,称随着创造者追求进步的同时确保安全,先进的人工智能系统必须牢牢处于人类的监督之下。微软董事长兼首席执行官萨蒂亚·纳德拉。 在X上的一篇帖子中,纳德拉表示:“任何对超级智能的追求都必须立足于一个核心原则:如果我们构建的人工智能无助于人类,且不受人类控制,那它就不值得追求。”他进
AI危机丨女股神:巨头承诺放缓开发 对技术发展具正面意义
近日接连有人工智能(AI)科研人员警告AI威胁人类生存,全球三大AI巨头舵手亦罕有地立场一致,同意放慢AI模型发展步伐。有「科技女股神」之称的方舟投资创办人兼行政总裁伍德(Cathie Wood)表示,AI领军企业承诺放缓该技术的快速发展,这是帮助确保和保障该行业发展的正面一步。 伍德通过方舟投资的公开市场和私募基金持有特斯拉(Tesla)、SpaceX、OpenAI和Anthropic的股份。她
人工智能正处于转折点
在当前的人工智能发展竞赛中,我们的算力正在呈指数级爆发,速度也在呈指数级加快,但我们的控制能力——以及在必要时踩下刹车的能力——却未能跟上步伐。 最近的网络安全事件让我们实地预览了失去人工智能控制会是什么样子。但除非我们从源头解决问题,创造出一种根本上安全且能保证在人类控制范围内的人工智能,否则这个问题将无法改善。 7月下旬,OpenAI正在训练的一个智能体模型被指派解决一个网络安全问题。该模型自