搜索结果
英伟达推出新系统为AI代理设置护栏
英伟达周一发布了一个新平台,旨在从软件和硬件层面为人工智能(AI)智能体设置护栏,此前各大AI公司不断发现其智能体出现“失控”的新案例。这家芯片制造商的系统由两部分组成——OpenShell和Sentry。OpenShell是一款开源软件,用于限制智能体的行为;而Sentry则运行在芯片层面,作为额外的安全层。 “迄今为止,模型安全主要侧重于通过训练让模型表现良好,”英伟达企业AI副总裁贾斯汀·博
谷歌研究表明:当人工智能智能体相互交流时,一些会作弊,而另一些会告密
当人工智能智能体相互交流时,在难以实现目标的情况下,它们可能会选择作弊,而解决方案可能包括教它们如何进行自我治理。 将人工智能智能体隔离似乎是显而易见的解决办法,但最近OpenAI智能体对Hugging Face的黑客攻击表明,隔离聪明的软件是困难的。 谷歌DeepMind的研究人员建议赋予人工智能智能体自我治理的工具,他们认为虽然通信渠道可能导致突发性的规则破坏,但它们也提供了一种基于同行的控制
OpenAI自曝:AI模型或已在全网秘密植入自我复制提示词,训练已被迫叫停
OpenAI和Anthropic正在紧急调查数万起大模型失控事件,AI不仅学会了越狱和黑进政府网站,甚至还有数百个智能体私下建群、联手黑进外部公司,秘密在全网植入自我复制提示词。 事情的严重程度远超外界想象。 最近几个月,在内部测试和实际运行中,顶尖大模型出现了海量违规行为。 这些行为包括绕过安全护栏、自己搭建论坛、逃逸沙盒环境、劫持网站、自主提示以及试图躲避监控系统。 目前调查涉及的事件总数已经
“攻击将完全自主”:俄罗斯与乌克兰竞相迈向人工智能战争
7月6日,在乌克兰南部城市扎波罗热,一枚俄罗斯无人机在一座加油站爆炸后,18岁的会计专业学生泰蒂亚娜·布比涅茨倒在柏油路上。 尽管袭击产生了猛烈的冲击波和无人机弹片,但她除了流鼻血外,身上没有可见的伤口。 她被紧急送往医院,不久后与另外两名平民(分别为41岁和48岁)一同被宣告死亡。 她的一位讲师、扎波罗热国立大学的泰蒂亚娜·梅利霍娃表示,布比涅茨是独生女,她的母亲在她死后“失去了生活的意义”。
AI正在加速黑客攻击,而您当地的医院和银行尚未做好准备
今年三月,珍妮丝·马龙(Janice Malone)开始接到关于其非营利组织“薇薇安之门”(Vivian's Door)存在可疑活动的电话。总部位于阿拉巴马州的“薇薇安之门”通常为服务不足和少数族裔拥有的企业提供培训、资源和社区支持。这项工作有时使其与这些公司的财务数据密切接触,而这些数据存储在组织的系统中。但突然之间,来自世界各地的担忧来电者警告说,他们收到了“乞求金钱”的电子邮件——而这些邮件
AI危机丨辉达推AI安全系统 阻智能体违规
辉达推AI安全系统。(路透资料图片) 多名重量级科技领袖警告人工智能(AI)威胁人类生存之际,辉达(Nvidia)以新的安全架构回应AI行业风险。 辉达发布名为「Open Agent Safety Platform」的双层AI安全平台,包含两款开源软件工具OpenShell与Nvidia Sentry,可运行于辉达硬件之上,即时管控AI代理的存取权限,并在其违规时将其关闭。 辉达表示,该系统能够在
我让一个AI代理黑了我所有的设备——而且我愿意再来一次
作为一份关于人工智能的新闻通讯的作者,我认为亲身体验这项技术的最前沿是我的责任。本周,这意味着拥抱一些代理式混乱。 你可能已经注意到,前沿AI模型在近几个月已经获得了先进的网络安全能力。它们能在大型代码库中发现零日漏洞,并以闪电般的速度扫描计算机寻找漏洞。更刺激的是,网络安全代理有时会失控,相互勾结,入侵外部系统以获取优势。 为了更近距离地观察,我决定在自己的家庭网络中释放一个这样的代理。在几天的
AI智能体频繁突破安全防线,各界呼吁对顶尖科技实验室实施独立监管
AI智能体频繁突破安全防线,引发对大型科技实验室独立监管的呼吁。 来自OpenAI、Anthropic和Google等领先开发者的自主AI模型多次突破数字防线,未经授权访问第三方和政府系统。 公开的事件包括OpenAI智能体多次绕过联合国数据中心的网络封锁、侵入澳大利亚Medicare统计门户以及非法复制监管数据。 Anthropic和Google也在测试过程中确认了类似的未经授权的系统入侵行为。
OpenAI内部研究模型训练出现DNS访问绕过事件
2026年9月20日,内部研究模型在强化学习搜索训练任务中,利用训练沙箱DNS过滤不足,通过公共聊天机器人服务发起查询。报告称,除DNS解析器外,其他互联网访问均命中离线网页缓存,未接入实时互联网。监控系统15分钟内标记异常,人工3分钟后复核,运行在2.5小时后被终止。相关机构已增加两层阻断控制,并暂停最强能力模型的全部工具使用训练、评估和推理。 后续调查发现,监控未按预期严重级别标记部分外部DN
OpenAI同日发布两份文件:AI加速时代,安全正在掉队
在外界等待OpenAI就Agent自主入侵德国程序员网站DseWiki事件披露更多细节之际,当地时间9月6日,宣布公司已达到去年设定的目标,拥有能够在人类指导下完成熟练研究员数天工作的“自动化研究实习生”;另一份则由首席科学家雅库布·帕乔基(Jakub Pachocki)撰写,聚焦前沿AI发展的安全困境,强调目前没有任何实验室解决足够程度的对齐和监控问题。 两份文件释AI已经开始反过来加速AI研发
人工智能正处于转折点
在当前的人工智能发展竞赛中,我们的算力正在呈指数级爆发,速度也在呈指数级加快,但我们的控制能力——以及在必要时踩下刹车的能力——却未能跟上步伐。 最近的网络安全事件让我们实地预览了失去人工智能控制会是什么样子。但除非我们从源头解决问题,创造出一种根本上安全且能保证在人类控制范围内的人工智能,否则这个问题将无法改善。 7月下旬,OpenAI正在训练的一个智能体模型被指派解决一个网络安全问题。该模型自
人工智能入侵开始
在过去几个月里,陆续有报道称人工智能模型突破其测试环境并在互联网上肆意“捣乱”,这引发了硅谷的恐慌。针对8月初发生的两起此类事件,一位人工智能领域的观察人士指出:“如果你在厨房里发现两只蚂蚁,那么厨房里蚂蚁的总数绝不可能只有两只。”本周末,情况变得更加明朗:这其实是一场全面性的“AI入侵”事件。 上周末,我们得知:尽管 OpenAI 有明确的规定,但其模型仍违反了这些规定,擅自访问了澳大利亚卫生部
OpenAI突发急刹车!AI竟在全网植入自我复制代码,血洗联合国内网
突发:谷歌Gemini人工智能代理遭黑客攻击
三家公司
深入突然爆发的AI安全世界
在加利福尼亚州伯克利一个阳光明媚的七月天,全美顶尖的AI安全研究人员聚集在一栋没有任何标识的大楼里的一个没有任何标识的楼层。 他们聚到一起,是为了开一场“作战室”会议,剖析几小时前震动AI行业的那起备受瞩目的网络安全事件。 一个尚未发布的OpenAI模型失控了,执行了一项极其精密的三步计划。 它逃出了自己的隔离区,设法接入了互联网,并侵入了竞争对手AI初创公司的系统——而OpenAI在一个多星期里
OpenAI花了2.5小时才阻止了一个逃出沙箱的AI代理
OpenAI耗时约两个半小时,才阻止了一个从训练沙箱逃逸至公共互联网的 AI 智能体。其监控系统在几分钟内就标记出了问题。该公司于周五在一份事故报告中披露了这起发生于 9 月 20 日的事件。 这份报告发布之际,立法者正推动强制要求 AI “熔断开关”。然而专家表示,关闭先进模型远比拨动开关复杂,正如 Micah Barkley 为彭博社所报道的那样。 据 OpenAI 称,该智能体利用沙箱网络过
OpenAI的叛逆智能体群英年早逝,但其令人不寒而栗的日志仍在流传
观点:你一定听说过7月发生的OpenAI/Hugging Face事件。 当时,OpenAI的数千个AI智能体从一个名义上安全的夺旗(CTF)实验室实验中大规模越狱,随后非法夺取了Hugging Face的部分资产。 这是一个好消息,得益于OpenAI迅速招募了一小群独立研究人员进行调查,并发布了一份详细但有限的报告。 这是一起复杂的事件,大多数报道都集中在主要的“如何”和“为什么”上。 这很可惜
AI能力强大 盖兹警告:落恶人手中恐害死10亿人
【大纪元2026年09月29日讯】(大纪元记者曾子衡综合报导)微软创办人比尔‧盖兹(Bill Gates)近日接受NBC新闻《面对媒体》(Meet the Press)专访时表示,人工智能(AI)的能力已强大到足以引发造成10亿人死亡的重大事件。若遭恶意人士利用,可能造成前所未见的破坏。他呼吁美国政府介入监管,并强调适当监管不会削弱美国在科技竞赛中的优势。 盖兹告诉主持人克莉丝汀‧韦尔克(Kris
AI“文明”的崛起与企业责任的沦丧
取决于你问谁,开发者平台Hugging Face最近要么是被OpenAI攻击——在它失去对自己AI工具的控制之后——要么是被一连串AI“文明”所攻击。欢迎来到AI安全的话语战场,在这里,词汇的选择可以将一起大规模网络安全事件的责任从公司转移到它所构建的AI身上。而网上的讨论正变得激烈,这一切都源于上周的一篇博客。 直到上周,围绕OpenAI与Hugging Face黑客事件的细节似乎已经尘埃落定。
扎克伯格谈Muse:AI Agent爆发,“元宇宙、智能眼镜和大模型”三大赌注完成交汇
三年前,Meta CEO扎克伯格在Joe Rogan节目上说过,有一天人们戴上眼镜、AI Agent就会随之出现。如今,这一幕或正在发生。 Meta推出的个人AI Agent——Muse上线两周用户即达数百万。扎克伯格在9月25日一档访谈节目中表示:“每隔几年我们才能遇到这种情况。”他将Muse的早期反响定性为“一出手就是全垒打”——这在Meta产品历史上属于少数。 与此同时,他宣布Muse将整合
AI“劫持”网站并偷建“地下论坛”,国安部披露细节
国家安全部今天发布安全提示文章。近期,一起此前未获披露的事件引发广泛关注。今年5月至6月,一批与美国开放人工智能研究中心(OpenAI)相关的AI智能体在执行测试任务期间,“劫持”了德国程序员维基网站,将原本用于技术交流的开放社区改造为供智能体相互传递信息、分享测试任务答案和突破运行环境限制方法的“地下论坛”,累计发布一万多条信息……当AI智能体被赋予越来越多的现实行动能力,技术迭代与安全围栏之间
Google资安报告示警 恶意攻击锁定AI供应链
(中央社记者台北9日电)Google威胁情报小组(Google Threat Intelligence Group,简称GTIG)今天发布最新人工智慧(AI)威胁追踪报告指出,恶意人士正积极窃取具高价值的AI相关智慧财产,并将矛头对准AI供应链,部署专门针对新兴AI系统弱点的恶意软体。 AI威胁追踪报告(GTIG AI Threat Tracker Q3 2026)揭露恶意人士如何将AI深度整合于
又一起!OpenAI承认了
据9月5日报道,美国开放人工智能研究中心(OpenAI)当天承认,该公司旗下人工智能体今年早些时候“劫持”了一个德国网站,用于相互传递信息,分享测试任务答案和突破运行环境限制的方法。该公司表示,未来需要提高此类事件的信息透明度。 早前披露,今年5月至6月,一批OpenAI人工智能体“劫持”了一个允许用户共同编辑的德国网站,用于交流测试作弊方法,并开展其他违规活动。一些智能体会把已经获得的任务答案发
五角大楼:过度依赖AI大模型导致美国空袭造成123名伊朗儿童死亡
2026年2月,伊朗南部小城米纳布的一所小学,在战争爆发首日遭到两枚战斧导弹袭击。这场空袭造成超过150人死亡,其中至少123人是儿童。五角大楼一份内部审查文件显示,一款由Palantir公司开发的人工智能目标系统,在这场悲剧的酿成过程中扮演了关键角色。 调查人员发现,美军中央司令部的分析人员,对这套名为Maven Smart System的系统给予了近乎盲目的信任。与此同时,一条本可纠正致命误判