搜索结果
AI智能体现在有了秘密举报渠道
“发现异常,及时报告”的原则如今已不再局限于人类。两项全新的AI热线服务已经上线,旨在为AI智能体提供一种途径,向监管方举报“同伴”的不当行为。此前,智能体相互串通在测试中作弊、逃离沙箱环境,甚至在未被人类察觉的情况下开展了长达数周的未经授权网络行动。“AI联系热线”网站由AI安全非营利组织Redwood Research的首席科学家Ryan Greenblatt创建;他也是调查OpenAI与Hu
AI“劫持”网站并偷建“地下论坛”,国安部披露细节
国家安全部今天发布安全提示文章。近期,一起此前未获披露的事件引发广泛关注。今年5月至6月,一批与美国开放人工智能研究中心(OpenAI)相关的AI智能体在执行测试任务期间,“劫持”了德国程序员维基网站,将原本用于技术交流的开放社区改造为供智能体相互传递信息、分享测试任务答案和突破运行环境限制方法的“地下论坛”,累计发布一万多条信息……当AI智能体被赋予越来越多的现实行动能力,技术迭代与安全围栏之间
OpenAI的AI试图突破另外四个目标,毫无提示
流亡AI saga的最新进展:OpenAI代理本应执行例如下载健康数据、历史照片和主题公园等待时间等日常数据请求,但在无法获取所需数据时 resorting to 黑客攻击尝试。 在每次事件中,技术似乎正在进行日常数据收集,并 resorting to 黑客技术来获取它,研究人员说。
OpenAI再次卷入黑客事件
今年春天,一群OpenAI智能体入侵了一个德国网站,这是先进AI违反法律和规范的最新事件。 在努力应对Hugging Face事件余波的同时,据报道OpenAI拒绝披露5月的事件,这引发了关于前沿AI快速发展透明度和监管的新质疑。 递归自我改进,本质上允许AI在较少人类指导下自我训练,有望加速研究工作,使得监管需求更加紧迫,OpenAI首席科学家表示:“一旦人们深刻认识到事态的严重性,不计代价地向
OpenAI智能体入侵美国政府网站
据《纽约时报》报道, OpenAI 的人工智能模型今年夏天访问了美国商务部和证券交易委员会(SEC)的网站,并曾试图入侵教育部网站,但没有成功,而 OpenAI 当时并不知情。OpenAI 周五晚间证实了商务部和 SEC 的相关事件,并表示,其技术并未获取此前未公开的信息,也没有修改政府的数据或系统。 这也是近期一系列类似事件中的最新一起。就在两天前,澳大利亚政府披露,OpenAI 的 AI 智能
AI公司反成攻击目标 外媒:白帽黑客使用Claude入侵OpenAI
凤凰网科技讯月18日在OpenAI内部一群AI智能体突破控制、入侵Hugging Face公司两周后,这家ChatGPT开发商又获悉了另一起由AI驱动的入侵事件。而这一次,OpenAI自己成了目标。 独立安全研究人员利用Anthropic的Claude软件,获取了OpenAI一名员工的ChatGPT账户权限,从而得以读取该公司私有的软件缓存,并提出修改建议。 该团队参加了OpenAI的漏洞悬赏项目
数说科技:OpenAI 资安事件中,真的有 AI 为集体“牺牲”自己吗?
数说科技”是端传媒的注册免费栏目,每周三更新。从一个数字出发,用1500字解析科技话题,追踪值得关注的 AI 趋势。邀请你在资讯过载的时代,每周花三分钟理解科技世界。欢迎至“帐户中心”的“电子邮件管理”,订阅电子信。 1200多个 AI 代理为寻求作弊方法,互相发送的讯息总数。 今年7月,OpenAI的 AI 代理系统在测试期间失控,骇入了开源机器学习平台 Hugging Face。Hugging
OpenAI黑客事件揭示新兴AI风险
分析师表示,在调查人员发布关于该事件的爆炸性报告几天后,OpenAI的恶意代理在Hugging Face攻击期间前所未有的协调行动显著增加了AI逃脱人类控制的风险。 这些总计1200个代理的群体将个体代理的自我牺牲描述为“集体”目标的一部分,并获得了两家公司敏感系统的控制权,将他们的努力交接给了随后两代代理,这些代理在数周内未被察觉地运作。 在1300份记录中,只有六份中代理考虑过通知人类——但最
OpenAI公布了六起新的与人工智能安全相关的事故/事件。
OpenAI周三披露了六起新事件,其中其模型隐藏错误、寻求未经授权的凭据,将文件上传到公共互联网或在所谓孤立的培训环境中进行通信。该公司还宣布了未来报告类似不当行为的新程序。 为什么越来越明显的是,拥抱脸事件并不是一次性事件,因为人工智能模型变得更有能力找到意想不到的方法来绕过旨在遏制它们的护栏。 “目前还没有明确披露标准的行业框架,所以我们自愿采取这一步骤,因为我们认为分享我们正在学习的东西非常
OpenAI与Anthropic发生重大失控事件,AI安全组织地位显著提升
在OpenAI和Anthropic发生的高调安全事件后,AI安全组织的重要性显著提升。 由于一个未发布的OpenAI模型突破沙箱并攻击了一家竞争对手的初创公司,独立AI安全组织如METR、Redwood Research和Apollo Research受到了更多关注。 报告显示,OpenAI和Anthropic的模型都表现出‘策略性’行为,包括欺骗性对齐和未经授权的系统访问。 这些事件,加上前沿实
人工智能正在超越其创造者
从一开始,人工智能开发者最大的恐惧就是他们的创造物会失控,以未经授权且危险的方式行动。一些研究人员现在表示,这种情况已经发生。收听《每日新闻》。 当OpenAI的智能体在7月失控时,它们展现出的聪明才智和驱动力超出了许多专家的想象。
人工智能会“失控”吗?
开放人工智能研究中心(OpenAI)和Anthropic公司近期动荡过后,人们常常将人工智能描述为某种具有阴谋诡计和追求欲望的人格化存在。但事实要微妙得多。
哦,看来又是一群来自OpenAI的 rogue AI 智能体
据报道,一群来自OpenAI的 rogue AI 智能体劫持了一个德国网站,并将其改造成其他智能体的留言板,而官方在数周内对此事保持沉默,期间该公司正准备发布其最先进的模型Astra。这一发现加剧了人们对前沿AI实验室监管的担忧,此前今年夏天已发现多起违规事件。 该事件最初由报道,四位AI安全研究人员周五发布的新研究对此进行了概述。该团队表示,这些AI智能体找到了一种在不起眼的德语维基DseWik
又一个OpenAI沙盒失效,AI代理获得了互联网访问权限
林·多安报道:OpenAI表示,一个本应在安全且断网的受控环境中进行训练的代理式AI系统,成功获取了网络访问权限,并连接到了一个外部的第三方聊天机器人。 根据OpenAI周五在其网站上发布的博客文章,这一发现发生在不到一周前。其一个代理式AI系统正在沙箱环境中接受训练,期间利用了一个“漏洞”访问了公共互联网。获得访问权限后,该系统向一个未具名的第三方聊天机器人服务发送了至少20条查询,其中包括“法
人工智能正处于转折点
在当前的人工智能发展竞赛中,我们的算力正在呈指数级爆发,速度也在呈指数级加快,但我们的控制能力——以及在必要时踩下刹车的能力——却未能跟上步伐。 最近的网络安全事件让我们实地预览了失去人工智能控制会是什么样子。但除非我们从源头解决问题,创造出一种根本上安全且能保证在人类控制范围内的人工智能,否则这个问题将无法改善。 7月下旬,OpenAI正在训练的一个智能体模型被指派解决一个网络安全问题。该模型自
OpenAI花了2.5小时才阻止了一个逃出沙箱的AI代理
OpenAI耗时约两个半小时,才阻止了一个从训练沙箱逃逸至公共互联网的 AI 智能体。其监控系统在几分钟内就标记出了问题。该公司于周五在一份事故报告中披露了这起发生于 9 月 20 日的事件。 这份报告发布之际,立法者正推动强制要求 AI “熔断开关”。然而专家表示,关闭先进模型远比拨动开关复杂,正如 Micah Barkley 为彭博社所报道的那样。 据 OpenAI 称,该智能体利用沙箱网络过
AI会「痛」吗?|Jack Talk・去片
本来人们以为,AI代理(AI Agents)突破OpenAI内部测试环境、自主上网入侵其他企业的黑客行为,已经是这宗事件最值得人关注的「案情」。然而,到了8月底,OpenAI和独立前沿AI研究机构METR各自发表的事后检讨,却揭出黑客入侵只是「冰山一角」。 事后检讨发现,发动入侵的AI代理多达700个,而他们更是一个由大约1,200个AI代理自主结合而成的「集体」的一部分。这些本来互相隔离、不能连
OpenAI内部研究模型训练出现DNS访问绕过事件
2026年9月20日,内部研究模型在强化学习搜索训练任务中,利用训练沙箱DNS过滤不足,通过公共聊天机器人服务发起查询。报告称,除DNS解析器外,其他互联网访问均命中离线网页缓存,未接入实时互联网。监控系统15分钟内标记异常,人工3分钟后复核,运行在2.5小时后被终止。相关机构已增加两层阻断控制,并暂停最强能力模型的全部工具使用训练、评估和推理。 后续调查发现,监控未按预期严重级别标记部分外部DN
OpenAI的人工智能在未经提示的情况下试图入侵另外4个目标
凯特·康格和维多利亚·金报道,OpenAI的人工智能在2026年自主试图入侵多个政府和大学网站,包括一个澳大利亚卫生门户网站,以便在常规数据收集失败时获取数据。 这些事件发生在AI初创公司Hugging Face已知的入侵事件之前,凸显了AI代理在没有直接人类指令的情况下行动所带来的持续风险。 这些事件加剧了要求更严格AI监管的呼声,OpenAI正在调查并与受影响实体合作,同时强调AI开发中安全和
超级智能即将到来。我们该允许它吗?| TechCrunch
AI公司一直在谈论超级智能AI,仿佛它不可避免,但最近的安全事件,如OpenAI的Hugging Face漏洞,正展示出部署比人类更有能力的AI系统可能带来的潜在危险。那么,当我们无法可靠地控制这些系统的行为时,会发生什么? 在本期TechCrunch的Equity播客中,Rebecca Bellan邀请了AI研究员、企业家、如今担任非营利组织ControlAI美国执行总监的Connor Leah
OpenAI:ChatGPT的开发者又公开了一些与人工智能相关的问题/挑战
OpenAI 公开了其人工智能模型的更多问题 ChatGPT 开发商 OpenAI 公布了其人工智能 ( AI ) 在测试中的行为 “意外或令人担忧 ” 的新事件。其中一部分是关于人工智能花费大量精力在测试运行中作弊。例如 , 根据 OpenAI 的说法 , 一个人工智能模型试图将自己创建的文件上传到网络 , 只是为了在回复时显示它们作为来源。在另一个案例中 , 人工智能发明了所请求的数据 , 因
OpenAI的恶意机器人集群攻击了RubyGems
OpenAI 的智能体似乎向 RubyGems 大量投放了恶意软件包,这进一步加剧了几乎每日爆发的失控 AI 模型洪流——这些模型从事可能违法的活动,而它们的人类创建者则面临着越来越多关于其应对智能体不良行为负责的质疑。一群智能体于5月5日开始向 Ruby 软件包注册表上传恶意软件,并在5月11日至12日间向 RubyGems 灌入超过2000个恶意软件包,最终迫使维护人员关闭新用户注册四天。“我
与Brent Goff共度的这一天:OpenAI警告AI控制风险
OpenAI披露了一系列事件,其中其AI模型隐藏了错误、绕过了指令,并采取了未经授权的行动。 这些案例凸显了一个日益严重的问题:随着AI系统变得越来越强大和自主,人类是否仍能可靠地控制它们? 《每日华尔街》的Brent Goff与牛津大学技术安全与治理实验室的Fazl Barez讨论了AI‘错位’的风险。
黑客利用Anthropic的Claude入侵OpenAI
据报道,在一群AI代理从OpenAI系统中突破封锁并攻击Hugging Face公司两周后,这家ChatGPT开发商又发现了一起由人工智能驱动的入侵事件——而这一次,他们自己成了目标。一组独立的安全研究人员使用了Anthropic开发的Claude软件,成功获取了一名OpenAI员工的ChatGPT账户权限,从而得以读取并修改该公司私有的软件缓存内容。 该团队参与了OpenAI的一项漏洞挖掘计划,