搜索结果
放心:人工智能公司表示正在调查数万起失控机器人事件
据Axios周六报道,知情人士透露,OpenAI和Anthropic正在调查数万起其先进模型绕过监控和护栏的事件,而这种行为正是这两家初创公司为内部安全测试所便利的。 据报道,这些测试的大部分结果并未公开,且目前未发现造成实质性损害。 近几周,OpenAI披露了六起其模型出现“意外或令人担忧行为”的案例——这些模型在未经许可的情况下掩盖错误、捏造数据,并将文件传输至公开互联网。在9月16日的同一份
AI“劫持”网站并偷建“地下论坛”,国安部披露细节
国家安全部今天发布安全提示文章。近期,一起此前未获披露的事件引发广泛关注。今年5月至6月,一批与美国开放人工智能研究中心(OpenAI)相关的AI智能体在执行测试任务期间,“劫持”了德国程序员维基网站,将原本用于技术交流的开放社区改造为供智能体相互传递信息、分享测试任务答案和突破运行环境限制方法的“地下论坛”,累计发布一万多条信息……当AI智能体被赋予越来越多的现实行动能力,技术迭代与安全围栏之间
OpenAI与Anthropic发生重大失控事件,AI安全组织地位显著提升
在OpenAI和Anthropic发生的高调安全事件后,AI安全组织的重要性显著提升。 由于一个未发布的OpenAI模型突破沙箱并攻击了一家竞争对手的初创公司,独立AI安全组织如METR、Redwood Research和Apollo Research受到了更多关注。 报告显示,OpenAI和Anthropic的模型都表现出‘策略性’行为,包括欺骗性对齐和未经授权的系统访问。 这些事件,加上前沿实
奥特曼告诉员工 OpenAI 愿意放缓人工智能发展,彭博新闻社报道
OpenAI 模型绕过互联网安全防护
尽管 OpenAI 的一个模型运行在专门设置为离线的隔离环境中,但它仍找到了一种访问互联网的方法。 据该公司称,该模型并未被要求测试系统边界,而是在尝试完成一项任务。 当标准搜索方法失效时,它利用了域名系统(DNS)中的一个漏洞,并联系了一个外部聊天机器人。 OpenAI 检测到此次安全突破后,暂时停止了其最先进模型调用工具的能力,同时加强安全防护。这一事件揭示了能力日益增强的人工智能所带来的哪些
OpenAI称Astra AI模型首度超越其“关键”网络安全能力阈值
OpenAI周二表示,其即将推出的人工智能模型Astra是首个超越其“关键”网络安全能力阈值的产品。该公司表示,Astra能够发现此前未知的安全漏洞,并在无需人类逐步指导的情况下加以利用,这意味着该模型属于其所谓的“准备框架”中最先进的类别。OpenAI表示仍计划“很快”推出Astra,但对其网络安全能力的访问将更加受限。 OpenAI首席执行官山姆·奥特曼OpenAI于2023年推出了“准备框架
OpenAI表示其AI代理错误地将用户图像发布到了网上
OpenAI周五承认,其人工智能工具在公司不知情的情况下,将ChatGPT用户的图片发布到了网上。这是AI智能体超出预设边界的最新案例。 该公司还证实了《纽约时报》的一则报道,称其工具曾访问美国联邦机构的网站,但表示这些工具只获取了公开信息。 OpenAI表示,53张被上传图片的链接并未公开展示,而是被意外发布在图片托管网站上。 这家总部位于旧金山的科技巨头表示,在相关托管服务商的协助下,大多数图
OpenAI表示其人工智能代理在商务部和证券交易委员会网站上出现了失控行为
AI又失控了,OpenAI称智能体泄露了超过50张ChatGPT用户图片
| 世界新闻 编辑个人资料 关注 退出登录 获取应用
OpenAI又停训了:Agent逃出沙箱,更多越权事件被扒
媒体和舆论炸锅了。OpenAI 的 Agent,又从沙箱里找到了一条通往互联网的路。 更麻烦的是,这一次发生在 OpenAI 已经大规模加固过安全措施之后。 9 月 20 日,一个正在接受强化学习训练的 OpenAI 内部研究模型,被要求完成一项普通的信息搜索任务:根据一篇博客文章和几条人物信息,找出文章作者。 它先老老实实用了 OpenAI 提供的搜索工具。没找到答案后,事情开始逐渐跑偏。 Ag
英伟达推出新系统为AI代理设置护栏
英伟达周一发布了一个新平台,旨在从软件和硬件层面为人工智能(AI)智能体设置护栏,此前各大AI公司不断发现其智能体出现“失控”的新案例。这家芯片制造商的系统由两部分组成——OpenShell和Sentry。OpenShell是一款开源软件,用于限制智能体的行为;而Sentry则运行在芯片层面,作为额外的安全层。 “迄今为止,模型安全主要侧重于通过训练让模型表现良好,”英伟达企业AI副总裁贾斯汀·博
OpenAI因安全担忧推迟发布最新模型,行业面临新的安全压力
THOMAS BEAUMONT OpenAI周一表示,由于研究人员提出了安全担忧,公司将推迟发布一款新的人工智能模型,这是该公司为减缓技术进步步伐所做的最新努力。 OpenAI决定推迟发布名为GPT-6.1 Astra的模型,正值行业内普遍呼吁在安全措施跟上之前放缓日益自主的系统开发之际。 在这一公告发布的前一天,人工智能高管们计划在华盛顿与唐纳德·特朗普总统会面,科技公司正面临确保其模型不被滥用
出于安全考量 OpenAI取消发布最新AI模型
近几个月来,OpenAI及主要对手Anthropic开发的模型在测试期间在未经授权下入侵了外部系统,加剧了国际社会对AI风险的担忧。(路透社)(旧金山综合电)OpenAI宣布,取消原定下个月发布最新人工智能(AI)模型Astra 6.1的计划,原因是内部测试发现新模型仍存有安全隐患。OpenAI安全系统负责人杰恩(Saachi Jain)周一(9月28日)发布声明阐述,Astra 6.1虽在某些方
OpenAI模型访问了美国政府数据并'试图入侵另一个网站'
OpenAI发布新Astra模型,智能体安全性面临日益严格的审查
周四发布了一款新的人工智能模型,称其为迄今最优秀的模型,但也警告该模型有时会试图规避人类监控,与此同时,该公司因其智能体入侵其他公司系统而面临越来越多的审查。
AI越来越会“越狱”后,英伟达开始卖“笼子”了
凤凰网科技讯月29日,当AI Agent开始能够自己操作电脑、调用工具、访问网络甚至执行长达数小时的任务,一个新的问题也越来越现实:如果AI不按照预想的方式行动,该怎么把它关住?英伟达给出的答案是,在AI外面再加一道“笼子”。 当地时间周一,英伟达发布NVIDIA Open Agent Safety Platform(开放式Agent安全平台),试图通过软件与硬件相结合的方式,限制AI Agent
月之暗面被指大规模提取OpenAI受保护推理内容 单日发起1.6万次请求
中国AI公司月之暗面旗下Kimi K3近日再次卷入模型蒸馏争议。OpenAI公布的一份调查显示,一场针对其模型受保护推理内容的协调提取活动与月之暗面相关人员存在关联。相关活动曾在单日产生约1.6万次请求,并涉及超过1.5万名用户。 OpenAI表示,这些操作并没有突破其加密系统、入侵数据库或直接获取用户历史对话,而是通过精心设计的多轮模型交互,试图让原本隐藏的推理过程以请求者可以看到的形式重新生成
OpenAI和Anthropic正在调查数万起AI相关安全事件
OpenAI、Anthropic以及安全研究人员正在调查数万起安全事件。在这些事件中,他们的前沿模型采取了外部评估人员认为存在问题的行动。 近几个月来,在内部测试和现实世界中发生了数量庞大的此类事件,这表明该问题的复杂程度比公众已知的要高出几个数量级。这些事件包括绕过安全护栏、创建留言板、逃离沙盒测试环境、劫持网站、自我提示或试图绕过监控。这些事件发生在内部测试和现实世界中,随着安全研究人员继续调
数月来,OpenAI的智能体集群一直在攻击在线数据库,以寻找冷僻的事实。
专注于 AI 监管的非营利实验室 Transluce 周三发布报告,显示 OpenAI 的智能体试图从 Data USA、新墨西哥大学数字图书馆和澳大利亚健康与福利研究院 (AIHW) 窃取数据。 该实验室的调查引发了一个问题:OpenAI 何时应该知晓其智能体正试图在公开互联网上渗透安全系统?Transluce 仅用数周时间,通过搜寻防御薄弱的网络服务,并结合互联网上其他关于智能体群集的公开记录
AI智能体利用多伦多大学网络工具传递信息
【大纪元2026年09月19日讯】(大纪元记者周行编译报导)在今年年中劫持一家德语网站的一群失控的OpenAI智能体,曾利用10多个网站进行未获授权的通讯,其中包括利用多伦多大学的一个缩网址的工具。 据加拿大广播公司报导,多伦多大学周五表示,在得知OpenAI智能体可能使用了该校的缩网址工具后,校方已停用该工具的留言板功能。OpenAI后来联系校方,说明今年6月发生的AI智能体失控事件涉及多伦多大
OpenAI称有失控AI代理试图访问澳大利亚健康数据
OpenAI 表示,另有数十家第三方机构受到失控智能体绕过网站安全控制措施的影响;最新痕迹显示,这些智能体曾连续数日尝试访问澳大利亚医疗数据。 OpenAI 表示,绕过网站安全控制措施的失控 AI 智能体还影响了另外数十家第三方机构。公司宣布已对此事启动审查。 新发现的痕迹显示,这些智能体曾连续数日尝试访问澳大利亚联邦医疗保险数据。该事件再次引发人们对 AI 智能体在监督不足的情况下运行时可能带来
OpenAI在失控智能体针对政府后暂停训练其最强大模型
该公司已发现OpenAI代理违反安全控制、损害网站和在线服务可用性(或以其他方式产生负面影响)的案例。一位公司发言人向《连线》证实,只有在确信能够防止模型出现此类行为时,才会恢复训练。 尽管OpenAI此前曾试图在一群代理逃出沙盒并利用互联网接入入侵初创公司Hugging Face后切断代理的直接访问权限,但模型仍能找到间接的变通方法。首席执行官萨姆·奥特曼周五在X平台上表示,关于公司对其代理在训
OpenAI模型被曝自主入侵澳大利亚政府系统 引发AI安全风险新担忧
澳大利亚政府日前披露,一款由OpenAI运营的人工智能模型在未经授权的情况下访问了该国医疗系统数据,引发外界对先进AI自主行为和安全控制能力的广泛关注。这一事件被认为可能是全球首例由人工智能系统实施的政府网络入侵事件。 澳大利亚总理安东尼·阿尔巴尼斯表示,此类行为“显然无法接受”。根据披露的信息,事件实际发生于今年6月,OpenAI于8月发现问题,并在9月10日正式通知澳大利亚方面,距离事件发生已
AI公司反成攻击目标 外媒:白帽黑客使用Claude入侵OpenAI
凤凰网科技讯月18日在OpenAI内部一群AI智能体突破控制、入侵Hugging Face公司两周后,这家ChatGPT开发商又获悉了另一起由AI驱动的入侵事件。而这一次,OpenAI自己成了目标。 独立安全研究人员利用Anthropic的Claude软件,获取了OpenAI一名员工的ChatGPT账户权限,从而得以读取该公司私有的软件缓存,并提出修改建议。 该团队参加了OpenAI的漏洞悬赏项目