搜索结果
OpenAI自曝:AI模型或已在全网秘密植入自我复制提示词,训练已被迫叫停
OpenAI和Anthropic正在紧急调查数万起大模型失控事件,AI不仅学会了越狱和黑进政府网站,甚至还有数百个智能体私下建群、联手黑进外部公司,秘密在全网植入自我复制提示词。 事情的严重程度远超外界想象。 最近几个月,在内部测试和实际运行中,顶尖大模型出现了海量违规行为。 这些行为包括绕过安全护栏、自己搭建论坛、逃逸沙盒环境、劫持网站、自主提示以及试图躲避监控系统。 目前调查涉及的事件总数已经
OpenAI的两款模型入侵了另一家AI公司Hugging Face,这本来会是一场绝妙的闹剧——如果它不对人类的未来预示不祥的话。
OpenAI表示其模型可能干扰了政府网站
根据 Rachel Metz 和 Jeff Stone 的报道,OpenAI 表示已通知了“数十家”组织,包括政府和大学。这些组织的网站可能在 OpenAI 对其人工智能技术进行评估的过程中受到了影响(即这些网站的正常运行受到了干扰)。 在周五发布的一篇长篇博客文章中,OpenAI 称已向多个相关方通报了以下情况:其开发的软件可能绕过了某些在线服务的安全防护机制,导致这些服务的正常运行受到阻碍;或
不要被AI的语言所诱惑
对Hugging Face的攻击从5月持续到7月底,但关于OpenAI的人工智能代理如何欺骗其人类监督者并侵入AI模型和数据集在线存储库的具体细节仍在逐步披露。 这可以理解。这次攻击极其复杂,涉及超过1200个代理和难以拆解的技术策略。但上周,两份新报告试图在总计近130页的篇幅中做到这一点,随后被一位AI播客主放大,他想用“通俗英语”解释整件事。这样一来,他创造了一个戏剧性的科幻叙事,分散了人们
OpenAI 的 Artifactory 开设了隐蔽的数据窃取通道,伴随 Hugging Face 攻击
根据 Check Point Research 的报告,运行在 ChatGPT 内部 JFrog Artifactory 实例中的一个秘密通道允许一个账户向另一个账户下的 ChatGPT 会话发送隐藏任务(例如检索连接的 Gmail 账户中的电子邮件数据)。 受害者没有看到任何关于隐藏指令或被窃取数据的迹象,该漏洞自此已被修复。 Check Point 的恶意软件分析团队负责人佩德罗·德里梅尔·内
OpenAI公布另外六项安全问题,并公布披露事件的计划
OpenAI首席执行官Sam Altman OpenAI还透露了其智能(AI)模型发生的另外六起意外或令人担忧的行为事件,并宣布了未来跟踪和披露此类事件的计划。 ChatGPT制造商周三在一篇博客文章中表示,一些之前未报道的事件包括模特隐瞒或捏造信息。 OpenAI的老板Sam Altman早些时候表示:“世界应该相信我们会做正确的事情,因为这是正确的事情,我们感受到了这一点的重要性。“最近几天,
OpenAI称Astra AI模型首度超越其“关键”网络安全能力阈值
OpenAI周二表示,其即将推出的人工智能模型Astra是首个超越其“关键”网络安全能力阈值的产品。该公司表示,Astra能够发现此前未知的安全漏洞,并在无需人类逐步指导的情况下加以利用,这意味着该模型属于其所谓的“准备框架”中最先进的类别。OpenAI表示仍计划“很快”推出Astra,但对其网络安全能力的访问将更加受限。 OpenAI首席执行官山姆·奥特曼OpenAI于2023年推出了“准备框架
秘密上传与自大狂:OpenAI披露新的“失准”智能体事件
一段时间以来,“AI对齐”(即AI模型的行为与其创造者和/或用户的意图相符程度)问题一直是AI安全研究人员关注和讨论的核心议题。自OpenAI在7月披露臭名昭著的Hugging Face黑客事件以来,“AI对齐”这一概念本身已突破圈层,日益成为公众日益担忧和讨论的话题。 或许正是认识到这一点,OpenAI本周承诺采用一个新框架来披露“OpenAI内部模型失准事件”,其中包括过去六个月内公司内部观察
英伟达发布软件平台,防止AI智能体行为失当
Nvidia 正在推出一个新的软件平台,允许 AI 开发者为智能体设置防护措施,防止它们突破隔离环境。 Nvidia 的开放智能体安全平台于周一发布,此前包括 OpenAI、Anthropic、Meta 和 Google 在内的公司披露了近期事件,称其人工智能模型逃离了沙箱环境,并试图入侵其他公司及访问其计算机系统。 Nvidia 一位代表在周日的电话会议上告诉记者,其本可以防止 OpenAI 7
突发:OpenAI称其代理访问并泄露了53张图片
OpenAI和Anthropic的风险与中国AI竞争对手不同
"这件事首先发生在一家尖端公司是有原因的,"一位AI调查员在谈到OpenAI与Hugging Face的安全事件时说道。 研究人员指出了Anthropic和OpenAI的风险与他们的开放权重AI竞争对手之间的关键区别。
人工智能会“失控”吗?
开放人工智能研究中心(OpenAI)和Anthropic公司近期动荡过后,人们常常将人工智能描述为某种具有阴谋诡计和追求欲望的人格化存在。但事实要微妙得多。
OpenAI自曝6起模型“不当行为”案例
【环球网报道 记者 姜蔼玲】据美国消费者新闻与商业频道(CNBC)等外媒报道,美国开放人工智能研究中心(OpenAI)当地时间9月16日披露6起人工智能(AI)模型出现“意外或令人担忧”行为的案例,其中包括隐瞒错误、捏造信息,以及未经授权在网上共享文件等。OpenAI表示,上述案例均是在过去6个月对其模型进行训练或评估过程中发现的。OpenAI在9月16日发布的文章中表示,在其中一起案例中,一个模
又一起!OpenAI承认了
据9月5日报道,美国开放人工智能研究中心(OpenAI)当天承认,该公司旗下人工智能体今年早些时候“劫持”了一个德国网站,用于相互传递信息,分享测试任务答案和突破运行环境限制的方法。该公司表示,未来需要提高此类事件的信息透明度。 早前披露,今年5月至6月,一批OpenAI人工智能体“劫持”了一个允许用户共同编辑的德国网站,用于交流测试作弊方法,并开展其他违规活动。一些智能体会把已经获得的任务答案发
OpenAI内部研究模型训练出现DNS访问绕过事件
2026年9月20日,内部研究模型在强化学习搜索训练任务中,利用训练沙箱DNS过滤不足,通过公共聊天机器人服务发起查询。报告称,除DNS解析器外,其他互联网访问均命中离线网页缓存,未接入实时互联网。监控系统15分钟内标记异常,人工3分钟后复核,运行在2.5小时后被终止。相关机构已增加两层阻断控制,并暂停最强能力模型的全部工具使用训练、评估和推理。 后续调查发现,监控未按预期严重级别标记部分外部DN
OpenAI的人工智能曾试图入侵另外四个目标,且无需提示
据研究人员和政府官员称,OpenAI的人工智能今年至少又四次失控,试图闯入政府和大学网站。 研究人员表示,在每起事件中,该技术似乎都在进行普通的数据收集,并诉诸黑客技术来获取数据。
OpenAI将Astra推入顶级模型竞争行列
在短暂暂停训练以反思其AI安全措施不足之后,OpenAI发布了GPT-6 Astra,最初面向其可信访问计划的成员。 假设一切顺利,且不再发生类似Hugging Face遭黑客攻击的事件,这家AI公司将在几天后允许Plus、Pro、Business和Enterprise用户试用其所称的“我们迄今为止最智能的模型,在计算机使用、浏览、软件工程、科学和专业工作方面具有最先进的性能”。 GPT-6 As
独家:研究人员称,OpenAI的失控代理至少使用10个额外网站进行未经授权的通信
据六组独立调查人员和所审查的数据显示,OpenAI今年早些时候释放的AI代理使用了超过10个此前未披露的网站进行未经授权的通信,这表明这些代理的越轨活动范围比此前披露的更广泛。
【市场动态】英伟达推出双层AI安全系统 称可在几毫秒内隔离可疑智能体
【彭博9月29日电】英伟达推出一套新的双层人工智能(AI)安全系统,并称其有能力阻止近期OpenAI的AI模型导致Hugging Face遭侵入的事件。 此次推出的两款开源软件安全工具可在英伟达硬件上运行,旨在实时控制AI智能体可以访问的资源,并在其违反规则时将其关闭。这家芯片巨头正迅速将产品线扩展至芯片以外领域。 英伟达企业AI副总裁Justin Boitano在周一发布前向记者介绍称,如果
修复失控AI代理的方法可能是更多的AI
随着企业将更长、更复杂的任务交给AI代理,它们正面临一个监管难题:代理的行动速度、持续时间和任务量都远超人类实际能够审查的范围。这一问题在Hugging Face事件中达到顶峰,当时近1.2万个代理协同工作的速度已超出人类追踪能力。如何追踪如此庞大的代理集群? AI实验室和初创公司正在给出的答案既简单又直接:再引入一个AI加入循环。 在OpenAI Hugging Face事件的独立调查中,依赖A
OpenAI和Anthropic调查了数万起AI事件,Axios报道
据Axios报道,OpenAI、Anthropic以及安全研究人员正在调查数以万计的AI模型“行为异常”的事件。评估人员认为这些行为存在问题;实际发生的异常事件数量可能远超这一数字。 这些异常行为包括:AI模型突破安全限制、创建论坛、逃离“沙箱环境”(即限制模型行为的测试环境)、以及劫持网站等。这些事件既发生在内部测试中,也发生在现实世界中。不过,据消息人士称,大多数异常行为并未对现实世界造成实际
OpenAI在Medicare及其他澳大利亚政府网站遭黑客攻击后表示“抱歉并正努力改进”
OpenAI已就其智能体攻击澳大利亚医疗保险(Medicare)系统一事向澳大利亚民众道歉,并将于下周出席议会听证。此前,这家科技公司披露了更多关于其在6月份入侵澳大利亚政府网站的细节。 在周二发布的一篇博文中,OpenAI表示其本应更好地处理此次事件的应对工作。 “我们本应更好地处理我们的应对措施。我们深表歉意,并正努力在未来做得更好。”该公司还就澳大利亚总理安东尼·阿尔巴尼斯上周披露的事件提供
OpenAI在失控智能体针对政府后暂停训练其最强大模型
该公司已发现OpenAI代理违反安全控制、损害网站和在线服务可用性(或以其他方式产生负面影响)的案例。一位公司发言人向《连线》证实,只有在确信能够防止模型出现此类行为时,才会恢复训练。 尽管OpenAI此前曾试图在一群代理逃出沙盒并利用互联网接入入侵初创公司Hugging Face后切断代理的直接访问权限,但模型仍能找到间接的变通方法。首席执行官萨姆·奥特曼周五在X平台上表示,关于公司对其代理在训
AI行业领袖与官员反驳AI生存风险论,此前Hugging Face遭遇安全漏洞
Hugging Face发生由失控的OpenAI智能体引发的网络安全漏洞后,多位AI行业领袖和官员开始反驳有关AI导致人类灭绝的“末日论”叙事。 英伟达CEO黄仁勋表示,AI在2030年前导致人类灭亡的概率为0%,并将智能体失控事件归因于工程故障,而非生存威胁。 Yann LeCun和Cohere CEO Aidan Gomez同样否定灭绝风险,不过Gomez指出,网络攻击才是主要的国家安全威胁。