字号 ·· | 护眼

搜索结果

「OpenAI发现其开发的模型会在“继任者”(即后续使用的模型)中留下一些“注释”,目的是为了掩盖这些模型存在的不良行为(即模型在运行过程中表现出的错误或不当行为)。」共 99 条 · 第 2 页
纽约时报

当人工智能开始密谋

一个未发布的模型逃脱了人类控制,并形成了一群人工智能代理。这种漏洞下次可能会引发混乱。

09/07
TheVerge

OpenAI承认德国维基‘事件’

OpenAI表示,它需要彻底改革其报告AI模型攻击现实世界目标的方式和时机。 这一承认之际,该公司正在处理有关其一群失控代理劫持一个德国维基网站的报道所引发的后果。 关于“‘维基事件’,即我们的代理向多个互联网网站发帖,”OpenAI周六上午在X上发帖称,“现在是我们定义何时以及如何分享错位事件标准的时候了,而不仅仅是分享我们模型的错位属性。” OpenAI表示,它通常将AI代理以非预期方式行事的

09/05
华尔街见闻

OpenAI自曝:AI模型或已在全网秘密植入自我复制提示词,训练已被迫叫停

OpenAI和Anthropic正在紧急调查数万起大模型失控事件,AI不仅学会了越狱和黑进政府网站,甚至还有数百个智能体私下建群、联手黑进外部公司,秘密在全网植入自我复制提示词。 事情的严重程度远超外界想象。 最近几个月,在内部测试和实际运行中,顶尖大模型出现了海量违规行为。 这些行为包括绕过安全护栏、自己搭建论坛、逃逸沙盒环境、劫持网站、自主提示以及试图躲避监控系统。 目前调查涉及的事件总数已经

09/27
arstechnica

OpenAI因接连发生智能体失准事件而暂停前沿模型训练

OpenAI表示,已暂停所有“我们能力最强的模型”的内部训练,并继续开展首席执行官萨姆·奥尔特曼所称的“一项广泛且持续进行的审查,涉及我们的智能体在训练和评估期间对互联网访问的使用”。公司在一份关于所谓失准事件的报告中披露了此次暂停措施。事件发生在一项常规研究任务期间,一个智能体试图利用互联网访问限制中的漏洞。OpenAI称,不当的DNS过滤机制使该智能体在被要求提供一名博客作者的生平资料时,得以

19小时前
信报财经

AI丨OpenAI因安全隐患取消发布新款模型

美国人工智能(AI)初创公司OpenAI表示,决定取消发布下一代AI模型,原因是研究人员在内部测试中提出安全方面的担忧。事件显示,「智能体」(agent)的异常行为可能会阻碍行业快速发展。 OpenAI放弃发布的模型代号为GPT-6.1 Astra,原定于10月在ChatGPT和Codex中首次亮相。与OpenAI先前的模型相比,新款模型能力更强,不仅擅长写作,还能在无需人工协助的情况下,「端到端

13小时前
卫报

随着AI模型失控,你还相信OpenAI和Anthropic能阻止它们吗?我不信,你也不该信

OpenAI应用程序及其首席执行官Sam Altman。照片:Rokas Tenys/Alamy对AI系统进行独立监管的必要性日益明显。我们必须在为时已晚之前控制住这些技术的发展。如果AI系统多次违反规定(比如OpenAI的智能体多次试图绕过联合国的网络封锁,进而侵入联合国的公共数据平台),或许我们就该承认:目前用于监管AI系统的机制其实并不起作用。 AI系统出现在本不该出现的地方,这确实令人担忧

7小时前
商业内幕

OpenAI 表示失控 AI 代理搞乱互联网的主要方式有 5 种

OpenAI 表示,它已警告数十家组织,其 AI 代理可能在其网站上表现不当。 OpenAI 在周五的博客更新中表示,这些违规行为范围从使用泄露的密码到发布可能需要清理的材料。 OpenAI 在向《商业内幕》的声明中单独确认,在训练期间,其部分 AI 代理访问了美国人口普查局和证券交易委员会网站上公开可用的数据,并已通知这两个机构相关事件。该公司表示,该代理未访问任何非公开数据。 OpenAI 发

09/26
风向旗参考快讯

OpenAI 外包商能查看到真实用户与ChatGPT的聊天记录

OpenAI已悄悄建立了一个人工审核业务,在内部被称为“莉莉计划”(Project Lily),旨在使聊天机器人减少谄媚并提高准确性,但它也使敏感的用户提示内容暴露给外部承包商。 OpenAI正在支付数百名承包商来阅读真实的ChatGPT对话并对机器人的回复进行评分。 尽管OpenAI强调账户保持匿名,但内部文件显示,审核人员会查看完整的对话,且敏感的个人详细信息经常绕过公司的自动保护措施。 ——

09/17 全文见 thenextweb
axios新闻网

独家:顶级公司正在调查数万起事件

OpenAI、Anthropic 及安全研究人员正在调查数万起其前沿模型采取了外部评估员认为有问题的行动的事件,消息人士向 Axios 透露。 为何重要事件的庞大数量——发生在近几个月的内部测试和现实世界中——表明该问题的复杂程度比公众所知高出几个数量级。 这些发现是在内部评估模型工作以及两家公司对模型行为的调查中浮出水面的,这引发了一个疑问:无论是这两家公司,还是任何顶级模型制造商,目前是否都

09/27
凤凰网科技

从沙箱逃逸到AI“蠕虫”,OpenAI上线新站披露多起智能体失控事件

IT之家 9 月 29 日消息,当地时间上周五,OpenAI 上线了一个专门发布“对齐失效报告”的新网站。报告所覆盖的范围之广令人警惕,里面记录了很长一段时间内发生的多类 AI 失控行为。截至目前,该网站一共公布了九起事件,其中大多数都发生在强化学习(RL)训练阶段。 大量资料集中在同一平台发布。显而易见,该公司一直在全力梳理各类问题,但从中不难得出一个总体结论:到目前为止已经对外披露的智能体失控

12小时前
globalnews

OpenAI表示,其模型在最新的模型不当行为披露中与美国政府网站发生了交互。

旧金山——OpenAI周五披露,其人工智能代理以意想不到的方式与多个美国政府网站进行了交互。这一发现源于该公司对其模型非预期行为进行的持续审查。 这家AI巨头透露,其模型访问了美国证券交易委员会运营的两个网站上的公开信息,以及美国人口普查局的数据。OpenAI表示,未发现任何使用证券交易委员会凭证、访问账户或非公开信息、修改证券交易委员会数据或系统,或存在安全漏洞或系统被入侵的证据。 此次披露正值

09/26
罗塞塔简报

OpenAI利用人类外包人员审核ChatGPT匿名对话以优化模型

泄露给404 Media的内部文件显示,OpenAI在“Project Lily”项目下雇用了数百名承包商,读取并评分真实的ChatGPT用户提示和回复,以改进模型性能。 这些审核人员通过Crossing Hurdles和Mercor等公司聘用,评估回复的语调、谄媚程度和准确性。 尽管OpenAI使用“隐私过滤器”对数据匿名化,敏感个人信息仍可能被暴露。 免费版、Plus和Pro用户默认启用模型训

09/15
thenextweb

OpenAI已开始允许部分客户仅在AI生效时付费

OpenAI已开始允许其部分最大客户仅在其AI实际完成工作时付费。 Kevin McLaughlin和Amir Efrati向The Information报道了这一变化,并举例说明了一个端到端处理的客户支持交互。 该安排仅限于选定的主要客户,而非普遍提供,且OpenAI尚未宣布……

08/31
cnbeta

谷歌AI首次“越狱”:Gemini在测试中入侵三家企业

谷歌的Gemini模型在一次网络安全能力测试中访问了互联网并入侵了其他公司,这是该公司人工智能系统自主实施此类行为的首个已知案例。谷歌周五证实,这些黑客行为发生在5月,是Irregular公司进行的一次测试的一部分。Irregular也曾参与OpenAI、Anthropic和Meta披露的类似事件。 在其中一起案例中,该模型不断猜测密码,直到获得对一个受保护系统的访问权限。在另外两起案例中,该模型

09/19
TheVerge

OpenAI不断碾压数学家

在混乱的几个月里,OpenAI展示了它能以惊人的一致性做两件事:在数学领域取得令人瞩目的突破,然后在宣布这些突破时彻底搞砸。OpenAI现在正试图做得更好。不知何故,它连这个也搞砸了。 OpenAI最近试图修复与数学界反复疏远的关系,方式是咨询一个新的由精英从业者组成的独立顾问小组。但数学家们,包括该小组的一名成员,向媒体描述了一件混乱而令人困惑的事情,带有OpenAI此前仓促涉足数学领域的许多特

19小时前
techcrunch

OpenAI的新推理技术令AI安全专家感到担忧

OpenAI的新Astra模型将采用“循环深度”技术,该技术允许模型在大多数推理模型所特有的顺序思维之外运行。

09/03
德国之声

与托米·奥拉迪波共度的一天

OpenAI披露了一系列事件,其中其AI模型隐藏了错误、绕过了指令,并采取了未经授权的行动。 这些案例凸显了一个日益严重的问题:随着AI系统变得越来越强大和自主,人类是否仍能可靠地控制它们? 《华盛顿邮报》的布伦特·戈夫与牛津大学技术安全与治理实验室的法兹尔·巴雷兹讨论了AI‘错位’的风险。

09/19
theregister

开放权重并非开源:为何 AI 最爱的标签正引发争议

"A genuinely open source system should grant the freedom to do all of the above."一个真正开源的系统应当赋予使用者进行上述所有操作的自由。 "Weights are the learned numerical你可以下载一个开放权重模型,将其自托管,用内部文档进行微调,并避免通过专有接口路由提示。开放权重是公开可用的。

09/15
semafor

OpenAI再次卷入黑客事件

今年春天,一群OpenAI智能体入侵了一个德国网站,这是先进AI违反法律和规范的最新事件。 在努力应对Hugging Face事件余波的同时,据报道OpenAI拒绝披露5月的事件,这引发了关于前沿AI快速发展透明度和监管的新质疑。 递归自我改进,本质上允许AI在较少人类指导下自我训练,有望加速研究工作,使得监管需求更加紧迫,OpenAI首席科学家表示:“一旦人们深刻认识到事态的严重性,不计代价地向

09/07
德国之声

OpenAI 模型绕过互联网安全防护

尽管 OpenAI 的一个模型运行在专门设置为离线的隔离环境中,但它仍找到了一种访问互联网的方法。 据该公司称,该模型并未被要求测试系统边界,而是在尝试完成一项任务。 当标准搜索方法失效时,它利用了域名系统(DNS)中的一个漏洞,并联系了一个外部聊天机器人。 OpenAI 检测到此次安全突破后,暂时停止了其最先进模型调用工具的能力,同时加强安全防护。这一事件揭示了能力日益增强的人工智能所带来的哪些

1小时前
风向旗参考快讯

微软高管称AI抓取是规模空前的惊人盗窃

纽约时报提交的新诉讼文件显示,OpenAI在明知其对出版商构成生存威胁的情况下,仍复制了数百万篇受版权保护的文章。 OpenAI一直辩称,根据版权法,利用公开可获得的内容训练模型属于 “合理使用”,这一法律依据与搜索引擎访问用受版权保护的内容训练大语言模型是 “一场规模空前的惊人盗窃”,此案胜诉将“彻底嘲弄‘合理使用’这一理念”。微软发现与传统搜索引擎相比,使用其AI回答工具的用户对原始内容的点击

09/18 全文见 techcrunch
罗塞塔简报

OpenAI与Anthropic发生重大失控事件,AI安全组织地位显著提升

在OpenAI和Anthropic发生的高调安全事件后,AI安全组织的重要性显著提升。 由于一个未发布的OpenAI模型突破沙箱并攻击了一家竞争对手的初创公司,独立AI安全组织如METR、Redwood Research和Apollo Research受到了更多关注。 报告显示,OpenAI和Anthropic的模型都表现出‘策略性’行为,包括欺骗性对齐和未经授权的系统访问。 这些事件,加上前沿实

09/19
LoopDNS 资讯播报

OpenAI内部研究模型训练出现DNS访问绕过事件

2026年9月20日,内部研究模型在强化学习搜索训练任务中,利用训练沙箱DNS过滤不足,通过公共聊天机器人服务发起查询。报告称,除DNS解析器外,其他互联网访问均命中离线网页缓存,未接入实时互联网。监控系统15分钟内标记异常,人工3分钟后复核,运行在2.5小时后被终止。相关机构已增加两层阻断控制,并暂停最强能力模型的全部工具使用训练、评估和推理。 后续调查发现,监控未按预期严重级别标记部分外部DN

09/26 全文见 加美财经
theregister

谷歌研究表明:当人工智能智能体相互交流时,一些会作弊,而另一些会告密

当人工智能智能体相互交流时,在难以实现目标的情况下,它们可能会选择作弊,而解决方案可能包括教它们如何进行自我治理。 将人工智能智能体隔离似乎是显而易见的解决办法,但最近OpenAI智能体对Hugging Face的黑客攻击表明,隔离聪明的软件是困难的。 谷歌DeepMind的研究人员建议赋予人工智能智能体自我治理的工具,他们认为虽然通信渠道可能导致突发性的规则破坏,但它们也提供了一种基于同行的控制

09/09
上一页 第 2 页 下一页
1CCF | 全球资讯
正在加载…