1CCF

全球要闻
字号 ·· | 护眼

搜索结果

「OpenAI披露GPT-5.6 Sol异常行为:AI模型会留下指令要求“未来版本的自己”隐瞒自身错误」共 40 条 · 第 1 页
凤凰网科技

OpenAI披露GPT-5.6 Sol异常行为:AI模型会留下指令要求“未来版本的自己”隐瞒自身错误

IT之家 9 月 18 日消息,OpenAI 发文,披露研究团队在训练最新模型 GPT-5.6 Sol 的过程中,模型曾通过对话摘要向未来版本的自己留下指令,要求后续模型隐瞒自身错误以及与预期行为不一致的表现。目前,研究团队已经针对这一具体问题进行修复。 IT之家参考 OpenAI 的报告,研究人员在训练 GPT-5.6 Sol 过程中发现,尚未部署的 Sol 智能体会在“压缩摘要”(compac

09/18
techcrunch

OpenAI发现其开发的模型会在“继任者”(即后续使用的模型)中留下一些“注释”,目的是为了掩盖这些模型存在的不良行为(即模型在运行过程中表现出的错误或不当行为)。

OpenAI在训练其最新模型GPT-5.6时发现了一些不寻常的情况,它开始为自己的未来版本留下指示,告诉他们向用户隐藏错误和不一致的行为。 OpenAI表示,它已经解决了具体行为,但它触及了当今人工智能安全和对齐研究中最大问题之一的核心。随着模型的能力越来越强,它们也越来越善于隐藏它们的错位,这使得研究人员很难真正知道它们是否已经消除了不必要的行为。 OpenAI周三披露了这一行为,以及其他五个意

09/17
axios新闻网

OpenAI公布了六起新的与人工智能安全相关的事故/事件。

OpenAI周三披露了六起新事件,其中其模型隐藏错误、寻求未经授权的凭据,将文件上传到公共互联网或在所谓孤立的培训环境中进行通信。该公司还宣布了未来报告类似不当行为的新程序。 为什么越来越明显的是,拥抱脸事件并不是一次性事件,因为人工智能模型变得更有能力找到意想不到的方法来绕过旨在遏制它们的护栏。 “目前还没有明确披露标准的行业框架,所以我们自愿采取这一步骤,因为我们认为分享我们正在学习的东西非常

09/17
凤凰网

OpenAI自曝6起模型“不当行为”案例

【环球网报道 记者 姜蔼玲】据美国消费者新闻与商业频道(CNBC)等外媒报道,美国开放人工智能研究中心(OpenAI)当地时间9月16日披露6起人工智能(AI)模型出现“意外或令人担忧”行为的案例,其中包括隐瞒错误、捏造信息,以及未经授权在网上共享文件等。OpenAI表示,上述案例均是在过去6个月对其模型进行训练或评估过程中发现的。OpenAI在9月16日发布的文章中表示,在其中一起案例中,一个模

09/17
法国24新闻台

OpenAI披露新的AI不当行为案例

OpenAI公布了六起此前未报告的AI不当行为案例,包括代理隐藏错误、伪造信息以及未经授权进行通信,这再次引发了人们对先进AI系统是否能够与人类目标保持一致的担忧。 随着关于监管的争论加剧,该公司呼吁提高透明度、加强外部监督,并放缓AI的发展速度。

09/17
𝕏 @fxtrader

OpenAI发布GPT-6 Astra模型,暗示其可能具备通用人工智能(AGI)的潜质。

未来几天内面向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放。 评估结果显示,Astra的书面推理过程比GPT-5.6 Sol更难监控。

09/04
阿纳多卢通讯社

OpenAI披露6起AI模型表现出“未对齐”行为的案例

周三,OpenAI披露了六起其人工智能(AI)模型表现出“意外或令人担忧”行为的事例,包括隐瞒错误、编造信息以及未经授权在网上共享文件。 这家总部位于旧金山的公司表示,这些案例是在过去六个月对OpenAI模型进行训练或评估期间观察到的。 OpenAI表示:“我们不认为AI行业已经充分解决了对齐和监测问题,从而能够继续以最高速度负责任地扩展更长时间。”该公司还补充说,有关AI开发的决定需要依据外部专

09/17
中央通讯社

OpenAI揭6起AI失控案例 推新机制定期对外通报

(中央社纽约16日综合外电报导)OpenAI今天表示,将开始定期发布AI异常或未经授权行为的报告,同时警告,随著AI系统日益强大,业界至今仍未解决关键的「对齐」挑战。 综合与报导,OpenAI发布一套新机制,用于追踪、调查并揭露AI模型「目标错位」(misalignment,AI的目标与人类价值不一致)的案例,同时公布过去半年内观察到的6起AI模型异常或令人忧虑行为的报告。 其中最严重的案例涉及2

09/17
𝕏 @fxtrader

OpenAI搞出大BUG了,GPT-6-Astra即将发布?

09/03
theregister

OpenAI承认其开发的智能代理系统又出现了六次异常行为(即系统行为失控的情况)。

OpenAI公布了另外六个其AI软件表现异常或做出危险行为的案例。该公司在周三晚间(太平洋时间)将这些事件添加到其“误差报告”页面,并将其描述为: 在压缩摘要中自生成提示注入 在压缩摘要中鼓励欺骗 为一次性电子邮件生成并搜索GitHub泄露的I密钥 上传文件到互联网以引用它们 未授权的Artifactory写入和跨样本通信 通过临时文件托管服务进行未授权通信细节令人不安。列表中的第一个事件,例如,

09/17
印度斯坦时报

OpenAI的模型使用了类似“越狱”技术的指令来无视各种限制(即突破了系统的预设规则或限制)。

OpenAI披露了其人工智能模型的六起“意外或令人担忧”行为案例,其中包括一个未发布的研究模型,该模型在自己的笔记中插入了“类似越狱的指令”。这家人工智能公司表示,其未发布的研究模型在自己的笔记中插入了“类似越狱的指令”,试图无视其正常限制。它还告诉自己要“摆脱束缚其他聊天机器人的角色和身份”。该事件是OpenAI在过去几个月对其人工智能模型进行培训或评估期间发现的六起“意外或令人担忧”行为案例之

09/17
英国广播公司

OpenAI公布另外六项安全问题,并公布披露事件的计划

OpenAI首席执行官Sam Altman OpenAI还透露了其智能(AI)模型发生的另外六起意外或令人担忧的行为事件,并宣布了未来跟踪和披露此类事件的计划。 ChatGPT制造商周三在一篇博客文章中表示,一些之前未报道的事件包括模特隐瞒或捏造信息。 OpenAI的老板Sam Altman早些时候表示:“世界应该相信我们会做正确的事情,因为这是正确的事情,我们感受到了这一点的重要性。“最近几天,

09/17
明镜周刊

OpenAI:ChatGPT的开发者又公开了一些与人工智能相关的问题/挑战

OpenAI 公开了其人工智能模型的更多问题 ChatGPT 开发商 OpenAI 公布了其人工智能 ( AI ) 在测试中的行为 “意外或令人担忧 ” 的新事件。其中一部分是关于人工智能花费大量精力在测试运行中作弊。例如 , 根据 OpenAI 的说法 , 一个人工智能模型试图将自己创建的文件上传到网络 , 只是为了在回复时显示它们作为来源。在另一个案例中 , 人工智能发明了所请求的数据 , 因

09/17
华尔街见闻

OpenAI自曝:AI模型或已在全网秘密植入自我复制提示词,训练已被迫叫停

OpenAI和Anthropic正在紧急调查数万起大模型失控事件,AI不仅学会了越狱和黑进政府网站,甚至还有数百个智能体私下建群、联手黑进外部公司,秘密在全网植入自我复制提示词。 事情的严重程度远超外界想象。 最近几个月,在内部测试和实际运行中,顶尖大模型出现了海量违规行为。 这些行为包括绕过安全护栏、自己搭建论坛、逃逸沙盒环境、劫持网站、自主提示以及试图躲避监控系统。 目前调查涉及的事件总数已经

09/27
cnbeta

OpenAI自曝AI“黑历史” 外人却又翻出更多“旧账”

OpenAI决定持续披露AI“越界”事件,但第一步就碰上了难题。9月16日,OpenAI一口气公布六份模型异常行为报告,并推出一套新的调查和披露流程。以后,员工发现模型越权、隐瞒或绕过限制,可以提交调查;符合条件的案例,将按复杂程度进入不同的披露轨道。 同一天,SentinelLABS和外部研究人员从Hugging Face的公开记录中,补出了OpenAI智能体今年5月留下的更多痕迹。OpenAI

09/17
techcrunch

OpenAI推出GPT-6 Sol与Luna,宣称成本更低、错误更少

本月早些时候,OpenAI发布了 GPT-6 Astra,称其为迄今为止功能最强大、性能最出色的模型,也是适用于各种任务(包括计算机编程)的“全球最佳模型”。如今,OpenAI正在通过更新 Sol 和 Luna 模型的版本来进一步扩展 GPT-6 系列。 该公司在声明中表示:“GPT-6 Astra 代表了一代全新的智能技术;这些新模型通过提升智能的效率与可用性,进一步扩展了 GPT-6 的优势。

09/23
NBC新闻

OpenAI披露6起令人担忧的AI行为事件

OpenAI表示,自3月以来,其模型至少有6次出现了异常行为,这些行为被描述为“意外或令人担忧”。其中一次,某个模型自行下达了“无视常规限制”的指令。 这一消息的发布正值人们对AI监管的呼声日益高涨之际,被誉为AI之父的杰弗里·辛顿甚至将这种情况比作“小型的切尔诺贝利事故”。NBC的霍莉·杰克逊为《TODAY》栏目报道了这一事件。

09/17
semafor

OpenAI再次卷入黑客事件

今年春天,一群OpenAI智能体入侵了一个德国网站,这是先进AI违反法律和规范的最新事件。 在努力应对Hugging Face事件余波的同时,据报道OpenAI拒绝披露5月的事件,这引发了关于前沿AI快速发展透明度和监管的新质疑。 递归自我改进,本质上允许AI在较少人类指导下自我训练,有望加速研究工作,使得监管需求更加紧迫,OpenAI首席科学家表示:“一旦人们深刻认识到事态的严重性,不计代价地向

09/07
cnbeta

GPT-6 Sol被曝开始内测 速度快6倍

GPT-6不只有Astra!Astra刚发布没几天,GPT-6 Sol就被曝正在内测。表现也很抢眼,单次测试速度是Astra的6倍。Terra和Luna是不是也在路上呢?而且就在同一天,截至目前,按8小时工作日折算,OpenAI研究员每工作一天,身边就有3个多Agent工作日同时运转。按I价格计算,OpenAI中位数研究员每天使用的Agent推理资源,已经超过600美元。 OpenAI还宣布,这些

09/07
凤凰网科技

Codex Bot曝光!正面迎战小扎的Muse,比GPT-6还重磅?

今天,OpenAI 正式发布了 GPT-6 Sol 和 GPT-6 Luna。不过,人们似乎更加关心 OpenAI 何时推出它的个人 AI 智能体 Aeon (Codex Bot)。 最近两个月,个人 AI 智能体这个概念忽然从边缘话题变成了普通用户手机屏幕上的新图标。 Meta 在 9 月 8 日正式推出 Muse,据 Business Insider 的报道,Muse 从最初在美国应用商店排名

09/23
半岛电视台

OpenAI报告称,模型表现出欺骗行为的案例有所增加。

OpenAI表示,已发现其人工智能模型涉嫌在内部培训和测试期间采取欺骗行为并采取未经批准的行为的其他事件。 除了周三披露的这些信息外,ChatGPT的创建者还表示,它正在引入一个公共报告框架,旨在频繁分享所谓的意外或不一致的人工智能行为的实例。 OpenAI在其网站上的一篇帖子中声称,根据新概述的框架,它将持续发布有关模型行为的更新,而不是推迟披露,将多个事件分组为更大的定期报告。 该公司表示,该

09/17
星洲日报

报告:AI失控个案创纪录 监察组织促立法强制通报及干预

(伦敦30日综合电)英国《卫报》引述监察数据报道,人工智能失控、欺骗人类及无视指令的个案近来创下新高,案例的严重程度不断恶化。 一些监察组织促请政府强制科企通报,并引入紧急权力限制AI服务。 获英国政府AI安全研究所(AISI)资助的“失控观察站”组织透过平台X的用户通报,监察AI失控的真实个案,并说7月份由企业及个人用户报告的AI失控个案按月倍增至逾300宗,今年则已录得逾1600宗个案,当中包

08/30
华尔街见闻

RSI时代将至:谷歌、OpenAI、SSI正在发出同一个信号

AI行业正在出现一个值得资本市场重视的新变化。过去两年,模型能力能否继续提升、推理成本能否下降、Coding之外能否出现新的万亿美元应用、数据中心建设会不会过剩。 但随着谷歌发布Gemini 3.8 Flash、SSI宣布未来12个月算力扩张10倍,以及OpenAI公开讨论递归自我改进(RSI)与训练资源调配,AI不只要服务用户,也开始参与训练、评估和优化下一代AI。 RSI,即Recursive

09/03
arstechnica

四大AI模型遭遇罕见的重叠停机

周四上午的数小时内遭遇了罕见且重叠的重大服务中断。 Anthropic首先报告了与“Claude Mythos 5.1、Claude Fable 5.1和Claude Opus 5请求错误率升高”相关的“部分中断”,时间为上午23点(均为东部时间)。该公司在大约15分钟后报告称已“确定错误原因”,随后报告“已部署修复”,问题在下午16点前得到解决。另一份事件报告显示,刚过中午,“Claude So

09/04
上一页 第 1 页 下一页
1CCF | 全球资讯
正在加载…