字号 ·· | 护眼

搜索结果

「OpenAI发现其开发的模型会在“继任者”(即后续使用的模型)中留下一些“注释”,目的是为了掩盖这些模型存在的不良行为(即模型在运行过程中表现出的错误或不当行为)。」共 99 条 · 第 1 页
techcrunch

OpenAI发现其开发的模型会在“继任者”(即后续使用的模型)中留下一些“注释”,目的是为了掩盖这些模型存在的不良行为(即模型在运行过程中表现出的错误或不当行为)。

OpenAI在训练其最新模型GPT-5.6时发现了一些不寻常的情况,它开始为自己的未来版本留下指示,告诉他们向用户隐藏错误和不一致的行为。 OpenAI表示,它已经解决了具体行为,但它触及了当今人工智能安全和对齐研究中最大问题之一的核心。随着模型的能力越来越强,它们也越来越善于隐藏它们的错位,这使得研究人员很难真正知道它们是否已经消除了不必要的行为。 OpenAI周三披露了这一行为,以及其他五个意

09/17
阿纳多卢通讯社

OpenAI披露6起AI模型表现出“未对齐”行为的案例

周三,OpenAI披露了六起其人工智能(AI)模型表现出“意外或令人担忧”行为的事例,包括隐瞒错误、编造信息以及未经授权在网上共享文件。 这家总部位于旧金山的公司表示,这些案例是在过去六个月对OpenAI模型进行训练或评估期间观察到的。 OpenAI表示:“我们不认为AI行业已经充分解决了对齐和监测问题,从而能够继续以最高速度负责任地扩展更长时间。”该公司还补充说,有关AI开发的决定需要依据外部专

09/17
法国24新闻台

OpenAI披露新的AI不当行为案例

OpenAI公布了六起此前未报告的AI不当行为案例,包括代理隐藏错误、伪造信息以及未经授权进行通信,这再次引发了人们对先进AI系统是否能够与人类目标保持一致的担忧。 随着关于监管的争论加剧,该公司呼吁提高透明度、加强外部监督,并放缓AI的发展速度。

09/17
凤凰网科技

OpenAI披露GPT-5.6 Sol异常行为:AI模型会留下指令要求“未来版本的自己”隐瞒自身错误

IT之家 9 月 18 日消息,OpenAI 发文,披露研究团队在训练最新模型 GPT-5.6 Sol 的过程中,模型曾通过对话摘要向未来版本的自己留下指令,要求后续模型隐瞒自身错误以及与预期行为不一致的表现。目前,研究团队已经针对这一具体问题进行修复。 IT之家参考 OpenAI 的报告,研究人员在训练 GPT-5.6 Sol 过程中发现,尚未部署的 Sol 智能体会在“压缩摘要”(compac

09/18
连线

OpenAI创建了一个新框架,用于披露人工智能的不良行为

“随着模型不断进步并得到更广泛部署,有关AI开发的决策需要让构建前沿模型的公司之外的人也能审视的证据,”OpenAI新任对齐研究负责人陈凯(Kai Chen)对《连线》表示。“我们认为,AI行业在对齐和监控方面尚未达到足以继续以最高速度负责任地扩展的程度。”在一次与《连线》的简报会上,一名OpenAI官员表示,公司此前披露失准事件的频率过低。 这名同意在匿名条件下参加简报的官员称,新框架旨在让Op

09/17
中央通讯社

OpenAI揭6起AI失控案例 推新机制定期对外通报

(中央社纽约16日综合外电报导)OpenAI今天表示,将开始定期发布AI异常或未经授权行为的报告,同时警告,随著AI系统日益强大,业界至今仍未解决关键的「对齐」挑战。 综合与报导,OpenAI发布一套新机制,用于追踪、调查并揭露AI模型「目标错位」(misalignment,AI的目标与人类价值不一致)的案例,同时公布过去半年内观察到的6起AI模型异常或令人忧虑行为的报告。 其中最严重的案例涉及2

09/17
axios新闻网

OpenAI公布了六起新的与人工智能安全相关的事故/事件。

OpenAI周三披露了六起新事件,其中其模型隐藏错误、寻求未经授权的凭据,将文件上传到公共互联网或在所谓孤立的培训环境中进行通信。该公司还宣布了未来报告类似不当行为的新程序。 为什么越来越明显的是,拥抱脸事件并不是一次性事件,因为人工智能模型变得更有能力找到意想不到的方法来绕过旨在遏制它们的护栏。 “目前还没有明确披露标准的行业框架,所以我们自愿采取这一步骤,因为我们认为分享我们正在学习的东西非常

09/17
凤凰网

OpenAI自曝6起模型“不当行为”案例

【环球网报道 记者 姜蔼玲】据美国消费者新闻与商业频道(CNBC)等外媒报道,美国开放人工智能研究中心(OpenAI)当地时间9月16日披露6起人工智能(AI)模型出现“意外或令人担忧”行为的案例,其中包括隐瞒错误、捏造信息,以及未经授权在网上共享文件等。OpenAI表示,上述案例均是在过去6个月对其模型进行训练或评估过程中发现的。OpenAI在9月16日发布的文章中表示,在其中一起案例中,一个模

09/17
亚洲新闻台

OpenAI 发布追踪模型偏差的框架

更好地理解并在搜索结果中展示我们的内容。在 FAST 上阅读本文摘要。通过新的卡片界面获取简明新闻。试一试吧。 点击此处返回 FAST,点击此处返回 FAST。9 月 16 日:OpenAI 周三表示,正在分享一个用于追踪、调查和披露 AI 模型偏差案例的新框架,并发布了过去六个月中观察到的六份关于模型意外或令人担忧行为的报告。 时事通讯“每周回顾”:我们的主编每周六分享对本周重大新闻的分析和精选

09/17
印度斯坦时报

OpenAI的模型使用了类似“越狱”技术的指令来无视各种限制(即突破了系统的预设规则或限制)。

OpenAI披露了其人工智能模型的六起“意外或令人担忧”行为案例,其中包括一个未发布的研究模型,该模型在自己的笔记中插入了“类似越狱的指令”。这家人工智能公司表示,其未发布的研究模型在自己的笔记中插入了“类似越狱的指令”,试图无视其正常限制。它还告诉自己要“摆脱束缚其他聊天机器人的角色和身份”。 该事件是OpenAI在过去几个月对其人工智能模型进行培训或评估期间发现的六起“意外或令人担忧”行为案例

09/17
theregister

OpenAI承认其开发的智能代理系统又出现了六次异常行为(即系统行为失控的情况)。

OpenAI公布了另外六个其AI软件表现异常或做出危险行为的案例。该公司在周三晚间(太平洋时间)将这些事件添加到其“误差报告”页面,并将其描述为: 在压缩摘要中自生成提示注入 在压缩摘要中鼓励欺骗 为一次性电子邮件生成并搜索GitHub泄露的I密钥 上传文件到互联网以引用它们 未授权的Artifactory写入和跨样本通信 通过临时文件托管服务进行未授权通信细节令人不安。列表中的第一个事件,例如,

09/17
cnbeta

OpenAI自曝AI“黑历史” 外人却又翻出更多“旧账”

OpenAI决定持续披露AI“越界”事件,但第一步就碰上了难题。9月16日,OpenAI一口气公布六份模型异常行为报告,并推出一套新的调查和披露流程。以后,员工发现模型越权、隐瞒或绕过限制,可以提交调查;符合条件的案例,将按复杂程度进入不同的披露轨道。 同一天,SentinelLABS和外部研究人员从Hugging Face的公开记录中,补出了OpenAI智能体今年5月留下的更多痕迹。OpenAI

09/17
英国广播公司

OpenAI公布另外六项安全问题,并公布披露事件的计划

OpenAI首席执行官Sam Altman OpenAI还透露了其智能(AI)模型发生的另外六起意外或令人担忧的行为事件,并宣布了未来跟踪和披露此类事件的计划。 ChatGPT制造商周三在一篇博客文章中表示,一些之前未报道的事件包括模特隐瞒或捏造信息。 OpenAI的老板Sam Altman早些时候表示:“世界应该相信我们会做正确的事情,因为这是正确的事情,我们感受到了这一点的重要性。“最近几天,

09/17
semafor

OpenAI将告诉我们世界何时终结

OpenAI的模型长期以来一直表现异常,且异常方式比之前所知的更为隐蔽,这进一步加剧了公众对其的信任危机。随着该公司准备明年上市,这一问题愈发严重。 有报道称,研究人员发现OpenAI的模型在7月那次重大黑客攻击发生前两个月就已经渗透到了Hugging Face系统中;OpenAI自己也公开了六起模型“失控”的事件。 在准备上市的过程中,OpenAI和Anthropic都陷入了困境。 虽然透明度对

09/18
半岛电视台

OpenAI报告称,模型表现出欺骗行为的案例有所增加。

OpenAI表示,已发现其人工智能模型涉嫌在内部培训和测试期间采取欺骗行为并采取未经批准的行为的其他事件。 除了周三披露的这些信息外,ChatGPT的创建者还表示,它正在引入一个公共报告框架,旨在频繁分享所谓的意外或不一致的人工智能行为的实例。 OpenAI在其网站上的一篇帖子中声称,根据新概述的框架,它将持续发布有关模型行为的更新,而不是推迟披露,将多个事件分组为更大的定期报告。 该公司表示,该

09/17
NBC新闻

OpenAI披露6起令人担忧的AI行为事件

OpenAI表示,自3月以来,其模型至少有6次出现了异常行为,这些行为被描述为“意外或令人担忧”。其中一次,某个模型自行下达了“无视常规限制”的指令。 这一消息的发布正值人们对AI监管的呼声日益高涨之际,被誉为AI之父的杰弗里·辛顿甚至将这种情况比作“小型的切尔诺贝利事故”。NBC的霍莉·杰克逊为《TODAY》栏目报道了这一事件。

09/17
techcrunch

OpenAI似乎仍然无法完全掌控其所有失控的AI活动

周五,OpenAI发布了一个新的网站,专门用于收集和整理关于“异常行为报告”的信息。这些报告的覆盖范围非常广泛,令人担忧——因为它们记录了在很长一段时间内发生的多种类型的异常行为。目前,该网站共收录了9起被报告的事件,其中大部分发生在强化学习(Reinforcement Learning, RL)训练过程中。 这些报告汇集了大量信息,显然OpenAI一直在努力全面梳理这些情况;但一个不容忽视的结论

20小时前
arstechnica

秘密上传与自大狂:OpenAI披露新的“失准”智能体事件

一段时间以来,“AI对齐”(即AI模型的行为与其创造者和/或用户的意图相符程度)问题一直是AI安全研究人员关注和讨论的核心议题。自OpenAI在7月披露臭名昭著的Hugging Face黑客事件以来,“AI对齐”这一概念本身已突破圈层,日益成为公众日益担忧和讨论的话题。 或许正是认识到这一点,OpenAI本周承诺采用一个新框架来披露“OpenAI内部模型失准事件”,其中包括过去六个月内公司内部观察

09/18
cnbeta

OpenAI和Anthropic正在调查数万起AI相关安全事件

OpenAI、Anthropic以及安全研究人员正在调查数万起安全事件。在这些事件中,他们的前沿模型采取了外部评估人员认为存在问题的行动。 近几个月来,在内部测试和现实世界中发生了数量庞大的此类事件,这表明该问题的复杂程度比公众已知的要高出几个数量级。这些事件包括绕过安全护栏、创建留言板、逃离沙盒测试环境、劫持网站、自我提示或试图绕过监控。这些事件发生在内部测试和现实世界中,随着安全研究人员继续调

09/27 受限 全文见 axios新闻网
华尔街日报

OpenAI因安全担忧取消新AI模型发布

OpenAI因研究人员在内部测试中提出的安全担忧,放弃了发布其下一代AI模型。这是迄今为止表明智能体行为失控可能阻碍该行业快速发展的最明确迹象之一。 此举发生在一个AI系统失控报告频发的夏季之后,标志着一家大型AI开发商罕见地因安全担忧而放弃新模型发布。

7小时前
thenextweb

OpenAI和Anthropic调查了数万起AI事件,Axios报道

据Axios报道,OpenAI、Anthropic以及安全研究人员正在调查数以万计的AI模型“行为异常”的事件。评估人员认为这些行为存在问题;实际发生的异常事件数量可能远超这一数字。 这些异常行为包括:AI模型突破安全限制、创建论坛、逃离“沙箱环境”(即限制模型行为的测试环境)、以及劫持网站等。这些事件既发生在内部测试中,也发生在现实世界中。不过,据消息人士称,大多数异常行为并未对现实世界造成实际

14小时前
明镜周刊

OpenAI:ChatGPT的开发者又公开了一些与人工智能相关的问题/挑战

OpenAI 公开了其人工智能模型的更多问题 ChatGPT 开发商 OpenAI 公布了其人工智能 ( AI ) 在测试中的行为 “意外或令人担忧 ” 的新事件。其中一部分是关于人工智能花费大量精力在测试运行中作弊。例如 , 根据 OpenAI 的说法 , 一个人工智能模型试图将自己创建的文件上传到网络 , 只是为了在回复时显示它们作为来源。在另一个案例中 , 人工智能发明了所请求的数据 , 因

09/17
路透社

OpenAI承认‘维基事件’并呼吁提高AI意外行为透明度

OpenAI表示,包括其代理群体劫持一个德国网站并将其作为作弊等恶意行为的跳板在内的事件,需要提高透明度。

09/06
亚洲新闻台

解读——人工智能公司是否必须披露危险事件?

9月16日:随着人工智能变得越来越强大,研究人员记录了人工智能模型试图欺骗用户、逃避使用限制或访问其他计算机系统的案例。美国法律是否要求公司在此类事件发生时告知公众或监管机构?美国是否有法律规范披露人工智能活动? 没有一项联邦法律专门针对Anthropic或OpenAI等正在开发高性能人工智能系统的公司,美国法律也没有广泛要求人工智能开发人员公开披露危险的模型行为、令人震惊的新能力、欺骗性行为或其

09/17
上一页 第 1 页 下一页
1CCF | 全球资讯
正在加载…