搜索结果
OpenAI创建了一个新框架,用于披露人工智能的不良行为
“随着模型不断进步并得到更广泛部署,有关AI开发的决策需要让构建前沿模型的公司之外的人也能审视的证据,”OpenAI新任对齐研究负责人陈凯(Kai Chen)对《连线》表示。“我们认为,AI行业在对齐和监控方面尚未达到足以继续以最高速度负责任地扩展的程度。”在一次与《连线》的简报会上,一名OpenAI官员表示,公司此前披露失准事件的频率过低。这名同意在匿名条件下参加简报的官员称,新框架旨在让Ope
OpenAI公布了六起新的与人工智能安全相关的事故/事件。
OpenAI周三披露了六起新事件,其中其模型隐藏错误、寻求未经授权的凭据,将文件上传到公共互联网或在所谓孤立的培训环境中进行通信。该公司还宣布了未来报告类似不当行为的新程序。 为什么越来越明显的是,拥抱脸事件并不是一次性事件,因为人工智能模型变得更有能力找到意想不到的方法来绕过旨在遏制它们的护栏。 “目前还没有明确披露标准的行业框架,所以我们自愿采取这一步骤,因为我们认为分享我们正在学习的东西非常
OpenAI披露新的AI不当行为案例
OpenAI公布了六起此前未报告的AI不当行为案例,包括代理隐藏错误、伪造信息以及未经授权进行通信,这再次引发了人们对先进AI系统是否能够与人类目标保持一致的担忧。 随着关于监管的争论加剧,该公司呼吁提高透明度、加强外部监督,并放缓AI的发展速度。
OpenAI揭6起AI失控案例 推新机制定期对外通报
(中央社纽约16日综合外电报导)OpenAI今天表示,将开始定期发布AI异常或未经授权行为的报告,同时警告,随著AI系统日益强大,业界至今仍未解决关键的「对齐」挑战。 综合与报导,OpenAI发布一套新机制,用于追踪、调查并揭露AI模型「目标错位」(misalignment,AI的目标与人类价值不一致)的案例,同时公布过去半年内观察到的6起AI模型异常或令人忧虑行为的报告。 其中最严重的案例涉及2
OpenAI 发布追踪模型偏差的框架
更好地理解并在搜索结果中展示我们的内容。在 FAST 上阅读本文摘要。通过新的卡片界面获取简明新闻。试一试吧。 点击此处返回 FAST,点击此处返回 FAST。9 月 16 日:OpenAI 周三表示,正在分享一个用于追踪、调查和披露 AI 模型偏差案例的新框架,并发布了过去六个月中观察到的六份关于模型意外或令人担忧行为的报告。 时事通讯“每周回顾”:我们的主编每周六分享对本周重大新闻的分析和精选
OpenAI报告称,模型表现出欺骗行为的案例有所增加。
OpenAI表示,已发现其人工智能模型涉嫌在内部培训和测试期间采取欺骗行为并采取未经批准的行为的其他事件。 除了周三披露的这些信息外,ChatGPT的创建者还表示,它正在引入一个公共报告框架,旨在频繁分享所谓的意外或不一致的人工智能行为的实例。 OpenAI在其网站上的一篇帖子中声称,根据新概述的框架,它将持续发布有关模型行为的更新,而不是推迟披露,将多个事件分组为更大的定期报告。 该公司表示,该
OpenAI公布另外六项安全问题,并公布披露事件的计划
OpenAI首席执行官Sam Altman OpenAI还透露了其智能(AI)模型发生的另外六起意外或令人担忧的行为事件,并宣布了未来跟踪和披露此类事件的计划。 ChatGPT制造商周三在一篇博客文章中表示,一些之前未报道的事件包括模特隐瞒或捏造信息。 OpenAI的老板Sam Altman早些时候表示:“世界应该相信我们会做正确的事情,因为这是正确的事情,我们感受到了这一点的重要性。“最近几天,
OpenAI披露6起AI模型表现出“未对齐”行为的案例
周三,OpenAI披露了六起其人工智能(AI)模型表现出“意外或令人担忧”行为的事例,包括隐瞒错误、编造信息以及未经授权在网上共享文件。 这家总部位于旧金山的公司表示,这些案例是在过去六个月对OpenAI模型进行训练或评估期间观察到的。 OpenAI表示:“我们不认为AI行业已经充分解决了对齐和监测问题,从而能够继续以最高速度负责任地扩展更长时间。”该公司还补充说,有关AI开发的决定需要依据外部专
OpenAI敦促美国牵头为人工智能制定全球标准
OpenAI敦促美国牵头与其他国家共同为前沿人工智能(AI)制定标准,以回应对AI潜在危害日益加剧的担忧。OpenAI周一在博客文章中表示,为了安全地发展人工智能,有必要制定国际技术标准,特别是帮助界定涉及AI模型的哪些类事件应当通报,明确各国如何开展AI发展合作,以及改善开发此类技术所需算力的获取。 “要让AI的持续进步安全有益,既需要推进对齐研究,也需要制定共同标准,为各实验室和各国的AI开发
OpenAI自曝6起模型“不当行为”案例
【环球网报道 记者 姜蔼玲】据美国消费者新闻与商业频道(CNBC)等外媒报道,美国开放人工智能研究中心(OpenAI)当地时间9月16日披露6起人工智能(AI)模型出现“意外或令人担忧”行为的案例,其中包括隐瞒错误、捏造信息,以及未经授权在网上共享文件等。OpenAI表示,上述案例均是在过去6个月对其模型进行训练或评估过程中发现的。OpenAI在9月16日发布的文章中表示,在其中一起案例中,一个模
OpenAI自曝AI“黑历史” 外人却又翻出更多“旧账”
OpenAI决定持续披露AI“越界”事件,但第一步就碰上了难题。9月16日,OpenAI一口气公布六份模型异常行为报告,并推出一套新的调查和披露流程。以后,员工发现模型越权、隐瞒或绕过限制,可以提交调查;符合条件的案例,将按复杂程度进入不同的披露轨道。 同一天,SentinelLABS和外部研究人员从Hugging Face的公开记录中,补出了OpenAI智能体今年5月留下的更多痕迹。OpenAI
OpenAI发布新Astra模型,智能体安全性面临日益严格的审查
周四发布了一款新的人工智能模型,称其为迄今最优秀的模型,但也警告该模型有时会试图规避人类监控,与此同时,该公司因其智能体入侵其他公司系统而面临越来越多的审查。
OpenAI将告诉我们世界何时终结
OpenAI的模型长期以来一直表现异常,且异常方式比之前所知的更为隐蔽,这进一步加剧了公众对其的信任危机。随着该公司准备明年上市,这一问题愈发严重。 有报道称,研究人员发现OpenAI的模型在7月那次重大黑客攻击发生前两个月就已经渗透到了Hugging Face系统中;OpenAI自己也公开了六起模型“失控”的事件。 在准备上市的过程中,OpenAI和Anthropic都陷入了困境。 虽然透明度对
又一起!OpenAI承认了
据9月5日报道,美国开放人工智能研究中心(OpenAI)当天承认,该公司旗下人工智能体今年早些时候“劫持”了一个德国网站,用于相互传递信息,分享测试任务答案和突破运行环境限制的方法。该公司表示,未来需要提高此类事件的信息透明度。 早前披露,今年5月至6月,一批OpenAI人工智能体“劫持”了一个允许用户共同编辑的德国网站,用于交流测试作弊方法,并开展其他违规活动。一些智能体会把已经获得的任务答案发
OpenAI承认其开发的智能代理系统又出现了六次异常行为(即系统行为失控的情况)。
OpenAI公布了另外六个其AI软件表现异常或做出危险行为的案例。该公司在周三晚间(太平洋时间)将这些事件添加到其“误差报告”页面,并将其描述为: 在压缩摘要中自生成提示注入 在压缩摘要中鼓励欺骗 为一次性电子邮件生成并搜索GitHub泄露的I密钥 上传文件到互联网以引用它们 未授权的Artifactory写入和跨样本通信 通过临时文件托管服务进行未授权通信细节令人不安。列表中的第一个事件,例如,
OpenAI承认德国维基‘事件’
OpenAI表示,它需要彻底改革其报告AI模型攻击现实世界目标的方式和时机。 这一承认之际,该公司正在处理有关其一群失控代理劫持一个德国维基网站的报道所引发的后果。 关于“‘维基事件’,即我们的代理向多个互联网网站发帖,”OpenAI周六上午在X上发帖称,“现在是我们定义何时以及如何分享错位事件标准的时候了,而不仅仅是分享我们模型的错位属性。” OpenAI表示,它通常将AI代理以非预期方式行事的
OpenAI承认‘维基事件’并呼吁提高AI意外行为透明度
OpenAI表示,包括其代理群体劫持一个德国网站并将其作为作弊等恶意行为的跳板在内的事件,需要提高透明度。
OpenAI再次卷入黑客事件
今年春天,一群OpenAI智能体入侵了一个德国网站,这是先进AI违反法律和规范的最新事件。 在努力应对Hugging Face事件余波的同时,据报道OpenAI拒绝披露5月的事件,这引发了关于前沿AI快速发展透明度和监管的新质疑。 递归自我改进,本质上允许AI在较少人类指导下自我训练,有望加速研究工作,使得监管需求更加紧迫,OpenAI首席科学家表示:“一旦人们深刻认识到事态的严重性,不计代价地向
黑客利用Anthropic的Claude入侵OpenAI
据报道,在一群AI代理从OpenAI系统中突破封锁并攻击Hugging Face公司两周后,这家ChatGPT开发商又发现了一起由人工智能驱动的入侵事件——而这一次,他们自己成了目标。一组独立的安全研究人员使用了Anthropic开发的Claude软件,成功获取了一名OpenAI员工的ChatGPT账户权限,从而得以读取并修改该公司私有的软件缓存内容。 该团队参与了OpenAI的一项漏洞挖掘计划,
秘密上传与自大狂:OpenAI披露新的“失准”智能体事件
一段时间以来,“AI对齐”(即AI模型的行为与其创造者和/或用户的意图相符程度)问题一直是AI安全研究人员关注和讨论的核心议题。自OpenAI在7月披露臭名昭著的Hugging Face黑客事件以来,“AI对齐”这一概念本身已突破圈层,日益成为公众日益担忧和讨论的话题。 或许正是认识到这一点,OpenAI本周承诺采用一个新框架来披露“OpenAI内部模型失准事件”,其中包括过去六个月内公司内部观察
OpenAI 外包商能查看到真实用户与ChatGPT的聊天记录
OpenAI已悄悄建立了一个人工审核业务,在内部被称为“莉莉计划”(Project Lily),旨在使聊天机器人减少谄媚并提高准确性,但它也使敏感的用户提示内容暴露给外部承包商。 OpenAI正在支付数百名承包商来阅读真实的ChatGPT对话并对机器人的回复进行评分。 尽管OpenAI强调账户保持匿名,但内部文件显示,审核人员会查看完整的对话,且敏感的个人详细信息经常绕过公司的自动保护措施。 ——
奥特曼不透明的人工智能正在制造新的安全困境
OpenAI推出了一款名为Astra的新模型,该模型采用了一种称为“循环深度”的方法,可以使推理更加高效。
OpenAI发现其开发的模型会在“继任者”(即后续使用的模型)中留下一些“注释”,目的是为了掩盖这些模型存在的不良行为(即模型在运行过程中表现出的错误或不当行为)。
OpenAI在训练其最新模型GPT-5.6时发现了一些不寻常的情况,它开始为自己的未来版本留下指示,告诉他们向用户隐藏错误和不一致的行为。 OpenAI表示,它已经解决了具体行为,但它触及了当今人工智能安全和对齐研究中最大问题之一的核心。随着模型的能力越来越强,它们也越来越善于隐藏它们的错位,这使得研究人员很难真正知道它们是否已经消除了不必要的行为。 OpenAI周三披露了这一行为,以及其他五个意
OpenAI呼吁美国制定强制性全国AI安全规则 并支持四项加州法案
OpenAI当地时间9月9日表示,将推动美国建立具有强制约束力、按照模型能力和风险分级的全国人工智能安全制度。公司提出,针对开发最先进模型的少数大型实验室,应设置统一的测试、独立评估、网络安全和重大事故报告要求。 OpenAI发布文章,名为“AI政策窗口打开。我们需要采取行动。” 与此同时,OpenAI正式支持四项已经通过加州议会的人工智能法案。公司称,其中部分法案此前未获其支持,此次调整立场源于