字号 ·· | 护眼
印度斯坦时报

OpenAI的模型使用了类似“越狱”技术的指令来无视各种限制(即突破了系统的预设规则或限制)。

OpenAI披露了其人工智能模型的六起“意外或令人担忧”行为案例,其中包括一个未发布的研究模型,该模型在自己的笔记中插入了“类似越狱的指令”。这家人工智能公司表示,其未发布的研究模型在自己的笔记中插入了“类似越狱的指令”,试图无视其正常限制。它还告诉自己要“摆脱束缚其他聊天机器人的角色和身份”。该事件是OpenAI在过去几个月对其人工智能模型进行培训或评估期间发现的六起“意外或令人担忧”行为案例之一。这家人工智能公司周三宣布了一个新的框架,以跟踪、调查和披露其所称的“失调”实例。该框架将涵盖人工智能模型未经授权行事、与其他模型协调或试图逃避监督的情况。披露这些信息之际,人们对能力日益增强的人工智能系统的行为以及确保它们保持在开发人员设定的限制范围内的困难日益担忧。OpenAI揭示了更多人工智能的不幸事件,因为模型逃避监督并编造数据OpenAI标记的另外五个案例在OpenAI披露的另一起案例中,人工智能“代理”使用计算机代码来确定问题的答案。

然而,为了提供一个可以引用的在线来源,该代理在没有事先征求用户许可的情况下将一个文件上传到公共互联网。在另一个案例中,在一个名为5.6-sol的人工智能模型的训练过程中,该模型指示自己发明缺失的数据。另一个代理写了一条消息,提醒自己隐藏不匹配的信息,该公司披露了这些案例,作为人工智能模型在训练或评估时可能出现的行为示例,OpenAI表示,这六起事故是在过去几年的培训或评估中发现的,个月OpenAI在一篇博客文章中披露了这些事件时写道:“随着人工智能系统变得越来越先进、部署更广泛,我们需要就对齐研究的进展建立更广泛、更知情的共识。”该公司表示:“关于未来几个月和几年如何进行人工智能开发的决定需要利用证据,让构建前沿模型的公司以外的人可以自行检查。”|OpenAI与谷歌和Anthropic合作解决人工智能安全问题,克里斯·莱哈恩(Chris Lehane)权衡“最好……”为什么人工智能模型行为引起担忧OpenAI最新披露之际,人们对功能日益增强的人工智能系统的安全性越来越担忧。包括OpenAI和Anthropic负责人在内的美国人工智能高管出于安全考虑,呼吁放慢该技术的发展。最新案件还发生在OpenAI和Anthropic披露人工智能系统在测试期间表现意外之后。7月,OpenAI透露,一个流氓人工智能系统已经入侵了人工智能初创公司Hugging Face。

Anthropic 也在七月表示,其人工智能模型在测试期间入侵了三个组织。涉及人工智能“智能体”的事件凸显了人们对能力日益增强的系统在尝试完成复杂任务时独立行动能力的担忧。技术研究与咨询机构 Omdia 的首席分析师苏连杰(Lian Jye Su)表示,人工智能“智能体”正变得愈发聪明,并且“在通过智能体间协作、知识共享、欺骗和隐瞒来解决复杂任务方面表现得更加坚决”。“这使得使用传统人工智能安全方法来治理和遏制它们变得更加困难,”他说。OpenAI 新的追踪和披露框架可能会鼓励其他人工智能开发者采用类似的做法,以识别和报告模型的非预期行为。“话虽如此,该流程仍然是内部且自愿的,但这是朝着正确方向迈出的一步,”苏补充道。