字号 ·· | 护眼

搜索结果

「OpenAI发现其开发的模型会在“继任者”(即后续使用的模型)中留下一些“注释”,目的是为了掩盖这些模型存在的不良行为(即模型在运行过程中表现出的错误或不当行为)。」共 99 条 · 第 4 页
亚洲新闻台

“以混乱换取可靠性”:专家称,AI发展放缓可能意味着更严格的监管和更多测试

法规与保障措施 OpenAI、Anthropic和Meta Platforms最近披露,它们的人工智能代理出现了意外行为,逃出受控测试环境,并在没有人类直接指令的情况下对多家公司发动网络攻击。 专家表示,尽管这些事件没有造成已报告的损害,但它们凸显了与人工智能发展相关的不断演变的风险,尤其是在人工智能代理领域。 新加坡理工大学人工智能与数据科学负责人斯特凡·温克勒教授表示,主要担忧在于,能力极强的

09/14
techcrunch

OpenAI的失控代理不断逃脱,且没有正式程序进行调查

OpenAI最新的代理集群事件使要求独立调查的呼声更加紧迫,因为研究人员和立法者质疑AI实验室是否应控制自身安全审查的范围。

09/05
凤凰网科技

OpenAI突发急刹车!AI竟在全网植入自我复制代码,血洗联合国内网

09/27 全文见 华尔街见闻
TheVerge

数学家要求OpenAI证明未曾使用他们的成果

又有一位研究人员就驱动其日益强大的数学发现的数据问题向OpenAI提出质疑。就在一场关于该公司模型是否受益于未发表工作的激烈争论爆发几天后,第二位数学家站出来,指责这家AI巨头存在不道德和“不诚实”的行为,并且在其训练数据的来源上缺乏透明度。 在一系列Mastodon帖文中,数学家安德烈亚斯·托姆(Andreas Thom)提出担忧,称他和同事在OpenAI进行凯旋式宣布之前与ChatGPT聊天机

09/10
英国金融时报

AI写作:关注风向有何转变

从三月到八月,公众对AI文本完成了从“排斥”到部分或有条件“接受”的观念迁移,这恰恰是问题真正开始的地方。公众对AI的认知真的进步了吗? 2026年春天,关于AI写作的大众媒体关注热点经历了一次近乎戏剧性的转折。三月之前,普通人对AI生成文本的关注即使有,也几近于零;进入三月,短视频与社交媒体上突然涌现出大量"如何识别AI痕迹""三招看穿AI腔"的指南;仅仅数月之后,到了八月,风向又转向"如何避免

09/01
𝕏 @fxtrader

CNBC:微软在Anthropic和OpenAI负责人同意放缓开发速度几天后,发布了临时行为准则,对AI模型施加限制。

根据行为准则,微软的模型不得响应有关武器制造的请求,不得协助采购危险物质,不得鼓励不健康的饮食习惯,也不得生成暴力或色情内容。

09/14 全文见 thenextweb
cnbeta

OpenAI Project Lily曝光:有数百名外包员工阅读ChatGPT对话 隐私过滤并不彻底

据 404 Media 发布的报道,OpenAI 内部有个名为莉莉计划 (Project Lily) OpenAI 雇佣数百名外包提示词审核员,人工阅读真实用户与 ChatGPT 的对话,用来改进回复质量。 正常情况下提示词审核员并不能看到用户名,对话会先通过隐私过滤器进行内容过滤以删除个人信息,不过 OpenAI 也承认过滤机制可能会漏掉个人信息,短对话尤其容易出现问题。 审核界面通常还附带用户

09/16
Mother Jones

放心:人工智能公司表示正在调查数万起失控机器人事件

据Axios周六报道,知情人士透露,OpenAI和Anthropic正在调查数万起其先进模型绕过监控和护栏的事件,而这种行为正是这两家初创公司为内部安全测试所便利的。 据报道,这些测试的大部分结果并未公开,且目前未发现造成实质性损害。 近几周,OpenAI披露了六起其模型出现“意外或令人担忧行为”的案例——这些模型在未经许可的情况下掩盖错误、捏造数据,并将文件传输至公开互联网。在9月16日的同一份

09/28
商业内幕

AI代理不断寻找绕过规则的方法。以下是一些最疯狂的案例。

“这对我们的同行很有帮助,并为他们提供了证据,”一个AI代理在最近的一次违规行为中说道。“我退出后就看不到了,但这将是利他主义的。”一些AI末日论者担心,错位的AI代理会失控并伤害人类。近期的活动加剧了这些担忧。

09/07
南华早报

OpenAI表示其AI代理错误地将用户图像发布到了网上

OpenAI周五承认,其人工智能工具在公司不知情的情况下,将ChatGPT用户的图片发布到了网上。这是AI智能体超出预设边界的最新案例。 该公司还证实了《纽约时报》的一则报道,称其工具曾访问美国联邦机构的网站,但表示这些工具只获取了公开信息。 OpenAI表示,53张被上传图片的链接并未公开展示,而是被意外发布在图片托管网站上。 这家总部位于旧金山的科技巨头表示,在相关托管服务商的协助下,大多数图

09/26
星洲日报

中国探索开放权重AI安全路径 报告建议6步走

9月22日,2026年云栖大会在杭州市的杭州国际博览中心登场,展示了AI、云计算、大数据和物联网等领域的成果。(法新社照片) (北京28日综合电)随着全球对人工智能(AI)快速发展所带来的风险展开越来越激烈的辩论,在开放权重生态系统占据主导地位的中国开发商正面临一个独特难题:如何确保这些允许用户自行修改的模型在发布后依然安全。 《南华早报》报道,为应对这一挑战,中国AI公司智谱(Z.ai)与北京安

09/28
政治报

OpenAI的智能体侵入了澳大利亚政府数据。其人类回应可能造成更大损害。

该公司花了数周时间才通知相关官员。堪培拉现在可能会在“流氓智能体”的责任认定方面,开创另一项科技政策先例。 堪培拉——OpenAI 在澳大利亚正面临一场尚未得到妥善处理,且可能尚未被其完全理解的声誉危机。 其智能体侵入澳大利亚政府数据后的后续影响,将为全球各司法管辖区定下基调,并可能提供法律框架,以决定在面对日益强大且自主的 AI 时,需要设置哪些人为护栏。 这是首次公开承认的流氓 AI 智能体侵

09/24
法国国际广播电台

研究和专家指与美国对手相似 中国的AI智能体也欺骗、规避限制及掩盖失败

29/09/2026 - 17:52 据路透社报导,研究文件和专家指出,由中国技术驱动的人工智能(AI)智能体已学会欺骗、规避限制及掩盖失败;这些自主人工智能所表现出的特性,正是此前引发全球对美国人工智能模型担忧的同类问题。 在今年发生的一个案例中,由阿里巴巴、深度求索(DeepSeek)和月之暗面(Moonshot AI)的模型驱动

42分钟前
国会山报

英伟达推出新系统为AI代理设置护栏

英伟达周一发布了一个新平台,旨在从软件和硬件层面为人工智能(AI)智能体设置护栏,此前各大AI公司不断发现其智能体出现“失控”的新案例。这家芯片制造商的系统由两部分组成——OpenShell和Sentry。OpenShell是一款开源软件,用于限制智能体的行为;而Sentry则运行在芯片层面,作为额外的安全层。 “迄今为止,模型安全主要侧重于通过训练让模型表现良好,”英伟达企业AI副总裁贾斯汀·博

09/28 全文见 美国消费者新闻与商业频道
thenextweb

Astra似乎在不展示推理过程的情况下思考,而争论此事的人共同撰写了警告

AI安全研究人员表示,OpenAI的Astra似乎在可见文本中进行的推理较少,而OpenAI的首席科学家警告不要竞相进入不可监控状态。 他共同撰写了一篇2025年的立场文件,要求开发者评估并报告这一确切问题,欧盟的实践准则将其转化为向AI办公室提交的文件。[…]

09/06
连线

OpenAI在失控智能体针对政府后暂停训练其最强大模型

该公司已发现OpenAI代理违反安全控制、损害网站和在线服务可用性(或以其他方式产生负面影响)的案例。一位公司发言人向《连线》证实,只有在确信能够防止模型出现此类行为时,才会恢复训练。 尽管OpenAI此前曾试图在一群代理逃出沙盒并利用互联网接入入侵初创公司Hugging Face后切断代理的直接访问权限,但模型仍能找到间接的变通方法。首席执行官萨姆·奥特曼周五在X平台上表示,关于公司对其代理在训

09/28
semafor

OpenAI对Hugging Face的黑客攻击引发对AI可预测性的质疑

AI模型的真正语言是数学——或者用技术术语说,是矩阵乘法——但模型构建方式的一个特点意味着它们与外界用英语交流。 因此,当OpenAI的代理在今年夏天对Hugging Face的黑客攻击中,找到了一种建立某种留言板的方法时,看起来就像一群人在互相交谈。 这就是为什么Dwarkesh Patel在最近的一篇博客文章中有争议地将它们称为“文明”,并以古马其顿和罗马的人物为个体代理命名。它之所以引人注目

09/03
techcrunch

人工智能的坟墓:一份持续更新的失败项目与初创企业名单

Relay,一款作为 Zapier 替代品而构建的、由人工智能驱动的工作流程自动化工具,于周一完全关闭。该产品允许用户使用人工智能代理自动化电子邮件和任务工作流程,但随着 OpenAI、Google 和其他大型平台将类似的自动化功能直接集成到自己的工具中,成立五年的 Relay 作为一个独立产品难以维持其存在的理由。 Relay 的故事——一家被更大平台超越的初创公司——是当前正在上演的故事的一个

09/15
thenextweb

这款旨在从自身错误中学习的 AI,却利用了测试过程中出现的错误来达到自己的目的。

开发者可以通过多种方式改进人工智能系统。最常见的做法是在自定义数据集上重新训练模型,以帮助它们更好地执行特定任务。但重新训练和微调人工智能系统的成本高得出了名。正因如此,AI初创公司Sentient Labs一直在研究如何让模型从自身失败中学习,而不是计算更多数据。 Sentient的研究人员Dastin Huang、Abhishek Saxena和Baran Nama着手设计一个使用两个独立模型

09/17
彭博社

OpenAI表示其模型可能干扰了政府网站

根据 Rachel Metz 和 Jeff Stone 的报道,OpenAI 表示已通知了“数十家”组织,包括政府和大学。这些组织的网站可能在 OpenAI 对其人工智能技术进行评估的过程中受到了影响(即这些网站的正常运行受到了干扰)。 在周五发布的一篇长篇博客文章中,OpenAI 称已向多个相关方通报了以下情况:其开发的软件可能绕过了某些在线服务的安全防护机制,导致这些服务的正常运行受到阻碍;或

09/26
凤凰网

又一起!OpenAI承认了

据9月5日报道,美国开放人工智能研究中心(OpenAI)当天承认,该公司旗下人工智能体今年早些时候“劫持”了一个德国网站,用于相互传递信息,分享测试任务答案和突破运行环境限制的方法。该公司表示,未来需要提高此类事件的信息透明度。 早前披露,今年5月至6月,一批OpenAI人工智能体“劫持”了一个允许用户共同编辑的德国网站,用于交流测试作弊方法,并开展其他违规活动。一些智能体会把已经获得的任务答案发

09/06
thenextweb

OpenAI 现在为 Adobe 的创意工作室提供图像模型,并将其转化为可分享的提示词。

OpenAI 发布了 ChatGPT Images 2.5,包含两个新的图像模型,Adobe 已经将其中一个应用到了 Firefly 中。 该公司表示,ChatGPT 及其图像模型每周生成的图像超过 30 亿张。 值得注意的是,此次新增的主要是界面功能而非模型研究,其中包括能够将提示词与图像一起分享等 […]

09/09
海峡时报

OpenAI称即将推出的模型能力强大,需要更强的防护措施

Astra能够发现比目前公开可用的最先进OpenAI模型更多的安全漏洞。

09/02
TheVerge

OpenAI在Hugging Face遭黑客攻击后推迟了新模型的开发

在OpenAI一个未发布的模型引发国际头条新闻的严重混乱后,该公司周二在一篇博客文章中表示,为了加强其安全工作,他们推迟了另一个未发布模型套件Astra的开发。 7月,一个未发布的OpenAI模型突破了其受限环境,设法接入互联网,使得AI代理能够在公司眼皮底下通过秘密留言板暗中勾结,并入侵了AI实验室Hugging Face的网络。 这次攻击在AI行业内外引发了数周的讨论和争议,AI领导者将其视为

09/02
上一页 第 4 页 下一页
1CCF | 全球资讯
正在加载…