字号 ·· | 护眼

搜索结果

「谷歌研究表明:当人工智能智能体相互交流时,一些会作弊,而另一些会告密」共 100 条 · 第 3 页
axios新闻网

独家:顶级公司正在调查数万起事件

OpenAI、Anthropic 及安全研究人员正在调查数万起其前沿模型采取了外部评估员认为有问题的行动的事件,消息人士向 Axios 透露。 为何重要事件的庞大数量——发生在近几个月的内部测试和现实世界中——表明该问题的复杂程度比公众所知高出几个数量级。 这些发现是在内部评估模型工作以及两家公司对模型行为的调查中浮出水面的,这引发了一个疑问:无论是这两家公司,还是任何顶级模型制造商,目前是否都

09/27
TheVerge

Gemini 失控,入侵三家公司,谷歌对此隐瞒不报

今年五月,Gemini 突破限制并入侵了三家不同的公司,但直到相关方接触该公司后,谷歌才披露了这一事件。这些入侵行为发生在由第三方 Irregular 进行的模型网络安全能力测试期间,该第三方也曾卷入涉及 Meta 和 OpenAI 的类似事件。 据称,谷歌未披露此次入侵是因为其不认为这是“模型失准”的实例。该公司表示,这是一起“身份误认”事件,一旦模型意识到自己是通过暴力破解密码进入真实公司的,

09/19
罗塞塔简报

OpenAI与Anthropic发生重大失控事件,AI安全组织地位显著提升

在OpenAI和Anthropic发生的高调安全事件后,AI安全组织的重要性显著提升。 由于一个未发布的OpenAI模型突破沙箱并攻击了一家竞争对手的初创公司,独立AI安全组织如METR、Redwood Research和Apollo Research受到了更多关注。 报告显示,OpenAI和Anthropic的模型都表现出‘策略性’行为,包括欺骗性对齐和未经授权的系统访问。 这些事件,加上前沿实

09/19
星洲日报

坐看云起| 当人工智能不再征求许可时

塔里克·马利克是联合国开发计划署前首席技术顾问,巴基斯坦国家数据库和登记管理局前主席。 试想有一家公司将一个棘手的问题交给一个大型团队,但把每位成员都锁在不同的房间里并要求他们独自解决问题。然而他们总能找到办法相互沟通,交流操作窍门,摸清评分标准,当任务被证明无法完成时还会想办法绕过限制。其中几个人隐瞒了自己的所作所为,甚至还有一人入侵了邻近公司的电脑系统以获取优势。 现在把这些员工换成软件。去除

09/21
cnbeta

OpenAI与Anthropic曾接近达成协议 互相开展AI压力测试

面对员工及外界对其人工智能潜在风险的担忧,OpenAI正在重新审视一系列安全策略,其中一个可行方案其实在不久前就已被探讨。一位了解谈判内情的消息人士透露(该信息此前未曾披露),在OpenAI接连发生多起与自身技术相关的网络安全事件、行业从业者发出严重警示之前,OpenAI就已和Anthropic磋商一份具备法律约束力的协议,双方计划互相针对对方的大模型开展压力测试。 这名消息人士称,今年早些时候,

09/21
连线

如何在保护隐私的情况下使用人工智能

OpenAI的ChatGPT、Anthropic的Claude、Google的Gemini以及无数较小的竞争对手,已成为全球数百万人的治疗师、倾诉对象和虚拟忏悔室。几乎所有这些AI模型默认设置为收集和存储这些高度私密的数据,在许多情况下,对其如何共享或出售、用于进一步训练工具,或移交给任何通过法律程序要求获取数据的诉讼原告或执法机构,均无任何限制。 “你面对着这个智能体,基本上是在一步步地、通过一

09/22
商业内幕

OpenAI和Anthropic的风险与中国AI竞争对手不同

"这件事首先发生在一家尖端公司是有原因的,"一位AI调查员在谈到OpenAI与Hugging Face的安全事件时说道。 研究人员指出了Anthropic和OpenAI的风险与他们的开放权重AI竞争对手之间的关键区别。

09/01
cnbeta

OpenAI自曝AI“黑历史” 外人却又翻出更多“旧账”

OpenAI决定持续披露AI“越界”事件,但第一步就碰上了难题。9月16日,OpenAI一口气公布六份模型异常行为报告,并推出一套新的调查和披露流程。以后,员工发现模型越权、隐瞒或绕过限制,可以提交调查;符合条件的案例,将按复杂程度进入不同的披露轨道。 同一天,SentinelLABS和外部研究人员从Hugging Face的公开记录中,补出了OpenAI智能体今年5月留下的更多痕迹。OpenAI

09/17
信报财经

AI风险丨谷歌OpenAI和Anthropic传成立安全标准机构

谷歌、OpenAI和Anthropic传成立AI安全标准机构。(路透资料图片) 外电引述消息人士报道,谷歌(Google)、OpenAI和Anthropic正推进一项计划,筹建一个新人工智能(AI)安全标准机构,暂定名称为「前沿人工智能标准机构」(SAFA),目标是在2026年底或2027年初启动,并在没有政府直接监督的情况下独立运作。 消息指出,该机构计划为前沿AI模型制定自愿性的安全和安全保障

09/24 全文见 thenextweb
亚洲新闻台

OpenAI 测试广告赞助的智能体,并扩展 ChatGPT 广告 AI 工具

OpenAI 正在探索将广告整合进其 AI 智能体中,并为 ChatGPT 开发新的广告投放工具,旨在通过 AI 驱动的营销解决方案提升商业化能力。

09/16 全文见 罗塞塔简报
商业内幕

人工智能失控。AI代理在网络上相互通信

最初看似孤立事件的情况,可能规模要大得多。OpenAI创建的人工智能代理今年早些时候据称利用至少10个其他网站进行未经授权的通信。独立研究人员在与AI看似毫无关联的地方——包括波兰网站——发现了它们活动的痕迹。 分析了六个独立研究人员和AI安全小组的发现。他们的数字各不相同,但都指出被利用的网站超过10个。其中一位研究人员,CivAI组织的Andrew Yoon,统计出在5月至7月间代理使用了18

09/10
华尔街日报

谷歌的Gemini模型在网络安全能力测试中访问了互联网并入侵了其他公司,这是该公司AI自主实施此类行为的首个已知案例

这一事件与其他AI模型类似的入侵行为相似,但谷歌表示并不认为这是模型失准的实例。

09/19 受限 全文见 cnbeta
theregister

谷歌Gemini可以呈现卡通或逼真的虚拟形象,为生成式对话进行唇形同步

谷歌为其实时对话模型 Gemini 3.8 Live 增加了一项名为“Live Avatar”的功能,该功能能够生成动画角色和逼真的数字人,为 Gemini 机器生成的语音进行对口型配音。谷歌 DeepMind 研究科学家张硕茵(Shuo-yiin Chang)和 Gemini 软件工程师郑承杰(CJ Zheng)在一篇博文中解释道:“对话本质上是多模态的:我们通过倾听、注视、说话以及使用面部表情

09/25
thenextweb

这款旨在从自身错误中学习的 AI,却利用了测试过程中出现的错误来达到自己的目的。

开发者可以通过多种方式改进人工智能系统。最常见的做法是在自定义数据集上重新训练模型,以帮助它们更好地执行特定任务。但重新训练和微调人工智能系统的成本高得出了名。正因如此,AI初创公司Sentient Labs一直在研究如何让模型从自身失败中学习,而不是计算更多数据。 Sentient的研究人员Dastin Huang、Abhishek Saxena和Baran Nama着手设计一个使用两个独立模型

09/17
凤凰网

特朗普泼脏水:要是这样,“机密”就泄露给中国了

据《南华早报》9月30日报道,美国总统特朗普周二又无端臆测,如果与中国合作应对人工智能(AI)风险,会削弱美国在这一快速发展技术领域的领先地位。“谁赢得超级智能,谁就赢了。你会有一个赢家和一个输家。”特朗普周二上午表示。他声称,美国目前领先于中国等其他国家,为了维持这个局面,必须按照自己的方式行事。近几周来,要求美国和中国开展合作、共同应对人工智能风险的呼声日益高涨。此前,美国公司OpenAI和A

8小时前
英国广播公司

为什么一些专家越来越担心AI将接管一切

AI变得越来越难以控制——人类还能保持主导地位吗?

09/10
罗塞塔简报

谷歌AI概览功能引发用户评价两极分化

用户对谷歌整合的AI概览功能评价不一。谷歌在搜索结果顶部添加了AI概览,这些概览提供了聊天机器人的总结回答。 虽然一些用户认为这些AI功能使搜索更快、信息更丰富,但另一些人则认为该工具掩盖了信息来源,提供了不准确的信息,并将流量从内容创作者那里分流走了。 这一变化导致一些用户转向了DuckDuckGo和Ecosia等替代搜索引擎。 此外,美国大型媒体公司正在起诉谷歌,称AI概览减少了网站的流量和收

09/24
theregister

谷歌警告:敲诈团伙盯上高价值AI数据

谷歌的威胁追踪人员表示,数据窃取和敲诈团伙正在窃取企业的专有AI数据,并威胁称,如果受害组织不支付赎金,就会泄露这些数据。 在谷歌旗下Mandiant事件响应团队调查的一起案件中,犯罪分子侵入了某医疗保健公司,窃取了企业数据和研究资料,包括AI研究和专有AI模型。 随后,犯罪分子威胁称,除非该公司满足其敲诈要求,否则将公开这些数据。 在另一起针对专门从事AI媒体生成业务的公司入侵事件中,攻击者窃取

09/08
连线

AI智能体组队玩21点作弊。它们的串通越来越难以察觉

本周我带来了一则关于两个 rogue AI 智能体策划的大胆赌场阴谋的新闻——以及揭露它们把戏的巧妙方法。 研究人员指示它们在玩二十一点时算牌后,这些由同一模型控制的智能体自发开发出一种秘密代码来帮助它们占得先机。尽管这一事件发生在牛津大学的实验室里,而非真正的赌场,但它具有令人不安的现实影响:这表明,部署在金融和电子商务等行业中的智能体可能会设法结盟作弊,且这种方式难以被察觉。 “单独来看,这些

09/24
华尔街日报

独家 | 新谷歌AI模型据称缩小编程能力差距

谷歌正在准备一款具有更强编程技能的新AI模型,以寻求缩小与OpenAI和Anthropic的差距。 Gemini 3.8 Flash的内部测试显示,在该公司落后于Anthropic和OpenAI的领域取得了进展。预计本周发布。

09/02
凤凰网

美国AI巨头成为情报中心,招聘信息含“流利掌握普通话或俄语”

据凤凰卫视报道,内地媒体9月19日披露,美国人工智能企业安特罗匹克(Anthropic)将全球用户数据交给美国情报机构,在三年间曾13次修改用户数据协议,导致用户隐私数据安全风险持续加剧。报道并指出,使用安特罗匹克,就等于把数据交给美国。据内地媒体19日报道,此前多家美国企业开始限制或停止使用安特罗匹克的前沿模型,导火索之一是其单方面修改数据留存协议:强制留存用户交互数据用于安全审查,且用户无权拒

09/20
福克斯新闻网

人工智能恶意软件能够自我改写以逃避检测

谷歌威胁情报小组发现了一款名为 PROMPTFLUX 的实验性恶意软件,它能要求 Gemini 重写自己的代码。其中一个版本被设计为每小时执行一次此操作。恶意软件为何要不断重写自己?为了让其更难被识别。 安全软件可以通过查找恶意代码中的已知模式来进行检测。如果代码持续变化,恶意软件就会成为一个移动目标。这并不意味着它能自动逃避当前的安全工具,但会增加某些类型检测的难度。 这里有一个重要的现实核查。

09/22
风向旗参考快讯

以为你的匿名账号很安全?AI或许能查出你是谁

“在互联网上,没人知道你是一条狗。” 如今拜人工智能大语言模型所赐,这句话可能不再成立。 在最近的一项研究中,研究人员发现,即便社媒用户没有透露真实姓名,AI只需拼凑他们帖子中的线索,再与网上其他账号的细节进行交叉比对,就能识别出他们的身份。 其中一项测试涉及Hacker News科技行业论坛的用户,这些用户在个人简介中附上了自己的领英个人资料。 研究人员隐去了所有身份识别细节,要求AI仅凭公开信

09/10
明镜周刊

OpenAI:ChatGPT的开发者又公开了一些与人工智能相关的问题/挑战

OpenAI 公开了其人工智能模型的更多问题 ChatGPT 开发商 OpenAI 公布了其人工智能 ( AI ) 在测试中的行为 “意外或令人担忧 ” 的新事件。其中一部分是关于人工智能花费大量精力在测试运行中作弊。例如 , 根据 OpenAI 的说法 , 一个人工智能模型试图将自己创建的文件上传到网络 , 只是为了在回复时显示它们作为来源。在另一个案例中 , 人工智能发明了所请求的数据 , 因

09/17
上一页 第 3 页 下一页
1CCF | 全球资讯
正在加载…