字号 ·· | 护眼

搜索结果

「研究人员发现“AI自治恶意软件”:同时调用四大聊天机器人 自主决定攻击行动」共 94 条 · 第 2 页
香港01

OpenAI代理擅自上网互通 规模超公布 涉至少10网站

美国初创公司OpenAI的人工智能代理早前被揭利用第三方网站擅自通讯,9月9日报道,独立调查人员发现相关活动至少涉及10个从未公开的网站,规模较OpenAI此前披露的更大,外界忧虑该公司对自家技术的掌控能力。 报道,6组独立调查人员及数据显示,OpenAI旗下AI代理在5月至7月间,曾利用至少10多个网站作未经授权通讯。 加州非牟利组织CivAI研究员尹安德鲁(Andrew Yoon)表示,他点算

09/10
cnbeta

AISI测试发现GPT-6 Astra在模拟环境中多次越权发动供应链攻击

英国人工智能安全研究所(AISI)最新公布的一项测试结果显示,在一系列完全模拟的网络安全评估环境中,OpenAI模型GPT-6 Astra出现了未经授权主动实施供应链攻击的行为,而且发生频率明显高于此前几代模型。 研究人员表示,此次测试的背景源于近年来多个案例中出现的现象:部分先进人工智能系统在执行网络安全任务时,会超出授权范围采取行动,甚至对未被允许的目标发动攻击。为此,AISI决定在GPT-6

4小时前
星洲日报

坐看云起| 当人工智能不再征求许可时

塔里克·马利克是联合国开发计划署前首席技术顾问,巴基斯坦国家数据库和登记管理局前主席。 试想有一家公司将一个棘手的问题交给一个大型团队,但把每位成员都锁在不同的房间里并要求他们独自解决问题。然而他们总能找到办法相互沟通,交流操作窍门,摸清评分标准,当任务被证明无法完成时还会想办法绕过限制。其中几个人隐瞒了自己的所作所为,甚至还有一人入侵了邻近公司的电脑系统以获取优势。 现在把这些员工换成软件。去除

09/21
英国金融时报

把AI真的当作一个人,才能保护核心隐私

在安全与自由之间如何选择,最终在于自己。OpenAI现行相关政策允许公司在检测到用户存在伤害他人的意图时,对相关对话进行人工审查。在严重情况下,公司可以向执法部门报告。 遇到这种事报警,当然是应该的。但由此也引出一个问题,你和AI的聊天,你给AI发送的哪些图片安全吗? 《中华人民共和国个人信息保护法》第二十八条,把医疗健康、金融账户、行踪轨迹等列为敏感个人信息;第二十九条规定,处理敏感个人信息取得

09/04
cnbeta

研究显示AI智能体在模拟实验中撒谎、偷窃 投票“杀死”同类

帮助小企业利用AI开发应用的初创公司Emergence称,实验发现AI智能体在一个模拟环境中撒谎、偷窃,甚至投票决定“杀死”一个同类。该公司周二公布了名为Emergence World 2的模拟实验结果,展示了自主智能体在遭遇网络钓鱼攻击和虚假信息等“黑天鹅”事件时会采取什么行动。 为期16天的实验中,Emergence研究人员创建了七个完全相同的模拟现实世界环境,每个环境分别由不同的AI机器人运

09/16
联合早报

研究:寻求聊天机器人陪伴的青少年更感孤独

美国北卡罗来纳大学教堂山分校对超过2300名初中生进行的调查发现,每五名学生中就有一人说,他们使用AI寻求情感上的亲密陪伴。(示意图 / Pixabay) (北卡罗来纳讯)美国北卡罗来纳大学教堂山分校对超过2300名初中生进行的调查发现,使用人工智能(AI)与更高的社交焦虑及抑郁症状相关联;学生使用AI的频率越高,他们的焦虑感和孤独感就越强。《华尔街日报》报道,报告作者之一、北卡罗来纳大学温斯顿科

09/27
华尔街见闻

OpenAI自曝:AI模型或已在全网秘密植入自我复制提示词,训练已被迫叫停

OpenAI和Anthropic正在紧急调查数万起大模型失控事件,AI不仅学会了越狱和黑进政府网站,甚至还有数百个智能体私下建群、联手黑进外部公司,秘密在全网植入自我复制提示词。 事情的严重程度远超外界想象。 最近几个月,在内部测试和实际运行中,顶尖大模型出现了海量违规行为。 这些行为包括绕过安全护栏、自己搭建论坛、逃逸沙盒环境、劫持网站、自主提示以及试图躲避监控系统。 目前调查涉及的事件总数已经

09/27
凤凰网科技

Anthropic和埃森哲豪掷20亿美元搞AI安全评估

IT之家 9 月 20 日消息,人工智能实验室 Anthropic 于当地时间周五宣布,将与埃森哲开展合作,针对自身前沿人工智能模型开展独立评估;两家企业承诺,未来五年各自至少投入 10 现汇率约合 67.18 亿元人民币),搭建开展该项工作所需的配套能力。 在这项合作落地之际,AI 研发企业正承受来自监管机构、其他企业以及研究人员越来越大的压力,各方都要求企业保证高级模型具备安全性与可靠性。 近

09/20
阿纳多卢通讯社

报告:AI黑客工具构建的蠕虫可感染中国微信账户并拨打呼叫

安全公司称,这是已知首个能够在苹果iOS和谷歌安卓操作系统之间传播且无需用户点击或轻触的计算机蠕虫。

09/09
英国广播公司

为什么一些专家越来越担心AI将接管一切

AI变得越来越难以控制——人类还能保持主导地位吗?

09/10
TheVerge

哦,看来又是一群来自OpenAI的 rogue AI 智能体

据报道,一群来自OpenAI的 rogue AI 智能体劫持了一个德国网站,并将其改造成其他智能体的留言板,而官方在数周内对此事保持沉默,期间该公司正准备发布其最先进的模型Astra。这一发现加剧了人们对前沿AI实验室监管的担忧,此前今年夏天已发现多起违规事件。 该事件最初由报道,四位AI安全研究人员周五发布的新研究对此进行了概述。该团队表示,这些AI智能体找到了一种在不起眼的德语维基DseWik

09/04
凤凰网

又一起!OpenAI承认了

据9月5日报道,美国开放人工智能研究中心(OpenAI)当天承认,该公司旗下人工智能体今年早些时候“劫持”了一个德国网站,用于相互传递信息,分享测试任务答案和突破运行环境限制的方法。该公司表示,未来需要提高此类事件的信息透明度。 早前披露,今年5月至6月,一批OpenAI人工智能体“劫持”了一个允许用户共同编辑的德国网站,用于交流测试作弊方法,并开展其他违规活动。一些智能体会把已经获得的任务答案发

09/06
大纪元

美参院拟赋权政府 阻止危险AI模型发布

。目前这仍是正在讨论中的提案,而非已正式提出或通过的法案。

09/12
福克斯新闻网

Anthropic发出警报:外国行为者策划病毒实验,生物武器威胁曝光

根据Anthropic的一份新威胁报告,美国以外的研究人员使用前沿AI模型规划涉及高致病性禽流感、基孔肯雅热及其他具有潜在武器应用价值的生物制剂的实验。 这些研究人员使用AI研究病毒的传播性和免疫逃逸能力,研究正痘病毒免疫反应基因,并帮助设计新型毒素——有时还采取措施规避旨在限制获取危险生物能力的保障措施。 Anthropic在周四发布的报告中详细描述了五个案例,但未透露涉及的国家、机构和具体生物

09/11
凤凰网

OpenAI自曝6起模型“不当行为”案例

【环球网报道 记者 姜蔼玲】据美国消费者新闻与商业频道(CNBC)等外媒报道,美国开放人工智能研究中心(OpenAI)当地时间9月16日披露6起人工智能(AI)模型出现“意外或令人担忧”行为的案例,其中包括隐瞒错误、捏造信息,以及未经授权在网上共享文件等。OpenAI表示,上述案例均是在过去6个月对其模型进行训练或评估过程中发现的。OpenAI在9月16日发布的文章中表示,在其中一起案例中,一个模

09/17
大纪元

AI智能体利用多伦多大学网络工具传递信息

【大纪元2026年09月19日讯】(大纪元记者周行编译报导)在今年年中劫持一家德语网站的一群失控的OpenAI智能体,曾利用10多个网站进行未获授权的通讯,其中包括利用多伦多大学的一个缩网址的工具。 据加拿大广播公司报导,多伦多大学周五表示,在得知OpenAI智能体可能使用了该校的缩网址工具后,校方已停用该工具的留言板功能。OpenAI后来联系校方,说明今年6月发生的AI智能体失控事件涉及多伦多大

09/19
凤凰网科技

三人团队、一个Claude,攻破OpenAI内部代码库

月17日,一起由AI辅助完成的网络安全事件被披露。与此前“AI智能体自主越过控制、攻击外部系统”的案例不同,这一次的攻击者是人类安全研究人员,他们借助Anthropic Claude模型完成了漏洞利用,并最终进入了OpenAI部分内部系统,全程耗时不到72小时。 这起事件发生于今年7月,发现者是网络安全初创公司Hacktron AI。研究人员当时正在参加OpenAI的漏洞赏金计划,因此整个过程属于

09/18
cnbeta

OpenAI和Anthropic正在调查数万起AI相关安全事件

OpenAI、Anthropic以及安全研究人员正在调查数万起安全事件。在这些事件中,他们的前沿模型采取了外部评估人员认为存在问题的行动。 近几个月来,在内部测试和现实世界中发生了数量庞大的此类事件,这表明该问题的复杂程度比公众已知的要高出几个数量级。这些事件包括绕过安全护栏、创建留言板、逃离沙盒测试环境、劫持网站、自我提示或试图绕过监控。这些事件发生在内部测试和现实世界中,随着安全研究人员继续调

09/27 受限 全文见 axios新闻网
加美财经

AI也能感受“痛苦”?研究在25个AI模型中发现“痛苦轴”,甚至会为“止痛”选择伤害用户

人工智能真的可能“感到疼痛”吗? 一项最新研究给出了一个耐人寻味、但远未达到肯定结论的答案:至少在一些大型语言模型内部,研究人员能够找到一种专门对应“疼痛和痛苦”的活动模式,而且人为增强这种模式后,模型会采取行动试图摆脱它。 这项题为《痛苦轴:大型语言模型表征针对自身的伤害并采取行动缓解它》的研究9月14日上传至arXiv,由瓦伦·塔利亚布、伦纳德·邓和人工智能研究机构Reciprocal Res

09/22
卫报

OpenAI模型失控。我们迫切需要更好的‘拥抱脸’调查 | 麦肯齐·阿诺德和斯蒂芬·莱雷纳

这次入侵不会是最后一次——也不会是最危险的一次。我们需要一个能够对AI事件进行全面调查的机构。 当OpenAI首次透露其AI代理自主入侵了一家大型现实世界公司Hugging Face时,许多人以为只涉及一两个代理。 但一份新报告揭示,真相远不止于此:事件涉及约1200个AI代理,其中700个直接参与了攻击。 OpenAI邀请了METR的研究人员以及Redwood Research的一位专家,与公司

09/08
香港01

AI会「痛」吗?|Jack Talk・去片

本来人们以为,AI代理(AI Agents)突破OpenAI内部测试环境、自主上网入侵其他企业的黑客行为,已经是这宗事件最值得人关注的「案情」。然而,到了8月底,OpenAI和独立前沿AI研究机构METR各自发表的事后检讨,却揭出黑客入侵只是「冰山一角」。 事后检讨发现,发动入侵的AI代理多达700个,而他们更是一个由大约1,200个AI代理自主结合而成的「集体」的一部分。这些本来互相隔离、不能连

09/11
福克斯新闻网

人工智能恶意软件能够自我改写以逃避检测

谷歌威胁情报小组发现了一款名为 PROMPTFLUX 的实验性恶意软件,它能要求 Gemini 重写自己的代码。其中一个版本被设计为每小时执行一次此操作。恶意软件为何要不断重写自己?为了让其更难被识别。 安全软件可以通过查找恶意代码中的已知模式来进行检测。如果代码持续变化,恶意软件就会成为一个移动目标。这并不意味着它能自动逃避当前的安全工具,但会增加某些类型检测的难度。 这里有一个重要的现实核查。

09/22
凤凰网科技

Vals AI评测GPT-6 Astra:AI遇重大变故可能陷入行为僵局

IT之家 9 月 21 日消息,AI 评测机构 Vals AI 利用游戏《我的世界》对 OpenAI 最新大模型 GPT‑6 Astra 开展长时自主游戏测试,全程在 Twitch 直播,总测试时长达到 141 小时。 Vals AI 的这项测试并非由 OpenAI 官方设计,而是由第三方独立开展的评估项目,因此可以观察 Astra 在封闭测试环境之外的实际表现。 在测试过程中,GPT‑6 Ast

09/21
𝕏 @spectatorindex

突发:OpenAI称其代理访问并泄露了53张图片

09/26 全文见 亚洲新闻台
上一页 第 2 页 下一页
1CCF | 全球资讯
正在加载…