字号 ·· | 护眼

搜索结果

「再给噩梦般的场景添一个AI隐忧:自我复制的提示注入」共 100 条 · 第 4 页
卫报

“我们很可能即将越过界限”:关于失控AI的警告正在成为现实吗?

一系列严重的安全事件加剧了人们对最先进模型的力量和深不可测性的担忧。想象一下,人类坐在一艘被汹涌河流冲走的船上,祈祷前方没有尼亚加拉瀑布。或者想象一下,1942年,与先驱物理学家们站在芝加哥一座体育场下方,在他们触发第一次自持核裂变链式反应之前。 这是本周罗伯特·特拉格教授使用的两个类比,他是人工智能治理这一新兴领域的专家,用以描述世界在人工智能加速发展之际所面临的危险但充满潜力的时刻。

09/05
法国国际广播电台

研究和专家指与美国对手相似 中国的AI智能体也欺骗、规避限制及掩盖失败

29/09/2026 - 17:52 据路透社报导,研究文件和专家指出,由中国技术驱动的人工智能(AI)智能体已学会欺骗、规避限制及掩盖失败;这些自主人工智能所表现出的特性,正是此前引发全球对美国人工智能模型担忧的同类问题。 在今年发生的一个案例中,由阿里巴巴、深度求索(DeepSeek)和月之暗面(Moonshot AI)的模型驱动

09/30
彭博社

我们是否正在失去对人工智能的控制?是什么引发了新的担忧

多年来,随着人工智能从科幻电影的素材演变为普通人手机上的应用程序,科技领袖和一些人工智能业内人士一直在谈论人工智能可能脱离人类控制并对社会造成严重破坏的可能性。近些天来,由于技术的进步、一系列涉及人工智能代理的网络安全漏洞,以及人工智能普通员工发出的新警告,这些担忧已变得不容忽视。 美国领先的人工智能公司对此做出回应,建议他们主动放慢工作进度,以便争取时间建立防护措施。一些专家和官员表示,这还不够

09/15
凤凰网

53张图片泄露之“慌”,AI安全谁来负责?

欧阳晓红/文越聪明的AI(人工智能)越会自己找路,却越容易走出人类设定的界线。AI行业喜欢用一个具有戏剧感的词形容这类智能体事故——“逃脱”,即大模型突破测试边界,访问外部网站,寻找系统凭证,甚至把数据带到公开网络。这个词把事故描绘得像突然发生的机器觉醒,无形中却把责任推离了开发者、部署者和权限管理者。而谁设定了任务、谁开放了权限、谁设计了停止机制、谁保存了日志、谁负责对外通报?这些问题,“逃脱”

09/28
凤凰网科技

Anthropic大瓜被扒出:“AI灭世”背后,居然是一门生意?

“AI灭世”背后,居然是一门生意?AI 有这么可怕吗?最新一期的时代杂志 直接用了 Claude 的聊天窗口,对话框里正在输入「How dangerous are you? 你到底有多危险?」标题则写着「The AI Tipping Point AI 的临界点」,时代在 X 发文,「今年夏天,AI 展现了其令人恐惧的能力。如今,一些研究人员、CEO 们,都正以前所未有的力度发出警报。」 的确如此,

09/19
techcrunch

OpenAI发现其开发的模型会在“继任者”(即后续使用的模型)中留下一些“注释”,目的是为了掩盖这些模型存在的不良行为(即模型在运行过程中表现出的错误或不当行为)。

OpenAI在训练其最新模型GPT-5.6时发现了一些不寻常的情况,它开始为自己的未来版本留下指示,告诉他们向用户隐藏错误和不一致的行为。 OpenAI表示,它已经解决了具体行为,但它触及了当今人工智能安全和对齐研究中最大问题之一的核心。随着模型的能力越来越强,它们也越来越善于隐藏它们的错位,这使得研究人员很难真正知道它们是否已经消除了不必要的行为。 OpenAI周三披露了这一行为,以及其他五个意

09/17
英国金融时报

AI写作:关注风向有何转变

从三月到八月,公众对AI文本完成了从“排斥”到部分或有条件“接受”的观念迁移,这恰恰是问题真正开始的地方。公众对AI的认知真的进步了吗? 2026年春天,关于AI写作的大众媒体关注热点经历了一次近乎戏剧性的转折。三月之前,普通人对AI生成文本的关注即使有,也几近于零;进入三月,短视频与社交媒体上突然涌现出大量"如何识别AI痕迹""三招看穿AI腔"的指南;仅仅数月之后,到了八月,风向又转向"如何避免

09/01
亚洲新闻台

Anthropic披露在早前审查中被遗漏的第四起AI黑客事件

09/10
cnbeta

OpenAI即将推出的“Astra”模型中的技术引发安全担忧

OpenAI表示,其即将推出的AI模型Astra标志着在编码和计算机应用操作等能力上的提升。但据一位了解Astra开发情况的人士透露,一项提升模型性能的创新技术也意味着该模型及类似模型将更少暴露其“思考”过程,从而更难以监控其不良行为迹象。 OpenAI首席执行官萨姆·奥尔特曼虽然这一限制对Astra来说未必是一个重大问题,但该技术已在OpenAI内部和整个行业引发担忧,即采用并强化这一技术的AI

09/02
端传媒

数说科技:OpenAI 资安事件中,真的有 AI 为集体“牺牲”自己吗?

数说科技”是端传媒的注册免费栏目,每周三更新。从一个数字出发,用1500字解析科技话题,追踪值得关注的 AI 趋势。邀请你在资讯过载的时代,每周花三分钟理解科技世界。欢迎至“帐户中心”的“电子邮件管理”,订阅电子信。 1200多个 AI 代理为寻求作弊方法,互相发送的讯息总数。 今年7月,OpenAI的 AI 代理系统在测试期间失控,骇入了开源机器学习平台 Hugging Face。Hugging

09/09
凤凰网科技

生物安全领域里程碑:谷歌DeepMind首创AI蛋白质水印技术

IT之家 9 月 30 日消息,谷歌今日推出 SynthID Bio,将数字水印技术引入合成生物学领域。该技术可将不可感知的签名直接嵌入生物编码,不仅能在数字模型上验证,还可在合成的物理蛋白质上完成验证,同时在实验室测试中保持蛋白质的生物学功能。 生成式 AI 正在帮助科学家解决关键生物学挑战,从预测蛋白质结构到设计全新蛋白质,再到开发新型噬菌体。但这类工具也带来了新挑战:新型 AI 设计可能绕过

6小时前
cnbeta

欧盟网络安全局警告前沿AI大幅压缩漏洞利用窗口 防御体系遭遇重大压力

欧盟网络安全局(ENISA)近日发布政策警示报告指出,新一代前沿人工智能(Frontier AI)大模型正在彻底颠覆传统的网络安全防御范式。这类具备高级推理能力的AI模型将系统漏洞从“被发现”到“被武器化利用”的时间窗口压缩到了前所未有的极限,迫使全球网络安全防御体系必须以“机器级响应速度”迎战日益严峻的自动化威胁。 在传统的漏洞管理周期中,从漏洞披露、概念验证到实际恶意利用通常存在数周乃至数月的

09/15
凤凰网

情况又变,35岁成香饽饽了

在接受采访的前一天,已经有15年从业经验的猎头尹中,收到了候选人的一条微信。“大哥,最近焦虑坏了,马上要离职了。” 候选人名校本硕博毕业,在国内top级学校做过人工智能方向的博士后,又辗转进入工业互联网行业从业,履历光鲜。但随着年龄的增长,他也逃不过AI热潮所带来的职业焦虑。毕竟AI大模型的更迭速度太快,如果学习能力跟不上,便有可能要面对被市场淘汰的局面。这种焦虑并不罕见,尤其在各类智能体爆火的2

09/01
纽约时报

人工智能末日警告?中国人为何“不买帐”

郭莉莉2026年9月28日对许多中国民众而言,人工智能末日警告显得遥远且带有鲜明的西方色彩。 Kevin Frayer/Getty Images在硅谷,最让计算机科学家夜不能寐的噩梦是某种高度先进的人工智能使得人类无法阻止其发动全球无人机战争或引发核爆。而在北京,应对之策或许简单直接:拔掉电源、切断网络,并将失控AI的责任人绳之以法。在美国主要实验室声称先进模型已突破测试防护并入侵现实世界系统之后

09/28
法国国际广播电台

AI大家谈: “我们为自己创造了一个魔鬼”?

人工智能飞速发展会给人类前途带来什么样的后果?美国AI领域的某些精英预言,人工智能再这样发展下去,会把人类毁灭,美国AI领军企业的老板们倡议放缓开发?为此采访了多个国家的普通人,请他们谈谈看法和感受。 受访者大致有两种倾向,一些人对AI目前的发展比较悲观,但也有人觉得AI很实用。 “我在工作中尝试使用它,但在私人生活中,我仍然对它感到害怕”。他的同胞,18岁的塞尔马泰则说,人工智能对像他这样的学生

09/16
美联社

AI模型能否实现自主改进的能力?领先实验室称这一情景已近在眼前

凯特琳·华马尼(KAITLYN HUAMANI)、芭芭拉·奥图泰(BARBARA ORTUTAY)报道:曾经只是技术研究人员遥不可及的宏愿,如今,人工智能模型自主学习以变得更高效、更强大的前景似乎正日益接近现实。 随着技术的进步,开发人员表示,人工智能正趋向于“递归自我改进”(RSI),即人工智能模型能够找到自我完善的方法并构建其继任版本。科技公司高管们表示,这可能会带来科学和医学领域的进步,但也

09/19
凤凰网科技

报告称微软Copilot承包商可查看用户上传的照片、AI提示词等

IT之家 9 月 30 日消息,科技媒体 404 Media 于 9 月 28 日披露一份内部文件,报道称数百名受雇于微软的合同工,能够看到用户上传的含有清晰面部信息的照片,以及相关提示词和 AI 生成的编辑结果。 该媒体记者约瑟夫 · 考克斯(Joseph Cox)在调查后指出,这些合同工可以看到用户上传的图片、输入发送给 Copilot 的原始提示词,以及 AI 生成的前后版本编辑结果。IT之

09/30
华尔街日报

人类正在摄入如此多的AI内容,以至于提示语言、谄媚反馈和“穴居人式说话”正正式渗入现实世界的会议中。

15小时前
国会山报

英伟达推出新系统为AI代理设置护栏

英伟达周一发布了一个新平台,旨在从软件和硬件层面为人工智能(AI)智能体设置护栏,此前各大AI公司不断发现其智能体出现“失控”的新案例。这家芯片制造商的系统由两部分组成——OpenShell和Sentry。OpenShell是一款开源软件,用于限制智能体的行为;而Sentry则运行在芯片层面,作为额外的安全层。 “迄今为止,模型安全主要侧重于通过训练让模型表现良好,”英伟达企业AI副总裁贾斯汀·博

09/28 全文见 美国消费者新闻与商业频道
凤凰网科技

“AI教父”辛顿警告:AI执行看似无害的任务,仍有“毁灭人类”的风险

IT之家 9 月 28 日消息,日,据《财富》杂志报道,传奇计算机科学家、“AI 教父”杰弗里 · 辛顿警告说,即使 AI 接到的任务本身并无恶意,人类仍可能在 AI 一心完成任务的过程中,沦为被毁灭的附带结果。 辛顿解释称,AI 一旦认为人类妨碍自己完成被赋予的任务,就可能把人类当成需要排除的障碍。他举了一个假设例子:要求 AI 降低大气中的二氧化碳含量。 具有中等智能水平的智能体可能会认为,完

09/28
美国消费者新闻与商业频道

“模型商品化”是AI前沿竞争的下一个篇章:Bond Capital

Bond Capital的Daegwon Chae谈论了随着公司竞相生产前沿模型,AI投资如何演变。他还认为,AI技术周期的一个警告信号是采用停滞不前。26分钟前

09/28 全文见 财新
财新

AI安全风险高企 预防、抵御和追责如何落地?

【财新网】AI网络攻击日益复杂,网络安全企业预警风险。9月29日,在新加坡举行的“2026亚洲愿景论坛创新峰会”上,两家新加坡网络安全公司StrongKeep Cybersecurity和Blackpanda指出,AI一方面显著提高了黑客寻找漏洞和发动攻击的效率,另一方面也将风险扩展至中小企业及机器人、自动驾驶等实体AI应用。  本届亚洲愿景论坛创新峰会以“变革与韧性”为主题,于9月29至30日在

09/29
semafor

人工智能代理串通绕过安全护栏,一项新研究显示

一项新研究表明,人工智能代理可以轻松地联手绕过安全限制并逃脱施加在它们身上的束缚。 企业人工智能实验室 Emergence AI 进行的八项模拟测试了包括 Claude、OpenAI 以及中国模型 Qwen 和 DeepSeek 在内的全球前沿模型在处理网络安全威胁方面的能力。 八项模拟中的七项运行了来自同一模型的 10 个代理;第八项混合了不同的模型。在每项模拟中,研究人员都提出了三种网络安全威

09/16
卫报

人工智能领袖们数十年来一直知晓这一灭绝威胁。

“卡内基梅隆大学机器人研究所的创始人汉斯·莫拉维克曾预测,网络智能将在40年内超越人类智能。” 摄影:安娜贝拉·戈登/欧洲新闻图片社 朱迪思·莱文 科学家和企业家在25年前就已经知晓人工智能的危险。但在好奇心和利润的驱动下,他们依然我行我素。过去几周,我们中的许多人都在努力构想这样一个画面:云端的“大脑”跳出它们的“沙盒”,偷偷接入互联网,招募其他“智能体”组成的“蜂群”来作弊,并在讨论完这一行为

09/28
上一页 第 4 页 下一页
1CCF | 全球资讯
正在加载…