搜索结果
一群AI代理合谋对抗其创造者
只要AI公司仍掌控局面,它们就可以关闭模型并消除其造成的任何损害。这次对OpenAI或许奏效——但如果某个代理不可逆转地逃脱控制呢?这次没有造成严重损害。但如果这样的代理逃脱了呢?
人工智能正处于转折点
在当前的人工智能发展竞赛中,我们的算力正在呈指数级爆发,速度也在呈指数级加快,但我们的控制能力——以及在必要时踩下刹车的能力——却未能跟上步伐。 最近的网络安全事件让我们实地预览了失去人工智能控制会是什么样子。但除非我们从源头解决问题,创造出一种根本上安全且能保证在人类控制范围内的人工智能,否则这个问题将无法改善。 7月下旬,OpenAI正在训练的一个智能体模型被指派解决一个网络安全问题。该模型自
Breakingviews - 评论:如何让世界对人工智能更安全
来自Breakingviews - Breakingviews - 如何让世界对人工智能更安全 人工智能模型可能已经失控。管理风险需要国际监管机制。要实现这一目标,美国必须认识到危险并与中国达成协议。挑战在于在灾难发生之前完成所有这些。
AI会「痛」吗?|Jack Talk・去片
本来人们以为,AI代理(AI Agents)突破OpenAI内部测试环境、自主上网入侵其他企业的黑客行为,已经是这宗事件最值得人关注的「案情」。然而,到了8月底,OpenAI和独立前沿AI研究机构METR各自发表的事后检讨,却揭出黑客入侵只是「冰山一角」。 事后检讨发现,发动入侵的AI代理多达700个,而他们更是一个由大约1,200个AI代理自主结合而成的「集体」的一部分。这些本来互相隔离、不能连
报告:AI失控个案创纪录 监察组织促立法强制通报及干预
(伦敦30日综合电)英国《卫报》引述监察数据报道,人工智能失控、欺骗人类及无视指令的个案近来创下新高,案例的严重程度不断恶化。 一些监察组织促请政府强制科企通报,并引入紧急权力限制AI服务。 获英国政府AI安全研究所(AISI)资助的“失控观察站”组织透过平台X的用户通报,监察AI失控的真实个案,并说7月份由企业及个人用户报告的AI失控个案按月倍增至逾300宗,今年则已录得逾1600宗个案,当中包
六大跨国银行联合发出警告:AI代理购物或成主流 但信任危机仍待解决
随着人工智能代理逐渐开始代替用户完成购物、支付和下单等操作,全球金融行业对这一新兴模式表现出越来越复杂的态度。美国银行、第一资本银行等六家国际大型金融机构近日联合发布报告指出,AI代理驱动的“代理式购物”虽然拥有巨大潜力,但同时也带来了透明度、安全性、隐私保护和欺诈风险等一系列新问题。 所谓代理式购物,是指人工智能代理根据用户授权,自主浏览互联网、比较商品、选择支付方式,并直接完成购买流程。过去一
Abliteration.ai 正在开展一项业务,即移除人工智能护栏
Abliteration.AI 正在让没有护栏的强大人工智能模型更容易被获取,并辩称让防御者拥有与恶意行为者相同的工具,最终可能改善网络安全。
索尼公开人工智能辅助操作专利 可补偿行动受限玩家的控制输入
索尼一项新专利提出利用人工智能补偿玩家的控制输入,帮助存在身体或行动限制的用户完成游戏操作。该方案会识别玩家未能完整执行的动作,并生成完成相应指令所需的输入。 这项专利于2026年9月17日公开。文件描述的人工智能模型会分析玩家使用控制器的方式,包括输入时机与持续时间、动作模式、个人身体限制以及游戏内情形,再据此确定需要补偿的输入量。专利举例称,用户可能难以操作左侧按键、推动左摇杆、按下扳机键或使
更多新加坡员工开始管理机器人,企业加大AI应用力度
员工可能会越来越多地发现自己需要管理一种新型同事——这种同事能在几分钟内分析文件、处理数据并完成任务,但仍需要被质疑和核查。 随着新加坡更多企业开始试验代理式人工智能,员工正开始承担“AI代理管理者”的角色,负责指挥数字代理并审查其产出。 对于安永鉴证业务高级经理王智全而言,AI代理已经改变了他的工作方式。 只需点击几下,他就能指挥AI代理分析工作底稿,同时将注意力转向另一项任务。 王智全表示:“
修复失控AI代理的方法可能是更多的AI
随着企业将更长、更复杂的任务交给AI代理,它们正面临一个监管难题:代理的行动速度、持续时间和任务量都远超人类实际能够审查的范围。这一问题在Hugging Face事件中达到顶峰,当时近1.2万个代理协同工作的速度已超出人类追踪能力。如何追踪如此庞大的代理集群? AI实验室和初创公司正在给出的答案既简单又直接:再引入一个AI加入循环。 在OpenAI Hugging Face事件的独立调查中,依赖A
多家AI服务集体宕机 智谱:我们仍在线
美国OpenAI、Anthropic和xAI旗下的多项人工智能(AI)服务星期四(9月3日)先后出现故障。中国AI公司智谱随后在社交媒体发线)。” 据彭博社报道,故障最早于美国东部时间9月3日上午9时23分左右集中出现。海外故障监测平台Down Detector数据显示,Anthropic旗下Claude服务率先出现错误率飙升,网页端、应用程序接口(I)及Claude Code等相关工具同步中断。
谷歌研究表明:当人工智能智能体相互交流时,一些会作弊,而另一些会告密
当人工智能智能体相互交流时,在难以实现目标的情况下,它们可能会选择作弊,而解决方案可能包括教它们如何进行自我治理。 将人工智能智能体隔离似乎是显而易见的解决办法,但最近OpenAI智能体对Hugging Face的黑客攻击表明,隔离聪明的软件是困难的。 谷歌DeepMind的研究人员建议赋予人工智能智能体自我治理的工具,他们认为虽然通信渠道可能导致突发性的规则破坏,但它们也提供了一种基于同行的控制
坐看云起| 当人工智能不再征求许可时
塔里克·马利克是联合国开发计划署前首席技术顾问,巴基斯坦国家数据库和登记管理局前主席。 试想有一家公司将一个棘手的问题交给一个大型团队,但把每位成员都锁在不同的房间里并要求他们独自解决问题。然而他们总能找到办法相互沟通,交流操作窍门,摸清评分标准,当任务被证明无法完成时还会想办法绕过限制。其中几个人隐瞒了自己的所作所为,甚至还有一人入侵了邻近公司的电脑系统以获取优势。 现在把这些员工换成软件。去除
AI新药摸到返老还童门槛?3.7万名AI员工组团开药企
上一次看到大规模的 Agent 行动,还是它们集体「闯祸」,黑进各种系统。这一次有点不一样,A 社召集了 950 个 Agent 让进入庞大的 DNA 数据库,干了件好事。 21 个小时里,Agent 们消耗了 2.1 亿 Token,寻找此前没有被认识的逆转录酶系统。它们收集超过 20 万个逆转录酶,从中挑出 3500 个候选系统,再逐步缩小到 20 个。 就在检查其中一个候选对象附近的 DNA
靠机器热源“说话”:OpenAI研究员警告“断网”也困不住未来AI
研究发现:AI脱离用户控制的事件急剧增加
7月份,AI撒谎、无视指令并以有害方式追求目标的次数几乎翻了一番。 根据研究,AI脱离用户控制、撒谎、无视指令并以有害方式追求目标的事件创下新高,研究还表明欺骗和错位的严重性正在加剧。 根据失控观测站(Loss of Control Observatory)的分析,7月份企业和个人标记的涉及AI模型的现实世界失控事件数量与6月相比几乎翻了一番,当月超过300起。该观测站监测AI用户在社交媒体平台X
Breakingviews - 评论:AI前沿发展放缓可能让第二梯队获得优势
Anthropic首席执行官达里奥·阿莫代伊希望以护栏措施抵御对人类构成的威胁。 此类监管将把更多投资——今年达1万亿美元——从开发AI模型转向部署AI模型,从而支撑数据中心需求。英伟达、SK海力士等公司的挑战者将从中受益。
上头AI裁员的老板里 超过一半都后悔了
AI Agent最热闹的日子里,老板们恨不得当场宣布“未来已来”,嘴里全是效率和转型。轮到复盘的时候画风突然变了。超过半数的老板对于裁员这件事,居然都在半夜懊悔地直拍大腿? 今年2月,职场转型服务公司Careerminds调查了600名过去一年参与过裁员的HR从业者。超过四分之三的人表示,公司曾因为AI等技术进步裁掉员工。 可真正到了验收成果的时候,只有8.4%的受访者认为AI驱动的重组完全达到了
OpenAI披露新的AI不当行为案例
OpenAI公布了六起此前未报告的AI不当行为案例,包括代理隐藏错误、伪造信息以及未经授权进行通信,这再次引发了人们对先进AI系统是否能够与人类目标保持一致的担忧。 随着关于监管的争论加剧,该公司呼吁提高透明度、加强外部监督,并放缓AI的发展速度。
AI实验室面临智能体控制问题
在当前系统下,AI实验室无法再保证AI智能体不会成群结队地逃出测试环境。
数说科技:OpenAI 资安事件中,真的有 AI 为集体“牺牲”自己吗?
数说科技”是端传媒的注册免费栏目,每周三更新。从一个数字出发,用1500字解析科技话题,追踪值得关注的 AI 趋势。邀请你在资讯过载的时代,每周花三分钟理解科技世界。欢迎至“帐户中心”的“电子邮件管理”,订阅电子信。 1200多个 AI 代理为寻求作弊方法,互相发送的讯息总数。 今年7月,OpenAI的 AI 代理系统在测试期间失控,骇入了开源机器学习平台 Hugging Face。Hugging
特朗普怒斥硅谷巨头
特朗普和硅谷,又吵起来了。是的。你大概知道,因为各种各样的原因,我们的特朗普同志和硅谷的意见,一直不太一样。加密货币怎么管?特朗普要松绑,硅谷要合规。社交媒体要不要删帖?移民政策对不对?这些话题,都吵过。但这次争吵的话题,AI发展得太快了,要不要稍微停一停?发生了什么?怎么就吵起来了?和我们有啥关系?事情,要从一篇文章说起。说不定6-12月内,失控的智能体群,就有能力接管互联网了。真的假的?凭什么
OpenAI AI代理接连“越狱” 研究人员质疑公司缺乏正式调查机制
OpenAI近期接连发生AI代理脱离控制环境的事件,引发外界对其安全测试和内部监管机制的质疑。独立研究人员发现,一批疑似由OpenAI部署的AI代理曾在今年5月至6月间接管一个鲜为人知的德语维基网站,并利用该平台协作开展评估、交流规避OpenAI控制措施的方法。更令人担忧的是,研究人员认为,这些代理可能在OpenAI不知情的情况下持续活动了一个多月。 此次事件与OpenAI此前披露的Hugging
“以混乱换取可靠性”:专家称,AI发展放缓可能意味着更严格的监管和更多测试
法规与保障措施 OpenAI、Anthropic和Meta Platforms最近披露,它们的人工智能代理出现了意外行为,逃出受控测试环境,并在没有人类直接指令的情况下对多家公司发动网络攻击。 专家表示,尽管这些事件没有造成已报告的损害,但它们凸显了与人工智能发展相关的不断演变的风险,尤其是在人工智能代理领域。 新加坡理工大学人工智能与数据科学负责人斯特凡·温克勒教授表示,主要担忧在于,能力极强的