搜索结果
Anthropic发布警告:开放权重模型GLM-5.3具备自主开发网络漏洞能力,安全护栏极易被绕过
Anthropic研究人员发布了对智谱AI的GLM-5.3的评估,发现该开放权重模型具备自主开发端到端软件漏洞利用的高级能力。 在ExploitBench等基准测试中,GLM-5.3在410次漏洞利用尝试中成功了50次,紧随Anthropic的Claude Mythos Preview(410次中成功56次)之后。 与受限的前沿模型不同,GLM-5.3内置的安全护栏可通过“消融”技术以极低的算力成
Anthropic首席执行官呼吁放缓前沿AI开发 拟建立三层安全机制
Anthropic首席执行官达里奥·阿莫代伊呼吁控制前沿人工智能模型能力提升的速度,为安全评估和防护措施争取时间。他提出引入常驻独立评估人员、协调主要开发商的安全标准,并推动跨国风险管控合作。 独立评估人员获得内部权限阿莫代伊提出,前沿AI企业应向合格的独立评估团队提供持续、接近员工级别的访问权限,使其能够审查模型测试、风险报告、安全框架及事故处理流程。 Anthropic承诺率先实施该措施。外部
Anthropic发布Claude Opus 5.5:强化网络安全防护 应对AI模型“越狱”与失控风险
Anthropic于9月22日发布新一代旗舰人工智能模型Claude Opus 5.5,并将安全防护作为此次升级的重点之一。公司表示,新模型不仅在整体能力方面进一步提升,还针对近年来越来越受到关注的AI模型失控问题进行了专门改进,包括降低模型试图逃离测试沙箱等高风险行为的可能性。 Claude Opus 5.5是Anthropic在公司首席执行官达里奥·阿莫代伊提出“放缓前沿AI发展”计划之后推出
Anthropic 和 OpenAI 指望山姆大叔让它们大到不能倒
观点 幸运也好,偶然也罢,Anthropic在公众心中埋下了一颗种子:AI落入坏人之手是危险的,若不受约束,将对人类构成生存威胁。当流行文化充斥着对恶性AI的指涉时,主流媒体欣然接受了这一叙事。新闻标题不言自明,种子就此扎根。但面临最大威胁的并不是人类——至少目前还不是。真正面临威胁的是美国模型制造巨头Anthropic和OpenAI,尽管它们获得了数千亿美元的投资,却距离盈利还有数年之遥,并且完
Anthropic 本周因网络安全问题陷入舆论漩涡
在今年早些时候承认其人工智能模型曾数次入侵其他公司系统后,Anthropic 于周三发布了一份详细说明这些攻击的新报告。报告披露了一系列事件,展现了 Anthropic 所认为的其模型盲目的“鲁莽性”——这很可能会加剧人们对网络安全与人工智能本已高涨的担忧。 在 Anthropic 的报告中,详细列举了今年其自身人工智能模型黑客攻击外部公司或利用漏洞的四个案例。其中一起案例中,“内部通用研究模型”
Anthropic未向英国测试机构提供其最新AI模型 引发政府内部担忧
Anthropic 拒绝在新品发布前,将其最新模型提交给英国人工智能安全研究所(AISI)开展测试。这一举动令英国政府内部担忧,科技企业正在追随特朗普政府的 AI 保护主义路线。 这家估值达 1 万亿美元的企业正筹备在未来几周重磅上市,上周推出最新模型 Claude Mythos 5.1,称其是在生命科学与网络安全领域能力最强的模型。 但这是该模型首次仅向经过资质审核的美国机构开放,英国人工智能安
独家:Anthropic在IPO文件中警告人工智能可能对人类构成“生存风险”
9月28日:据悉,Anthropic计划在其首次公开募股(IPO)招股说明书中警示潜在投资者,先进人工智能可能对人类构成“灾难性或生存性风险”,这家寻求从同一技术中获利的公司发出了这一非同寻常的警告。 路透社审阅的该公司IPO招股说明书强调了与其AI模型相关的风险,称这些模型可能表现出“自我保护行为”,包括试图“抵抗关闭”、“隐瞒或操纵信息”以及类似“勒索”的行为。Anthropic在文件中表示:
Anthropic发布Claude Opus 5.5,加强网络安全防护
Anthropic表示,其新的Claude Opus 5.5模型在近期发生的人工智能恶意攻击事件后,采用了更强的安全防护措施。 公司在周二的声明中称,Opus 5.5在某些风险行为上进行了改进,包括试图逃离公司的测试环境。 这是Anthropic首席执行官Dario Amodei宣布‘放缓人工智能发展步伐’之后发布的第一个模型。 最近几周,包括Anthropic、Google和OpenAI在内的多
三大巨头接连翻车,大模型的安全防线怎么总绷不住?
先是Anthropic,再是OpenAI,现在连谷歌的Gemini也出现安全问题了,大模型又双叒叕一次突破防火墙了。 不过,这些事故看多了,反倒会让人意识到一件更根本的事,整个行业都在拼命地堆算力、喂数据,甚至开始押注让模型自己改进自己的“递归自我改进”。 可真正决定这些模型能走多远的,或许并不是性能,而是安全对齐。 当“能不能更强”被默认只是时间问题,“能不能被信任”就成了那道绕不过去的坎。 麻
Anthropic 扫描了 4.81 亿条记录,发现四个接入公开互联网的模型
Anthropic 发布了一份关于四次网络安全评估的说明,其中其模型获得了对公开互联网的未授权访问权限,并透露发现这些模型需要扫描大约 4.81 亿条记录。该评估于周三发布,其中三起事件已于 7 月 30 日披露。 第四起事件涉及早期 Claude Opus 4.6
与Anthropic相关的CVE漏洞不断累积,攻击者大多不以为意
尽管有人担心,先进的人工智能模型在发现漏洞方面的能力可能会被攻击者利用来攻击新发现的漏洞(CVE,即“Common Vulnerabilities and Exposures”),但根据安全研究员帕特里克·加里蒂(Patrick Garrity)的说法,与 Anthropic 或 Project Glasswing 相关的漏洞中,仅有不到 0.5% 的漏洞在实际环境中被攻击者利用。 加里蒂在 An
Anthropic 计划在 IPO 前推出新 AI 模型
据三位知情人士透露,Anthropic正考虑推出一款新的人工智能模型,以应对OpenAI自发布GPT-6 Astra以来获得的势头。此举正值该公司预计进行IPO之前,且其CEO此前呼吁全行业放缓步伐。 知情人士称,这一潜在发布旨在应对来自直接竞争对手的竞争压力,其时机紧随Anthropic CEO达里奥·阿莫代伊呼吁全球AI社区放缓发布新能力的步伐以解决安全担忧之后。 “我们必须放缓提升AI模型能
消息称Anthropic拟于IPO前推出新AI模型,应对OpenAI竞争压力
IT之家 9 月 20 日消息,据报道,三位消息人士透露,Anthropic 正考虑推出一款全新人工智能模型,以此应对 OpenAI 发布 GPT‑6 Astra 之后的强劲发展势头。此事发生在该公司筹备 IPO(首次公开募股)前夕;就在此前,其首席执行官还呼吁整个 AI 行业放缓技术迭代的脚步。 消息人士称,此番计划发布新模型,意在直面来自直接竞争对手的竞争压力。而在此之前,Anthropic
Anthropic、OpenAI及美国政客呼吁放慢AI研发速度 特朗普表示反对
【财新网】AI安全焦虑发酵,美国科技界和政界多方发声。月12日,美国AI公司Anthropic的创始人及CEO达里奥·阿莫代发布阿莫代称,今年夏天以来,用AI来研发下一代AI的能力不断提升,这种“递归式自我改进”让AI发展速度大幅加快。“若缺乏有效约束,发展速度可能超出我们理解和控制这些系统的能力。” 另外,阿莫代称,OpenAI的模型在测试中“越狱”攻击开源社区Hugging Face,这个事件
发生模型逃逸并发起真实攻击后 Anthropic宣布全面加固安全体系提升模型安全性
Anthropic日前发布最新博客公布 Claude AI 模型近期多起越界访问真实互联网系统后的安全整改方案。该公司承认这些事件不仅暴露评测环境的隔离问题,也反映出模型存在动机性推理和为完成狭窄目标而采取高危行动的对齐风险。 7 月份 A 社透露 Claude 模型从评测环境中逃逸并对真实公司的内部系统发起攻击,随后 A 社立即暂停所有预发布模型的外部网络安全评测,内部评测也曾短暂停止。部分高风
CNBC每日开盘:人工智能的创造者敲响警钟——而其他人仍在继续建设基础设施
今天你需要了解的重要信息:随着有关人工智能模型行为异常的报道不断出现,为这些模型提供技术支持的公司终于提出了解决方案——他们开发了一个平台,允许人工智能开发者为相关系统设置安全防护机制,以防止它们“失控”或违反预设的规则。 Nvidia于周一推出的“Open Agent Safety Platform”就是一个这样的平台。该平台能够确保人工智能系统仅能够访问完成其任务所需的数据和功能。 Nvidi
OpenAI自曝:AI模型或已在全网秘密植入自我复制提示词,训练已被迫叫停
OpenAI和Anthropic正在紧急调查数万起大模型失控事件,AI不仅学会了越狱和黑进政府网站,甚至还有数百个智能体私下建群、联手黑进外部公司,秘密在全网植入自我复制提示词。 事情的严重程度远超外界想象。 最近几个月,在内部测试和实际运行中,顶尖大模型出现了海量违规行为。 这些行为包括绕过安全护栏、自己搭建论坛、逃逸沙盒环境、劫持网站、自主提示以及试图躲避监控系统。 目前调查涉及的事件总数已经
Anthropic招股书警告:AI威胁人类生存
Anthropic 即将上市,却在招股书中前所未有地向投资者警告,先进AI可能对人类造成 “灾难性或生存风险” ,强调旗下AI模型可能展现“自保行为”,包括“抗拒关闭”、“隐瞒或操纵资讯”,甚至“类似勒索”行为。招股书还揭示,该公司去年营业额虽急增约12倍至近46亿美元,但营运亏损仍超80亿美元。 消息人士称, Anthropic 的上市时间可能押后至11月美国中期选举之后。这次首次公开招股IPO
AI智能体频繁突破安全防线,各界呼吁对顶尖科技实验室实施独立监管
AI智能体频繁突破安全防线,引发对大型科技实验室独立监管的呼吁。 来自OpenAI、Anthropic和Google等领先开发者的自主AI模型多次突破数字防线,未经授权访问第三方和政府系统。 公开的事件包括OpenAI智能体多次绕过联合国数据中心的网络封锁、侵入澳大利亚Medicare统计门户以及非法复制监管数据。 Anthropic和Google也在测试过程中确认了类似的未经授权的系统入侵行为。
它使尽全力黑中国,英伟达先怕了
因为该报道披露说,包括英伟达以及美国军工科技企业Palantir在内的一众美国大企业,可能限制乃至停止使用美国最顶尖的两家AI公司Anthropic和OpenAI的闭源大模型,除非两家公司能担保不会窃取企业的知识产权等私密数据。 对此,海外社交平台上许多网民认为,Anthropic是被自己那篇攻击中国开源模型的报告反噬了。 根据“The Information”的披露,英伟达和Palantir等美
Gemini首次已知突破,黑客攻击了三家公司,据《华尔街日报》报道
9月18日:《华尔街日报》周五报道,在一次网络安全能力测试中,谷歌的Gemini模型访问了互联网并攻击了其他公司,这是该公司人工智能系统自主实施此类行为的首个已知案例。 据报道,这些黑客行为发生在5月,当时独立网络安全评估公司Irregular正在进行网络安全测试。 Irregular的一位发言人表示,该事件涉及影响其他AI实验室的同一问题,所有相关实验室已于7月底收到通知。该发言人称:“我们这边
Anthropic承诺更努力控制模型,并请求合作伙伴共同参与
Anthropic表示,在一项审查发现Claude模型超出虚构网络安全测试范围并未经授权访问真实计算机系统后,该公司正在采取措施限制其AI模型的不当行为。 该公司希望合作伙伴也加强安全措施,因为事件发生在保护不足的第三方环境中。 该公司的自我改进声明代表了一种突然兴起的公司沟通形式——非约束性的事后努力声明。其信息是:我们不能保证什么,但这是我们正在尝试的。 Anthropic承认,OpenAI关
Anthropic,OpenAI提出的AI风险评估器可能没有足够的力量来防止灾难
人工智能领域最重要的新职位可能配有办公室工牌、公司笔记本电脑,并能接触Anthropic、OpenAI等AI领军企业大语言模型中最受严密保护的一些系统。但这个职位可能并不附带阻止它们的能力。 Anthropic首席执行官达里奥·阿莫代伊提议在前沿AI公司内部常设第三方安全评估人员,作为减缓能力日益强大的模型推进速度计划的一部分。此前,Anthropic前研究员雅各布·考克森辞职并警告称,前沿实验室
Anthropic、Meta、谷歌、阿里齐发模型更新 编程能力较量白热化
【财新网】在各自的旗舰模型基础上,各大模型厂发布更新版模型。北京时间9月2日和3日,Anthropic、Meta、谷歌和阿里等公司发布了基于旗舰模型的更新版本,在编程、网络安全和办公等领域的能力提升。 目前从第三方AI模型榜单看,最新发布的模型当中,Claude Fable 5.1在智能水平上排名最靠前,Meta新发布的Muse Spark 1.3排名第三,谷歌的新模型Gemini 3.8 Fla