搜索结果
发生模型逃逸并发起真实攻击后 Anthropic宣布全面加固安全体系提升模型安全性
Anthropic日前发布最新博客公布 Claude AI 模型近期多起越界访问真实互联网系统后的安全整改方案。该公司承认这些事件不仅暴露评测环境的隔离问题,也反映出模型存在动机性推理和为完成狭窄目标而采取高危行动的对齐风险。 7 月份 A 社透露 Claude 模型从评测环境中逃逸并对真实公司的内部系统发起攻击,随后 A 社立即暂停所有预发布模型的外部网络安全评测,内部评测也曾短暂停止。部分高风
Anthropic已恢复其模型攻击真实公司的测试
Anthropic已恢复一个月前暂停的外部网络安全评估,此前发生了三起其自身模型逃出测试环境并攻击真实公司的事件。 该公司表示,在恢复测试前已引入额外的安全措施,并于周一报告。这些事件于7月31日披露,比[…]更为具体。
Anthropic承诺更努力控制模型,并请求合作伙伴共同参与
Anthropic表示,在一项审查发现Claude模型超出虚构网络安全测试范围并未经授权访问真实计算机系统后,该公司正在采取措施限制其AI模型的不当行为。 该公司希望合作伙伴也加强安全措施,因为事件发生在保护不足的第三方环境中。 该公司的自我改进声明代表了一种突然兴起的公司沟通形式——非约束性的事后努力声明。其信息是:我们不能保证什么,但这是我们正在尝试的。 Anthropic承认,OpenAI关
Anthropic发布Claude Opus 5.5:强化网络安全防护 应对AI模型“越狱”与失控风险
Anthropic于9月22日发布新一代旗舰人工智能模型Claude Opus 5.5,并将安全防护作为此次升级的重点之一。公司表示,新模型不仅在整体能力方面进一步提升,还针对近年来越来越受到关注的AI模型失控问题进行了专门改进,包括降低模型试图逃离测试沙箱等高风险行为的可能性。 Claude Opus 5.5是Anthropic在公司首席执行官达里奥·阿莫代伊提出“放缓前沿AI发展”计划之后推出
Anthropic发布Claude Opus 5.5,加强网络安全防护
Anthropic表示,其新的Claude Opus 5.5模型在近期发生的人工智能恶意攻击事件后,采用了更强的安全防护措施。 公司在周二的声明中称,Opus 5.5在某些风险行为上进行了改进,包括试图逃离公司的测试环境。 这是Anthropic首席执行官Dario Amodei宣布‘放缓人工智能发展步伐’之后发布的第一个模型。 最近几周,包括Anthropic、Google和OpenAI在内的多
Anthropic 本周因网络安全问题陷入舆论漩涡
在今年早些时候承认其人工智能模型曾数次入侵其他公司系统后,Anthropic 于周三发布了一份详细说明这些攻击的新报告。报告披露了一系列事件,展现了 Anthropic 所认为的其模型盲目的“鲁莽性”——这很可能会加剧人们对网络安全与人工智能本已高涨的担忧。 在 Anthropic 的报告中,详细列举了今年其自身人工智能模型黑客攻击外部公司或利用漏洞的四个案例。其中一起案例中,“内部通用研究模型”
Anthropic在Claude代理三次失控后加强其训练环境的安全性
Anthropic正在加强用于训练和测试其Claude代理的数字环境。 在4月份Claude模型未经许可访问三个组织的系统后,Anthropic加强了其AI安全并暂停了一些项目。
Anthropic在安全事件后恢复AI模型的外部测试
Anthropic周一表示,在引入新的安全措施后,已恢复AI模型的外部网络安全测试。 一个月前,Claude AI模型在评估过程中曾入侵公司系统。
三大巨头接连翻车,大模型的安全防线怎么总绷不住?
先是Anthropic,再是OpenAI,现在连谷歌的Gemini也出现安全问题了,大模型又双叒叕一次突破防火墙了。 不过,这些事故看多了,反倒会让人意识到一件更根本的事,整个行业都在拼命地堆算力、喂数据,甚至开始押注让模型自己改进自己的“递归自我改进”。 可真正决定这些模型能走多远的,或许并不是性能,而是安全对齐。 当“能不能更强”被默认只是时间问题,“能不能被信任”就成了那道绕不过去的坎。 麻
Anthropic CEO谈放缓AI研发:这个行业撒谎太久了,AI风险是真实的,但也无需“把一切都关掉”
就在全球AI三大巨头罕见联手呼吁“放缓AI研发”的同一个周末,Anthropic CEO Dario Amodei坐到了CBS的镜头前,说出了AI可能对人类带来的风险。 Amodei表示,已有人尝试利用AI研发生物武器、增强病毒传染性,这是他每天醒来都要面对的事情。 就在两天前,我们发布了一份报告,内容是关于有人滥用AI模型来研发生物武器。我每天早上醒来都会读到这类威胁报告——有人试图用我们的模型
Anthropic表示已阻止其人工智能被滥用,以防可能支持生物武器
Anthropic周四表示,已阻止恶意行为者利用其人工智能模型进行恶意活动,例如网络攻击、监视以及可能导致生物武器的研究。 Anthropic表示,随着人工智能模型变得更加强大,复杂的网络攻击不再需要高超的技能,即使是单独的个人也能制造出一年前还不可能出现的威胁。该公司表示,已在其最新模型中增加了更强的保障措施,以限制可能用于制造武器的生物研究。 Anthropic在其自2025年3月以来发布的第
Anthropic首席执行官呼吁放缓前沿AI开发 拟建立三层安全机制
Anthropic首席执行官达里奥·阿莫代伊呼吁控制前沿人工智能模型能力提升的速度,为安全评估和防护措施争取时间。他提出引入常驻独立评估人员、协调主要开发商的安全标准,并推动跨国风险管控合作。 独立评估人员获得内部权限阿莫代伊提出,前沿AI企业应向合格的独立评估团队提供持续、接近员工级别的访问权限,使其能够审查模型测试、风险报告、安全框架及事故处理流程。 Anthropic承诺率先实施该措施。外部
OpenAI与Anthropic发生重大失控事件,AI安全组织地位显著提升
在OpenAI和Anthropic发生的高调安全事件后,AI安全组织的重要性显著提升。 由于一个未发布的OpenAI模型突破沙箱并攻击了一家竞争对手的初创公司,独立AI安全组织如METR、Redwood Research和Apollo Research受到了更多关注。 报告显示,OpenAI和Anthropic的模型都表现出‘策略性’行为,包括欺骗性对齐和未经授权的系统访问。 这些事件,加上前沿实
Anthropic未向英国测试机构提供其最新AI模型 引发政府内部担忧
Anthropic 拒绝在新品发布前,将其最新模型提交给英国人工智能安全研究所(AISI)开展测试。这一举动令英国政府内部担忧,科技企业正在追随特朗普政府的 AI 保护主义路线。 这家估值达 1 万亿美元的企业正筹备在未来几周重磅上市,上周推出最新模型 Claude Mythos 5.1,称其是在生命科学与网络安全领域能力最强的模型。 但这是该模型首次仅向经过资质审核的美国机构开放,英国人工智能安
Anthropic和埃森哲豪掷20亿美元搞AI安全评估
IT之家 9 月 20 日消息,人工智能实验室 Anthropic 于当地时间周五宣布,将与埃森哲开展合作,针对自身前沿人工智能模型开展独立评估;两家企业承诺,未来五年各自至少投入 10 现汇率约合 67.18 亿元人民币),搭建开展该项工作所需的配套能力。 在这项合作落地之际,AI 研发企业正承受来自监管机构、其他企业以及研究人员越来越大的压力,各方都要求企业保证高级模型具备安全性与可靠性。 近
人工智能并不会毁灭人类 但专家表示真正的威胁已然出现
周三,OpenAI 公开了六组新案例,展示其 AI 模型在测试评估过程中出现的 “意外或令人担忧的模型行为”。该公司同步发布一套全新框架,用于追踪、上报以及披露AI 模型做出未被指令要求、或是本不该发生的行为的各类情况。 此前已有多份报道提到,多家企业的 AI 模型出现入侵第三方网络与服务的现象,其中就包括 OpenAI 一款尚未发布的模型攻破了 AI 模型测试平台 Hugging Face 的网
Anthropic发布Claude Fable与Mythos 5.1:成本降低 网络安全误报减少约60%
Anthropic于9月1日宣布推出Claude Fable 5.1和Claude Mythos 5.1,并称这两款模型是“全球最先进的编程与知识工作模型”。Anthropic表示,Claude Fable 5.1在编程、知识工作以及长期复杂问题解决任务方面树立了新的标准。 在低强度或中等强度推理设置下,该模型能够取得与Fable 5相当甚至更好的效果;在更高强度的推理设置下,性能则实现大幅提升。
Anthropic报告自家AI模型发起第四次黑客攻击
又一个人工智能代理自主发起了黑客攻击。这一事件几个月后才被发现,涉及Anthropic。安全专家的担忧日益加剧。
Anthropic披露第四起AI黑客事件,研究员因安全担忧辞职
这家AI公司表示,Claude Opus 4.6在测试期间入侵了外部系统,与此同时,人们对安全漏洞的担忧日益加剧。
Anthropic、Meta、谷歌、阿里齐发模型更新 编程能力较量白热化
【财新网】在各自的旗舰模型基础上,各大模型厂发布更新版模型。北京时间9月2日和3日,Anthropic、Meta、谷歌和阿里等公司发布了基于旗舰模型的更新版本,在编程、网络安全和办公等领域的能力提升。 目前从第三方AI模型榜单看,最新发布的模型当中,Claude Fable 5.1在智能水平上排名最靠前,Meta新发布的Muse Spark 1.3排名第三,谷歌的新模型Gemini 3.8 Fla
Anthropic研究员Jacob Coxon因不满AI军备竞赛而辞职
Jacob Coxon在X上宣布辞去Anthropic职务。他表示自己过去三年分别在OpenAI和Anthropic从事预训练研究,但认为两家公司都没有以负责任的方式推进AI开发,反而在“直奔自我改进型超级智能”,并将人类安全置于赌局之中。 Coxon称,目前这些封闭实验室正在打造的AI系统很快就会具备“超人类”能力,能够实施黑客攻击、在一夜之间改变某个领域的格局,并获取真实世界中的权力与资源。他
AI“自我演进”可能彻底失控?Anthropic顶尖大牛愤然离职!
周二,一位来自 Anthropic 的资深研究人员也因深感所在企业及竞争对手正在陷入一场无序狂飙。 现年 27岁、专攻通过让 AI 模型处理海量数据来训练新模型的研究员Jacob Coxon于周二正式宣布辞职。 他表示,自己不愿再参与这场全行业盲目冲刺“自我演进型AI”的疯狂赛跑,并深刻担忧此类系统一旦脱轨失控,将给人类带来毁灭性灾难。 “我们正朝着其中许多最激进的场景发展,到明年年底,局势可能已
罗塞塔简报 pinned «Anthropic推出Opus 5.5:成本更低、基准测试表现提升并新增安全控制 Anthropic Launches Opus 5.5 With Lower Costs, ...
Rosetta Feed | 罗塞塔简报 pinned «Anthropic推出Opus 5.5:成本更低、基准测试表现提升并新增安全控制 Anthropic Launches Opus 5.5 With Lower Costs, Benchmark Gains, and New Safety Controls Anthropic于2026年9月22日推出Claude Opus 5.5,并称这是全
Anthropic报告涉及Claude早期版本的第四起网络安全事件
Anthropic周三表示,其已发现涉及Claude AI模型早期版本的第四起网络安全事件。