Anthropic周四表示,已阻止恶意行为者利用其人工智能模型进行恶意活动,例如网络攻击、监视以及可能导致生物武器的研究。
Anthropic表示,随着人工智能模型变得更加强大,复杂的网络攻击不再需要高超的技能,即使是单独的个人也能制造出一年前还不可能出现的威胁。该公司表示,已在其最新模型中增加了更强的保障措施,以限制可能用于制造武器的生物研究。
Anthropic在其自2025年3月以来发布的第三份关于人工智能滥用的报告中表示:“我们在这里分享的案例并非典型的滥用,而是我们迄今发现的最显著、最新颖的威胁活动的例子。”该报告包含Anthropic发现的恶意代码和人工智能提示的片段,并敦促各国政府和人工智能竞争对手识别并防止类似的滥用行为。
该公司表示:“我们发布这份报告,是因为我们认为我们有责任披露我们服务被恶意滥用的行为。随着模型能力不断增强,除非人工智能开发者和社会防御者采取行动使其更安全,否则其风险将会增加。”
这家计划于今年秋季进行首次公开募股的人工智能初创公司发布这份冗长报告的前一天,其一名研究员宣布辞职,原因是担心Anthropic及其竞争对手在人工智能开发方面没有采取负责任的行为。他呼应了业内和业外对该技术可能逃脱人类控制的担忧。Claude被要求支持使病毒更具危害性在2025年12月至2026年8月期间,Anthropic的研究人员发现了各种行为者的滥用行为,从间谍软件供应商和“有政治动机的个人”到传播宣传的国家支持团体。
该公司报告中的发现包括未具名的行为者试图利用其模型进行可能导致生物武器的研究。在一个案例中,Anthropic表示其系统阻止了一个请求,该请求要求Claude协助撰写一份科学资助的拨款申请。
报告称:“申请中讨论的工作涉及对基孔肯雅病毒进行功能获得研究(即通过基因改造生物体以产生新的或增强的生物学特性的研究)。这项功能获得研究针对的是该病毒的传播性和免疫逃逸特性。”
基孔肯雅热是一种由蚊子传播的病毒,会导致严重疼痛和发烧等衰弱症状。该请求涉及一项拨款提案,旨在增强突变,使病毒逐渐更具危害性。Anthropic表示,虽然此类研究“肯定”可用于开发更好的疫苗和治疗方法,但“也可能被用来使病原体更加危险。”Anthropic表示不能声称其模型无害Anthropic在报告中包含的案例中,没有发现任何案例使用了其更新的、更强大的Claude Fable或Mythos级模型,除了一个非法蒸馏案例,Anthropic将其描述为“一场工业规模的秘密行动,旨在提取模型的能力并无授权地将其复制到另一个模型中。”
Anthropic表示,其较旧的模型,如2025年的Claude Opus 4和Claude Sonnet 4.5,“远低于能够有意义地帮助熟练用户进行危险生物研究的门槛。”
报告称:“因此,这些模型上的保障措施不太严格,主要旨在防止访问可能提升新手重现已知生物武器的内容。但对于当今的模型——它们能够协助一系列复杂的科学研究任务——证据不再确定,我们无法做出同样的保证。”因此,Anthropic在其较新的模型(如Claude Fable 5)中应用了“更强的保障措施,限制对广泛的双用途生物研究查询的访问。”报告发布前有研究员的严厉警告Anthropic还发现了一些团体创建了数百个看起来属于普通人的社交媒体账户,然后在一周内发布放大同一政治观点的材料。该公司概述了发现的九个此类案例,这些案例源自俄罗斯、伊朗、土耳其以及波斯湾、南亚、非洲和欧洲。
虽然社交媒体公司可以在帖子传播后检测其平台上的影响力行动,但“我们可能在行动仍在构建时就于Claude上看到它。”Anthropic发布这份报告之前,其一名研究员Jacob Coxon宣布辞职,因为他担心该公司及其主要竞争对手OpenAI“正竞相冲向自我改进的超级智能,并用我们的生命赌博。”Coxon的帖子警告说,他的一些同事现在认为人工智能可能在本十年末威胁到人类生命。
但Anthropic表示,它已阻止了其识别的每一项恶意活动,利用这些经验加强了保障措施,并与政府当局和行业合作伙伴分享了信息。
Anthropic表示:“我们希望这份报告中的发现能帮助其他开发者识别其平台上的类似模式,让政府和公民社会更清楚地了解新兴威胁如何形成,并加强集体防御。”