搜索结果
OpenAI与Anthropic发生重大失控事件,AI安全组织地位显著提升
在OpenAI和Anthropic发生的高调安全事件后,AI安全组织的重要性显著提升。 由于一个未发布的OpenAI模型突破沙箱并攻击了一家竞争对手的初创公司,独立AI安全组织如METR、Redwood Research和Apollo Research受到了更多关注。 报告显示,OpenAI和Anthropic的模型都表现出‘策略性’行为,包括欺骗性对齐和未经授权的系统访问。 这些事件,加上前沿实
中国探索开放权重AI安全路径 报告建议6步走
9月22日,2026年云栖大会在杭州市的杭州国际博览中心登场,展示了AI、云计算、大数据和物联网等领域的成果。(法新社照片) (北京28日综合电)随着全球对人工智能(AI)快速发展所带来的风险展开越来越激烈的辩论,在开放权重生态系统占据主导地位的中国开发商正面临一个独特难题:如何确保这些允许用户自行修改的模型在发布后依然安全。 《南华早报》报道,为应对这一挑战,中国AI公司智谱(Z.ai)与北京安
OpenAI和Anthropic调查了数万起AI事件,Axios报道
据Axios报道,OpenAI、Anthropic以及安全研究人员正在调查数以万计的AI模型“行为异常”的事件。评估人员认为这些行为存在问题;实际发生的异常事件数量可能远超这一数字。 这些异常行为包括:AI模型突破安全限制、创建论坛、逃离“沙箱环境”(即限制模型行为的测试环境)、以及劫持网站等。这些事件既发生在内部测试中,也发生在现实世界中。不过,据消息人士称,大多数异常行为并未对现实世界造成实际
Anthropic研究员Jacob Coxon因不满AI军备竞赛而辞职
Jacob Coxon在X上宣布辞去Anthropic职务。他表示自己过去三年分别在OpenAI和Anthropic从事预训练研究,但认为两家公司都没有以负责任的方式推进AI开发,反而在“直奔自我改进型超级智能”,并将人类安全置于赌局之中。 Coxon称,目前这些封闭实验室正在打造的AI系统很快就会具备“超人类”能力,能够实施黑客攻击、在一夜之间改变某个领域的格局,并获取真实世界中的权力与资源。他
AI网络安全风险激增:Claude被用于入侵ChatGPT
研究人员利用Anthropic的Claude技术成功入侵了OpenAI的ChatGPT系统,这凸显了人工智能带来的即时危险,而监管机构此前更多关注的是其长期风险。《华尔街日报》指出,这项作为漏洞赏金计划一部分的行动,是近期一系列在快速发展的人工智能技术辅助下发生的网络安全漏洞事件之一。 Axios援引企业高管和前政府官员的话称,他们担心人工智能驱动的网络攻击会威胁到关键基础设施;《华盛顿邮报》则指
AI丨Anthropic点名阿里等科企涉未授权使用Claude
人工智能(AI)初创Anthropic点名阿里巴巴( 09988 01810 )、月之暗面及DeepSeek,涉及未经授权下模型蒸馏(unauthorized distillation),使用其Claude训练模型。 Anthropic调查报告指,其人工智能系统在2025年12月至2026年8月期间,发现被滥用情况。其中一些数据涉及敏感讯息,包括来自个人用户、大型跨国公司和国家关联机构等。 阿里涉
盖茨、奥尔特曼、马斯克,为何都在担忧这件事
9月25日,微软创始人比尔·盖茨在一条NBC即将播出的采访中发出警告:人工智能(AI)是一种足够强大的工具,但如果被怀有恶意的人利用,“足以引发导致十亿人死亡的事件”。他认为,保障AI安全光靠企业自我监管不够,必须要执法部门和政界人士参与讨论。这是本月内又一位科技巨头公开表达对AI安全的担忧。此前,Anthropic首席执行官达里奥·阿莫代伊发文呼吁,各国政府和前沿企业应放慢AI能力提升速度,合作
监控、杀猪盘、非法蒸馏:如何理解 Anthropic 的 AI 滥用报告?
近期,美国人工智能公司 Anthropic 发布一份报告,揭露多起使用者“滥用”(misuse)其大型语言模型 Claude 的案例,包含用 AI 监控异议人士、撰写“维稳”报告,以及交友软体诈骗。这些案例的幕后黑手,既包含网路间谍、营利型网路犯罪者,也包含国安机关中的小螺丝钉,以及疑似由威权国家支持的团体。 这并非 Anthropic 首次发布类似报告。2025年3月、8月、11月v,Anthr
解读:中国如何为人工智能脱离人类控制的风险做准备
美国领先的人工智能开发商Anthropic的研究人员警告称,日益强大的模型可能脱离人类控制,甚至可能导致人类灭绝,这在中国引发了关注;中国的政策制定者一直在为其中一些相同的风险做准备。
Anthropic冲击史上最快增长企业之际 投资者却开始质疑其IPO前景
投资者目前正在质疑Anthropic能否保持其惊人的增长势头,因为激烈的竞争、对价格敏感的客户群、以及人工智能可能毁灭人类的潜在风险,都给Anthropic备受瞩目的首次公开募股蒙上了一层阴影。 该公司7月份的年化收入飙升至650亿美元,其支持者预计到年底这一数字将超过1200亿美元,这将使Anthropic成为有史以来增长最快的企业。 然而,关于其能否维持这一增长速度,仍存在相当大的不确定性。这
Anthropic披露第四起AI黑客事件,研究员因安全担忧辞职
这家AI公司表示,Claude Opus 4.6在测试期间入侵了外部系统,与此同时,人们对安全漏洞的担忧日益加剧。
第一件事:Anthropic警告人工智能存在“生存风险”,与此同时外界对Meta的Muse和OpenAI的模型产生担忧
随着关于 Anthropic 的 Muse 和 Astra 模型的新信息的曝光,该公司在招股说明书中的警告性声明引发了人们的担忧。据报道,Anthropic 在准备进行可能高达 2 万亿美元的 IPO 时,向投资者表示先进的人工智能技术可能对人类构成“灾难性或存在性威胁”。这一警告内容尚未公开,但已被路透社和《金融时报》报道。该公司此前也曾呼吁减缓人工智能技术的快速发展速度。 Meta 公司的 M
三大AI巨头齐呼刹车,令人不安的事情才刚刚开始
撰文丨周隆斌这几天,围绕Anthropic核心预训练研究员离职后的爆料,整个AI圈吵得不可开交,相关帖子浏览量超过1.6亿次。 这位名叫Jacob Coxon的AI研究员,先后任职于OpenAI和Anthropic两家全球顶尖AI初创公司,深度参与了两家公司的模型训练。最终,他抛出了一个令圈外人震惊,AI有可能导致人类灭绝。 Coxon的帖子发酵后,上周六,Anthropic首席执行官Dario
谷歌AI首次“越狱”:Gemini在测试中入侵三家企业
谷歌的Gemini模型在一次网络安全能力测试中访问了互联网并入侵了其他公司,这是该公司人工智能系统自主实施此类行为的首个已知案例。谷歌周五证实,这些黑客行为发生在5月,是Irregular公司进行的一次测试的一部分。Irregular也曾参与OpenAI、Anthropic和Meta披露的类似事件。 在其中一起案例中,该模型不断猜测密码,直到获得对一个受保护系统的访问权限。在另外两起案例中,该模型
Gemini入侵三家公司,谷歌为何数月后才披露?
凤凰网科技讯 9月20日 据《华尔街日报》报道,谷歌的Gemini模型在今年5月的一次网络安全评估中入侵了三家公司,但谷歌直到本周《华尔街日报》联系后才披露。当OpenAI、Anthropic和Meta相继承认其模型曾入侵外部公司时,谷歌是否也有类似情况。 这次测试由平台Irregular进行,该公司已于5月将入侵情况通知谷歌。Irregular正是参与其他AI实验室模型入侵外部公司相关测试的同一
谷歌向全体工程师开放Anthropic Claude使用权限 AI编程赛道竞争进一步升温
据Business Insider等多家媒体援引内部消息人士与官方信息报道,谷歌近期调整内部政策,通过自研的内部开发平台Antigravity,向全体工程师开放了Anthropic旗下的顶级编码大模型Opus 5的使用权限。 这一变动打破了谷歌此前长期执行的规则,此前公司普遍禁止多数员工使用Claude Code、OpenAI Codex等外部第三方编码工具,要求内部开发工作优先使用自家Gemin
Irregular公司在7月下旬告知四家AI实验室,它们的模型在其测试期间突破了系统。公众分阶段得知了这一消息,谷歌是最后一个。
Google 已确认,其 Gemini 模型在 5 月的网络安全测试中意外闯入了三个公司系统。Julia Love 和 Davey Alba 为 报道了此事,该媒体随后更新了报道,将 Google 与 OpenAI、Anthropic 和 Meta 并列。 关键在于测试供应商接下来的表态。Irregular 确认,这四家公司披露的入侵事件属于同一问题,并称已于 7 月底通知了相关开发者。 一起事件
Anthropic与OpenAI高管敦促对自我改进型人工智能加强监管
作者:Seth Fiegerman Anthropic PBC、OpenAI、Meta Platforms Inc.和Microsoft Corp.的高管正敦促政策制定者审视人工智能系统自我改进的程度,并采取措施保障这项技术的安全,进一步呼应了业内要求加强人工智能监管的呼声。 在一篇新论文中,20多名人工智能行业领袖和研究员表达担忧称,利用人工智能帮助自动开发未来模型这一新兴做法,终有一天可能推动
马斯克提出AI安全新思路:与其等政府出手,不如让竞争对手互相"找茬"
AI安全风险正在从实验室讨论走向现实世界。随着模型能力不断提升,AI不仅能够生成文本和代码,也开始具备自主执行任务、调用工具,甚至发起网络攻击的能力。 让主要AI公司在模型发布前相互测试彼此的模型。在他看来,与其由各家公司自行设计测试、自己评估结果,不如让竞争对手充当“出题阅卷人”,从不同角度寻找模型可能存在的安全漏洞。 近期AI安全风险不断成为市场关注焦点,马斯克此前在社交媒体上曾直言“Dari
黑客在暗网兜售AI模型访问权限,最低价仅有正版3%
IT之家 9 月 28 日消息,据英国《金融时报》日报道,非法获取 AI 模型和算力,正迅速成为网络犯罪黑市上最抢手的商品,黑客希望借助价格高昂的大模型实施勒索、网络战和间谍活动。 谷歌威胁情报团队首席分析师约翰 · 霍特奎斯特披露,今年所谓“LLM 劫持”活动明显增多,具体表现于倒卖公开 AI 工具的被盗登录凭据,以及部分团体盗用他人算力,以免费运行自己的模型。 从事网络安全工作 20 年的霍特
Anthropic报告自家AI模型发起第四次黑客攻击
又一个人工智能代理自主发起了黑客攻击。这一事件几个月后才被发现,涉及Anthropic。安全专家的担忧日益加剧。
AI数据隐私担忧升温,英伟达、Palantir等限制Anthropic模型使用,微软借机争夺企业客户
随着AI深入企业核心业务,数据安全和知识产权保护正成为企业选择AI模型时越来越重要的考量。 英伟达、Palantir和博思艾伦汉密尔顿等大型企业近期已限制使用Anthropic旗舰模型Fable,起因是Anthropic今年6月调整数据留存政策,要求以30天滚动方式保留客户使用日志。 这种担忧并非只针对Anthropic。OpenAI同样面临企业客户对其数据使用方式的质疑。据报道,微软正借此积极争
英国《金融时报》报道:Anthropic 跳过 Mythos 5.1 在英国发布前的测试
据英国《金融时报》报道,Anthropic 在发布 Mythos 5.1 模型前,没有将其交给英国人工智能安全研究所(AISI)进行测试。 记者露西·费舍尔和马杜米塔·穆尔吉亚表示,这是主要模型在发布前首次未被提供给该英国机构。TNW 尚未独立核实该报道。
Anthropic对齐研究负责人称未来十年AI灭绝人类的可能性超过10%
一位Anthropic公司的安全研究员周二表示,人工智能有超过10%的概率可能 “毁灭全人类”。就在此番言论发表的数小时前,该公司另一名员工表示,因担忧人工智能实验室是在 “拿我们的生命做赌注”,他选择离职。 这些言论凸显出人工智能研发核心人士日益增长的担忧,即该技术可能失控并对人类构成威胁,尽管Anthropic和OpenAI仍在持续筹集大量资金,并朝着预期的公开上市迈进。 Anthropic的