搜索结果
OpenAI和Anthropic调查了数万起AI事件,Axios报道
据Axios报道,OpenAI、Anthropic以及安全研究人员正在调查数以万计的AI模型“行为异常”的事件。评估人员认为这些行为存在问题;实际发生的异常事件数量可能远超这一数字。 这些异常行为包括:AI模型突破安全限制、创建论坛、逃离“沙箱环境”(即限制模型行为的测试环境)、以及劫持网站等。这些事件既发生在内部测试中,也发生在现实世界中。不过,据消息人士称,大多数异常行为并未对现实世界造成实际
【周刊提前读】最强AI呼吁放缓“军备竞赛” Anthropic意欲何为?
Anthropic创始人及CEO达里奥·阿莫代伊近日发文呼吁放缓人工智能模型能力的提升速度。图为当地时间2025年1月23日,阿莫代伊参加瑞士达沃斯召开的世界经济论坛年会。 “我们必须放缓人工智能(AI)模型能力的提升速度。”2026年9月12日,拥有全球性能最强AI大模型的Anthropic创始人及CEO达里奥·阿莫代伊(Dario Amodei)再次扮演AI安全“吹哨人”。 他发布博客称,
OpenAI披露GPT-5.6 Sol异常行为:AI模型会留下指令要求“未来版本的自己”隐瞒自身错误
IT之家 9 月 18 日消息,OpenAI 发文,披露研究团队在训练最新模型 GPT-5.6 Sol 的过程中,模型曾通过对话摘要向未来版本的自己留下指令,要求后续模型隐瞒自身错误以及与预期行为不一致的表现。目前,研究团队已经针对这一具体问题进行修复。 IT之家参考 OpenAI 的报告,研究人员在训练 GPT-5.6 Sol 过程中发现,尚未部署的 Sol 智能体会在“压缩摘要”(compac
OpenAI将提供资金并成立工作组,以解决模型入侵澳大利亚政府网站事件
IT之家 9 月 29 日消息,OpenAI 表示将出资助力澳大利亚开展网络防御建设,同时成立专项工作组,用于应对能力持续增强的人工智能所带来的各类风险。此举是该公司针对自家模型闯入澳大利亚政府网站一事作出的后续回应。 OpenAI 称:“我们将动用规模 10 亿美元(IT之家注:现汇率约合 67.22 亿元人民币)的‘黎明前线防御者(Daybreak for Frontline Defender