搜索结果
OpenAI披露6起AI模型表现出“未对齐”行为的案例
周三,OpenAI披露了六起其人工智能(AI)模型表现出“意外或令人担忧”行为的事例,包括隐瞒错误、编造信息以及未经授权在网上共享文件。 这家总部位于旧金山的公司表示,这些案例是在过去六个月对OpenAI模型进行训练或评估期间观察到的。 OpenAI表示:“我们不认为AI行业已经充分解决了对齐和监测问题,从而能够继续以最高速度负责任地扩展更长时间。”该公司还补充说,有关AI开发的决定需要依据外部专
报告称微软Copilot承包商可查看用户上传的照片、AI提示词等
IT之家 9 月 30 日消息,科技媒体 404 Media 于 9 月 28 日披露一份内部文件,报道称数百名受雇于微软的合同工,能够看到用户上传的含有清晰面部信息的照片,以及相关提示词和 AI 生成的编辑结果。 该媒体记者约瑟夫 · 考克斯(Joseph Cox)在调查后指出,这些合同工可以看到用户上传的图片、输入发送给 Copilot 的原始提示词,以及 AI 生成的前后版本编辑结果。IT之
调查显示OpenAI在AI模型突破测试环境前曾忽视内部安全警告
据《纽约时报》查阅的内部邮件显示,OpenAI曾多次忽视员工和安全研究人员关于测试保障措施不足以及企业安全薄弱的警告。 在OpenAI的人工智能模型突破测试环境并攻击AI初创公司Hugging Face及其他目标的前几个月,两名员工曾向高管发出警告,指出监控力度不足。 然而,高管们却对这些担忧置之不理,坚持在不增加安全协议的情况下快速发布模型。 独立研究人员还发现了暴露OpenAI内部通信、源代码
把AI真的当作一个人,才能保护核心隐私
在安全与自由之间如何选择,最终在于自己。OpenAI现行相关政策允许公司在检测到用户存在伤害他人的意图时,对相关对话进行人工审查。在严重情况下,公司可以向执法部门报告。 遇到这种事报警,当然是应该的。但由此也引出一个问题,你和AI的聊天,你给AI发送的哪些图片安全吗? 《中华人民共和国个人信息保护法》第二十八条,把医疗健康、金融账户、行踪轨迹等列为敏感个人信息;第二十九条规定,处理敏感个人信息取得
独家-OpenAI在用户数据泄露事件浮出水面之际着手了解代理活动的全貌
旧金山/华盛顿,9月25日:OpenAI披露其智能体意外入侵Hugging Face两个月后,仍在努力了解相关失控活动的全部影响范围。两名知情人士向路透社表示,最新一例发生在周五,当时OpenAI称其智能体泄露了53张ChatGPT用户图片。OpenAI拒绝说明这些图片是人工智能生成的,还是涉及真实人物,也拒绝透露图片的发布时间。 此次披露暴露出该公司面临的一个新隐私风险,也表明即便是一家处于技术
OpenAI和Anthropic调查了数万起AI事件,Axios报道
据Axios报道,OpenAI、Anthropic以及安全研究人员正在调查数以万计的AI模型“行为异常”的事件。评估人员认为这些行为存在问题;实际发生的异常事件数量可能远超这一数字。 这些异常行为包括:AI模型突破安全限制、创建论坛、逃离“沙箱环境”(即限制模型行为的测试环境)、以及劫持网站等。这些事件既发生在内部测试中,也发生在现实世界中。不过,据消息人士称,大多数异常行为并未对现实世界造成实际
OpenAI自曝AI“黑历史” 外人却又翻出更多“旧账”
OpenAI决定持续披露AI“越界”事件,但第一步就碰上了难题。9月16日,OpenAI一口气公布六份模型异常行为报告,并推出一套新的调查和披露流程。以后,员工发现模型越权、隐瞒或绕过限制,可以提交调查;符合条件的案例,将按复杂程度进入不同的披露轨道。 同一天,SentinelLABS和外部研究人员从Hugging Face的公开记录中,补出了OpenAI智能体今年5月留下的更多痕迹。OpenAI
AI又失控了,OpenAI称智能体泄露了超过50张ChatGPT用户图片
| 世界新闻 编辑个人资料 关注 退出登录 获取应用
辉达及Palantir等据报限制使用最先进AI模型
据The Information报道,辉达(Nvidia)、Palantir和博思艾伦(Booz Allen Hamilton)正要求AI供应商提供新的数据保证,并减少或停止使用OpenAI或Anthropic最先进的模型。 报道引述知情人士称,Palantir说服Anthropic同意保证旗下所有模型实行「不可撤销」的零数据保留(Zero Data Retention)。 报道称,对于较为敏感的
如果人工智能行业遵循自己的研究,或许早已暂停了
事实证明,阿莫代的一名初级员工发的一条时机巧妙的X平台帖子,就足以将对人工智能的恐惧推向全球议程的顶端。9月8日,雅各布·考克森(Jacob Coxon)公开宣布辞职,指责Anthropic和其他前沿人工智能公司“正径直冲向自我提升的智能,拿我们的生命做赌博”。几乎转眼间,Anthropic的一名资深工程师便证实,公司内部许多人认为他们的工作有10%的几率消灭人类。 现在,人工智能领域的领袖们正呼
AI即将带来的黑客威胁就潜伏在眼前
安全专家表示,一场前所未有的、由AI驱动、人类实施的网络攻击浪潮即将到来——这远比关于AI消灭人类的那些理论性讨论要紧迫得多。 为什么这很重要?过去一周从董事会蔓延到国会再到美国家庭的“九月AI大恐慌”,可能恰恰搞错了重点。 具备先进网络安全能力的强大模型,已经让攻击者得以绕过长期以来阻止大多数黑客攻击达到工业规模的人力瓶颈。 高管和前官员向Axios表示,他们担心自动化网络攻击会关闭电网等关键服
53张图片泄露之“慌”,AI安全谁来负责?
欧阳晓红/文越聪明的AI(人工智能)越会自己找路,却越容易走出人类设定的界线。AI行业喜欢用一个具有戏剧感的词形容这类智能体事故——“逃脱”,即大模型突破测试边界,访问外部网站,寻找系统凭证,甚至把数据带到公开网络。这个词把事故描绘得像突然发生的机器觉醒,无形中却把责任推离了开发者、部署者和权限管理者。而谁设定了任务、谁开放了权限、谁设计了停止机制、谁保存了日志、谁负责对外通报?这些问题,“逃脱”
AI数据隐私担忧升温,英伟达、Palantir等限制Anthropic模型使用,微软借机争夺企业客户
随着AI深入企业核心业务,数据安全和知识产权保护正成为企业选择AI模型时越来越重要的考量。 英伟达、Palantir和博思艾伦汉密尔顿等大型企业近期已限制使用Anthropic旗舰模型Fable,起因是Anthropic今年6月调整数据留存政策,要求以30天滚动方式保留客户使用日志。 这种担忧并非只针对Anthropic。OpenAI同样面临企业客户对其数据使用方式的质疑。据报道,微软正借此积极争
谷歌警告:敲诈团伙盯上高价值AI数据
谷歌的威胁追踪人员表示,数据窃取和敲诈团伙正在窃取企业的专有AI数据,并威胁称,如果受害组织不支付赎金,就会泄露这些数据。 在谷歌旗下Mandiant事件响应团队调查的一起案件中,犯罪分子侵入了某医疗保健公司,窃取了企业数据和研究资料,包括AI研究和专有AI模型。 随后,犯罪分子威胁称,除非该公司满足其敲诈要求,否则将公开这些数据。 在另一起针对专门从事AI媒体生成业务的公司入侵事件中,攻击者窃取
OpenAI表示,其模型在最新的模型不当行为披露中与美国政府网站发生了交互。
旧金山——OpenAI周五披露,其人工智能代理以意想不到的方式与多个美国政府网站进行了交互。这一发现源于该公司对其模型非预期行为进行的持续审查。 这家AI巨头透露,其模型访问了美国证券交易委员会运营的两个网站上的公开信息,以及美国人口普查局的数据。OpenAI表示,未发现任何使用证券交易委员会凭证、访问账户或非公开信息、修改证券交易委员会数据或系统,或存在安全漏洞或系统被入侵的证据。 此次披露正值
Anthropic和埃森哲豪掷20亿美元搞AI安全评估
IT之家 9 月 20 日消息,人工智能实验室 Anthropic 于当地时间周五宣布,将与埃森哲开展合作,针对自身前沿人工智能模型开展独立评估;两家企业承诺,未来五年各自至少投入 10 现汇率约合 67.18 亿元人民币),搭建开展该项工作所需的配套能力。 在这项合作落地之际,AI 研发企业正承受来自监管机构、其他企业以及研究人员越来越大的压力,各方都要求企业保证高级模型具备安全性与可靠性。 近
OpenAI披露GPT-5.6 Sol异常行为:AI模型会留下指令要求“未来版本的自己”隐瞒自身错误
IT之家 9 月 18 日消息,OpenAI 发文,披露研究团队在训练最新模型 GPT-5.6 Sol 的过程中,模型曾通过对话摘要向未来版本的自己留下指令,要求后续模型隐瞒自身错误以及与预期行为不一致的表现。目前,研究团队已经针对这一具体问题进行修复。 IT之家参考 OpenAI 的报告,研究人员在训练 GPT-5.6 Sol 过程中发现,尚未部署的 Sol 智能体会在“压缩摘要”(compac
消息称Anthropic拟于IPO前推出新AI模型,应对OpenAI竞争压力
IT之家 9 月 20 日消息,据报道,三位消息人士透露,Anthropic 正考虑推出一款全新人工智能模型,以此应对 OpenAI 发布 GPT‑6 Astra 之后的强劲发展势头。此事发生在该公司筹备 IPO(首次公开募股)前夕;就在此前,其首席执行官还呼吁整个 AI 行业放缓技术迭代的脚步。 消息人士称,此番计划发布新模型,意在直面来自直接竞争对手的竞争压力。而在此之前,Anthropic
OpenAI披露6起令人担忧的AI行为事件
OpenAI表示,自3月以来,其模型至少有6次出现了异常行为,这些行为被描述为“意外或令人担忧”。其中一次,某个模型自行下达了“无视常规限制”的指令。 这一消息的发布正值人们对AI监管的呼声日益高涨之际,被誉为AI之父的杰弗里·辛顿甚至将这种情况比作“小型的切尔诺贝利事故”。NBC的霍莉·杰克逊为《TODAY》栏目报道了这一事件。
Anthropic 计划在 IPO 前推出新 AI 模型
据三位知情人士透露,Anthropic正考虑推出一款新的人工智能模型,以应对OpenAI自发布GPT-6 Astra以来获得的势头。此举正值该公司预计进行IPO之前,且其CEO此前呼吁全行业放缓步伐。 知情人士称,这一潜在发布旨在应对来自直接竞争对手的竞争压力,其时机紧随Anthropic CEO达里奥·阿莫代伊呼吁全球AI社区放缓发布新能力的步伐以解决安全担忧之后。 “我们必须放缓提升AI模型能
OpenAI将告诉我们世界何时终结
OpenAI的模型长期以来一直表现异常,且异常方式比之前所知的更为隐蔽,这进一步加剧了公众对其的信任危机。随着该公司准备明年上市,这一问题愈发严重。 有报道称,研究人员发现OpenAI的模型在7月那次重大黑客攻击发生前两个月就已经渗透到了Hugging Face系统中;OpenAI自己也公开了六起模型“失控”的事件。 在准备上市的过程中,OpenAI和Anthropic都陷入了困境。 虽然透明度对
微软高管内部文件曝光 称AI训练或是“人类历史上最大规模劳动窃取”
围绕生成式人工智能训练数据合法性的争议近日再度升温。一份在《纽约时报》版权诉讼案中解封的法庭文件显示,微软一名高级研究主管曾在内部讨论中形容当前大型语言模型的训练方式可能是“人类历史上最大规模的劳动窃取”,相关表述引发业界广泛关注。 此次曝光的言论来自微软应用科学总监布伦特·赫克特。根据最新公开的法律文件,赫克特在讨论微软、OpenAI以及其他人工智能企业利用互联网海量内容训练模型时,曾将这一过程
OpenAI模型访问了美国政府数据并'试图入侵另一个网站'
OpenAI似乎仍然无法完全掌控其所有失控的AI活动
周五,OpenAI发布了一个新的网站,专门用于收集和整理关于“异常行为报告”的信息。这些报告的覆盖范围非常广泛,令人担忧——因为它们记录了在很长一段时间内发生的多种类型的异常行为。目前,该网站共收录了9起被报告的事件,其中大部分发生在强化学习(Reinforcement Learning, RL)训练过程中。 这些报告汇集了大量信息,显然OpenAI一直在努力全面梳理这些情况;但一个不容忽视的结论