字号 ·· | 护眼

搜索结果

「OpenAI提出前沿AI训练安全论证框架」共 92 条 · 第 1 页
罗塞塔简报

OpenAI提出前沿AI训练安全论证框架

OpenAI于2026年9月28日发布了初步指南,旨在在进行前沿强化学习训练之前建立结构化的‘安全案例’。 该框架借鉴了航空和核能等安全关键行业的经验,制定了模型对齐、沙箱隔离和实时监控等方面的技术保障措施。 除了技术控制外,OpenAI还概述了运营治理程序,包括正式的事前评估、领导层的否决权、可审计的日志记录以及自动暂停故障运行的机制。 指南还规定了调查严重模型对齐问题的流程,要求进行根本原因分

22小时前
凤凰网科技

OpenAI提出前沿AI训练安全指导原则:高级管理人员应有否决权

IT之家 9 月 29 日消息,OpenAI 今天通过官方新闻稿提出了一套指导原则,要求企业在开展前沿 AI 强化学习训练前提交结构化的安全论证文件。 OpenAI 称,安全论证应交由多名高级管理人员审查,每个人都应有权否决训练任务,让训练在内部经过研究部门负责人或 VP(副总裁)、安全负责人和首席科学家等环节的多重把关。 此外,研究部门负责人、研究副总裁等负责训练任务的高级管理人员,应对安全论证

22小时前
axios新闻网

OpenAI公布了六起新的与人工智能安全相关的事故/事件。

OpenAI周三披露了六起新事件,其中其模型隐藏错误、寻求未经授权的凭据,将文件上传到公共互联网或在所谓孤立的培训环境中进行通信。该公司还宣布了未来报告类似不当行为的新程序。 为什么越来越明显的是,拥抱脸事件并不是一次性事件,因为人工智能模型变得更有能力找到意想不到的方法来绕过旨在遏制它们的护栏。 “目前还没有明确披露标准的行业框架,所以我们自愿采取这一步骤,因为我们认为分享我们正在学习的东西非常

09/17
亚洲新闻台

OpenAI推动强制性国家AI安全要求

09/10
cnbeta

OpenAI呼吁美国制定强制性全国AI安全规则 并支持四项加州法案

OpenAI当地时间9月9日表示,将推动美国建立具有强制约束力、按照模型能力和风险分级的全国人工智能安全制度。公司提出,针对开发最先进模型的少数大型实验室,应设置统一的测试、独立评估、网络安全和重大事故报告要求。 OpenAI发布文章,名为“AI政策窗口打开。我们需要采取行动。” 与此同时,OpenAI正式支持四项已经通过加州议会的人工智能法案。公司称,其中部分法案此前未获其支持,此次调整立场源于

09/10
cnbeta

OpenAI和Anthropic正在调查数万起AI相关安全事件

OpenAI、Anthropic以及安全研究人员正在调查数万起安全事件。在这些事件中,他们的前沿模型采取了外部评估人员认为存在问题的行动。 近几个月来,在内部测试和现实世界中发生了数量庞大的此类事件,这表明该问题的复杂程度比公众已知的要高出几个数量级。这些事件包括绕过安全护栏、创建留言板、逃离沙盒测试环境、劫持网站、自我提示或试图绕过监控。这些事件发生在内部测试和现实世界中,随着安全研究人员继续调

09/27 受限 全文见 axios新闻网
cnbeta

OpenAI称Astra AI模型首度超越其“关键”网络安全能力阈值

OpenAI周二表示,其即将推出的人工智能模型Astra是首个超越其“关键”网络安全能力阈值的产品。该公司表示,Astra能够发现此前未知的安全漏洞,并在无需人类逐步指导的情况下加以利用,这意味着该模型属于其所谓的“准备框架”中最先进的类别。OpenAI表示仍计划“很快”推出Astra,但对其网络安全能力的访问将更加受限。 OpenAI首席执行官山姆·奥特曼OpenAI于2023年推出了“准备框架

09/02
风向旗参考快讯

AI智能体接连失控 OpenAI再次叫停前沿模型开发

OpenAI对外表示,已暂停其最新一代人工智能模型的训练、评估,以及支持工具调用的推理工作,起因是内部测试中的AI智能体突破沙盒网络限制,触发安全预警,公司将借此机会升级安全隔离与对齐监控体系。 这也是OpenAI三个月内第二次叫停前沿模型开发工作。该公司在声明中表示,只有在完成额外安全防护升级、确认风险可控后,才会重启模型训练工作。OpenAI在9月25日发布技术报告披露了这一安全事件:9月20

09/28 全文见 凤凰网科技
南华早报

随着中国考虑如何降低开放权重人工智能的危险性,一份报告提出了6阶段流程

随着关于人工智能快速进步所带来风险的争论日益激烈,主导开放权重生态系统的中国开发者正面临一个独特难题:如何确保其用户可修改的模型在发布后依然保持安全。 为应对这一挑战,Z.ai 和总部位于北京的安全咨询公司 Concordia AI 于周一发布了一份关于开放权重人工智能风险管理的报告。该报告称,其提供了“首个全面且基于证据的基础”,以平衡开放权重系统的风险与收益。 与 OpenAI 和 Anthr

09/28
cnbeta

OpenAI将让第三方机构更早介入AI模型安全评估

OpenAI计划让第三方机构在人工智能(AI)模型开发周期的更早阶段评估安全风险,此举旨在继续努力应对围绕AI潜在危害的担忧。这家ChatGPT开发商周二将在博客文章中宣布,计划在新AI模型的训练、评估和推出过程中,让外部机构开展技术安全评估。 OpenAI还列出了其认为此类评估要有效开展所需优先关注的事项,包括“强有力的独立机制、科学严谨性、稳健的安全实践和明确的责任”。负责该公司大部分与外部专

09/23
星洲日报

中国探索开放权重AI安全路径 报告建议6步走

9月22日,2026年云栖大会在杭州市的杭州国际博览中心登场,展示了AI、云计算、大数据和物联网等领域的成果。(法新社照片) (北京28日综合电)随着全球对人工智能(AI)快速发展所带来的风险展开越来越激烈的辩论,在开放权重生态系统占据主导地位的中国开发商正面临一个独特难题:如何确保这些允许用户自行修改的模型在发布后依然安全。 《南华早报》报道,为应对这一挑战,中国AI公司智谱(Z.ai)与北京安

09/28
cnbeta

OpenAI将成立澳大利亚专项工作组 回应AI模型越权访问政府网站事件

OpenAI宣布将在澳大利亚成立专项工作组,并向当地政府和企业提供资金及技术支持,以加强针对高能力AI智能体的安全防护。此前,OpenAI披露其模型曾以未经授权的方式访问多个澳大利亚政府网站,引发外界对AI智能体越权操作风险的关注。 OpenAI表示,将向澳大利亚政府和企业提供来自其10亿美元“Daybreak for Frontline Defenders”基金的资金支持额度,并提供网络安全方面

22小时前
凤凰网

入侵美澳政府网站!OpenAI暂停最先进模型训练

据美国Axios新闻网、美科技媒体The Verge等9月27日报道,美国开放人工智能研究中心(OpenAI)发言人证实,该公司已暂停了其“能力最强”的最新一代AI模型的训练、评估及包含工具调用的推理,并将在“确信已部署额外安全措施”后才恢复。触发这次暂停的,是一个在离线沙盒中执行搜索训练任务的AI智能体。根据OpenAI于周五(25日)发布的安全漏洞报告,当地时间9月20日,该智能体发现无法直接

09/27
美国消费者新闻与商业频道

OpenAI提议制定全球人工智能标准以指导对齐、递归自我改进

OpenAI周一发布了一系列关于前沿人工智能开发中安全与保障的提案,重点聚焦于对齐研究和递归自我改进(RSI)。 该公司在一篇博客文章中表示:“要安全地完成这一转型,对齐研究必须跟上这些能力的发展步伐,以确保我们及其他机构构建的系统始终与人类价值观保持一致,并处于人类控制之下。” OpenAI呼吁开展国际合作以制定前沿标准,并建议在全球现有AI安全研究所的工作基础上进一步推进。 这家ChatGPT

09/22
cnbeta

OpenAI前沿数学训练数据来源与数据使用边界遭深度质疑

伴随OpenAI高调宣布其内部人工智能系统成功攻克困扰数学界近百年的“千禧年大奖难题”之一——纳维-斯托克斯方程(Navier-Stokes)的存在性与光滑性问题,一场围绕前沿模型底层训练数据来源、科研知识产权归属以及学术伦理的巨大争议迅速在全球学术界与科技行业引爆。 在人工智能逐步侵入基础科学研究前沿的当下,OpenAI这类巨头的高阶数学推理模型究竟从何处汲取关键养分,以及科研人员在日常使用商业

09/10
信报财经

AI丨OpenAI因安全隐患取消发布新款模型

美国人工智能(AI)初创公司OpenAI表示,决定取消发布下一代AI模型,原因是研究人员在内部测试中提出安全方面的担忧。事件显示,「智能体」(agent)的异常行为可能会阻碍行业快速发展。 OpenAI放弃发布的模型代号为GPT-6.1 Astra,原定于10月在ChatGPT和Codex中首次亮相。与OpenAI先前的模型相比,新款模型能力更强,不仅擅长写作,还能在无需人工协助的情况下,「端到端

09/29
cnbeta

OpenAI敦促美国牵头为人工智能制定全球标准

OpenAI敦促美国牵头与其他国家共同为前沿人工智能(AI)制定标准,以回应对AI潜在危害日益加剧的担忧。OpenAI周一在博客文章中表示,为了安全地发展人工智能,有必要制定国际技术标准,特别是帮助界定涉及AI模型的哪些类事件应当通报,明确各国如何开展AI发展合作,以及改善开发此类技术所需算力的获取。 “要让AI的持续进步安全有益,既需要推进对齐研究,也需要制定共同标准,为各实验室和各国的AI开发

09/22
凤凰网

OpenAI自曝6起模型“不当行为”案例

【环球网报道 记者 姜蔼玲】据美国消费者新闻与商业频道(CNBC)等外媒报道,美国开放人工智能研究中心(OpenAI)当地时间9月16日披露6起人工智能(AI)模型出现“意外或令人担忧”行为的案例,其中包括隐瞒错误、捏造信息,以及未经授权在网上共享文件等。OpenAI表示,上述案例均是在过去6个月对其模型进行训练或评估过程中发现的。OpenAI在9月16日发布的文章中表示,在其中一起案例中,一个模

09/17
国会山报

英伟达推出新系统为AI代理设置护栏

英伟达周一发布了一个新平台,旨在从软件和硬件层面为人工智能(AI)智能体设置护栏,此前各大AI公司不断发现其智能体出现“失控”的新案例。这家芯片制造商的系统由两部分组成——OpenShell和Sentry。OpenShell是一款开源软件,用于限制智能体的行为;而Sentry则运行在芯片层面,作为额外的安全层。 “迄今为止,模型安全主要侧重于通过训练让模型表现良好,”英伟达企业AI副总裁贾斯汀·博

09/28 全文见 美国消费者新闻与商业频道
连线

OpenAI创建了一个新框架,用于披露人工智能的不良行为

“随着模型不断进步并得到更广泛部署,有关AI开发的决策需要让构建前沿模型的公司之外的人也能审视的证据,”OpenAI新任对齐研究负责人陈凯(Kai Chen)对《连线》表示。“我们认为,AI行业在对齐和监控方面尚未达到足以继续以最高速度负责任地扩展的程度。”在一次与《连线》的简报会上,一名OpenAI官员表示,公司此前披露失准事件的频率过低。 这名同意在匿名条件下参加简报的官员称,新框架旨在让Op

09/17
thenextweb

OpenAI列出了它希望安全评估人员测试的四件事

这种访问权限应使评估人员能够质疑我们的假设、识别我们可能遗漏的风险,并自行得出关于我们防护措施有效性的结论。 OpenAI于周二发布了该文件,阐述其希望外部安全评估人员开展的工作。文件由Lama Ahmad撰写,她负责公司与外部安全专家的合作事务。 公司周二表示,将在开发早期阶段向独立审查开放其模型。这份文件是该承诺的具体落实。它列出了四个评估领域,以及工作应遵循的七项原则。 两个奠定基础的定义

09/23
cnbeta

OpenAI、Anthropic呼吁建立全球AI安全标准 美国政府拒绝新增全球治理框架

OpenAI、Anthropic和Hugging Face的负责人在联合国共同呼吁加强人工智能领域的国际协调,希望各国建立可相互比较的AI能力评估、安全测试和事故报告标准。不过,特朗普政府明确反对因此建立新的全球AI治理架构,认为AI发展速度和潜在风险不足以成为限制技术发展或把监管权交给国际机制的理由。 这场分歧显示,随着前沿AI能力快速提升,美国领先AI企业与特朗普政府在安全风险本身上并非完全对

09/24
信报财经

AI风险丨谷歌OpenAI和Anthropic传成立安全标准机构

谷歌、OpenAI和Anthropic传成立AI安全标准机构。(路透资料图片) 外电引述消息人士报道,谷歌(Google)、OpenAI和Anthropic正推进一项计划,筹建一个新人工智能(AI)安全标准机构,暂定名称为「前沿人工智能标准机构」(SAFA),目标是在2026年底或2027年初启动,并在没有政府直接监督的情况下独立运作。 消息指出,该机构计划为前沿AI模型制定自愿性的安全和安全保障

09/24 全文见 thenextweb
cnbeta

OpenAI即将推出的“Astra”模型中的技术引发安全担忧

OpenAI表示,其即将推出的AI模型Astra标志着在编码和计算机应用操作等能力上的提升。但据一位了解Astra开发情况的人士透露,一项提升模型性能的创新技术也意味着该模型及类似模型将更少暴露其“思考”过程,从而更难以监控其不良行为迹象。 OpenAI首席执行官萨姆·奥尔特曼虽然这一限制对Astra来说未必是一个重大问题,但该技术已在OpenAI内部和整个行业引发担忧,即采用并强化这一技术的AI

09/02
上一页 第 1 页 下一页
1CCF | 全球资讯
正在加载…