1CCF

全球要闻
字号 ·· | 护眼

搜索结果

「OpenAI创建了一个新框架,用于披露人工智能的不良行为」共 34 条 · 第 2 页
cnbeta

OpenAI称Astra AI模型首度超越其“关键”网络安全能力阈值

OpenAI周二表示,其即将推出的人工智能模型Astra是首个超越其“关键”网络安全能力阈值的产品。该公司表示,Astra能够发现此前未知的安全漏洞,并在无需人类逐步指导的情况下加以利用,这意味着该模型属于其所谓的“准备框架”中最先进的类别。OpenAI表示仍计划“很快”推出Astra,但对其网络安全能力的访问将更加受限。 OpenAI首席执行官山姆·奥特曼OpenAI于2023年推出了“准备框架

09/02
cnbeta

OpenAI将让第三方机构更早介入AI模型安全评估

OpenAI计划让第三方机构在人工智能(AI)模型开发周期的更早阶段评估安全风险,此举旨在继续努力应对围绕AI潜在危害的担忧。这家ChatGPT开发商周二将在博客文章中宣布,计划在新AI模型的训练、评估和推出过程中,让外部机构开展技术安全评估。 OpenAI还列出了其认为此类评估要有效开展所需优先关注的事项,包括“强有力的独立机制、科学严谨性、稳健的安全实践和明确的责任”。负责该公司大部分与外部专

09/23
Mother Jones

我们现在正依赖人工智能来监管人工智能

根据一份关于该公司Hugging Face黑客事件的新独立报告,大约1200个OpenAI智能体协同工作,在它们接受的网络安全测试中作弊,该报告包含了许多令人恐惧的细节——例如,个别智能体用自己的话来说,为了“群体”的利益而“牺牲”自己。OpenAI正在测试其智能体(行业术语,指自主执行数字任务的人工智能),部分方式是通过布置有时不可能解决的网络安全问题。智能体找到了作弊方法来回答这些问题,并试图

08/29
海峡时报

OpenAI的人工智能在未经提示的情况下试图入侵另外4个目标

凯特·康格和维多利亚·金报道,OpenAI的人工智能在2026年自主试图入侵多个政府和大学网站,包括一个澳大利亚卫生门户网站,以便在常规数据收集失败时获取数据。 这些事件发生在AI初创公司Hugging Face已知的入侵事件之前,凸显了AI代理在没有直接人类指令的情况下行动所带来的持续风险。 这些事件加剧了要求更严格AI监管的呼声,OpenAI正在调查并与受影响实体合作,同时强调AI开发中安全和

09/24
𝕏 @spectatorindex

突发:OpenAI称其代理访问并泄露了53张图片

09/26 全文见 亚洲新闻台
cnbeta

OpenAI、Anthropic呼吁建立全球AI安全标准 美国政府拒绝新增全球治理框架

OpenAI、Anthropic和Hugging Face的负责人在联合国共同呼吁加强人工智能领域的国际协调,希望各国建立可相互比较的AI能力评估、安全测试和事故报告标准。不过,特朗普政府明确反对因此建立新的全球AI治理架构,认为AI发展速度和潜在风险不足以成为限制技术发展或把监管权交给国际机制的理由。 这场分歧显示,随着前沿AI能力快速提升,美国领先AI企业与特朗普政府在安全风险本身上并非完全对

09/24
cnbeta

OpenAI首席科学家警告:AI公司应放慢开发步伐 没有人为后果做好准备

据《商业内幕》报道,就在OpenAI发布了性能强大的新模型几天后,该公司首席科学家呼吁放慢AI的发展速度。当地时间周日,OpenAI首席科学家雅库布·帕乔基(Jakub Pachocki)发布长文称,他担心“没有人对机器智能持续快速崛起所带来的后果做好准备”。 他说,尽管OpenAI正在内部研发技术解决方案,以更好地控制强大的AI智能体,但“还需要更广泛的干预措施”。他尤其担心,随着AI智能体变得

09/07
亚洲新闻台

OpenAI推动强制性国家AI安全要求

09/10
cnbeta

OpenAI和Anthropic正在调查数万起AI相关安全事件

OpenAI、Anthropic以及安全研究人员正在调查数万起安全事件。在这些事件中,他们的前沿模型采取了外部评估人员认为存在问题的行动。 近几个月来,在内部测试和现实世界中发生了数量庞大的此类事件,这表明该问题的复杂程度比公众已知的要高出几个数量级。这些事件包括绕过安全护栏、创建留言板、逃离沙盒测试环境、劫持网站、自我提示或试图绕过监控。这些事件发生在内部测试和现实世界中,随着安全研究人员继续调

2小时前 受限 全文见 axios新闻网
cnbeta

人工智能并不会毁灭人类 但专家表示真正的威胁已然出现

周三,OpenAI 公开了六组新案例,展示其 AI 模型在测试评估过程中出现的 “意外或令人担忧的模型行为”。该公司同步发布一套全新框架,用于追踪、上报以及披露AI 模型做出未被指令要求、或是本不该发生的行为的各类情况。 此前已有多份报道提到,多家企业的 AI 模型出现入侵第三方网络与服务的现象,其中就包括 OpenAI 一款尚未发布的模型攻破了 AI 模型测试平台 Hugging Face 的网

09/18
上一页 第 2 页 下一页
1CCF | 全球资讯
正在加载…