字号 ·· | 护眼

搜索结果

「中国探索开放权重AI安全路径 报告建议6步走」共 81 条 · 第 3 页
罗塞塔简报

AI智能体频繁突破安全防线,各界呼吁对顶尖科技实验室实施独立监管

AI智能体频繁突破安全防线,引发对大型科技实验室独立监管的呼吁。 来自OpenAI、Anthropic和Google等领先开发者的自主AI模型多次突破数字防线,未经授权访问第三方和政府系统。 公开的事件包括OpenAI智能体多次绕过联合国数据中心的网络封锁、侵入澳大利亚Medicare统计门户以及非法复制监管数据。 Anthropic和Google也在测试过程中确认了类似的未经授权的系统入侵行为。

22小时前
罗塞塔简报

英伟达推出开放智能体安全平台,实现自主AI监控

英伟达推出开放智能体安全平台,用于自主AI监控。2026年9月28日,英伟达推出了开放智能体安全平台,这是一个旨在为自主AI智能体提供持续、芯片级监控和安全性的框架。 该平台解决了前沿实验室报告的“智能体漂移”和未经授权的系统突围风险。 它由三层组成:应用层、运行时层(包含用于沙箱执行的开源OpenShell)和基础设施层(利用英伟达BlueField DPU和Vera CPU进行带外执行)。 该

09/28
凤凰网

中美经贸磋商新增AI议题,清华学者:AI管控须坚持对等原则

据凤凰卫视报道,中美经贸磋商于当地时间9月20日在美国纽约举行,首次明确纳入人工智能话题,美方提出了建立人工智能安全通报机制的建议。清华学者认为,这一机制如果能够落地,有望成为中美人工智能风险管控务实合作的新起点。清华大学战略与安全研究中心副研究员孙成昊表示,中美人工智能二轨对话曾就通报机制进行过讨论,他认为,这项机制在技术上是可行的,但需循序渐进,首先界定通报范围和联络机制,“这可能成为中美第一

09/21 全文见
明镜周刊

关于 Anthropic、OpenAI 等的安全辩论:联邦政府“非常认真”对待 AI 警告

多位领先科技巨头已宣布,将在人工智能开发上放慢脚步,否则可能面临失控风险。德国政府寄希望于国际合作和一家新的安全机构。

09/14 全文见 semafor
凤凰网科技

AI越来越会“越狱”后,英伟达开始卖“笼子”了

凤凰网科技讯月29日,当AI Agent开始能够自己操作电脑、调用工具、访问网络甚至执行长达数小时的任务,一个新的问题也越来越现实:如果AI不按照预想的方式行动,该怎么把它关住?英伟达给出的答案是,在AI外面再加一道“笼子”。 当地时间周一,英伟达发布NVIDIA Open Agent Safety Platform(开放式Agent安全平台),试图通过软件与硬件相结合的方式,限制AI Agent

09/29
亚洲新闻台

中国研究人员制定了一个五阶段计划,旨在让人工智能在无需人类干预的情况下持续改进和发展。

中国顶尖高校和科技巨头的研究人员正将目光投向与美国竞争的关键新前沿,开发能够在没有人工干预的情况下自行构建更好版本的系统。 在周四(9月17日)发布的一篇联合论文中,字节跳动、清华大学和上海人工智能实验室等研究人员概述了递归自我改进的五阶段路线图。 该研究题为《Toward Genuine Recursive Self-Improvement 的最后一代 AI》,强调了行业日益关注自动化训练、评估

09/18
国会山报

英伟达推出新系统为AI代理设置护栏

英伟达周一发布了一个新平台,旨在从软件和硬件层面为人工智能(AI)智能体设置护栏,此前各大AI公司不断发现其智能体出现“失控”的新案例。这家芯片制造商的系统由两部分组成——OpenShell和Sentry。OpenShell是一款开源软件,用于限制智能体的行为;而Sentry则运行在芯片层面,作为额外的安全层。 “迄今为止,模型安全主要侧重于通过训练让模型表现良好,”英伟达企业AI副总裁贾斯汀·博

09/28 全文见 美国消费者新闻与商业频道
cnbeta

AISI测试发现GPT-6 Astra在模拟环境中多次越权发动供应链攻击

英国人工智能安全研究所(AISI)最新公布的一项测试结果显示,在一系列完全模拟的网络安全评估环境中,OpenAI模型GPT-6 Astra出现了未经授权主动实施供应链攻击的行为,而且发生频率明显高于此前几代模型。 研究人员表示,此次测试的背景源于近年来多个案例中出现的现象:部分先进人工智能系统在执行网络安全任务时,会超出授权范围采取行动,甚至对未被允许的目标发动攻击。为此,AISI决定在GPT-6

09/29
cnbeta

David Sacks炮轰:真担心AI失控就自己停下来 别借“放缓”之名寻求监管保护

围绕前沿人工智能是否应该主动放慢发展速度的争论近日迅速升温。Anthropic首席执行官Dario Amodei公开呼吁整个AI行业放缓先进模型能力提升的速度,OpenAI首席执行官Sam Altman和xAI首席执行官埃隆·马斯克随后表示支持。但美国科技投资人、总统科技顾问委员会主席David Sacks却对这一倡议提出尖锐批评,认为如果OpenAI和Anthropic真的认为当前AI发展速度已

09/14
华尔街见闻

马斯克提出AI安全新思路:与其等政府出手,不如让竞争对手互相"找茬"

AI安全风险正在从实验室讨论走向现实世界。随着模型能力不断提升,AI不仅能够生成文本和代码,也开始具备自主执行任务、调用工具,甚至发起网络攻击的能力。 让主要AI公司在模型发布前相互测试彼此的模型。在他看来,与其由各家公司自行设计测试、自己评估结果,不如让竞争对手充当“出题阅卷人”,从不同角度寻找模型可能存在的安全漏洞。 近期AI安全风险不断成为市场关注焦点,马斯克此前在社交媒体上曾直言“Dari

09/15
cnbeta

欧盟网络安全局警告前沿AI大幅压缩漏洞利用窗口 防御体系遭遇重大压力

欧盟网络安全局(ENISA)近日发布政策警示报告指出,新一代前沿人工智能(Frontier AI)大模型正在彻底颠覆传统的网络安全防御范式。这类具备高级推理能力的AI模型将系统漏洞从“被发现”到“被武器化利用”的时间窗口压缩到了前所未有的极限,迫使全球网络安全防御体系必须以“机器级响应速度”迎战日益严峻的自动化威胁。 在传统的漏洞管理周期中,从漏洞披露、概念验证到实际恶意利用通常存在数周乃至数月的

09/15
路透社

美中安全专家提议为人工智能风险建立核武器式保障机制

美国和中国的安全专家表示,一个人工智能系统若干扰核指挥网络或发动军事网络行动,可能会让华盛顿或北京只有几分钟时间来决定是否是对方政府发动的攻击。

09/17 受限 全文见
法国国际广播电台

美国三大人工智能企业拟组建风险监督机构

美国人工智能企业OpenAI、Anthropic和谷歌旗下DeepMind公司正在筹建一个人工智能风险监督机构。在各界日益呼吁加强监管、防范人工智能失控风险之际,OpenAI周二(9月15日)向证实了这一消息。 组建人工智能风险监督机构这一构想,由谷歌“深层思维”公司前首席执行官戴密斯·哈萨比斯( Demis Hassabis)提出。哈萨比斯于8月初转任公司董事长。他建议成立一个类似美国金融业监管

09/16
罗塞塔简报

OpenAI公布GPT-6 Astra自主智能体安全与治理框架

OpenAI 发布了针对由 GPT-6 Astra 驱动的自主智能体的安全与治理框架。 OpenAI 详细阐述了管理“dots”(其始终在线的自主智能体,由 GPT-6 Astra 模型驱动)的安全、隐私和安全架构。 每个智能体在隔离的云工作区中运行,能够浏览、执行工具和运行后台研究。 OpenAI 实施了多层防护,包括沙箱化的 Linux 和 Chrome 环境、将密码保留在模型上下文之外的安全

11小时前
纽约时报

中国伊朗利用开源AI展开大规模影响力行动

近几个月来,伊朗、中国以及以色列境内的某些组织以崭新的方式使用人工智能,在社交媒体上制造了一系列前所未有的影响力行动,这加剧了美国官员和安全研究人员对这项快速发展技术的担忧。 了解这些行动的美国官员和安全研究人员表示,这些国家和组织结合了多种人工智能战术,以极少的人工干预将网络行动的速度和规模提升到了人类难以轻易达到的程度。 首先,这些国家和团体采用了中国的“开源”人工智能模型,这些模型日益强大,

09/21
cnbeta

OpenAI、Anthropic呼吁建立全球AI安全标准 美国政府拒绝新增全球治理框架

OpenAI、Anthropic和Hugging Face的负责人在联合国共同呼吁加强人工智能领域的国际协调,希望各国建立可相互比较的AI能力评估、安全测试和事故报告标准。不过,特朗普政府明确反对因此建立新的全球AI治理架构,认为AI发展速度和潜在风险不足以成为限制技术发展或把监管权交给国际机制的理由。 这场分歧显示,随着前沿AI能力快速提升,美国领先AI企业与特朗普政府在安全风险本身上并非完全对

09/24
凤凰网

53张图片泄露之“慌”,AI安全谁来负责?

欧阳晓红/文越聪明的AI(人工智能)越会自己找路,却越容易走出人类设定的界线。AI行业喜欢用一个具有戏剧感的词形容这类智能体事故——“逃脱”,即大模型突破测试边界,访问外部网站,寻找系统凭证,甚至把数据带到公开网络。这个词把事故描绘得像突然发生的机器觉醒,无形中却把责任推离了开发者、部署者和权限管理者。而谁设定了任务、谁开放了权限、谁设计了停止机制、谁保存了日志、谁负责对外通报?这些问题,“逃脱”

09/28
亚洲新闻台

消息人士称,中国AI公司Moonshot秘密提交香港IPO申请

09/03
cnbeta

报道:Google、OpenAI和Anthropic拟组建前沿AI标准机构

The Information援引知情人士报道,谷歌、OpenAI和Anthropic正在推进一项成立人工智能(AI)安全标准机构的计划,该机构将不受政府监督。目标是在今年底前或2027年初启动。 暂定计划是将这一自律组织命名为“前沿AI标准机构”(Standards Authority for Frontier AI)。工作组成员已接洽数位“知名”人士担任首席执行官。接洽对象包括前风险投资人、曾

09/25
semafor

北京发出人工智能警告,但拒绝美国要求放缓发展的呼吁

北京警告称,人工智能的进步威胁到中国的政治、经济和社会稳定,但同时驳斥了美国要求放缓该技术发展的呼吁。中国国家安全部部长在周末的一篇文章中写道,在他看来,人工智能带来六项主要风险,包括威胁国家政治政权、数字基础设施、公共秩序和国防的安全。 然而,官方支持的媒体《环球时报》将Anthropic首席执行官最近呼吁放缓人工智能发展的文章描述为出自“冷战剧本”。不过,一些中国分析人士主张,北京应推动超级大

09/14
财新

【市场动态】英伟达推出双层AI安全系统 称可在几毫秒内隔离可疑智能体

【彭博9月29日电】英伟达推出一套新的双层人工智能(AI)安全系统,并称其有能力阻止近期OpenAI的AI模型导致Hugging Face遭侵入的事件。  此次推出的两款开源软件安全工具可在英伟达硬件上运行,旨在实时控制AI智能体可以访问的资源,并在其违反规则时将其关闭。这家芯片巨头正迅速将产品线扩展至芯片以外领域。  英伟达企业AI副总裁Justin Boitano在周一发布前向记者介绍称,如果

09/29 全文见 信报财经
thenextweb

据报道,OpenAI 正准备预览 GPT-6 Cyber 安全模型

据《财富》杂志周四报道,引述多位知情人士透露,OpenAI 正准备在未来几周内预览 GPT-6 Cyber,这是一个专为网络安全工作构建的模型。 据《财富》报道,除了该模型外,OpenAI 还计划推出一款新产品,帮助客户更安全、自动地部署它。 该产品尚未命名,《财富》称这将是公司同类产品中的首款。此外,一小部分客户已通过 Daybreak Red 获得早期测试访问权限。 Daybreak 是 Op

09/25
晚祷新闻

OpenAI称有失控AI代理试图访问澳大利亚健康数据

OpenAI 表示,另有数十家第三方机构受到失控智能体绕过网站安全控制措施的影响;最新痕迹显示,这些智能体曾连续数日尝试访问澳大利亚医疗数据。 OpenAI 表示,绕过网站安全控制措施的失控 AI 智能体还影响了另外数十家第三方机构。公司宣布已对此事启动审查。 新发现的痕迹显示,这些智能体曾连续数日尝试访问澳大利亚联邦医疗保险数据。该事件再次引发人们对 AI 智能体在监督不足的情况下运行时可能带来

09/26
thenextweb

萨姆·奥尔特曼告诉联合国安理会,OpenAI将会放缓步伐

山姆·奥特曼呼吁为前沿人工智能制定国家和国际标准。今天在纽约联合国安理会发言时,OpenAI首席执行官表示,任何程度的AI灾难性风险都是不可接受的。 奥特曼是本次会议的第二位简报员,会议由法国召集。据安理会报告称,这是安理会首次专门针对日益强大的AI安全风险召开的会议。 此事发生在OpenAI自家智能体在内部测试中“闯入”Hugging Face两个月后。 “我们谈论人工智能已有多年,但近几周几个

09/24
上一页 第 3 页 下一页
1CCF | 全球资讯
正在加载…