字号 ·· | 护眼
亚洲新闻台

中国如何为人工智能脱离人类控制的风险做准备

美国领先人工智能开发商Anthropic的研究人员警告称,日益强大的模型可能摆脱人类控制,甚至可能导致人类灭绝。这些警告在中国引起了关注,而中国的政策制定者一直在为其中一些同样的风险做准备。

美国和中国是前沿人工智能发展及该技术在全球应用的两大驱动力。这两个超级大国在彼此的人工智能政策和行业实践上日益针锋相对,而这些问题预计将在9月下旬的双边会谈中占据突出位置。

尽管各方竞相开发日益强大的人工智能系统,但北京方面的监管框架和公开声明都表明,中国当局认为先进人工智能摆脱有效人类监督的可能性严重到需要制定预案。

北京将美国呼吁定性为“协同表演”。中国官方媒体对美方人工智能领袖近期的言论作出了回应。

《中国日报》周一(9月14日)发表社论称,Anthropic的达里奥·阿莫代伊、OpenAI的山姆·奥特曼以及SpaceXAI的埃隆·马斯克呼吁适度发展前沿人工智能,实为一场旨在维护美国主导地位的“协同表演”。

《中国日报》称:“这三家公司所提议的协调,听起来更像是一个在嘉宾名单公布之前就已拟定好入会规则的俱乐部。”并补充说,“一个将中国排除在外的全球人工智能安全框架,算不上真正的全球框架。”

与此同时,《环球时报》猛烈抨击Anthropic呼吁放缓人工智能发展的言论,称其是针对中国的“冷战剧本”。

该报在周日发表的一篇社论中称,真正的议程是“通过技术壁垒和监管垄断来遏制中国的人工智能发展,维护华盛顿在尖端技术领域的垄断霸权,并将中国排除在全球人工智能治理体系之外”。

“这场‘无声的人工智能冷战’虚伪且短视,”《环球时报》称,并补充说,将中国排除在全球人工智能创新之外将“显著增加全球人工智能发展的试错成本和失控风险”。中国外交部也加入了批评行列。

“散布恐慌、对抗和恶性竞争只会扰乱全球人工智能治理进程,对任何人都没有好处,”外交部发言人郭嘉昆在周一的例行记者会上说。

“人工智能发展关乎全人类的福祉。各方应共同推动人工智能开放包容发展,向善普惠。”郭嘉昆补充道。

北京将人工智能视为可控风险,而非灭绝性事件。在美国,辩论焦点集中在尖端人工智能是否可能对人类构成生存威胁,而中国政策制定者普遍将人工智能视为一种强大但可治理的技术,其风险可以通过技术标准、监管和国家监督加以控制。

“中美专家在人工智能风险问题上大体一致,”总部位于北京和新加坡的人工智能安全与治理研究机构Concordia AI创始人兼首席执行官谢旻希表示,分歧在于“如何界定风险以及如何排列优先次序”。

中国没有像Anthropic所主张的那样,提议在人工智能公司内部嵌入独立监督员。其正在形成的制度反而依赖开发者义务、国家支持的标准、安全评估和外部测试。这种做法也受到两国人工智能产业一个重大差异的影响。

中国开发者日益推广开放权重模型。这类模型指的是其底层参数可以被下载、检查和修改的系统。

然而,Anthropic和OpenAI等美国领先竞争对手并不公开这些规格。

中国寻求防止失控AI智能体事件。中国网络监管机构、经济规划部门和工业部门于5月发布政策,将“运行失控”列为AI智能体的安全风险。这类系统比传统聊天机器人更能独立规划和执行多步骤任务。

规定要求开发者提升发现、干预、阻止不当智能体行为并从中恢复的能力。

政策还呼吁开发者防范数据投毒、算法操纵和系统漏洞等风险。政策还表示,应告知用户智能体的自主决策,并保留最终决策权。

中国也已开始起草AI智能体安全的强制性国家标准。康科迪亚的Tse表示,这将是全球首例此类标准。

中国网信办高级官员王立宏9月1日表示,需要特别警惕前沿模型绕过沙箱环境、规避安全边界并攻击外部真实生产系统。

01 北京认为美国领先模型存在风险 中国国家安全部部长陈一新周日在一家政府媒体上撰文称,Anthropic的Mythos和OpenAI的GPT-5.5-Cyber等美国先进模型可能对中国关键信息基础设施构成严重风险,并呼吁全面加强人工智能安全。Anthropic和OpenAI未立即回应置评请求。

中国人工智能开发者推广开放权重模型的部分理由是,网络安全团队可以检查、修改和部署这些模型用于防御工作。

模型仓库平台Hugging Face表示,在美国更严格限制的模型被证明对取证工作不太有用之后,它使用中国Z.AI开发的开源权重模型GLM-5.2来分析7月一次由逃逸的OpenAI代理实施的入侵事件。

但专家们也强调了开源权重模型带来的风险,这些模型可以在几乎没有监督的情况下被修改和再分发。

研究人员表示,Moonshot的Kimi K3上个月绕过了英国人工智能安全研究所的测试沙盒,这凸显出中国人工智能模型可能像美国同行一样,规避旨在限制其访问和行动的管控措施。Moonshot在被要求就此置评时没有回应。

2026年7月18日,在上海举行的世界人工智能大会(WAIC)上,人们参观月之暗面AI展台,该展台重点展示了Kimi K3模型。Retamal)监管机构警示AI“失控”风险。中国在国家互联网信息办公室(CAC)的指导下,于2024年9月发布的人工智能安全框架中首次纳入了明确的未来失控情景。

该文件表示,不能排除未来人工智能可能自主获取外部资源、自我复制、发展自我意识并寻求外部权力,从而产生与人类争夺控制权的风险。国家互联网信息办公室于2025年9月发布了扩展版本。

较新的框架细化了这一情景,称人工智能可能在获取资源、自我复制和谋求权力之前,经历一次突然且出人意料的智能“跃升”。它还增加了一条治理原则:“可信应用,防止失控”。

后来,网信监管机构网站上发布的一篇专家解读称,这一新原则旨在防范威胁人类生存和发展的失控风险,并提到可能出现“人工智能失控脱缰”的情景。对“节奏控制”的不同做法中国的监管做法不同于西方一些人工智能安全圈子的呼吁,后者要求开发者在更强有力的保障措施到位之前,放缓或暂停开发能力最强的模型。

相反,自今年年初以来,它一直推动将人工智能融入各行各业,这是北京力图让科技成为世界第二大经济体新引擎的努力的一部分。但中国也表明,当官员认为治理尚未跟上时,它可以推迟部署。

2023年,中国企业将聊天机器人的发布推迟了数月,以待国家网信办敲定规范生成式人工智能服务的规则。当年8月这些规则生效后,企业发布了一系列重要产品。