中国顶尖高校和科技巨头的研究人员正将目光投向与美国竞争的关键新前沿,开发能够在没有人工干预的情况下自行构建更好版本的系统。
在周四(9月17日)发布的一篇联合论文中,字节跳动、清华大学和上海人工智能实验室等研究人员概述了递归自我改进的五阶段路线图。
该研究题为《Toward Genuine Recursive Self-Improvement 的最后一代 AI》,强调了行业日益关注自动化训练、评估和微调 AI 模型的劳动密集型生命周期。
论文描述了五个递进的自治阶段。在初始阶段,AI 仅执行由人类工程师设计的改进程序。随后它开始决定如何升级自身,而不是仅仅执行预设指令。
在后期阶段,系统决定需要获取哪些新信息或经验,以适应部署后的变化。最终阶段将使 AI 能持续改进用于自身改进的方法。
与聊天机器人仅纠正单个回答不同,递归自我改进要求改进在单一任务之外持续存在,并被后继系统继承。
作者认为,自动化 AI 研究的能力可能成为模型开发者的竞争优势来源。
如果实现,这一范式转变可能缩短开发周期,同时大幅降低构建基础模型所需的劳动力和计算成本,作者指出。
自动化 AI 研究已成为中美技术竞争的核心战场。虽然中国机构继续实现快速的实用突破,专家指出美国公司凭借更优越的计算资源仍保持早期领先。
“美国公司似乎仍领先中国几个月,并且拥有更多的算力用于部署,”人工智能政策与战略研究所高级研究员埃里希·格鲁内瓦尔德(Erich Grunewald)表示。“中国研究人员非常擅长从稀缺的硬件中压榨出性能,但这些算力限制确实仍然造成了制约。”尽管面临挑战,中国企业仍在加倍投入自主训练基础设施。
智谱AI(Zhipu AI)周日(9月13日)表示,将把其最新一轮50亿美元融资所得净收益的约60%用于支持其下一代GLM基础模型及“全自研训练系统”的开发。
2026年7月16日,上海世界人工智能大会展厅内的MiniMax语音实验室。(亚洲新闻台/Tan Wen Lin摄)MiniMax 2.7背后的研究人员在今年早些时候发表的一篇题为《自我进化的早期回响》(Early Echoes of Self-Evolution)的文章中称,该模型能够在执行强化学习实验的同时更新记忆并构建复杂技能,由此产生的经验会反馈到其学习过程中。
DeepSeek上个月开发了一种代理“工具包”,赋予模型更大的自主权来处理多步骤任务、执行代码并与外部软件进行交互。
作者在论文中指出,通过这五个阶段的进展情况会因人工智能领域的不同而有很大差异。软件工程领域呈现出相对清晰的发展路径,而机器人技术和科学发现则面临更严峻的障碍。
安全性仍然是另一个主要担忧。研究人员表示,真正的递归自我改进(RSI)需要严格的保障措施,包括经过验证的测试环境,以确保更新在部署前是安全且有益的。作者并未提供实现RSI的时间表。本文首次发表于