字号 ·· | 护眼
南华早报

中国研究人员绘制了通往“人类建造的最后一个AI”的五阶段路径

中国顶尖高校和科技巨头的研究人员正将目光投向人工智能竞赛的一个关键新前沿:开发无需人类干预就能构建更优版本自身的系统。

在周四发表的一篇联合论文中,来自字节跳动、清华大学和上海人工智能实验室等机构的研究人员概述了递归自我改进的五阶段路线图。

这项题为《迈向真正递归自我改进的最后一个AI》的研究,凸显了业界日益关注如何将训练、评估和微调AI模型这一劳动密集型生命周期实现自动化。

论文描述了自主性的五个渐进阶段。在最初阶段,AI 只是执行由人类工程师设计的改进程序。随后,它开始自行选择如何升级自己,而不再只是执行预先编程的指令。

在较后阶段,系统决定它必须获取哪些新信息或经验,并适应部署后的变化。最终阶段将允许 AI 持续改进用于提升 AI 自身的方法。

与聊天机器人纠正单个回答不同,递归自我改进(RSI)要求改进不仅限于单一任务,还能被后续系统继承。

作者认为,将 AI 研究的部分工作自动化的能力,可能成为模型开发者竞争优势的来源。

据作者称,如果这一范式转变得以实现,就可能缩短开发周期,同时大幅削减构建基础模型所需的劳动力和计算成本。

自动化AI研究已成为中美技术竞争的核心战场。尽管中国机构不断取得快速的实质性飞跃,专家指出,美国公司仍保持着早期领先优势,这在很大程度上得益于它们能更好地获取计算资源。

“美国公司似乎仍比中国领先几个月,并且拥有更多可用于部署的计算资源,”人工智能政策与战略研究所高级研究员埃里希·格鲁内瓦尔德表示。“中国研究人员非常擅长从稀缺硬件中榨取性能,但这些计算限制确实仍会产生影响。”尽管面临挑战,中国公司正在加大投入自主训练基础设施。

Z.ai,在中国被称为智谱AI,周日表示将把其最新一轮50亿美元融资净收益的约60%用于支持其下一代GLM基础模型及其“全自训练系统”的开发。

MiniMax 2.7背后的研究人员在今年早些时候一篇题为《自我进化的早期回响》的文章中表示,该模型在执行强化学习实验时能够更新其记忆并构建复杂技能,由此产生的经验会反馈到其学习过程中。

DeepSeek上个月开发了一种代理式“框架”,赋予模型更大的自主权,使其能够处理多步骤任务、执行代码并与外部软件交互。

作者在论文中指出,五个阶段的进展会因人工智能领域的不同而差异很大。软件工程提供了一条相对清晰的路径,而机器人技术和科学发现则面临更陡峭的障碍。

安全仍是另一个主要担忧。研究人员表示,真正的递归自我改进需要严格的保障措施,包括经过验证的测试环境,以确保更新在部署前是安全且有益的。作者没有提供何时能够实现递归自我改进的时间表。