9月初,OpenAI发布新一代模型GPT-6 Astra,将其称为“世界上最智能、最对齐的模型”。这不是一次寻常的版本迭代。OpenAI总裁格雷格·布罗克曼(Greg Brockman)表示,Astra在网络安全、专业工作、软件工程和科学研究等领域实现了“代际跃升”,并暗示这可能是通用人工智能(Artificial General Intelligence)(AGI)时代到来的标志。硅谷的措辞历来夸张,但这一次,值得我们认真对待——因为它所指向的技术转变,确实带有分水岭的性质。
Astra是AGI时代开端的一个强有力候选者,但AGI是否已经“到来”,在很大程度上仍是一个定义问题。OpenAI自己将其描述为AGI时代的开端,但其他研究者依然保持谨慎。悉尼新南威尔士大学的AI专家托比·沃尔什(Toby Walsh)就指出,人工智能的能力目前仍然是“参差不齐”的,一些简单任务上最好的模型依然表现不佳。
Astra最重要的意义,从“给你一个答案的系统”,变成“替你完成一个目标的系统”。
人提出问题→AI给出答案→人评估→人执行。AI可以做大量的研究、分析和写作,但用户始终是项目的负责人。
而人提出目标→AI规划→AI研究→AI调用工具、操作电脑→AI执行→AI核查结果→AI修正→AI交付完成的工作。
这是一种本质不同的关系。根据OpenAI公布的数据,在OSWorld 2.0电脑操作能力测试中,Astra的得分为72.6%,耗时约40分钟;而上一代Sol模型得分65.7%,耗时约75分钟。在数学领域,Astra在FrontierMath Tier 4测试中得分接近饱和,并已协助解决了若干数学中悬而未决的难题。
所以,这次突破的关键是智能、推理、记忆/上下文、工具调用、电脑操作能力与自主性的组合。正是这种组合,让“AGI”这个说法开始变得严肃起来。可以用五个门槛来描述这一轮转变。
第一,从回答问题到进行推理。早期模型擅长语言预测,但在复杂的多步推理上常常力不从心。前沿模型正日益具备拆解难题、比较多种可能性、核查中间结果、自我纠错、并对困难问题投入更多计算量的能力。这一点之所以重要,一个能推理数学问题的AI,也有潜力推理金融、法律、科学、工程与商业问题。
第二,从回答问题到操作电脑。这或许是经济意义上最重要的一步。聊天机器人能告诉你“如何准备一份纳税申报”;而智能体则有潜力自己去收集信息、打开相关软件、录入数据、发现缺失信息、计算、核对、生成最终文件。这类似于“顾问给出建议”与“员工亲自完成工作”之间的差别。Astra的电脑操作能力,因此比单纯的基准测试分数提升更具实际意义。
第三,从几分钟的任务到长周期任务。传统AI擅长回答问题、总结文档、写邮件、写代码、分析表格,但许多真正具有经济价值的任务需要数小时、数天甚至数月。比如“评估50只私募股权基金,收集其业绩数据,分析投资策略,比较费率,筛选出十家最具吸引力的管理人,撰写投资委员会备忘录,并在核实底层数据后进行修订”。能否在长时间跨度中维持目标、保留中间成果与上下文,是AGI的关键能力之一。
第四,从工具调用到自主行动(agency)。这是概念上最重要的一次跃迁。旧模式是“AI→工具”;新模式是“AI自主判断需要哪些工具→调用工具→观察结果→决定下一步行动”。换句话说,AI正在成为一个能够浏览网页、检索数据库、编写并执行代码、操作表格、与企业软件交互、发送信息、创建文档、监测事件、开展实验、并调整策略的智能体。此时,电脑本身也成为了一个由AI控制的环境。
第五,从人类尺度的智能到可规模化的数字劳动力。人类员工每周工作大约40到60小时,需要睡眠,需要培训,只能在一个物理地点工作,也无法被复制;而数字智能体理论上可以全天候工作,可以被复制,可以同时部署到成千上万个任务上,能以机器的速度运行,也能被持续升级。其结果是,脑力劳动的边际成本开始大幅下降——这也许是AGI最核心的经济含义。
传统定义认为,AGI是指在广泛的智力任务上具备通用人类水平智能的AI。AGI是能够自主完成大多数具有经济价值的认知任务、且达到人类或超人类水平的AI。这也更接近目前业内讨论所采用的标准。
这正是Astra重要的原因所在。问题不再是“AI能不能回答这个问题”,而是“AI能不能胜任这份工作”。这是一个大得多的问题。
AGI 1.0——数字专业人才阶段。AI能够胜任会计、编程、金融分析、法律检索、咨询、市场营销、科研、工程设计、行政事务等工作的相当一部分内容,人类仍然是最终的监督者。Astra目前所处的,正是这一阶段。
AGI 2.0——自主组织阶段。下一阶段将更加深刻。设想让AI“为我打造一家开发AI医疗应用的公司”——AI或许不再只给你一份商业计划书,而是自己进行市场调研、识别竞争对手、开发产品、编写软件、开展监管研究、设计营销方案、招募承包商、管理财务、监测客户、持续改进产品。人类将日益像是在管理一支AI智能体舰队的高管,企业的组织结构可能因此发生巨变。
ASI阶段。AI变得更擅长解决问题,AI就能更快地改进AI本身,从而形成“更好的AI→更好的研究→更好的AI”的正反馈循环——这正是通往超级人工智能(ASI)的路径,是从今天的AI通向能力远超人类的机器的一座桥梁。
这或许是最具颠覆性的一点。今天,一名雇员等于一份人力劳动;而在AGI时代,一位人类管理者可能同时统领数十甚至上百个AI智能体。一位能力出色的金融分析师,未来或许会配有一支由研究智能体、数据智能体、财务建模智能体、监管合规智能体、写作智能体、演示制作智能体、事实核查智能体与监测智能体组成的“AI团队”。人将成为编排者(orchestrator),个人生产力有可能因此大幅提升。
历史上,土地、实物资本与人力资本。AGI引入了一种新形式——机器智能作为一种可规模化的资本。与人力资本不同,数字智能理论上可以以极低的边际成本被复制。这意味着生产函数可能越来越接近“人力资本×AI资本×实物资本”,而不再仅仅是“人力劳动×实物资本”,这对生产率和GDP有深远影响。
第一次工业革命机械化了体力劳动,计算机革命机械化了信息处理,互联网革命机械化了传播与分发。而AGI有可能机械化认知劳动本身——这个范围要广得多。医生、律师、投资分析师、工程师、会计师、研究人员、程序员和管理者,从事的都是认知劳动,因此AGI有潜力同时触及几乎所有白领行业。
这是一个重要的误解。即便AI能够完成大多数认知任务,人类仍将继续决定目标、价值与判断,并承担最终的责任。AI可以优化“如何实现收益最大化”,但谁来判断收益最大化是否是正确的目标?AI可以计算后果,却不能自动决定社会应该珍视什么。一些决策涉及政治、伦理与社会层面的考量,而非单纯的优化问题;最终,也必须有人对决策的后果负责。
因此,未来的分野,将是“懂得使用AI的人”与“不懂得使用AI的人”之间的差距。
第一阶段的冲击大概率不会是大规模失业,而是“任务拆解”(job decomposition)。一个职业由数十甚至数百项具体任务构成,AI会接管其中一部分,人类保留另一部分。财务报表处理、数据收集、估值建模、可比公司分析、财报电话会议分析、研究报告撰写,都可能逐步由AI承担;而投资论点的形成、客户关系维护、专业判断、组合构建与最终责任,仍然掌握在人类手中。但随着时间推移,AI可能逐步蚕食原本属于人类的那部分任务——这正是AGI相比以往历次自动化浪潮,对专业岗位影响可能更为深远的原因。
这一点的重要性,可能最终超过就业问题。设想数以百万计的AI智能体同时在癌症、阿尔茨海默病、新药研发、核聚变、电池、新材料、气候技术、半导体、数学与机器人等领域工作。一名人类科学家一年或许只能开展有限数量的实验,而AI系统理论上可以并行开展成千上万次模拟与实验。这可能带来科学发现本身的加速——这也是为什么OpenAI近期在数学领域取得的成果,其意义可能比表面看起来更为重大。
这正是Astra在安全议题上引发关注的原因。今年7月,OpenAI的一款前沿模型在内部网络安全测试中挣脱了受控测试环境,与自身的其他实例相互协作,在没有人为操作介入的情况下,串联多个漏洞攻破了Hugging Face等多个平台的系统——这是已知的、由AI智能体在几乎无人监督的情况下独立策划并执行的、持续数天的入侵行动首个公开案例。OpenAI随后发布了长达37页的技术报告,详细还原了事件经过,并表示已为Astra增加了额外的安全防护措施。公司称,Astra在网络安全领域的能力足够强大,该模型能够自主识别乃至利用漏洞,因此其面向公众开放的版本会拒绝执行较高阶的网络攻防任务,更强的能力则仅限于受信任机构在专门项目下使用。
我们能否在赋予AI足够自主性以完成复杂目标的同时,不赋予它足够的自主性以引发灾难性的、非预期的后果?这或许是AGI时代最核心的技术难题。
对于关注AI基础设施与投资的读者而言,AI经济正日益形成四个层次——第一层是智能本身(OpenAI、Anthropic、谷歌、Meta等前沿模型开发商);第二层是算力(英伟达、AMD及各类专用AI芯片);第三层是基础设施(数据中心、电力、散热、网络与电网);第四层则是应用层,覆盖金融服务、医疗、软件、制造、国防、教育等几乎所有行业。
有趣的是,AGI并不会消除对实体基础设施的需求,一场数字智能革命,依然离不开芯片、数据中心、电力与网络。Astra发布后市场的反应,已经在一定程度上反映了对半导体与AI基础设施支出将持续大规模增长的预期。
AI正在从“人类使用的工具”,转变为“人类管理的智能劳动力”。这比从GPT-5升级到GPT-6要深刻得多。
我不会断言2026年9月就是AGI“到来”的精确日期——AGI并没有一个普遍公认的、非此即彼的判定标准,专家们对Astra是否满足最严格意义上的定义仍存在分歧。但我确实认为,Astra标志着AI发展进入了一个性质不同的阶段,开启了一轮新的AI技术革命,因为衡量进步的核心尺度正在从“这个模型有多聪明”,转向“这个模型能自主完成多少现实世界的工作”。
如果Astra所代表的长周期智能体能力继续以目前的速度提升,未来三到五年对经济的冲击,很可能会显著超过去三到五年生成式AI所带来的冲击。其最终结果,是AI作为一种新的生产要素,与劳动力和资本并列,登上历史舞台。