
一个好的操作系统,需要能够聚合硬件生态和软件生态的势能,形成规模效应,一方面为最终用户创造价值,一方面为要素生态创造价值,并且能抵御竞争对手。图:视觉中国
大模型自身正在形成一个价值数万亿美元的巨大产业,并且决定了整个AI价值链的价值锚点。是时候讨论大模型的产业格局了。
2026年初以来,在Anthropic打开大模型编程的天花板,创造了可以被称为硅基劳动力的现象级产品之后,其年化收入(ARR)奇迹般地逐月跳升,很多人认为这种指数级的增长在几年内都不会放缓,也一度认为大模型的产业格局将会很快收敛到Anthropic和OpenAI的双寡头格局。
但7月似乎是第二个“DeepSeek时刻”:Kimi K3、DeepSeek V4 Pro、智谱GLM 5.3、Qwen3.8、Muse Spark1.2相继发布,每一款开源模型均在代码任务和智能体任务上匹敌Claude Opus 4.7,而上一代Opus 4.6曾被认为在智能体能力上是跨越了奇点时刻的模型,现在看对开源模型也非难事。
越来越多的开发者和企业开始使用开源模型,可以看到三个趋势:首先,如图1,在第三方调用的OpenRouter平台上,以Anthropic、OpenAI、Google(所谓“御三家”)为代表的闭源模型,其token占比已经从一年前的超过60%下降到41%,很多观点预期明年开源模型的token消耗量会占到80%甚至90%以上。其次,Silicon Data编制的大模型token价格不断刷新新低。再次,Palantir、Cursor、Harvey等AI原生应用公司都公开宣布已经在基于中国开源模型训练自己的模型。
这些产业趋势的演变,与产业需求的不确定性交织,引发了大量的疑问和恐惧:
第一类是闭源大模型的商业模式问题:
闭源大模型是不是会逐渐丧失token溢价权?因此,其ARR增长是不是不可持续?
大模型的未来是不是最终会商品化?如果没有可持续的护城河,Anthropic和OpenAI是不是不值万亿美元?
第二类是大模型产业的竞争格局问题:如果能力上拉不开,那么企业是不是都会因为成本、数据主权等原因倒向开源大模型?
第三类是对市场总需求以及资本开支回报率的担忧:如果开源模型厂商在算力差距如此巨大的情况下,仍然能保持着模型能力不掉队,是不是意味着根本不需要那么多资本开支?比如,K3发布当周,费城半导体指数大跌10%。
回看科技产业发展历史,曾经出现过多次大大小小的基础设施“开放系统vs封闭系统”之争,比如PC市场的Windows(开放)和 Macintosh(封闭),移动市场的安卓(开放)和iOS(封闭)等等。
但历史并没有标准答案告诉我们谁将胜出。曾经有很多人“依葫芦画瓢”地在2010年代初期预言苹果在移动时代注定失败,包括当时的微软CEO鲍尔默。他们的理由就是开放的Windows曾在PC时代遥遥领先于苹果的Macintosh。
在这篇文章中,我们先回顾PC市场和智能手机市场的两段历史,看看这些问题是如何被回答的:当时的需求方倒向开放或封闭的原因是什么?开放会不会把系统变成商品?封闭系统有什么应对之策?系统层本身如何赚钱?
有几点是肯定的:第一,这涉及产业经济学的演绎,而非简单的开源与闭源之争;或者可以这样说,开源与闭源只是产业演化的不同路径,而非产业演化的本质逻辑。第二,在PC和移动市场的演化史中,核心企业往往会犯重大的战略认知和决策错误;我们相信这次也不例外。
在对历史理解的基础上,我们再回到当下的AI大模型产业,分析逻辑、可能的演化路径和终局。
PC系统之争:IBM、微软与苹果
先来看PC。
在PC产业早年的快速发展期,年销量从1981年的144万台上升到1990年的2000万台,9年增长14倍。但PC的基础设施格局,在很长时间是无数玩家的混战:在整个80年代,先后有超过14套操作系统出现(图2),同一时间在货架上竞争的通常超过5套;硬件玩家就更多。早在1982年,当时最主流的CP/M系统(这是Digital Research公司在1974年发布的操作系统)就已经被授权给了450款以上的PC机型,对应几十家做电脑硬件的厂商。直到80年代后期,微软的DOS系统才脱颖而出,逐渐占据主导。
回看这段历史,一个极有趣的商业问题出现了:当时的主要玩家,面对新生成的产业,是如何理解其逻辑,并做出战略选择的?
首先看那个时代绝对的科技巨头IBM,其眼中的产业愿景(vision)。IBM看到的是,PC是一种大型机的延续,最大的需求在企业端。但是,对这些企业来说,400多款机型、十多款操作系统、互不相通的软件生态,简直是灾难,无法大规模采购。
这个观察当然是对的。但不幸的是,IBM的落脚点放在了,把硬件、操作系统、软件生态都开放,让每一层都尽可能有更多玩家参与进来,IBM可以强化自己的议价能力,自己作为定义标准的整机厂,拿走最多的品牌溢价。毕竟,从大型机时代起,企业市场盛传的一句名言就是“没有人会因为采购IBM而被开除(No one ever got fired for buying IBM)”。在这个愿景下:
在硬件层,1981年,IBM推出了自己的第一款PC 5150,同时公布了一份详细的技术清单,目的就是希望吸引各类扩展卡厂商(比如显卡、硬盘控制卡、内存扩展卡、声卡等)加入到自己的硬件生态中,让这台电脑更好用。而且,IBM希望同一个环节的供应商越多越好。一个著名的例子就是,因为IBM不希望看到在CPU上只有英特尔一家供应商,要求其必须将x86架构授权给第二供应商才愿意继续合作,因此才有了AMD。
在系统层,IBM在PC上提供三个系统让客户自己挑:微软提供的PC DOS(图2中的浅蓝色系方块)、Digital Research提供的CP/M-86(图2中左侧绿色方块)、SofTech提供的UCSD p-System。但作为当时的主流开放系统,CP/M-86犯了两个错:一是更新太慢,没有赶上和机器一起发售,CP/M-86直到IBM PC上架6个月后才更新;二是太贵,微软的PC DOS只卖40美元,而CP/M-86卖240美元。最后,根据调查,96.3%的IBM PC订单选了DOS,只有3.4%选CP/M-86。到1983年2月,CP/M-86把价格降到60美元,但为时已晚。
在软件生态层,IBM在公开技术清单中公布了自己的BIOS(Basic Input/Output System)源代码,就是为了能让尽可能多的开发者都可以为IBM PC写软件,没有审核、没有分成。到PC发布满一年时,已经有753个第三方软件包,是同期Mac的4倍。1983年1月,Lotus1-2-3上市,这款电子表格软件真正把IBM PC带进了办公室,第一年的销售额就超过5300万美元。
这是一个产业龙头制定产业标准、同时全方位开放的战略。其效果怎么样?一部分的事实确实如IBM所想:PC成为一个企业需求主导的市场,企业客户占到了当时2/3以上的市场份额。更重要的是,它把硬软件标准收敛到了BIOS。在此之前,CP/M到1982年已经被授权给450多种机型,但那些机器彼此不兼容,意味着同一个软件要为每台机器单独出一个版本。IBM PC带来的新东西是硬件标准的统一,从而带来软件层面的兼容:从此以后,几百家厂商造出来的机器可以跑同一个软件,对软件提供商来说,写一次就能卖给所有人。
这本来是操作系统应该做的事情,但IBM自己却没有做操作系统。所以产业的发展就不如IBM所愿:一方面,硬件标准的开放,除了吸引了一批互补的供应商,也吸引了更多的竞争者,在1984年Phoenix公司做出了IBM PC兼容BIOS后(IBM仍然是标准,但技术不再是IBM独有,有很多兼容版),出现了几百家硬件整机厂可以生产类似的PC,比如戴尔就在这个浪潮中崛起。另一方面,因为IBM没有和微软签约操作系统的独家授权,每个硬件的竞争对手都能直接找到微软装上操作系统。这是巨大的失误,如果系统的独家授权在IBM手上,别人即使能造出机器,也装不上能跑软件的系统。
可以这样说,IBM的假设是自己产业龙头的地位不会改变,没能理解未来产业的竞争格局以及和自身的关系,更是低估了操作系统的重要性。产业标准的统一,实际上成就了一批竞争者。这里的教训是,在新技术面前,不理解未来产业格局的逻辑和趋势,是在位者常常犯下的错误。
再看微软。
1980年时,微软只是一家很小的软件供应商企业。其原先的主业就是将BASIC解释器(当时的编程软件)授权给几十家不同的硬件厂商。等IBM找上微软做操作系统时,微软也争取到了同样的条款:非独家授权,即同一套操作系统,微软可以保留并授权给其他厂商。
微软和IBM的开放实际上是完全不同的。IBM为了卖硬件,开放的是配方;微软是卖系统,开放的是使用权,但系统源代码从来都是封闭的。最终,第一种开放让自己受到竞争冲击,第二种开放让自己不能被绕过。
而微软不但傍上了IBM的大腿,而且赶上了IBM努力创造出来的标准硬件时代。在此之前,Digital Research已经在把系统使用权卖给整机厂了,但因为机器之前互不兼容,换不来任何规模效应,那不是一个很大的市场,而是450个小市场,没人有能力覆盖那么多市场。
微软那份非独家授权之所以值钱,是因为到了这个阶段,它的系统能跑在几百家厂商造出来的PC上。作为一个成长中的创业企业,微软自己最初也不确知哪个系统最可能成功。整个80年代,微软同时押注了四种系统(和IBM合作衍生出的MS-DOS、AT&T授权的Xenix、和IBM联合开发的OS/2、Windows),Windows甚至是其中最不起眼的。
最后看苹果。
苹果看到的需求来自消费者而非企业。乔布斯认为当时的电脑过于难用,无数的普通人都被命令行挡在门外。所以,苹果希望把计算机做成一个开箱即用、界面顺手、没有任何技术门槛的产品。
而在1984年的技术条件下,要达到这个目标,只有一条路径:那就是硬件和操作系统的一体化设计,软件层同样是无保留地开放给第三方(无审核、无分成)。
因为对硬件和操作系统的封闭,苹果不拥抱第三方硬件整机厂,其代价就是失去了定义行业标准的机会。但在当时,苹果并不相信这一点。
1985年6月,比尔盖茨给当时的苹果高管(乔布斯刚刚被赶出公司)写了一份备忘录:“苹果必须让Macintosh成为标准。没有任何一家个人电脑公司,连IBM都不行,能在没有独立第三方支持的情况下创造一个标准。”意思是,建议苹果把Macintosh系统装到更多第三方电脑上。
但对于苹果来说,一方面他们不认为第三方能造出一样体验的好电脑,另一方面,当时苹果的硬件毛利率高达55%,没有任何动力转向去做一项每台机器只能收取几十美元的系统授权业务,当时的Mac部门负责人加西在内部强硬表态:“放弃55%的毛利是愚蠢的”。他的判断是,苹果的Macintosh系统在图形界面上(GUI)是最领先的,不会遇到真正有意义的竞争,靠硬件赚毛利才是正道。这是肥水不流外人田的思路。
最终,不太开放的苹果做到了让自己不可复制,但同时也丢掉了指数级的扩张能力,它的增长天花板就是自己的产线能力。相比之下,Windows的体验虽然始终不如Mac,但到了1990年的Windows3.0以后,它已经“够用”了,一旦乘上几百家工厂的产能,后来发生的就是大家熟悉的历史:1995到2000年,全球PC市场从5000万台涨到1.38亿台,而Mac的年销量几乎原地不动、甚至略微下降(412万台到384万台),份额从8.2%掉到2.8%。
回到1980年,没人能准确预见Windows的胜出:IBM是当时计算机产业的龙头,CP/M是当时操作系统的领先者,Unix被很多人看好(AT&T开发)、苹果的GUI遥遥领先,而DOS则是一个刚刚被一家名叫微软的创业公司收购的、朴素的命令行系统。
我们能从中学到什么关于操作系统的逻辑?DOS是“涌现”出来的,还是有可以复制的产业逻辑?
第一,最重要的商业问题,不是要不要开放,而是如何理解、定位和塑造产业格局。面对PC这样一个正在生成的包括硬件、操作系统和软件的巨大产业价值链,显然可以预料到有很多产业玩家的加入。IBM、微软、苹果,实际上代表了三种不同的产业愿景以及答案。
第二,如何开放?开放是重要的战略选项,但最大程度的开放并不等于最大的生态,也不等于最高的商业价值。或者说,开放的程度不决定终局,开放能留下什么才决定。IBM全部开放,什么都没留下,对手做出兼容的BIOS硬件标准后就被绕过;反之,微软开放了使用权,留住了源码和非独家条款,谁想装系统都得来找它。
第三,如何打造好的操作系统飞轮?好的操作系统并非随机涌现,而是一种主动设计,能同时激发整机层和应用开发者的大规模参与,实现规模效应。它的打法就是通过定义硬件层的标准,带来装机量,让软件的开发者得以“写一次就能卖给所有人”,形成硬件、操作系统、软件生态的正向飞轮。CP/M的教训在于,当时已经有很多整机厂和软件开发商,但没有在系统层主动标准化,最终就沦为450个定制化的小市场。
第四,如何建立先发优势?在硬件标准出现后,系统需要快速与其绑定形成真正的先发优势。IBM PC在推出时,籍籍无名的DOS系统随着它一起出厂,卖40美元;在此之前最主流的CP/M更新仅仅晚了半年,卖统一标价的240美元,但就丢掉了整个市场。怎么找到哪个标准会最终胜出?微软的解法是多头下注,寻找涌现中的确定性。
第五,通过差异化的产品可以带动操作系统,但其势能取决于产品与市场阶段的适配度(Product-Market-Fit)。乔布斯看到的未来自然是对的,苹果的产品体验也一直是最好的,但当时PC市场的真实状态与节奏并不如他所想:在需求侧,PC仍然是企业买家主导,过渡到消费者市场还需要时间,在这个过程中,企业需要的是标准、价格、兼容、可控,而苹果却从未进入过这个市场。在供给侧,整机和供应链的制造能力都有限,并不是那么平民化、低门槛,也需要时间发展。再加上管理层当时对卖机器的路径依赖。因此,当时的硅谷连续创业者Steve Blank曾如此评价:“苹果没有实现PMF。”在当时PMF的背景下,苹果只能做成一个小众市场的价值链领导者。
所以,在PC产业的形成阶段,大家都是“摸着石头过河”。IBM以当时的王者自居,尝试了最大程度的开放,却丢掉了市场。苹果最封闭,其结果是做成了体验最好的小众市场。CP/M受困于早期惯性,为很多种计算机提供定制化系统,但是没有看到通过主动设计促成硬件、系统、软件兼容性的规模价值,产品太贵也迭代太慢。微软开放的是使用权,封闭的是系统源代码,让使用者无法绕过自己,同时多方押注和各种硬件兼容的系统,直到Windows胜出。答案是:胜出的关键不是一定开放或者封闭,而是哪种模式能最大化产业的规模效应,包含建立绕不过去的护城河。
智能手机系统之争:诺基亚、谷歌安卓与苹果
智能手机产业与PC产业不同之处在于,这些手机厂商完整地“观摩”了整个PC的发展历史,并在此理解基础上建立自己的商业。
这就是塞班系统的初衷,首先是防止重现类似微软在PC系统中的垄断地位。
早在20世纪末,手机的操作系统就已经基本完成了大一统,没有出现1980s初那样十几个PC系统混战的局面:在1998年,塞班系统就已经出现,由Psion、诺基亚、爱立信、摩托罗拉四家公司合资成立,后来三星、西门子、松下、索爱都陆续入股。当时微软正在用Windows CE系统进入手机领域,这些手机公司担心自己最终沦为戴尔、康柏这样的整机制造厂,受制于微软。因此,四家公司决定建立一个“行业共有的操作系统”,所有人都可以通过授权使用,也就是手机系统里的Windows。在此后的十年里,塞班系统也确实抵挡住了微软的竞争,如图4所示,到2007年底,塞班系统占据全球智能手机市场的64%,遥遥领先第二名的Windows Mobile(12%)、第三名的黑莓(10%)。
但实际上,塞班系统有两个问题。第一,因为系统一样,这群共同持有塞班系统的整机厂,都只能在硬件或者界面上做出差异化,于是就出现了三套互不兼容的界面:S60(诺基亚、后授权给三星、LG、西门子、松下、联想)、UIQ(爱立信、摩托罗拉、索爱)、MOAP(日本的富士通、三菱、夏普)。意思是,软件开发者仍然要为三套界面独立开发,本质上仍然是不同的系统。
第二,塞班系统被诺基亚控制。到2007年,全球已经有几十个手机品牌,每一家都不想只做利润微薄的整机厂。而彼时的塞班系统已经事实上成为了诺基亚的“一言堂”(股权占48%,出货量占近80%),由诺基亚来决定这个系统的路线图。于是,对很多手机厂商来说,塞班系统成为了一个“由竞争对手持有的Windows”。
塞班系统的这两个问题,造就了安卓的机会。2007年谷歌推出了代码开源、免费的安卓系统(2005年收购团队,2007年11月推出):三星、LG、HTC、摩托罗拉(过去都是通过授权使用塞班或者Windows Mobile)一夜之间都成了安卓开放手机联盟(OHA)的创始成员,承诺互相兼容。
而且,谷歌做安卓的初衷从来不是为了要成为一家手机厂商,而是为了防守微软。谷歌创始人曾经多次解释过,最初推出安卓系统就是因为担心微软的Windows Mobile系统最终会在手机生态中占据更大份额,然后再把自己的搜索引擎挡在门外。所以,谷歌是用搜索广告的账在算安卓的收益,APP商城的30%分成全部补贴给了运营商(当时手机的主流渠道),唯一的目标就是加速安卓系统的普及。最后,谷歌几乎是用一种IBM的方式(完全开源)成功击败了“手机里的Windows系统”塞班,唯一的区别就是谷歌不做整机。如图5所示,安卓系统仅仅用了三年,就从不到5%的市占率上升至50%以上,而塞班则从47%降至12%。
诺基亚也做出了反应:2008年6月,安卓系统发布后仅半年,诺基亚就宣布了对塞班系统的全资收购,并成立基金会尝试做开源。但是,塞班系统的开发门槛远高于安卓,而且到2010年2月才正式公布代码,以及仍然改变不了手机厂商对诺基亚的不信任。也就是开源太慢、不好用、不被信任,三个问题。最后,到了2011年,塞班基金会关门,失去系统主导权的诺基亚投奔Windows阵营。
再看智能手机时代的苹果。
如果说安卓在覆盖度上是成功的,那么苹果在商业上显然更加成功。苹果在手机上的打法和PC时代别无二致,但为什么PC时代苹果被压制到3%市占率的小众市场,而在手机时代,苹果却拿走了70%以上的行业利润呢?
我们认为,这和手机产业当时市场状态(Market)非常相关。或者说,产业当下阶段的本质特征会决定开源或者闭源的竞争力。
第一,和PC时代不同,这一次苹果面临的市场环境是,供需双方都走到了一个可以匹配的阶段,而iPhone开启了这个PMF的飞轮。需求侧,智能手机是一个ToC市场,垂直整合换来的先进体验在这里可以得到溢价和粘性;供给侧,苹果从2004年起就把生产外包给了富士康,产能限制问题已经很小。
在智能手机出现之前,手机市场一直是一个ToB市场。当时,手机的主要功能就是通话和短信,其次才是APP应用,主要的手机购买渠道和场景也是运营商的网点(比如美国的AT&T、Verizon,中国的电信、移动、联通)。运营商的话语权极大:可以直接决定手机的规格、品牌、预装系统、预装应用等等,就连软件应用的付费渠道都是话费支付,所以应用的价格也由运营商决定,而且他们会分走其中的30%-50%。
iPhone则是通过一种全新的产品组合,让智能手机成为了一个ToC市场,消费者对体验的追求成为第一优先级。在2007年初的初代iPhone发布会上,乔布斯就说:“这是三合一的产品:一台宽屏iPod、一部手机、一个上网设备”。在当时,iPod MP3已经是一款累计销量达到1亿台的爆款消费电子产品,其iTunes生态中已经有数千万绑定了信用卡的订阅用户;这一切(从外观设计到生态)全部被平移到了iPhone身上,成为重要的种子用户基础。从iPhone发布开始,其销量连续三年都是翻倍增长,从2008财年1160万台上涨到2011财年7230万台;而同期,作为龙头的诺基亚仅从7000万增长至约1亿台。
到2008年,和苹果签订了独家销售协议的AT&T披露,iPhone激活的用户中,约四成来自其他运营商。人们开始意识到,消费者是会为了一款手机的体验而改变运营商的。也因此,手机厂商和运营商的关系开始被扭转:AT&T和苹果的协议中规定,AT&T不能对iPhone的产品做出任何形式的干预,甚至iPhone用户每个月交给AT&T话费,必须分给苹果一部分(据报道,新用户每月10美元,其他套餐转过来的老用户每月3美元,为期2年)。
而那些在ToB市场中胜出的玩家,比如诺基亚和微软,PMF的重塑就变成了最经典的“在位者的窘境”问题:坚持为现有用户创造价值,但用户市场已经被重新定义了。
第二,安卓的完全开源模式,没有考虑到硬件厂商的动机,反而又造成了软件开发者的负担,最终又失去了在开发者生态上的优势。谷歌之后十年的兼容认证和服务套件都是在补这个短板,一直持续到今天。
安卓的完全开源让整机厂蜂拥而入,随之而来的副作用就是机型和系统版本的爆炸:到2013年,市面上已经有上万种安卓设备,每个厂商都根据自己的设计改造安卓系统。这对于软件的开发者来说是一场灾难:虽然确实是只需要开发一次(相比塞班的优势),但因为每个设备的屏幕尺寸、像素密度、后台进程规则、权限弹窗等等都不一样,一个APP要测试几百次。
于是,在2010-2015年间,软件行业不成文的标配就是先做iOS版,比如,Instagram在2010年10月就上线iOS系统,但到了18个月后才上线安卓。也因此,在这期间,虽然安卓的装机量已经是iOS的3-4倍,双方实行一样的分成政策(30%比例),但安卓的应用商店的收入却只有iOS的一半。
最终,消费者为体验付溢价(并不关心是否开源),开发者为一致性付优先级,两笔钱都流向了封闭系统的一方,这就是苹果用一到两成的出货拿走七到九成行业利润的原因。
和PC产业一样,各种玩家在一开始并不知道智能手机产业的未来。如果站在智能手机的元年(2007)时,当时可以看到的是:占据市场半壁江山的塞班(60%+)、在企业市场近乎垄断的黑莓、PC系统王者微软做出的Windows Mobile,一个刚刚被谷歌收购2年、没有任何一台机器的项目安卓,以及一家从未做过手机的电脑公司苹果。老对手鲍尔默的著名断言“iPhone没有任何机会”,在当时其实是共识。
那么,总结智能手机操作系统的发展历史,我们又可以学到什么?
第一,最开放的玩家,也就是安卓,仍然没有拿到最大的商业价值。安卓为了防御微软,通过极致的开源追求装机量,但却没有留下任何抓住整机厂的钩子,反而造成了软件开发者市场的规模不经济。
第二,做操作系统的玩家需要被信任,否则难以最大范围地聚合要素:开放系统需要有被硬件层信任的拥有者,做不到就无法创造硬件层的规模效应。这是安卓击败塞班的秘诀,也是在PC时代,IBM被微软打败的道理。IBM是当时最大的整机厂,而Windows在当时是一个第三方,没有直接的利益冲突;微软直到2012年才开始做自己的Surface Laptop,而且一直是一个次要业务。
第三,闭源也能聚合开发者生态,达到规模化的竞争力:因为智能手机生产制造的平民化(即硬件层的规模效应可以通过供应链完成),操作系统的第一性原理就是能创造应用开发者层的规模效应,即“写一次就能卖给所有人”。这种规模效应需要两个前置条件:足够的装机量,以及系统的一致性。PC时代的苹果做到了系统的一致性,但是装机量不够;在智能手机时代则因为产品体验的先进性可以做到。
第四,PMF会决定操作系统的势能,无论开源与否。这是苹果从一家从未做过手机的电脑公司,转变为全球最大的手机厂商的关键:智能手机是一个ToC市场,消费者在意手机的设计和界面,喜欢随处可见的零售网点等符合消费者偏好的特征。一直坚持做ToC业务、充满创意的苹果在这个阶段抓住了PMF的势能;而习惯了ToB(运营商体系)销售的老玩家们,即使看到了、反应过来了,也无法改变自己的路径依赖。
总之:
1、汲取了PC产业的教训,智能手机产业操作系统的形成,是从防御微软开始,这也注定了微软无法成为智能手机的操作系统。
2、同理,由诺基亚主导的塞班系统,也难以解决不被其他手机厂商信任的问题。
3、由此应运而生、本身不做手机的谷歌,收购和大力促成了安卓系统的最大普及,但安卓的完全开放,带来的是一定程度的规模不经济和同质化竞争。
4、iPhone抓住了2C智能手机的大机会,在需求侧能够享受产品和品牌的差异化溢价,消费者并不关心是否开源;在供给侧既能放量生产,还能让开发者生态享受红利。这个在消费者体验势能下,整合了硬件和系统的一致性,并且能促成开发者生态繁荣的闭源操作系统,成为利润的最大赢家。
作为操作系统的开源与闭源模型
今天,基础大模型是AI操作系统的一个核心部分。
如图6纵轴所示,如果对比PC或者手机,往底层看,云计算就是新一代的整机厂,半导体是整机厂的供应链;往上层看,Harness(驾驭系统)就是新一代的操作系统配套服务,就像当年的商店、预装应用,也是操作系统的一部分,各类智能体就是今天的应用层。我们可以带着对历史的总结、对AI产业的认知,理解当下正在发生的一些趋势和未来。
可以看到,不同的大模型公司,组织整条价值链的方式非常不同,已经至少有五类选择(如图6):Anthropic(模型和 Harness 都闭)、OpenAI和SpaceX(模型闭源,Harness开源)、英伟达(开模型权重、卖卡)、月之暗面和智谱(开权重、向云收分成)、DeepSeek(全开)。
历史告诉我们,无论PC、智能手机还是AI,操作系统的竞争逻辑是一样的,我们需要知道几个问题:买家是谁、买的是什么、他们根据什么下决定,这决定了应用会往哪个系统收敛、先发的系统能不能守住、垂直整合或者开放的系统有没有人买单。这些才是更重要的问题,而非开源与闭源的取舍。下面我们先站到企业买家的位置上,把它面对的三个问题看清楚,最后再回到历史、判断未来。
(注:在文章《陈龙:大模型2.0阶段拉开大幕》中我们曾经论述过对于这个阶段的AI来说,ToB更加重要,所以在本文中,我们因篇幅原因主要讨论企业AI市场)
这一次,企业买的不是PC这样的标准化硬件,而是硅基劳动力。可以想象一下,站在企业主的视角,雇佣一个劳动力的时候,主要会考虑什么因素?
第一,价值创造和成本问题:这个人每小时的产出值多少钱,我每小时要付给他多少钱?
第二,适配度问题:这个人的聪明才智能不能适配到我的业务里?否则再聪明也白搭;
第三,可信度问题:这个人好不好管理?比如他会不会越权查看不该看的信息、会不会同时给我的对手干活、会不会哪天突然不干了自己去开一家一样的公司?
把这三条对到大模型上,就能理解当下正在发生的很多事情:
第一个是价值创造和成本问题。
如果看token单价,似乎闭源大模型没有任何胜算:Fable的百万token单价约50美元,中国开源模型约0.5美元,差两个数量级。当企业的token账单一年内涨了21倍时,每个CEO、CFO都必须控制账单,第一反应就是换便宜的、或者设置上限。所以,我们看到,Meta在2026年5月下架了内部token消耗量排行榜,Uber在6月为每个人设置了1500美元/周的上限。这也是7月资本市场恐慌的推手之一,即对大模型收入可持续性的质疑。
但事实却是,Anthropic和OpenAI在企业支出中的占比不断攀升,7月达到了83%。为什么会这样?一方面,闭源大模型本身也在推出性价比的系列,比如OpenAI在9月22日发布的GPT6-Luna,其输入输出的token单价已经低于DeepSeek(但缓存价格还是更高);更重要的是,token单价本身就是一个狭隘的理解模型性价比的指标。很多单价便宜的开源模型,其工作方式是用更长的思维链反复试错,再靠Harness里的规则兜底,逼近前沿模型的水平。同一个任务,它要跑更多的token、更长的时间。
所以,对于企业来说,真正买的是完成任务的效率,不是token本身。而一个任务的成本其实是四项相加:1)token的数量乘以单价,2)Harness和工程所需的投入,3)等待的时间,4)犯错的成本。这四项成本在不同场景下显然差异很大:对于边界清楚、结果可验证、对速度不敏感的任务,开源模型的优势非常明显。比如Chamath(美国著名投资人)做过一个实验,同一个代码迁移任务,同一套Harness框架,GLM 5.2比Opus4.8便宜16.4倍,但也慢3倍;如果换成边界不清、需要判断、错一次代价很高的任务,多出来的token、时间和返工会把单价的差距完全吃掉,甚至开源大模型的成本更高。
如图7所示,如果区分有边界、可衡量、对速度不敏感的任务,以及长程、无明确可衡量目标的任务,按总体的任务成本计算,开源和闭源模型的差距其实远远小于token价格的差距。开源大模型并非就更有性价比,而是在哪类任务里,哪个模型更有性价比。换句话说,开源和闭源本身就不是一个零和取舍的关系。
第二个是适配性问题。
大模型和企业的适配是通过Harness完成的。模型提供的是通用智能,Harness提供的是一个接口,可以接入“这家公司特有的一切信息”:数据在哪、流程怎么走、谁能看什么、做错了怎么回滚,等等。因此,适配性问题,最终就等价于“这个操作系统能不能帮助企业构建出好用的 Harness”。
试想一下,从企业的角度,一个理想的Harness有什么特点?首先,它必须支持企业灵活地自定义,不能是大模型公司已经写死在代码中的;其次,它必须容易开发、易于部署,最好是门槛足够低,企业内人人可开发(不止是懂技术的人),而且一键可部署;最后,它最好是有一个繁荣兼容的生态,可以随时引入、借鉴外部的最佳实践。
先看开放性和灵活性。在这一点上,目前的状态可以大致分为三种:
一是Anthropic代表的封闭式Harness,企业可以通过MCP、Skills、Hooks等方式扩展Claude Code,但核心Agent Loop 仍由Anthropic控制,不可修改;
二是Codex、Grok Build、Zcode、Kimi Code代表的开放式Harness,即默认版本仍然由一个有资源的大厂维护,但核心Harness代码开源,可以看、可以改;
三是最开放的DeepSeek Harness(DSH),它倡导的“一切皆插件”,其思路就是,模型适配层、工具注册表、沙箱策略、子智能体后端,甚至默认的agent loop,都可以被一个插件替换掉。
虽然开源模型在开放性和灵活性上占优,但如果从开发和部署的门槛和效率看,排序却是完全相反:Claude Code与Codex是当下体验最好、最开箱即用的智能体产品;而DeepSeek Harness走的是基础设施路线,默认体验一般,理解和修改整个项目的门槛很高,往往要技术极客才能适应。一个或许贴切的类比是:Claude Code和Codex更像整合度很高的Windows,DeepSeek Harness像早期的Unix。
再看生态繁荣度和兼容度。
从数量上看,最开放的DSH的生态确实爆发得很快:截至8月19日,GitHub上DeepSeek Harness插件相关的仓库已经约7700个,其中可以一行命令即安装的插件约1500个。但如果去看这些插件在做什么,会发现最集中的方向之一,是在补充模型的体验,比如Web UI、桌面端、状态监控、交互组件。也就是说,开放Harness的生态,有相当一部分是在把它补成Claude Code。
而反观更封闭一些的两种Harness,因为“开箱即用”,用户数量更多,Github中大部分的开源Skills与插件,现成软件中提供的MCP,都是基于这些用户数更多、先发的主流框架做的,对模型的适配性也最好。
合起来看,完全封闭的Harness不够灵活,完全开放的Harness门槛太高,“由模型厂商维护的开源Harness”正在成为一个重要方向。Codex、Kimi Code、ZCode、Grok Build都开始呈现这种形态:企业可以保留源码级控制权和模型选择权,但不需要从零维护整个Agent系统。相比之下,Claude Code代表的是另一条更加封闭的路线,企业牺牲一部分核心控制权,换取更完整的产品化与维护。因此,企业用户真正需要选择的,不是开源还是闭源,而是根据自己的业务,决定自己希望掌握多少控制权,以及愿意承担多少Harness的工程责任。
第三个问题是可控性。
第一种涉及数据主权问题,即大模型在干活的同时会不会拿走企业的私有数据。Palantir公开抨击前沿模型实验室的就是这一点,也因此Palantir决定转型成为一家帮助企业部署本地开源大模型的服务商。但数据主权问题是存在解法的,并不是只有开源模型才能做,比如云计算层面可以设置第三方控制层(AWS Bedrock平台的主打功能之一),Anthropic也已经推出了Enterprise Frontier Safeguards服务,意思就是企业可以做到零数据留存在模型中。
更难解决的涉及利益和动机冲突问题,即随着模型能力的提升,大模型公司是不是就会自己下场做应用。这会导致很多AI原生应用公司最终倒向开源。最典型的例子就是Cursor。据悉,在早期的某个阶段,Cursor一度占据Anthropic收入的40%-50%;但结果却是作为智能操作系统的Anthropic自己进入了代码这个市场,做出了Claude Code;因此,Cursor在去年下半年开始基于Kimi的开源模型做强化学习训练自己的大模型Composer,在代码领域的效果已经可以比肩一流模型。同样的例子还包括法律领域的Harvey、语音领域的ElevenLabs等等(如图9)。可以预见,在这一轮AI浪潮中崛起的大部分AI原生应用公司最终都会基于开源模型做自己的智能体,它们原来被质疑是模型套壳,但现在,它们事实上在成为场景中的Harness公司,并且有自己基于开源模型的智能体。
理解了企业客户的需求与各大模型生态的供给,再结合PC和智能手机时代的经验教训,我们可以得出一些判断:
第一,会收敛:通用大模型作为一种操作系统,其终局大概率会收敛。但历史已经无数次证明,收敛的逻辑不是比谁的开放程度更高。比的是谁能留下一个钩子、创造一种标准,带来硬件层(云计算)的优先分发,最终创造应用层(企业智能体应用)的规模效应。可以看出,闭源模型选择的“钩子”就是智能水平本身,开源模型选择的“钩子”是性价比。
在过去三年里,开源和闭源都在特定的一段时间里促进了不同模型的分发,但并未形成明确的标准。要形成这个标准,未来有两种可能的情景:
一种小概率情景,是出现一个全新的模型范式,能同时实现最高的智能水平和最低的成本,并在一段时间内不可被模仿,也就自然而然地成为唯一的操作系统;
第二种更可能的情景是,开源和闭源形成一个组合,存在一种智能的路由规则,将企业不同目标(效果/成本)的任务完美地分配给对应的模型。于是,谁能定义这个路由规则,谁就更有可能占据入口级操作系统的市场份额,模型(无论智能高低)则沦为执行方。
第二,会共存:通用大模型既是操作系统,同时也是一种硅基劳动力(执行者)。就像不同的劳动者,开源和闭源会一直共存,本质就是能力和成本的不同组合。开源模型的规模效应出现在相对简单、但有明确闭环的任务市场中。另外,这个市场的覆盖范围随着模型能力的提升会不断扩大,模型智能每升级一次,就有一批变得有标准答案的任务,从闭源划到开源可以做的范围。闭源模型的规模效应则出现在更复杂、没有明确评估标准的开放式任务市场中。在这类场景里,闭源模型的成本是更低的:一是模型本身出错更少,消耗更少的token,二是花费更少力气构建复杂的harness。这两种任务自古都一直存在,也因此开源和闭源模型都会有用武之地。
第三,需要信任:从操作系统的视角看,因为信任度的原因,全栈不见得是很大的优势。有自建云计算的大模型,或者有自建应用的大模型,做操作系统的难度是更大而不是更小,这是诺基亚和塞班系统的教训。AI原生应用公司纷纷开始离开闭源,是最早的征兆。今天,闭源模型和原生应用的关系,和2007年三星、HTC不肯用诺基亚控制的塞班是同一种处境。最终,手机厂拥抱了不做整机的谷歌安卓,原生应用拥抱了今天的开源模型。这里闭源输在动机上,不输在能力上。但值得注意的是,走掉的这群企业,恰恰是token消耗最大、也最有能力自建Harness和训模型的一批;他们走了之后,闭源生态中仍然留有数量众多、要求技术门槛尽可能低的普通企业。
第四,护城河在哪里?通用大模型的护城河有二,一是不断提高智能的上限,二是必须做好Harness。从先发优势和锁定优势的视角看,Harness最终将会是护城河。在PC和手机时代,谁先绑上新一代的标准硬件,谁就赢了,而且赢了就成为滚雪球一般的优势。但模型天然没有这种锁定效应,换模型只要改一行配置,真正换不走的是企业为自己的业务适配好的那套Harness:调好的流程、接通的数据、试出来的用法、攒下来的权限规则。这些东西搭一次要几个月,要修改起来更是难上加难。今天,它们大多沉淀在Claude Code、Codex的配置里。这才是两大闭源模型厂商今天真正的先发优势,不是模型领先了几个月,而是Harness的积累暂时先落在了它们的生态里。也正因为如此,这个优势的可持续性,不取决于模型层的竞争,而取决于Harness层的竞争。
结语
大模型是AI操作系统的一个核心部分。这篇文章的初衷,是希望通过学习PC产业和智能手机产业的操作系统发展史,可以帮助判断大模型产业的当下和未来。
在研究的过程中,我们意识到,研究的话题其实并非开源还是闭源,而是如何理解一个新形成中的产业价值链的演化规律。显然,这样的产业思考是战略判断的基础。
我们总结一些思考,其中一些可能并非显而易见:
回看产业发展史,在PC产业和智能手机产业的生成阶段,主要玩家对产业未来的愿景差别很大,战略思考能力相差很大,一些企业也犯过重要的战略错误。我们猜测这一次大模型产业也不例外。
一个好的操作系统,需要能够聚合硬件生态和软件生态的势能,形成规模效应,一方面为最终用户创造价值,一方面为要素生态创造价值,并且能抵御竞争对手。在历史上,开源(微软)或者闭源(苹果)为主的模式都曾经达到过这种效果。所以,开源或者闭源,只是一种路径选择,并不是最本质的战略问题。
无论开源还是闭源,好的操作系统都需要在价值创造与性价比、适配度与易用门槛、信任度三个方面具备竞争力。以头部闭源大模型为例,OpenAI除了研发最领先的基础大模型(价值创造),也推出了各种token价位的产品(性价比),在尝试开源的harness(适配度和门槛,而且不只是为自己的模型);Anthropic已经推出了Enterprise Frontier Safeguards服务,企业可以做到零数据留存在模型中(可信度)。大模型产业是一个激烈竞争的产业,所以我们不应该静态地判断企业必然会依照原有的惯性行动,而是应该依据产业的商业逻辑。
企业会不会倒向开源模型生态?首先,当下市场担忧的Token单价和数据主权问题其实都有解法,并不会真正成为企业离开闭源模型生态的理由。真正可能导致企业离开闭源生态的理由只有两个:第一,企业和模型厂商之间存在根本的利益冲突,比如AI原生应用企业。这类企业的本质是场景中的Harness企业,它们和大模型公司做的是同一类业务。第二,出现一种更好用的开源Harness,也就是更灵活、门槛更低、更繁荣的Harness生态。但闭源模型(如OpenAI)也已经在做开源的Harness生态。
闭源模型能不能维持定价权?这个问题应该分任务、分时间窗口来看。
短期来看,闭源模型在开放式、更加挑战的任务市场中会一直有定价权,因为本质上它们在这类任务中代表更低的成本、更好的结果。而在简单的任务市场中,闭源模型则确实会丢失这部分定价权,因此要推出对应的廉价版本参与竞争。
长期来看,定价权会越来越转移到定义路由规则的操作系统层。如果终局真的是一个“模型委员会”,通过智能的路由把不同的任务分配给不同的模型,目前,我们认为闭源模型成为这个路由的可能性也很大。
大模型会不会商品化?大模型企业的护城河在哪里?大模型之间能力有差别,还有那么多与产业数据和场景结合的方式,所以会在很长时间内保持差异,而非完全同质化、商品化。长期来看,不会商品化的是入口,也就是谁来定义路由规则、以及谁能把企业的流程、数据和权限沉淀进自己的Harness系统。无论是垂直整合,还是水平开放,最终锚定的结果都是对入口的争夺,而不是token消耗量的份额。
大模型产业的先发优势和锁定效应,在于用户在harness层面的沉淀。随着时间的推移,价值越大,迁徙成本就越大。长期而言,即便执行大部分任务的大模型能力都已经普及,因为用户的锁定效应,仍然可以构成大模型的护城河。
在历史上,完全的开源本身,往往是糟糕的商业模式。
谁能做成操作系统?历史告诉我们,只要能规模化聚合要素,开源和闭源都有机会。此外,因为信任度原因,企业会天然防御有(潜在)竞争关系的对手做出操作系统,比如云计算公司会抵制对方的大模型,比如Harness公司对闭源模型的警惕。这意味着所谓的全栈能力,实际上是做成最广范围的操作系统的障碍。我们预期开源和闭源的操作系统会长期共存,而非一两家一统天下。特别重要的是,原来利益冲突不深、在产业形成初期不起眼的第三方,实际上有做成操作系统的机会。这个道理,总是被在位的大厂们低估。
开源追上了,还需要那么多算力吗?需要,而且更多。无论入口被谁占据,被路由的硅基劳动力们都跑在算力上。而且,更多的算力大概率会被开源模型消耗,云计算和开源模型的绑定会越来越紧密。随着开源模型的智能水平提升,其覆盖的任务市场会不断扩大,token的消耗量只会越来越多。也因此,云计算厂商有更多的动力分发开源模型。
我们认为,模型厂商的终局既不是PC也不是手机。在硅基劳动力这一层,越来越多的任务会更像PC,走向商品化,大部分token会跑在开源模型上;在入口这一层,它更像手机,做整合的一方会拿走大部分利润。但这一次的入口既不是模型本身,也不是应用商店,而是路由规则和Harness。