
电影《诺曼底72小时》剧照。
《诺曼底72小时》这部电影,我在《气候金融》第一堂课上就跟学生推荐过:无论如何,去看一遍。
当然,不是冲着战争片去看的——登陆那天的枪炮声,历史学家已经写了70年;也不是冲着职场片去看的——确实有人从里面读出不少办公室政治,比如两个部门如何互相瞧不上、参谋长身边的秘书如何一句话顶一个参谋团。我让他们看,是因为这部戏真正的主角,既不是登陆艇,也不是艾森豪威尔,而是两个吵架的气象学家。
决定历史的,是一张天气图
1944年6月,英吉利海峡上空的那团云,压在50万盟军将士的头顶上。登陆日原定于6月5日,可海况一天比一天糟。艾森豪威尔面前,摆着两拨气象学家给出的两套截然不同的判断。
一派的头面人物,是盟军首席气象顾问、苏格兰人詹姆斯·斯塔格(James Stagg)。斯塔格是北大西洋天气的专家,信的是"物理":他不跟你翻旧账,他盯着此刻的气压场、锋面位置、风速和水温,用大气环流的方程一格一格往前推。他告诉艾森豪威尔:6月5日不行,但6月6日清晨到上午,会有一个极其短暂的天气窗口——暴风骤雨之间,大约只有十几个小时的喘息。
另一派,是美国空军那边派来的欧文·克拉格(Irving P. Krick)。克拉格是当时美国最出名的"天气算命先生",他的方法说起来简单:把历史上每一次相似的天气型都翻出来,看后来几天海况是变好还是变坏,大数据一比对,这次像哪一次,八九不离十。他倾向于认为天气会迅速好转,登陆不必推迟太久。
电影把这场争论拍得很足:一个盯着地图上此刻的每一根等压线,一个翻着厚厚的历史天气档案;一个说"历史不会重复",一个说"太阳底下无新事"。
最后艾森豪威尔听了谁的?听了斯塔格。1944年6月6日,盟军在诺曼底登陆。事后证明,那个短暂的窗口,是整个6月里唯一能用的一天——再往后推,潮汐和月相就不对了,这场横跨海峡的豪赌,很可能要再等一整年。
但电影没有把克拉格写成小丑。真正耐人寻味的是结尾:两派的代表最后坐到了一张桌子前——斯塔格负责算物理,克拉格负责对历史,两边的误差互相校准,才把"6月6日可以登陆"这个判断,从七成把握磨到了敢签字的那九成。
这其实是整部电影最想讲的道理,只是藏在枪炮声底下:预测这件事,从来就有两个流派,谁也别想独霸江湖。
两个老冤家,打了几百年
天气预报是人类最古老的预测问题之一,它的两派也最典型。
一派,我叫它模式识别派:不问天气"应该"怎样,只问天气"过去"怎样。把历史上类似的形态找出来,看它们后来怎么走,用统计规律外推未来。今天的版本,就是各路天气大模型——谷歌等公司做出来的那一批,喂进去几十年的卫星和观测数据,底层是深度神经网络,让模型自己去悟规律。
另一派,是基本面派:不看你以前怎样,先把大气此刻的状态摸清楚——风、压、湿、温、海洋温度,然后用流体力学和热力学的方程,一步一步往前算。这就是今天还在跑、机场和港口还在靠它发预警的数值天气模型(Numerical Weather Model,NWM)。它一点也不"聪明":大气被切成无数个三维格子,每个格子里几百个方程,算一步前进一步,背后是湍流、辐射、陆面过程、积云对流、边界层、云微物理一整套物理参数化方案——这是几代气象学家一笔一笔写出来的。
打个不太恰当的比方:模式识别像一位老中医把脉——"你这种脉象我见过几千次,所以你大概是什么病";基本面像一套CT加验血——"先不管你以前怎样,我把你身体里每一处此刻发生了什么,老老实实算一遍"。
有意思的是,70年过去了,斯塔格赢了那一仗,可两派并没有分出胜负。今天的业务预报系统,其实是两派联手:短期靠数值模型算物理,同时拿历史形态做订正;神经网络这十年又杀回来,在不少环节上把数值模型逼出了一身冷汗。电影里那个握手言和的结尾,不是编剧的粉饰,是真实世界的常态。
走出天气预报:股票和房价,同一对冤家
把镜头从英吉利海峡拉远,你会发现这两个老冤家,根本不在气象厅上班。
股票市场上,它们一个叫技术分析,一个叫基本面分析。技术分析师盯着K线图和成交量,找历史形态——头肩顶、双底、金叉死叉,本质就是模式识别;基本面分析师掰开公司的财报和行业格局,算这家公司到底值多少钱——典型的基本面。两拨人吵了100多年,谁也没说服谁。
房价预测也一样。经济学家把模型分成两派:一派叫时间序列模型,盯着过去几个月、几年的房价走势,"涨的时候大概率继续涨",顺着趋势往外推;另一派叫基本面模型,用居民收入、按揭利率、土地供应、人口结构这些变量,去算"房子到底值多少钱"。
短期看,时间序列模型几乎总是赢。道理不复杂:房价是一种自相关极强的资产——今年的房价跟去年高度相关,涨势一旦形成,惯性可以维持很久。用它做三个月、半年的预测,曲线漂亮得无可挑剔。
可短期漂亮的模型,有一个致命的盲区:它不知道泡沫有多大,更不知道什么时候会破。它只会告诉你"明天和今天差不多",却回答不了"后天会不会天塌下来"。
我在房利美上过的那一课
这一段,是我自己的经历,写下来给学生们看。
2004年,我在两房之一的房利美(Fannie Mae)。那是美国房地产最癫狂的前夜。公司内部对房价的预测模型,短期用的就是时间序列那一套——ARMA、VAR这些,对未来一两个季度的房价指数,拟合得好得不能再好,报告里的曲线跟实际值几乎贴在一起。
可你要是问一句:"这轮涨势什么时候是个头?"模型就傻眼了。它不知道。它能告诉你房价下个月继续涨零点几个百分点,却算不出房价相对居民收入已经偏离历史均值多少,更算不出次级按揭那座火山什么时候喷。
反观基本面模型——把房价跟租金、收入、利率挂钩——短期总是笨笨的,预测误差比时间序列大,季度报告里永远是那个"拖后腿"的。可正是它,在2005、2006年就反复提示:价格已经脱离了基本面。
当时管理层选了谁?选了那个短期看起来更准的。理由很充分:监管要它每季度报数,投资者要它业绩漂亮,谁愿意用一个"老是偏悲观"的模型?
后来的事,大家都知道了。2008年。学费贵到整个美国金融体系为之颤抖。
危机之后,我观察了一下美国大型金融机构的房价模型,发现大家几乎不约而同地改成了同一种结构:短期用时间序列,长期收敛到基本面。这不是哪本教科书新写的理论,是真金白银买来的教训——短期趋势要尊重,长期规律更要敬畏。
大模型时代,这道题更难了
今天,这对冤家又被推到了一个全新的舞台上:大模型。
底层神经网络的复杂度,这几年是指数级上升的。十年前的机器学习论文,参数几百万就敢叫"大模型";今天,千亿、万亿参数的模型,报出来连个水花都没有。这在传统统计学习的时代是不可想象的——参数越多,模型越容易把历史里的噪声当成规律,越容易在样本外一败涂地;稳定性、可复现性,全都成了问题。
于是,一个朴素却致命的问题,摆到了每一个金融从业者面前:
你能解释模型为什么这么预测吗?
你敢把客户的钱、把机构的资产负债表,交给一个你自己都读不懂的模型吗?
这不再是象牙塔里的认识论问题。2008年那堂课教给我们的是:短期再漂亮的模型,如果回答不了"拐点在哪里",它就不是你的朋友,是你的顺风车——风一停,最先摔死的就是你。今天的大模型,把这个问题放大了100倍:斯塔格当年至少还能把每一步物理推演摊在艾森豪威尔面前;而一个万亿参数的神经网络,连它自己的作者都不一定说得清,它那个卖出信号,到底看懂了经济,还是只记住了历史。
课堂作业里的答案
所以在《金融中的机器学习和人工智能》这门课上,我把这个问题原封不动地抛给了所有学员。
答案藏在课程作业里。作业不考谁调的模型分更高,只考一件事:你用人工智能得出的每一个结论,能不能写清楚——它依据了什么、它的边界在哪里、在什么情况下它会错、如果它错了你凭什么发现?
你可以用AI,但必须知道它的短板和局限。是你在引导AI,而不是被AI引导。
古人说:尽信书,不如无书。
我把这句话改了两个字,送给每一个在大模型时代做预测、做决策的人:
尽信AI,不如无AI。