最近,数学可能要被AI“玩坏了”。难题解决得更快,为什么还值得担心?关键在于我们如何评价、组织和延续数学研究。
AI模型的能力很难用一句话概括,基准测试(benchmark)因此成为比较模型的常用工具。但成绩一旦与融资、声誉和研发投入挂钩,测试便不再只是被动记录能力,也开始引导能力向哪些方向发展。经济学家陈斌(Alex C当公开分数能够吸引投资,针对测试进行定向优化就可能有利可图,而分数对于广泛能力的指示作用反而会受到侵蚀。
这不必以作弊为前提。假如两条研发路线都能取得进展,一条可以迅速提高公开成绩,另一条改善的能力暂时无法展示,前者就更容易获得资源。问题也不只是测试题出得不好,而是有限的成绩单无法覆盖所有值得发展的能力。指标原本用于测量对象,后来却开始塑造对象。
放到数学研究中,解开一道难题,是取得了一项成果;从证明中提炼可迁移的方法,使别人能够理解、使用并提出新问题,则是在扩大整个学科的能力。声明尤其重视后一过程。如果只有解题成绩得到及时奖励,整理、解释和传播新思想就可能成为无人愿意支付的成本。即使每一道题都真的解对了,这种资源配置仍可能有问题。
1983年,认知心理学家莉珊娜·贝恩布里奇在《自动化的反讽》中指出,自动化接管日常操作后,人会减少练习,却仍须应对机器无法处理的异常。航空业提供了具体参照。美国联邦航空局的《飞行航径管理》通告指出,有限的手动飞行实践可能削弱接管能力,过度要求使用自动化也会影响技能保持。技术减少了某项能力的日常用途,却没有消除关键时刻对它的需要。
数学中的“接管”不必等到AI断网。一个证明可以逻辑正确,但其假设是否抓住了原来的问题,方法能否推广,遇到障碍时应当继续计算还是修改定义,仍需判断。即使数学家始终与AI共同工作,这些判断也不能仅凭模型给出了一份答案就自动完成。
不妨想象,一个总坐电梯、很少接触台阶的孩子,可能连下楼梯都不熟练。电梯代替了上下楼的过程,却不会代替孩子练出平衡感和身体协调能力,而这些能力在运动和日常生活中依然有用。
比技能退化更深一层的问题,是研究过程还可能改变研究目标。哥伦布本想寻找通往亚洲的西行航路,1492年却抵达了加勒比海。不妨设想,他在出发前就原目标或许更容易实现,这次意外登陆却未必发生。完成预定任务与发现任务之外的世界,并非同一种收获。
日本企业雅马哈的材料研发提供了另一种参照。据雅马哈发动机公司史,时任社长川上源一为改进射箭用弓,在美洲考察时接触到玻璃纤维增强塑料制成的弓,也看到了当地同类材料船艇的发展。1959年,雅马哈不但制成增强塑料弓,还完成首批增强塑料船艇原型,次年推出商业化船艇。这并非研发失败后意外发财的故事。它的启发在于,同一材料的价值,没有被限制在最初接触它的用途上。
它既被用于炸药,也成为缓解心绞痛的药物。研究者很早便注意到它引起头痛等生理反应;到19世纪70年代,英国医生威廉·默雷尔发现它引起头痛的机理可能是扩张血管,进而提出用小剂量硝酸甘油治疗心绞痛。所谓副作用,只是相对于原目标而言;换一个目标,它可能就是主作用。
哥伦布偏离了预想中的目的地,雅马哈把技术移向另一种用途,硝酸甘油则从工业用途延伸到医疗。但它们都提示,研发的收益不仅来自完成原计划,也来自途中形成的新选择。不强迫技术忠于它出生时的用途,本身就是一种创新能力。
如果项目只按离原目标还有多远来评估,新用途就可能在尚未被认识时失去继续探索的机会。用经济学的语言说,我们既要计算完成既定任务的效率,也要计算保留未来选择的价值。取消一条探索路径,节省的成本很容易入账;它原本可能带来的新问题、新方法和跨领域用途,却往往没有价格。
这些例子并不意味着AI只能优化、不能探索。AI也可以被用于寻找反例、比较不同表述和尝试跨领域联系,降低试错成本还可能扩大探索范围。是探索更多可能,还是继续提高同一张成绩单上的分数?如果当前的解题产出增加了,未来提出问题、发展方法的能力却被削弱,局部的效率增进就可能损害长期的知识生产。这才是值得警惕的优化陷阱。
数学并不需要以低效率证明自己的价值。更有意义的调整,是在评价成果时重视方法的可迁移性和解释的清晰度,在培养学生时保留提出问题、论证判断的训练,并给暂时偏离原目标的探索留下空间。这不等于给“创新能力”再做一张统一的成绩单,而是承认,一张成绩单不足以替学科作出全部判断。
我们要警惕的,不是AI越来越会做题,而是研究体系越来越只认做题。数学当然生产答案,但它也生产问题。有时候,进步并非更快抵达目的地,而是在途中发现,原来的目的地并不是最值得去的地方。