全球的学术图书馆中堆积着数以十万计的古希腊纸草片碎片。尽管其中许多件由于损坏程度过高其含义或已不可恢复,但学者们仍可以通过系统地填补缺失的单词或短语来恢复其内容。为了加速这一繁琐的工作,研究人员转而利用人工智能。
周三,奥地利科学院将发布“世界上首个先进的古希腊大语言模型”,该模型是与法国人工智能实验室米斯特拉尔(Mistral)以及科技服务公司赛尔回复(Sail Reply)合作开发的。这款名为阿波罗(Apollo)的模型,训练数据约为6亿条来自手稿、纸草和铭文的历史希腊语单词。
该模型将通过聊天机器人界面免费提供给学术界使用。其目标是帮助学者更快速地识别与其特定子学科相关的纸草片碎片,以及发现新的研究方向。当文档残破不全时,阿波罗可以根据统计上最可能的单词或段落来填补空缺,从而可能揭示隐藏在其中的历史事件和习俗细节。
赛尔回复的合伙人迪米特里斯·弗利塔斯(Dimitris Vlitas)告诉《连线》(WIRED),以这种方式解锁知识“在一年前还不可想象”。直到最近,修复一件残破的纸草片曾需要一位熟练的学者首先识别出单词的分界(古希腊语书写中没有空格),然后准确地确定文档年代,权衡相应的社会政治背景,并查阅参考资料以帮助选择合适的词语来填补空缺。“世界上能够如此擅长希腊历史的人非常少,”伦敦大学学院古典学和历史语言学教授斯蒂芬·科尔温(Stephen Colvin)说道。
不过,所有这些专业知识都已经内置于 Apollo 系统中了。奥地利科学院的历史学家兼纸莎草文献学家安娜·多尔加诺夫(Anna Dolganov)解释说:“当 Apollo 系统识别出古希腊语文本时,它会补充相应的希腊语词汇;当它看到用多利克方言写成的铭文时,就会使用多利克方言来进行解析。”
那些因繁琐的文本修复工作而感到困扰的学者们希望 Apollo 能够加快这一进程,使他们能够专注于研究历史文献背后的意义,而无需再花费大量精力去解读文本的具体内容。
“我认为这非常令人兴奋,”牛津大学古典语言与文学教授阿曼德·丹古尔(Armand D’Angour)说道。牛津大学拥有世界上最大的古代纸莎草文献收藏。他补充说:“如果有一台机器能告诉我‘这三个词可能适合填补这个空白’,那将会大大加快研究进度。”不过,Apollo 系统不太可能改变我们对古代世界的整体认知——因为许多纸莎草文献的内容其实都很普通(比如私人信件、婚姻契约或政府文件),因此至今仍未被准确解读。丹古尔表示:“对于外行人来说,你可能会以为我们会因此发现索福克勒斯的新剧作,但那是不太可能的。”不过,这个系统确实有助于揭示古代生活的更多细节,并验证现有的学术观点。他说:“每当 Apollo 系统生成新的解析结果时,它都会为我们提供关于古代世界的新的知识。”
弗利塔斯(Vlitas)认为,如果 Apollo 取得成功,同样的技术完全可以应用于其他古代语言(比如拉丁语或埃及语),或者任何可以从大量文本的整理与索引中受益的学术领域。人工智能在某些领域已经取得了显著进展:OpenAI 最近表示其人工智能模型解决了一个存在了 200 年的数学难题;而谷歌的 DeepMind 则发布了一个庞大的数据集,该数据集展示了基因突变如何影响分子生物学,这些信息都是通过人工智能技术整理出来的。
一个值得担忧的问题是:如果依赖语言模型(这些模型主要基于概率进行推理)来填补古代文献中的空白内容,就有可能导致历史记录被错误所污染。为了解决这个问题,Apollo系统被设计成能够为学者提供多个词汇选项供其选择。Dolganov指出:“关键在于人类的判断能力必须保留下来;如果我们完全依赖人工智能来转录和解读历史资料,问题才会真正开始出现。”