字号 ·· | 护眼
techcrunch

由安德烈森·霍洛维茨支持的Vals正致力于成为AI基准测试的黄金标准

基准测试已成为 AI 公司验证其模型能力的行业惯例,当指标对其有利时,便能借此脱颖而出、宣示优势。换言之,优秀的基准测试几乎总意味着良好的公关效应。

遗憾的是,企业也已摸索出如何“钻”传统基准测试体系的空子 —— 这些体系大多陈旧,并非为衡量现代模型能力而设计。

成立于 2024 年的初创公司 Vals 宣称,其使命正是修复这一极不完善的体系。在不到两年的时间里,该公司已在科技界确立了显著地位,去年完成由 8VC 和 Beta 领投的种子轮融资。随后上月,在经历快速增长后,又完成由 Andreessen Horowitz 领投的 4000 万美元 A 轮融资。

公司 25 岁的联合创始人 Rayan Krishnan 曾在 Palantir 实习,并在斯坦福大学本科期间为微软及该校备受推崇的人工智能实验室工作。Krishnan 表示,Vals 的诞生源于他对基准测试落后于其旨在衡量的行业进步的观察。

“我们看到大量新的、极具能力的模型快速涌现市场,而学术基准测试却跟不上这一前沿进展,”Krishnan 说道。随着 AI 融入社会的方方面面,基准测试理应用于验证模型能否真正实现公司宣称的功能。

上周,这位年轻创始人带我参观了位于旧金山福尔瑟姆街的两层办公楼 —— 这座百年老砖楼曾是一家大型啤酒厂的所在地。如今,这座历史建筑不再生产啤酒,而是容纳了多家致力于推动科技行业未来的初创公司。

“从历史上看,我认为评估一直是以一种非常抽象的方式来衡量智能的,”Krishnan 告诉我。“比如,模型是否掌握了足够的信息,从而能够通过类似律师资格考试的测试?”在这里,Vals 寻求差异化。虽然许多基准测试系统提供公开可用的测试(这可能允许公司针对这些测试训练模型,从而可以说是在考试中作弊),但 Vals 并不公开披露其具体的测试材料。Vals 不仅衡量 AI 模型的通用知识,还评估模型完成与法律、金融和编程等特定行业相关的复杂任务的能力。

“我们所做的实际上是审视模型的真实影响,”Krishnan 说。“它们能否在各个领域完成工作,产出与人类同等质量的成果?”

他说,其理念不仅是检查积极结果,也要检查消极结果。希望能够分析,“如果这些模型在世界上‘失控’运行,会产生什么负面影响。”Vals 所衡量的能力正在不断扩展。除了更传统的行业,这家初创公司还在继续拓展更独特的领域。“我们有关于递归自我改进的基准。我们正在心理健康、网络安全、生物安全,甚至武装冲突法等方面开展工作,让模型理解如何应用《日内瓦公约》,”Krishnan 透露道。

公司付费让 Vals 测试其模型,这可能是一个难以理解的概念。为什么公司要付费去了解自家模型表现不佳?但有效的衡量标准有助于公司随时间推移进行故障排查和改进。Krishnan 将他们的营收模式比作学生支付大学理事会费用参加 SAT 考试。

反过来,这些评估正成为公司寻求收购新 AI 模型时的关键决策因素。

这家初创公司最近透露,其目前的营收是去年的八倍。员工队伍也在不断壮大。Vals 今年年初仅有 8 人,现已增至 25 人,规模扩大了两倍。Krishnan 表示,随着初创公司的发展,计划是搬迁到一间大得多的办公室,并再招聘 10 到 15 名员工。该公司最近还推出了一个项目,专注于为联邦机构提供模型评估。

Krishnan 认为,他公司的基准测试体系代表了 AI 公司思考业务增长和建立公众信任的未来。

“AI 公司开始上市了。SpaceX 已上市。Anthropic 计划于今年晚些时候上市。我怀疑 OpenAI 很快也会上市。我认为,随着 AI 模型成为经济的核心部分并更广泛地普及,我们所做的基准测试和评估类型将驱动其使用,并成为这些公司提交公开文件或谈论其即将在 AI 领域进行的潜在投资的核心部分,”他说道。