如果人工智能实验室PrismML还没有出现在你的雷达上,它应该是-不是因为它筹集了大量的资金(它还没有,只是2225万美元的种子轮),而是因为它所涉及的技术思想和它正在开发的潜在的行业变化技术。
PrismML认为,有能力的、高性能的、推理的大型语言模型实际上不必很大。
它正在使推理模型变得如此之小,以至于可以安装在PC和智能手机上。(It甚至有传言称,谷歌正在与苹果进行谈判,不过首席执行官巴巴克·哈西比拒绝对TechCrunch发表评论。)周四,PrismML发布了Bonsai 2 27 B,这是其系列型号中的最新产品,该产品将阿里巴巴广泛使用的开源型号Qwen 3.8 27 B压缩至5.9 GB。它足够小,可以安装在PC上,也可能安装在高端智能手机上。与原版相比,内存减少了9倍到10倍。
PrismML由一群加州理工学院研究人员创立,由加州理工学院教授兼压缩技术专家Hassibi领导。该创业公司还将Ion Stoica视为顾问。斯托伊卡是Databricks(和其他公司)的联合创始人,也是伯克利著名的天空计算实验室的主任,该实验室诞生了许多技术和初创公司,从Letta到SGLang。
PrismML还得到了Khosla Ventures、Cerberus Capital和Caltech的投资。
这家初创公司当然不是唯一一家致力于LLM压缩技术的公司。另一家公司是由西班牙多诺斯蒂亚国际物理中心著名教授创立的多元宇宙计算公司。(And多元宇宙计算筹集了大量现金。)但Hassibi表示,PrismML的压缩技术是独一无二的,因为与原版相比,其LLM几乎没有损失任何性能。Bonsai 2与Qwen 98%的总基准分数相匹配。这比几个月前三月份发布的第一款Bonsai有所上升,该比例为95%。该公司表示,该原始模型已被下载超过1100万次,PrismML更小的模型也被下载了260万次。
因此,这表明PrismML的压缩结果从一个版本到下一个版本都有所改善。它是否能达到100%的基准性能平价是一个有待观察的问题。Hassibi说,压缩可能总会产生一些影响。
尽管如此,完美的基准平价无论如何都是相当学术性的。LLM的未压缩形式并不那么准确,基准也不那么完美地反映实际任务,以至于2%的降级可能会对模型在实际使用中的表现产生有意义的影响。(Plus周围的软件--模型运行的工具--在准确性方面也很重要。)PrismML表示,它通过缩小构成模型的“权重”来实现这一目标--权重本质上是模型在训练期间学习和存储的信息。通常情况下,每个重量需要16位。PrismML的方法称为“三进制”权重,将其简化为+1、-1或0。由于每个重量存储的值要小得多,该模型占用的空间大大减少。(For深入了解压缩技术,这里是该项目的GitHub页面。)该初创公司的下一个目标是将这种压缩技术应用于更大的模型。Hassibi告诉TechCrunch:“我们希望在未来几个月内发布的下一个模型将在数千亿个参数范围内,我预计在那里保留情报会更容易。”
随着模型尺寸的增长,他补充道,“有更多的空间可以在不失去智能的情况下压缩它们。所以我只想说,作为总趋势,对于较大的型号来说,更容易达到100%。”
斯托伊卡告诉我们,他对这项技术感到兴奋,因为它使高级模型可以在用户的设备上运行。“你将拥有触手可及的智能,而且它将是免费的,因为它将在你已经购买的设备上运行。它也将是私有的,因为您不会将其发送到云。”