字号 ·· | 护眼
theregister

闭嘴,计算吧:Jev为程序员打造的新AI原语

TypeSafe公司上周推出的Jev,其运行方式与目前大家熟悉的标准大型语言模型(LLMs)有所不同,因此立刻引起了广泛关注和讨论——开发者们纷纷尝试探索如何使用这项技术。Jev的输出结果受到严格限制:它只会返回开发者预先设定好的、固定形式的回答(即“类型化”的答案),同时还会提供相应的概率分布信息以及某些查询类型的置信度值,这些信息可用于辅助决策或自动化流程。正如布莱恩·伊诺(Brian Eno)所说,“更多的限制往往能激发更大的创造力”。在Jev发布后的这一周里,大量开发者纷纷使用该服务进行测试。FPV Ventures的合作伙伴尼昆·科塔里(Nikunj Kothari)创建了一个名为Jevable的网站,用于收集用户发布的Jev应用程序原型。Jevable网站上提供了各种开发工具和辅助工具,其中一些工具虽然看起来比较“琐碎”或实用性不强(例如:有的应用程序可以将简单的英文文本翻译成过于花哨的文学性语言;有的允许用户在电子表格中添加“紧急程度”标签,Jev会根据这些标签对任务进行分类;还有的应用程序可以让用户预览衣服穿在身上的效果)。使用Jev的费用仅为每条回答0.0011美元;Jev处理一个请求所需的时间约为620毫秒。此外,还有一些应用程序专门用于帮助玩家更快地完成游戏任务(例如:加速《毁灭战士》(Doom)、《俄罗斯方块》(Tetris)、《英雄联盟》(League of Legends)或《卡坦岛》(Settlers of Catan)等游戏的进程)。值得一提的是,有些开发者甚至利用Jev来模拟计算机的运行方式——这主要体现了开发者对递归算法的浓厚兴趣。

为此,有人提出了“JevOps”这一术语,用来描述在基于 Jev 的虚拟化环境中“运行所有代码”的最终目标。“JevOps”目前还只是一个概念或“梗”(即一种流行的网络用语),而非一个成熟的开发方法或学科。开发者使用 Jev 的方式可以被比作执行一个“智能函数调用”:用户提供输入,Jev 会根据预先定义的结构化决策模型返回相应的输出。TypeSafe 将这种机制称为“System One”模型,该模型旨在实现快速、高度结构化的决策过程。用户通过 API 提交数据进行分析,并可以通过三种类型的问题来查询这些数据:选择题(Choice)、评分题(Score)或“Noul”(表示信息真实性的概率值,范围在 0 到 1 之间);这些都属于 Jev 的基本数据类型。Jev 会在回答这些问题时提供相应的置信度信息。由于 Jev 无法生成自由形式的文本,因此用户必须事先明确指定问题类型及可选答案的格式。因此,与那些能够自动生成回答的大型语言模型(LLMs)相比,使用 Jev 需要事先进行一些手动配置工作。开发者需要仔细思考自己希望通过这些问题实现什么目标(例如,可以将任务分解为多个子任务)。TypeSafe 的文档建议使用类似“这条信息是否表达了紧急性?”这样的具体问题,而不是像“分析这条信息并确定最佳行动方案”这样开放性的问题。这种结构化的问答方式具有诸多优势:首先,它避免了 Jev 需要自行决定如何组织答案的结构;其次,TypeSafe 表示 Jev 可以在短短 150 毫秒内完成响应,这对于需要实时交互的应用来说速度非常快(这也是开发者热衷于使用 Jev 来加速游戏开发的原因之一)。此外,Jev 的服务成本也远低于传统的大型语言模型:输入令牌的费用为每百万令牌 0.042 美元,而输出令牌则完全免费。

“如果我们的应用程序能够在响应时间内完成许多有用的语义分析任务,那么我们会做出哪些不同的设计呢?”TypeSafe的技术人员Eugene Shvarts在GitHub上的一个README页面中这样问道。该页面用于评估Jev模型在特定项目中的实用性。Jev模型可能适用于的工作场景包括招聘流程、科学论文的审核(确保论文包含所有必要的部分),以及那些原本需要人工干预的软件管理任务。Jev的创造者Diogo Almeida建议使用Jev来自动化工具的调度工作,并将其与其他模型结合使用。那么,Jev到底有多智能呢?AI领域的专家Mo Bitar在视频中表示:“这个模型的智能程度究竟如何?我实在无法确定。”虽然Jev的演示效果很有趣,但其预测结果的准确性如何呢?虽然Jev属于大型语言模型(LLM)范畴,但目前我们对它的智能水平仍知之甚少(缺乏相关的基准测试数据)。Bitar认为,Jev在处理静态、结构化的数据集(如电子邮件垃圾邮件识别或在线购物场景)时表现最佳;但他认为,将其用于需要预测性分析的任务(例如股票推荐)可能并不合适。工程师Archer Hume进一步深入研究了Jev的性能,他通过10,000次API调用对Jev进行了测试。TypeSafe将Jev作为基于API的服务来提供;不过,也有其他人开发了类似Jev的开源分类器(如Jeff和Nimble)。Hume推测,Jev虽然具备大型语言模型应有的深度知识,但它并不会尝试预测需要反馈给用户的最终结果,而是直接从模型内部的表示结构中计算出决策概率。尽管如此,许多人仍认为Jev代表着一个正确的发展方向——即超越了当今那些功能强大但界面复杂、有时甚至具有欺骗性的大型语言模型。 “是时候摒弃‘我们需要更智能的模型’这种观念了。”

“我们需要的是更智能的系统,”代理软件提供商 Swamp Club 的首席执行官 Adam Jacob 在 X 平台上写道。“虽然智能本身很重要,但准确且可重复的结果同样不可或缺。”Anthropic 公司的研究员 Andrej Karpathy 也认为,Jev 在新兴的人工智能市场中开辟了一个新的领域。他在 X 上写道:“Jev 发现了一些被忽视的潜在需求——这些需求之所以被忽视,是因为人们都在竞相开发更高智能水平的 AI 系统。”他指出,Jev 可能能够满足的是那些对低延迟、且具备‘可接受智能水平’的单一令牌型大型语言模型(LLM)的需求。