字号 ·· | 护眼
techcrunch

由 ChatGPT 的开发者开发的一种新型人工智能模型令开发者们感到兴奋不已。

图片 **TypeSafe AI / # 来自 ChatGPT 发明者的一种新型 AI 模型正令开发者为之振奋 太平洋夏令时 2026 年 9 月 18 日上午 49 分 ChatGPT 让迪奥戈·阿尔梅达(Diogo Almeida)心碎了。

阿尔梅达曾是 OpenAI 的一名研究员,他曾协助构建该聊天机器人,随后又发明了人类反馈强化学习(RLHF)——这项模型训练技术或许是造就我们当今 AI 时代的幕后最大功臣。但尽管它功能强大,他却感到失望。

“我们手里握着绝世秘宝,然而它却并不实用,”阿尔梅达对 TechCrunch 表示。“从那时起,我一直在与这个问题作斗争。我花了一段时间才意识到,问题在于我们一直在为人类语言进行优化……四年来,我们一直极其擅长人类语言,但这对于自动化来说并没有用,因为计算机说的是另一种语言。”

两年前,阿尔梅达离开 OpenAI 创办了 TypeSafe AI,这是一家试图解决该问题的初创公司。本周,该公司发布了一款基于 Transformer 架构的新模型 Jev,它并非大语言模型。它不输出文本,而是生成概率,或者该公司所称的“校准决策”。抛弃语言带来了诸多优势:这使得该模型极其廉价且快速,并且由于用户可以提前定义输出结果,它不会产生幻觉。它的输出 Token 是免费的,而输入 Token 则以十亿为单位进行计量,而非百万。

一张截图显示了 Jev 与 OpenAI 模型在响应相同请求时的对比。图片 TypeSafe / TypeSafe 开发者对该产品表现出了浓厚的兴趣;由于需求过于旺盛,该公司一度短暂失去了为用户提供服务的能力。Jev 似乎在软件自动化领域最有用处。到目前为止,软件开发者将其视为一种更便宜、更稳健的方式,将智能融入他们的代码之中。

例如,Vercel公司的软件工程师Pranit Sharma表示,该公司曾使用OpenAI的ChatGPT Luna 5.6来运行分类器,以评估用户输入的命令的安全性。当Vercel将ChatGPT Luna替换为Jev后,处理命令的速度提高了5到18倍,同时准确率也得到了显著提升。

Dario Amodei等AI领域的领军人物希望“掌控技术发展的节奏”,但他们究竟该怎么做呢?(来源:Equity Podcast,时长34分钟,当前播放至0秒处。)另一位开发者Nikhil Mudholkar(Bryo AI的首席技术官)将Jev与Gemini进行了对比测试,用于对商务邮件进行分类。测试结果显示,Gemini的准确率略高一些,但使用成本却高出Jev的10到20倍。Mudholkar认为Jev的“置信度评分”(即模型对任务完成概率的预测)非常有用——“这是唯一一个能够提供实际概率值的模型,因此非常适合用于自动化工作流程!”除了在某些场景中替代大型语言模型(LLMs)外,Jev还可以作为这些模型的辅助工具,用于监控模型的行为是否异常。Almeida指出:虽然使用代理程序来监控其他代理程序的成本可能会很高,但使用Jev来实现这一目标是非常合理的。他认为用户可以部署Jev来追踪大型语言模型的运行轨迹,并防止它们出现“异常行为”(例如违反预设规则的行为)。

(注:翻译中保留了原文的专业术语和具体细节,同时采用了简洁明了的表达方式。)“归根结底,这种技术将‘幻觉’(即错误或误导性的信息)的问题部分地交给了用户自己去判断,”Earendil公司的首席技术官Armin Ronacher解释道。Earendil公司开发了名为Pi的开源模型。“用户需要自己做出决定:如果某个结果的出现概率只有50%,那么这可能只是随机事件,可以忽略不计;但如果概率高达95%,那么就可以据此采取相应的行动。”Ronacher还表示,Jev模型还可以用于模型路由(即决定某个任务应该使用哪个模型来处理)。虽然预测某个任务是否需要特定模型确实很有用,但使用大型语言模型(LLM)来完成这项任务会非常昂贵;而Jev模型由于成本低廉、处理速度快,使得这种实时任务分配成为可能。

这正是Almeida所期望的。该模型以19世纪经济学家William Stanley Jevons的名字命名——Jevons提出了一个著名的悖论,指出某种商品成本的下降会促使人们更多地使用该商品。在这个场景中,智能技术的成本下降也应该会推动其得到更广泛的应用。

“我们认为,未来的智能软件将会以一种‘自发的’、‘分布式’的方式无处不在……这种趋势会更类似于互联网的早期阶段,而不是现在那些大型应用程序(mega apps)的发展方向,”Almeida说道。

阿尔梅达对该模型的架构守口如瓶,外界观察人士怀疑它是基于一个开放权重的LLM构建的。该公司将Jev称为“系统一模型”,专注于直觉而非推理,并且专门针对正确的任务。阿尔梅达表示,Jev完全使用合成数据进行训练,采用的是一种他称之为“基于校准决策的强化学习”的技术。

“我们很早就下了一个赌注,那就是我们将自己制造所有数据,而这是我一生中做过的最好的赌注之一——在我看来,比我们的产品发布更好,比RLHF更好,”他告诉TechCrunch。“我们公司有一半是一个实验室,基本上拥有这个统计上可充分理解的合成数据的整个子领域,这现在是我的人生乐趣。”目前,Jev作为这类模型独树一帜,但罗纳赫预计,既然其实用性已经显而易见,竞争对手将会涌现。

“在很多方面,我们本应更早看到这一点,但大概是因为LLM如此便宜且受到补贴,你往往还不需要有创造力,”他说。

TypeSafe本身将会继续开发该模型的更多版本,并将其应用于新的领域/场景中。当被问及TypeSafe是否属于“前沿实验室”(frontier lab)时,Almeida表示:“前沿实验室的主要产物往往是炒作或恐惧(即公众对新兴技术的过度反应);我希望我们的主要产物是真正的‘智慧’(即这些技术能够带来的实际价值)……但我们并不是那种追求无限财富、将某种理念视为‘宗教信仰’、或者试图在数据中心中‘创造上帝’(即试图通过技术实现某种超自然目标)的实验室。”