中国人工智能明星企业 DeepSeek 于周四推出了其成本与延迟优化型 Flash 模型的新版本 v4.1。
该版本包含的架构改进比常规点版本(point release)预期的更为显著,这些改动可能会为更大、更聪明且资源消耗更少模型的发展打开大门。
这款拥有 7630 亿参数的点版本模型体积是其所取代模型的大约 2.5 倍以上。
事实上,该模型的规模甚至超过了曾在 2025 年初让 DeepSeek 声名大噪的 V3 和 R1 模型。
尽管参数规模极其庞大,但 DeepSeek V4.1 Flash 的内存需求并没有人们对同等规模模型预期的那么高。
在底层,DeepSeek 的开发人员进行了大量的架构更改,使大语言模型变得更聪明的同时,大幅减少了提供服务所需的资源。DeepSeek 通过两项关键改进实现了这一点。
首先,它对模型处理键值(KV)缓存的方式进行了重大更改,这些缓存用于跨多个会话跟踪模型状态。
这些所谓的 KV 缓存非常消耗内存,特别是在聊天机器人等高吞吐量应用中。
该模型各种注意力机制的更新以及新型因果编解码器(CED)的引入,使开发人员能够提高提示词处理性能,同时将 KV 缓存消耗量降至 DeepSeek V4 Flash 要求的 13% 到 25% 之间。
换句话说,V4.1 版本能够在相同的 KV 缓存占用空间内支持多达四到八倍的用户。
DeepSeek 的技术报告详细阐述了架构方面的更多改动,但可以说是其中最有趣的改动是引入了一种不同类型的模型权重。
在其 7630 亿参数中,有 1960 亿是 N 元语法(N-gram)参数,它们构成了 DeepSeek 开发人员所称的“条件内存模块”。
其核心理念是,通过将内存与计算解耦,DeepSeek 能够使模型更聪明,同时减少为其提供服务所需的计算和内存资源。到底什么是 N 元语法?
DeepSeek V4.1 Flash 内存模块背后的核心理念在许多方面类似于谷歌 Gemma 团队最初开发的每层嵌入(PLE)技术。
PLE 的目标是使大语言模型足够聪明,从而能够在带宽、内存和计算受限的设备(如智能手机)上实用化。
DeepSeek 的实现方案在一月份的一篇研究论文中首次详细披露,它用 N 元语法替换了 PLE 嵌入。
从宏观层面来看,N 元语法其实就是一组组标记(tokens)。
三元语法(three-gram)就是连续的三个标记,二元语法就是两个,以此类推。
听起来可能很复杂,但它的运作方式实际上有点像单词或短语联想。N 元语法参数类似于一种隐式知识或内化记忆的来源。
权重不再仅仅像传统大语言模型那样计算哪种标记组合回答问题的概率最高,而是通过廉价的查找快速浮现相关信息,从而对计算进行补充。这在很大程度上简化了底层的实际运作。事实上,模型并不是在查找提示词,而是在查找一系列哈希值。
最终的结果是:模型能够提供更聪明、更细致的回答,而没有通常与附加参数相关联的性能惩罚。为什么 N 元语法如此廉价?模型规模与智能之间的关系目前已得到充分证实。
DeepSeek 的 N 元语法参数之所以如此有趣,实际上与数据的访问方式有关。作为一般规律,现代大语言模型在解码时是自回归的。
这意味着聊天机器人或智能代理生成的每一个标记,都必须从内存中读取模型的全部活动权重,从而使带宽成为限制因素。
正如我们之前讨论过的,架构上的更改(例如专家混合模型的兴起或超低精度块浮点数据类型)有助于将这一瓶颈降至最低。
但 DeepSeek V4.1 Flash 中发现的 N 元语法权重的工作方式略有不同。
它们提供了一种在推理过程中有效增加模型可用参数数量的方法,而不会成比例地增加内存压力。这些 N 元语法权重本质上是巨大的查找表(LUT)。
这使得它们的查询速度快且成本低,因为与模型的其余活动参数不同,它们不需要在每次生成标记时从内存中完整读取。每个标记只需进行几十次表查找。
这给内存访问带来了一些影响,其中最主要的影响是这些 N 元语法权重不必为了维持性能而被挤进 GPU 内存中。
它们可以卸载到系统内存,甚至可能卸载到速度足够快的存储阵列中。那么这在实践中意味着什么呢?
如果你看看 DeepSeek V4.1 Flash,该模型在 FP8 精度下通常需要至少 763 GB 的 GPU 内存来保存权重。
然而,由于这些 N 元语法权重可以卸载到更便宜的系统内存中,我们只需要大约 567 GB 的 GPU 内存即可。
我们在此强调的是最低要求,因为在生产环境中,这些数字会显著更高,因为我们还需要考虑到随上下文长度和并发用户规模扩展的键值(KV)缓存。
在推理过程中,这些 N 元语法权重补充了 DeepSeek 用于处理提示词的 80 亿个活动参数,理论上在此过程中提高了输出的准确性和质量。
值得注意的是,N 元语法参数实际上并没有增加活动参数的数量。
相反,它们的运作方式更像是一本奇怪的特定百科全书,当模型处理提示词时,它几乎会立即打开相关的页面。
开源大语言模型的未来虽然 DeepSeek 的最新模型可能拥有迄今为止最大的 N 元语法参数池之一,但它并不是唯一一家押注该技术以提高部署大型模型效率的模型开发商。
正如前面提到的,谷歌已经在使用类似的方法,利用 PLE 将对带宽不那么敏感的权重卸载到本地存储。
到目前为止,它仅被应用于微型模型——至少据我们所知(谷歌对其专有模型并不是特别透明)。
与此同时,在上个月下旬,阿里巴巴透露了其代号为 Qwen 3.8-Flash-Next 的最新实验模型。
就像 DeepSeek V4.1 Flash 一样,这个拥有 1800 亿参数的模型也拥有一个由 510 亿 N 元语法权重组成的大型参数池,原因大同小异。
事实上,该模型的 N 元语法实现方式借鉴了 DeepSeek 团队在一月份发表的同一篇研究中的技术。
据阿里巴巴称,Qwen 3.8-Flash-Next 的架构基础将构成其下一代 Qwen 4 模型到来时的基石。
这意味着,不管你喜欢与否,这大概不会是你最后一次听到 N 元语法。