字号 ·· | 护眼
南华早报

深度求索称新款 Flash 人工智能模型在网络安全和编程基准测试中击败 Kimi K3

深度求索(DeepSeek)发布了 V4.1 Flash 模型,宣称其性能超越了上一代旗舰产品,同时降低了推理成本并提升了运行速度——这是中国激烈的价格与性能大战中的又一最新举措。

这家中国人工智能开发商周四表示,V4.1 Flash 采用了全新的“因果-编码器-解码器”(Causal-Encoder-Decoder)架构。尽管它构建于 5520 亿参数的大规模框架之上,但采用了混合专家(MoE)设计。

在传统人工智能中,每个查询都要通过整个系统运行。而 MoE 系统仅将任务路由到最适合该工作的特定子网络。深度求索表示,通过仅激活 80 亿参数来处理输入、激活 16 亿参数来生成响应,该模型显着降低了每个请求所需的计算能力。

深度求索将 V4.1 Flash 描述为其新系列中最小的模型,并具备原生多模态视觉理解能力。该公司表示,该模型在评估编程、网络安全和自主智能体任务的基准测试中表现优于 V4 Pro。

此次发布正值科技巨头和纯人工智能开发商在中国各地展开激烈的商业化人工智能争夺战之际。

随着硬件成本的上升以及外国芯片出口限制收紧了计算约束,中国玩家正在竞相提供高效的模型,以极低的运营成本提供高端推理。

在测试人工智能真实世界计算任务的 Terminal-Bench 2.1 上,V4.1 Flash 得分为 90.6,超过了 OpenAI 的 GPT-5.6 Sol(88.8)、月之暗面(Moonshot AI)的 Kimi K3(88.3)以及深度求索自己的 V4 Pro(87.9)。

在测试人工智能网络安全任务的基准测试 Cybergym 上,V4.1 Flash 得分为 88.1,领先于 V4 Pro(83.3)、Kimi K3(80)以及 OpenAI 的 GPT-5.6 Sol(84.5)。

在软件工程基准测试 DeepSWE v1.1 上,V4.1 Flash 微弱优势险胜 Anthropic 的 Claude Opus 5,不过美国模型在其他测试中仍保持领先地位。深度求索表示,新架构的一大突破是内存优化。

该公司表示,它减少了模型的键-值(KV)缓存——这是人工智能用来记住对话早期部分的临时内存存储。

通过将该内存占用缩小到每个标记(token)890 字节(低于上一版 Flash 的 3,514 字节),该公司表示其显著降低了人工智能智能体的推理成本。

深度求索将非高峰时段的应用程序编程接口(API)费率大幅削减至每百万个已缓存输入标记低至 0.02 元人民币(0.003 美分)。

深度求索 Harness 团队负责人崔天翼周三在社交平台 X 上表示:“鉴于 DeepSeek V4.1 Flash 模型在所有指标上全面超越 V4 Pro……以更高的价格向 DeepSeek 用户提供原本表现较差的 V4 Pro 模型是不合适的。”

该公司周三在给用户的一则通知中表示,深度求索将暂时把所有 V4 Pro 请求路由至更便宜的 Flash 模型,直至功能更强大的 V4.1 Pro 准备就绪。

这次发布突显了中国开发者之间日益增长的趋势,他们正通过“Flash”变体来争夺客户。

上个月,智谱 AI(Z.ai)推出了 GLM-5.3-Flash(此前代号为 Ox Alpha),该模型选择性地仅激活其 3200 亿参数中的 180 亿参数。

拥有《南华早报》的阿里巴巴集团控股有限公司推出了 Qwen3.8-Flash-Next,在其 1250 亿参数中仅激活了 60 亿。