字号 ·· | 护眼
thenextweb

一家手机制造商如今拥有了全球顶尖的开源权重AI模型

关键信息:这款名为 MiMo-V2.6 的模型采用了“开放权重”(open-weight)架构,其所有源代码均已公开。

小米的发布声明:周二,小米在发布 MiMo-V2.6 时强调了这一关键特性。这家手机和电动汽车制造商基于 MIT 的许可协议,推出了两款基于该模型的产品:Pro 和 Flash。这些模型的源代码托管在 Hugging Face 平台上。

性能评估:根据基准测试机构 Artificial Analysis 的评估,MiMo-V2.6-Pro 在其智能指数(Intelligence Index)中获得了 46 分,在该类别的 114 个模型中排名首位。这也是目前所有开放权重模型中取得的最高分数;同时,该模型也是该公司追踪的所有模型中运行成本最低的模型——每个处理任务的成本仅为 0.13 美元。

模型架构: MiMo-V2.6-Pro 是一种“稀疏专家混合模型”(sparse mixture-of-experts model),总参数数量为 1.02 万亿个,其中只有 420 亿个参数在处理数据时会被激活,因此该模型在保持高性能的同时具有较低的运行成本。

模型功能:该模型能够处理文本、图像、音频和视频数据,并能存储多达一百万个上下文信息(即“token”)。这些数据量足以支持长期的数据存储需求、完整的工具运行流程,或模拟智能体的多次工作记忆操作。

收费标准:小米对每个输入数据的处理费用为 0.435 美元,对每个输出数据的处理费用为 0.87 美元。相比之下,Anthropic 公司的 Claude Opus 5.5 的收费标准分别为 4 美元和 20 美元。

竞争优势:小米表示,MiMo-V2.6-Pro 的性能超过了 Moonshot 公司的 Kimi K3 以及阿里巴巴的 Qwen3.8 Max;在今年的大部分时间里,这两款模型一直占据着开放权重模型领域的领先地位。目前,这两款模型均已正式上线,可在小米的 AI Studio、MiMo Code 和 MiMo Desktop 应用程序中通过其自家的 API 平台进行使用;用户也可以直接从 Hugging Face 平台下载模型的源代码。

更高性能的版本:此外,小米还推出了 Pro-UltraSpeed 版本,其处理速度是 Pro 版本的 20 倍,但成本也相应提高了 10 倍(每个输入/输出数据的费用分别为 4.35 美元和 8.70 美元)。

训练过程:整个模型的训练过程仅耗时六天,训练过程中使用了大量的强化学习数据(约 75 万个训练轨迹)。其中,Pro 版本的训练成本约为 262 万美元,Flash 版本的训练成本约为 85 万美元。

直播演示:小米在训练过程中进行了实时直播,向公众展示了整个训练过程。

在 DeepSWE(一个备受关注的软件工程基准测试项目中),小米公司的 Pro 模型在测试过程中的得分从 58.4 分提升到了 72.57 分;Flash 模型的得分则从 48.8 分提升到了 65.68 分。

大多数研究机构会针对不同的测试领域分别进行训练。而小米公司将编码任务、通用智能体(general agents)、视觉处理任务以及网络安全任务整合到了同一个训练环境中,这样各个领域的进步能够相互促进、共同提升模型的性能。

小米公司还详细介绍了自己为防止模型被“奖励攻击”(reward hacking)所采取的防护措施。他们发现,早期的智能体会通过从软件包的后续版本中获取修复代码来解决问题,而不是自己编写修复代码。此外,他们清除了训练环境中的构建缓存数据以及未来的 Git 版本记录,并专门部署了一个智能体来查找系统中可能存在的漏洞。

Flash 模型是大多数公司会实际使用的模型;而 Pro 模型虽然表现更优秀,但可能不会被广泛采用(因此不太可能出现在实际生产环境中)。Flash 模型的训练成本为每百万个训练令牌 0.14 美元,而 Pro 模型的成本为每百万令牌 0.28 美元——Pro 模型的成本大约是 Flash 模型的三倍。不过,两者在训练数据(每百万令牌的上下文信息)和输入数据类型(多模态输入)方面是完全相同的。

在小米公司自己开发的多数测试基准测试中,Pro 模型的得分都比 Flash 模型高出 4 分或更少:在 DeepSWE 中 Pro 模型的得分为 71.9 分,Flash 模型为 67.9 分;在 AutomationBench 中 Pro 模型的得分为 53.1 分,Flash 模型为 52.3 分;在 JobBench 中 Pro 模型的得分为 62.0 分,Flash 模型为 61.2 分。

在专门针对网络安全的测试项目 CyberGym 中,Flash 模型的得分(95.1 分)高于 Pro 模型(94.0 分)。不过在另外三个网络安全测试项目中,Pro 模型的表现明显更出色。

不过,小米公司在自己的测试结果中也存在一些失利的情况:Claude Opus 5 模型在 DeepSWE 和 ProgramBench 中的表现优于 Pro 模型;在 Terminal Bench 4.0 中,Pro 模型的得分(34.9 分)远低于 Claude Opus 5 模型(49.0 分),而 GPT-6 Astra 模型的得分为 59.6 分。

相关排行榜也显示了类似的趋势:在 Artificial Analysis 测试中,Claude Opus 5 模型的得分为 58 分,远高于 Xiaomi 的 MiMo 模型(46 分)。虽然小米公司在“开放权重”(open-weight)类别中处于领先地位,但在整个测试领域中并非如此。

小米公司表示,在大多数测试基准测试中,Pro 模型的表现与 Claude Opus 5 模型和 GPT-5.6 模型相当。不过这一结论仅基于小米公司自己的测试结果;实际上,MiMo 模型的得分(46 分)可能并不代表其真实水平。

值得注意的是,小米公司发布的成果远不止这些:通常情况下,一个“开放权重”版本的模型发布会附带相应的权重设置说明和学术论文,但小米公司发布的资料内容要丰富得多。

随两款模型一同发布的还有完整技术报告、端到端强化学习框架、7000多个带自动评分器的强化学习任务环境、一套可组合的迷你测试框架,以及一个从MiMo训练过程中蒸馏出的小型模型。

这些任务涵盖软件开发、网络安全、办公工作和网页设计。另有约一千个任务涉及音乐创作。

小米还公开了奖励设计、超参数、数据配比和成本。其明确目标是可复现性,并邀请研究人员验证结果。

这可能比排名本身更重要。排行榜上的位置只能维持几周。一个已公开的强化学习框架,如果能让规模较小的实验室在较小的模型上运行,就会改变一个资金充足的研究团队能够尝试的范围。

为什么价格才是真正的关键 排名更迭很快。DeepSeek在8月保持着运行成本最低的头衔,Kimi K3在7月占据着开源模型的王座。

运营成本差距的变化则慢得多。一家每天运行数百万次智能体调用的公司,要在每百万输出token 0.87美元和Opus 5.5的20美元之间做选择。对于一个编程助手或文档处理流水线来说,每项任务要消耗数十万token,这比基准测试更能决定采购决策。

小米也是Anthropic在9月10日一份威胁报告中点名的七家中国实验室之一,该报告指控它们通过Claude路由请求以获取其输出。小米尚未对该指控作出回应。

它所做的,是把权重、代码、环境和账单交到任何想验证其说法的人手中。