基本情况

2026 年 9 月 22 日,小米交出 MiMo-V2.6-Pro。上一代 Pro 是 4 月 15 日的 V2.5-Pro,间隔五个月出头——放在国产头部模型两个月一小步的节奏里,这不算快,但小米把这段时间花在了一个很具体的方向上:把工具用熟,把长任务跑完。前代留下的问题是能力面窄,V2.5-Pro 在榜上只有 13 个 benchmark,其中能和 V2.6-Pro 直接对上的仅两个:HLE 从 40.0 涨到 49.0(+9.0),自建的 MiMo Coding Bench 反而从 73.7 掉到 63.2(−10.5)。口径太薄,纵向对比只能往更宽的 V2.5(3 月 15 日)去找:HLE 25.2 → 49.0(+23.8),SciCode 43.1 → 61.0(+17.9),CritPT 3.7 → 27.0(+23.3),AA-LCR 62.7 → 86.0(+23.3),Agents’ Last Exam 23.6 → 31.6(+8.0)。半年的着力点,基本都落在”会用工具”这一侧。

发布时机在九月这个超级月的尾巴上:GPT-6 Astra、Claude Fable 5.1、Gemini 3.8 Flash、Muse Spark 1.3 挤在同一周,Qwen3.8-Max-0902、DeepSeek-V4.1-Flash 随后,阶跃星辰的 Step 5 Preview 是两天前。MiMo-V2.6-Pro 带着 27 个 benchmark 入场,其中 Terminal-Bench 4.0 按官方报告与 Artificial Analysis 两个口径分别列示、各占一格,合计 28 格;进入综合排名统计的是 18 格(Code 榜 8 项、General 榜 10 项),榜单上暂无 V2.6 的价格与 Token 数据,档位与成本策略无从谈起,这里只谈分数。

结果是一次到位:综合榜全球第六、国产第一,Code 榜全球第六、国产第一,General 榜全球第七、国产第一。三榜国产头名同时收入囊中,在今年的发布里是头一回。

优势

Agent 与工具调用:AutomationBench 在 35 个模型里排第一

这是 MiMo-V2.6-Pro 最硬的一块。AutomationBench 拿到 59.0,全榜第一,领先 DeepSeek-V4.1-Flash 的 54.8 有 4.2 分,对 Grok 4.5(51.0)、Qwen3.8-Max-0902(50.8)、Claude Opus 5(50.3)、GLM-5.3(48.2)、Kimi K3(46.7)的领先都在七分以上,比 GPT-6 Astra 的 41.4 高出近 18 分——一个国产模型在”把事办成”这个最朴素的维度上压住了所有北美旗舰。Toolathlon-Verified 76.9 排第三,距 Claude Fable 5.1 的 77.9、Claude Opus 5 的 77.6 只差 1.0 与 0.7 分,却已越过 Kimi K3 的 76.5 和 Qwen3.8-Max-0902 的 73.3。配套的视觉编程也没有掉队,MiMo Visual Coding 拿到 72.3;JobBench 62.0 排第四,落后 Claude Opus 5 的 68.0、Muse Spark 1.3 的 64.9 和 Qwen3.8-Max-0902 的 64.0,但压住 GLM-5.3 的 58.2、Kimi K3 的 54.3 与 DeepSeek-V4.1-Flash 的 44.3。也就是说,在最能体现实战成色的两个 Agent 榜上,它要么第一,要么在 1 分以内。

安全攻防:CyberGym 紧随自家 Flash,SEC-Bench Pro 越过 DeepSeek

安全是这一代的意外之喜。CyberGym 94.0 排第二,前一名是同门 MiMo-V2.6-Flash 的 95.1,再往下是 DeepSeek-V4.1-Flash 的 88.1(差距 5.9 分)、Step 5 Preview 的 84.7、GLM-5.3 与 GPT-5.6 Sol 的 84.5、Kimi K3 的 80.0——也就是说这个榜的前两名全是小米,且对北美旗舰的领先接近十分。SEC-Bench Pro 66.3 排第三,落后 GPT-6 Astra 的 85.4 和 GPT-5.6 Sol 的 71.2,但压住了 DeepSeek-V4.1-Flash 的 62.8。自建的 MiMo Cyber Bench 81.7 与 MiMo Visual Coding 72.3 都只高于自家 Flash 的 77.2 与 71.5,没有任何第三方参照,榜单只作展示、不计入排名,此处仅记录。需要泼一点冷水的是 ExploitBench 47.9 只排第十——它与 GPT-5.5 同分,因榜单按行序定名次而列在其后,前面的 GPT-6 Astra 是 100.0、Claude Fable 5 与 Claude Mythos 5 都是 78.0——”找漏洞”和”打比赛”之间还有一道坎。

编程:Terminal-Bench 2.1 与 SciCode 双榜眼

Code 榜只有 8 项参评,但两项都咬住了前排。Terminal-Bench 2.1 拿到 89.9,在 52 个模型里排第二,仅次于 DeepSeek-V4.1-Flash 的 90.6,差 0.7 分;后面紧跟着 GPT-5.6 Sol 与 Muse Spark 1.3 的 88.8、Kimi K3 的 88.3、GLM-5.3 的 88.2,第三名到第六名之间总共只差 0.6 分,MiMo-V2.6-Pro 是挤在最顶上的那个。SciCode 61.0 同样排第二(68 个模型参评),落后 Claude Fable 5.1 的 62.0 一分,高于 Claude Fable 5 的 60.2、Kimi K3 的 59.0、Step 5 Preview 的 58.9、GPT-5.6 Sol 的 57.0 与 Claude Opus 5 的 55.0。JobBench 62.0 之外,DeepSWE 1.1 的 71.9 排第七,是唯一明显居中的一项,前面是 Muse Spark 1.3(75.4)、DeepSeek-V4.1-Flash(74.2)、GPT-6 Astra(74.1)、Claude Opus 5(74.0)、Gemini 3.8 Flash(73.7)。需要说明的是,Code 榜上排在它前面的五名里,Claude Fable 5.1 与 Claude Opus 5 分别有 10 个和 18 个 Code benchmark、Claude Fable 5 有 16 个,确实是拿参赛面积换的;但 GPT-6 Astra 的 8 个、Muse Spark 1.3 的 4 个都不比 MiMo-V2.6-Pro 的 8 个更多——前排不全是面积堆出来的,而在它参评的每一项上,它都咬在第一梯队。

知识检索:AA-LCR 全榜第二,反超北美旗舰

AA-LCR 86.0 是 MiMo-V2.6-Pro 分数最亮眼的一项,仅次于 Step 5 Preview 的 88.3,高于 Muse Spark 1.2(83.0)、Gemini 3.8 Flash 与 Muse Spark 1.1(均 81.0)、Claude Fable 5.1(80.0)、GLM-5.3(76.0)、Kimi K3(75.0)、DeepSeek-V4.1-Flash(74.2)和 GPT-6 Astra(74.0)。这个 benchmark 考的是”带着来源回答长问题”,一个一直在榜单中下游的系列,在知识检索这一项上压住了 GPT-6 Astra 十二分,这不是运气。同一方向的 HLE 49.0 排第七(90 个模型参评),也高过 Kimi K3 的 46.9、GLM-5.3 的 42.3 和 DeepSeek-V4.1-Flash 的 36.8。展示位的 GDPval-AA v2 Elo 1673 排第十三,低于 GLM-5.3 的 1769 与 Kimi K3 的 1682,高于 Gemini 3.8 Flash 的 1545。

不足

知识准确率:AA-Omniscience Accuracy 只有 35.0

这是最刺眼的一格。AA-Omniscience 准确率 35.0,在 40 个模型里排第三十一。Claude Fable 5.1 是 67.0、GPT-6 Astra 63.0、Claude Fable 5 61.0、GPT-5.6 Sol 59.0,与榜首的差距是 32 分。同一个 benchmark 的非幻觉率倒是 59.0、排第十四,前面是 MiniMax-M3(84.0)、GLM-5.2(74.0)、GLM-5.3-Flash(72.0)、GLM-5.3 与 Qwen3.8-27B(均 70.0)。两组数字放在一起,说明的不是”它爱编”,而是”它不知道”:知道自己不知道的自觉有了,知识的家底还没有。公平地说,这一项并非它独有——DeepSeek-V4.1-Flash 的 35.4 只比它高 0.4 分,GLM-5.3 的 34.0 就排在它身后;但对一个 AA-LCR 能拿 86.0 的模型,知识准确率停在 35.0,暴露的正是”会找”与”记得”之间的那道沟。

难度抬一档就露底

Terminal-Bench 4.0 现在按两个口径分别列示。官方报告口径,MiMo-V2.6-Pro 是 34.9,在 9 个有官方报数的模型里排第六,前面是 GPT-6 Astra 57.9、Claude Fable 5.1 55.8、Claude Opus 5 52.3、Claude Fable 5 42.0、GPT-5.6 Sol 37.3,与榜首相差 23.0 分。Artificial Analysis 口径则是 35.0,在 10 个模型里排第五,前面的 GPT-5.6 Terra 55.8、GPT-5.6 Luna 55.1、Claude Opus 5 51.8、GPT-5.6 Sol 37.3 全都没有官方数字可比。两套口径的结论一致:这一项它进不了前四。ProgramBench 26.5 排第五,低于 Claude Opus 5 的 41.5 与 Claude Fable 5 / 5.1 的 33.0——Step 5 Preview 那个 80.5 因口径不一致已被榜单排除出排名,不参与比较。漏洞利用侧同样吃力:ExploitBench 47.9 只排第十(与 GPT-5.5 同分)、ExploitGym 17.8 排第九,而 GPT-5.6 Sol 在这两个榜上分别是 76.5 与 216,Claude Fable 5 的 ExploitGym 是 181、GLM-5.3 是 105。CritPT 27.0 排第八,前面是 GPT-5.6 Sol(32.3)、GPT-6 Astra(32.0)、Claude Fable 5.1(30.0)。超长程、超高难度的任务上,MiMo-V2.6-Pro 与北美旗舰之间还隔着一整个身位——这在国产模型里是通病,但它确实还没有迈过去。

覆盖窄、自建题多、ClawProBench 缺席

27 个 benchmark(Terminal-Bench 4.0 两个口径共 28 格)里只有 18 格进得了排名,Code 榜 8/26、General 榜 10/55、综合榜 18/81,其中还包括三个 MiMo 自有 benchmark——三者都只有自家 V2.6 两代互相比,没有任何第三方参照(MiMo Coding Bench 73.7→63.2、MiMo Cyber Bench 77.2→81.7、MiMo Visual Coding 71.5→72.3),榜单只作展示、不计入排名。窄覆盖在胜率制排序下是把双刃剑:它让 MiMo-V2.6-Pro 在自己参评的项上几乎场场小胜,却也让它从未在宽口径考场上证明过自己——OSWorld-Verified 82.0 只排第八(前面是 Qwen3.8-Max 的 86.1、Claude Fable 5 的 85.0、Qwen3.8-27B 的 84.3、Claude Opus 4.8 的 83.4、GPT-5.6 Sol 的 83.2),GDP.pdf 19.0 排第十三,Claude Opus 5 是 37.0。另一个必须记下的信号:自建的 MiMo Coding Bench 从 V2.5-Pro 的 73.7 退到 63.2,是全部共同项里唯一明显回退的一个——一个团队敢把退步的数字一起放出来,比只放涨的更难得。另外,ClawProBench(OpenClaw 实战编程)榜上目前还没有 V2.6 的实测记录,MiMo 系列的最高位次仍是 mimo-v2.5-pro 的第 15 名(63.30 分),这一场考试,小米还没进场。

酥悠沫评

士别三日,即更刮目相待。——《三国志·吴书·吕蒙传》

吕蒙从”吴下阿蒙”到”非复吴下阿蒙”,靠的不是天赋被重新发现,而是忽然知道自己该读什么书。MiMo-V2.6-Pro 有几分相似:五个月前它还是个在榜单中下游安静排着的系列,一次发布之后,AutomationBench 59.0 站上 35 个模型之首,CyberGym 94.0 与自家 Flash 包揽前二,Terminal-Bench 2.1 的 89.9 距榜首 0.7 分,SciCode 61.0 距 Claude Fable 5.1 一分,AA-LCR 86.0 反超 GPT-6 Astra 的 74.0 十二分。综合第六、Code 第六、General 第七,三榜国产第一。

但刮目之后仍要看清那双眼睛在看什么地方。九月的牌桌上,Claude 与 OpenAI 在极限难度上加注——Terminal-Bench 4.0 是 55.8 与 57.9,ExploitBench 是 100.0 与 76.5;小米选了另一条路,把力气花在把工具用熟、把漏洞找出来、把该引的引对。这条路走通了,Code 榜全球第六、国产第一就是证据;这条路也有边,AA-Omniscience 准确率的 35.0 对 67.0、ExploitGym 的 17.8 对 216、27 个 benchmark 里只有 18 格敢进排名,都是那道边。

后来者的好处是知道自己缺什么,难处是时间总不够用。MiMo-V2.6-Pro 已经证明”够用”二字可以做到国产最好,剩下的问题是:当北美旗舰把难度再抬一档时,这把尺子还量不量得到自己。


  • 综合榜单:https://suyoumo.github.io/llm-leaderboard/