小米发布并开源MiMo-V2.6系列模型
小米 MiMo 正式发布并开源
MiMo-V2.6,包括Pro和Flash两个原生全模态模型,并提供最高 20 倍 速度的Pro UltraSpeed模式。Pro版为 1.02T 总参数、42B 激活参数,Flash版为 309B 总参数、15B 激活参数,均支持文本、图像、视频、音频和 1M Token 上下文。小米同时开源模型权重、技术报告、Distill-Qwen-9B模型、7K+ RL 环境及完整训练框架;新模型定价不变,旧版mimo-v2.5-pro和mimo-v2.5将于 10 月 21 日 下线。
小米 MiMo 正式发布并开源 MiMo-V2.6 系列,将这次升级的重点放在大规模强化学习和模型自我改进上。
系列核心包括 MiMo-V2.6-Pro 和 Flash 两个原生全模态模型,同时提供 Pro UltraSpeed 超高速模式,面向实时交互场景可提供最高 20 倍 推理速度。Pro 采用稀疏 MoE 架构,总参数量 1.02T、激活参数 42B;Flash 总参数量 309B、激活参数 15B,两者均支持文本、图像、视频和音频输入,以及 1M Token 上下文。
这次训练的核心变化是进一步扩大 Agentic RL 的规模。官方称,Flash 和 Pro 在不到 6 天内分别投入约 85 万美元 和 262 万美元 完成 30 步 强化学习训练,累计产生约 75 万条 轨迹;训练任务平均通过率分别提升约 25% 和 12%。
性能方面,小米 称 MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 中取得 46 分,高于其列出的 Kimi K3 和 Qwen3.8 Max,并表示其在多项 Agent Benchmark 上接近 Claude Opus 5 和 GPT-5.6 Sol。
配套资源也同步开放:小米 开源 Pro、Flash 权重和技术报告,以及基于 Qwen3.5-9B 微调得到的 MiMo-V2.6-Distill-Qwen-9B,并发布 7K+ RL 任务环境、端到端 RL 训练框架和 mini-harnesses,供社区继续进行 Agentic RL 研究。
MiMo-V2.6 已接入桌面客户端和开放平台,API 价格沿用 V2.5;现有 mimo-v2.5-pro 和 mimo-v2.5 计划于北京时间 2026 年 10 月 21 日 10:00 下线。




相关链接:









