2026年09月22日,小米 MiMo 团队正式发布并开源 Xiaomi MiMo-V2.6 系列。该系列包含 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 两个原生全模态模型,是小米探索 RSI(递归自我改进)路径的一次重要尝试。
MiMo-V2.6 的核心变化,是进一步扩大智能体强化学习的训练规模。官方披露,两款模型经历了约6天的 Live RL 训练,Flash 与 Pro 的训练成本分别约为85万美元和262万美元,各完成30步训练,累计产生约75万条轨迹。
在训练过程中,小米从训练批次、任务环境和奖励评估三个方向扩展RL算力。单次更新使用1568个样本,支持最高1M上下文长度训练,单步训练Token量达到27亿至37亿。训练任务覆盖代码、通用任务、视觉理解和网络安全等方向,并混合多种Agent Harness,增强模型在不同智能体框架中的适应能力。
在长程软件工程基准 DeepSWE v1.1 上,MiMo-V2.6-Flash 的成绩由48.8提升至65.68,MiMo-V2.6-Pro由58.4提升至72.57。根据小米公布的数据,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 中获得46分;这一结果反映特定测试设置下的表现,模型在真实业务中的效果仍需结合具体任务验证。
除代码和智能体任务外,MiMo-V2.6 还融合了多模态感知、3D空间推理和Computer Use能力。模型可以根据文字、图片或视频构建3D开放世界,在Blender中辅助完成三维建模,也能通过视觉反馈操作办公软件、处理数据及检查任务结果。在具身仿真环境中,模型还展示了控制机械臂完成物体抓取、颜色匹配和精准放置的能力。
在科研场景中,MiMo-V2.6-Pro 被用于材料设计、文献与专利检索、计算实验以及Lean 4形式化证明。内容创作方面,模型可生成前端网页、PPT、SVG、视频和音乐等数字内容,并协调代码、设计和多媒体工具完成较完整的创作流程。
本次小米同步开放 MiMo-V2.6-Pro、MiMo-V2.6-Flash 以及 MiMo-V2.6-Distill-Qwen-9B,并提供7000余个高质量RL任务环境、端到端训练框架和轻量级mini-harnesses。相关模型与资源已上线 Hugging Face。
普通用户可以通过 MiMo Desktop 使用新模型,开发者则可通过开放平台API接入。MiMo-V2.6系列沿用上一代API定价,Pro版本还提供UltraSpeed高速模式,官方称最高可获得普通模式约20倍的输出速度。


