小米发布 MiMo-V2.6 系列模型,刷 AI 大模型斩杀线
小米正式发布并开源 MiMo-V2.6 系列模型,包含两款原生全模态模型:面向复杂编程与 Agent 任务的 MiMo-V2.6-Pro,以及强调性能与成本平衡的 MiMo-V2.6-Flash。此外,小米还推出了输出速度最高达 Pro 版本 20 倍的 MiMo-V2.6-Pro-UltraSpeed。
豪赌强化学习,公开训练过程
小米将一场持续近六天、合计花费约 347 万美元的强化学习训练公开。技术报告显示,Flash 和 Pro 分别完成 30 个 RL step,各自产生约 75 万条训练轨迹。每个 step 包含 1568 个 prompt,同时生成 16 条候选轨迹,最长上下文达 100 万 token。小米将其视为探索递归自我改进(RSI)路线的重要尝试。
性能对标前沿,开源贡献慷慨
在 Artificial Analysis Intelligence Index v4.3 中,Pro 获得 46.32 分,超越 Kimi K3 和 Qwen3.8 Max,成为该榜单得分最高的开源模型。在 DeepSWE、Toolathlon 等多项基准测试中,MiMo-V2.6 表现接近或超越部分头部闭源模型。
除模型权重外,小米还开源了训练曲线、奖励机制、关键参数,以及由 Qwen3.5-9B 蒸馏而来的 MiMo-V2.6-Distill-Qwen-9B 和约 7000 个 RL 任务环境。
技术难度超 DeepSeek R1
罗福莉表示,MiMo-V2.6 背后的研究创新和工程难度甚至超过 DeepSeek R1。团队通过 MixRL 处理可验证的 Agent 任务,通过 MOPD 合并游戏、3D 等主观任务,扁平的团队结构有效降低了组织成本。
拓展 Vibe World 与极致性价比
MiMo-V2.6 将能力从自然语言编程延伸至可交互的数字世界(Vibe World),支持搭建 3D 场景、具身仿真控制、网页与幻灯片生成,甚至辅助科研形式化验证。
在价格方面,MiMo-V2.6 系列 API 价格仅为海外同级模型的 1/20 至 1/60。小米正以极高的智能水平和极低的调用成本,成为 AI 模型市场新的能力与价格斩杀线。
原始来源: 36氪 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。