AI

小米发布MiMo-V2.6系列模型,称技术难度超DeepSeek R1

小米正式发布并开源MiMo-V2.6系列模型,包含面向复杂任务的Pro版和强调效率的Flash版。小米公开了耗资347万美元、持续六天的强化学习训练过程,探索递归自我改进路线。测试显示该模型在多项基准中表现优异,且API价格极具竞争力。罗福莉表示,其背后的研究创新和工程难度超过DeepSeek R1,正成为AI模型市场新的能力与价格斩杀线。

来源:36氪

小米发布 MiMo-V2.6 系列模型,刷 AI 大模型斩杀线

小米正式发布并开源 MiMo-V2.6 系列模型,包含两款原生全模态模型:面向复杂编程与 Agent 任务的 MiMo-V2.6-Pro,以及强调性能与成本平衡的 MiMo-V2.6-Flash。此外,小米还推出了输出速度最高达 Pro 版本 20 倍的 MiMo-V2.6-Pro-UltraSpeed。

豪赌强化学习,公开训练过程

小米将一场持续近六天、合计花费约 347 万美元的强化学习训练公开。技术报告显示,Flash 和 Pro 分别完成 30 个 RL step,各自产生约 75 万条训练轨迹。每个 step 包含 1568 个 prompt,同时生成 16 条候选轨迹,最长上下文达 100 万 token。小米将其视为探索递归自我改进(RSI)路线的重要尝试。

性能对标前沿,开源贡献慷慨

在 Artificial Analysis Intelligence Index v4.3 中,Pro 获得 46.32 分,超越 Kimi K3 和 Qwen3.8 Max,成为该榜单得分最高的开源模型。在 DeepSWE、Toolathlon 等多项基准测试中,MiMo-V2.6 表现接近或超越部分头部闭源模型。

除模型权重外,小米还开源了训练曲线、奖励机制、关键参数,以及由 Qwen3.5-9B 蒸馏而来的 MiMo-V2.6-Distill-Qwen-9B 和约 7000 个 RL 任务环境。

技术难度超 DeepSeek R1

罗福莉表示,MiMo-V2.6 背后的研究创新和工程难度甚至超过 DeepSeek R1。团队通过 MixRL 处理可验证的 Agent 任务,通过 MOPD 合并游戏、3D 等主观任务,扁平的团队结构有效降低了组织成本。

拓展 Vibe World 与极致性价比

MiMo-V2.6 将能力从自然语言编程延伸至可交互的数字世界(Vibe World),支持搭建 3D 场景、具身仿真控制、网页与幻灯片生成,甚至辅助科研形式化验证。

在价格方面,MiMo-V2.6 系列 API 价格仅为海外同级模型的 1/20 至 1/60。小米正以极高的智能水平和极低的调用成本,成为 AI 模型市场新的能力与价格斩杀线。

原始来源: 36氪

本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。

更多「AI」资讯

让品牌在 AI 中生长

免费诊断你的品牌 AI 可见度