9月22日,小米MiMo团队发布并开源MiMo-V2.6系列模型,包括旗舰模型MiMo-V2.6-Pro和侧重效率的MiMo-V2.6-Flash。两款模型均采用稀疏混合专家架构,原生支持文本、图像、视频和音频输入,最长上下文窗口达100万Token。其中,Pro总参数1.02万亿,激活约420亿;Flash总参数3090亿,激活约150亿。
基准测试与应用表现
在基准测试中,MiMo-V2.6-Pro在DeepSWE v1.1上取得71.9分,在通用智能体测试AutomationBench上获得53.1分,多项指标比肩甚至超越部分闭源旗舰模型。实际应用方面,小米展示了“Vibe World”游戏开发、3D建模、具身仿真控制以及端到端视频创作等案例,并在材料研究和形式化数学证明等科研辅助任务中展现了作为辅助工具的潜力。
押注大规模强化学习
此次发布的核心亮点在于强化学习阶段的计算扩展。小米在不到6天内为两款模型完成了30个强化学习步骤,每款处理约75万条轨迹,合计训练成本约347万美元。训练将编程、智能体、视觉和网络安全任务混合,并引入组内比较机制优化奖励设计,以解决长程智能体训练中仅靠最终测试结果无法体现执行效率差异的问题。
技术架构与创新
技术实现上,模型采用“滑动窗口注意力+全局注意力”交替排列的混合架构,以平衡长上下文处理与计算成本。此外,小米在预训练后增加了面向智能体的“中期训练”阶段,让模型提前适应任务形式,为后续的大规模强化学习奠定基础。目前,模型权重、技术报告及训练代码均已开源。
原始来源: 36氪 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。