产品派
返回

小米MiMo-V2.6披露规模化强化学习训练方案

AIInfoQ 中文站2026/10/10 18:09:10
AI 导读

10月8日,小米MiMo团队发布技术报告,介绍MiMo-V2.6的规模化Agentic RL方案。该系列包括Pro和Flash:前者总参数1.02T、激活42B,后者总参数310B、激活15B,均采用MoE架构,并结合滑动窗口注意力与全局注意力,支持最高100万Token上下文。

训练系统将算力拆为Rollout、Grading和Training三部分。每个RL Step采样1568个Prompt,每个Prompt生成16条轨迹,单步约2.5万条、合计27亿至37亿Token,平均序列长11万至15万Token。任务涵盖代码、工具使用、视觉设计、上下文遵循和网络安全,比例分别为68%、12%、13%、3%和4%,采用GRPO与异步Partial Rollout。Pro和Flash后训练成本约260万美元、90万美元,Pro的Rollout、Training、Grader占比分别为43.8%、43.5%和12.7%,Flash的Grader占14.2%。

针对单纯测试通过奖励无法区分工程质量的问题,系统引入分组奖励合成与分组优势重分配,并加入组内相对长度惩罚,以比较方案质量、边界处理、修改范围和副作用。在线评分后,模型在保持通过率增长的同时,轨迹和交互轮数更稳定,生成的补丁更精确。团队还通过清理日志、Patch、缓存和上游历史、容器网络隔离及Hack Agent防范Reward Hacking,正式训练中相关轨迹比例低于2%。

团队将模块化mini-harness作为另一项Scaling维度,训练模型适应不同提示词、工具和上下文管理配置。在DeepSWE v1.1上,三个未见过的Codex、Claude Code和mini-swe-agent Harness平均Pass@1由约50%升至66%。此外,RL期间冻结MoE Router,避免20步内专家负载变异系数由0.78升至2.0、峰值负载达均值16倍及冷专家占22%;冻结后变异系数约0.7、峰值约5.5倍、冷专家约1%。

两次正式训练中,Pro的30个RL Step耗时123.1小时,Flash耗时81.8小时,期间出现GPU双比特错误、Kubernetes故障、Grader网络中断等问题。Partial Rollout重启还会造成任务长度误判,撑满GPU KV Pool和锁页内存;MoE微Batch负载曾达到平均30倍并引发显存溢出,Flash后期也因长序列导致主机内存耗尽。为承载单步2.5万条轨迹,系统重做RL基础设施,执行侧采用Ray Actor运行Harness,并以固定数量的持久Host Actor避免频繁创建进程耗尽控制节点文件描述符。

小米MiMo强化学习AgentMoE大模型训练

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文