HaiAI123

全球AI工具精选导航

行业动态
100
热度指数
新上榜

小米发布 MiMo-V2.6-Pro 与 Flash,披露 Agentic RL 路线

2026/10/10 — 10/10 18:20·1 个来源(全部)·1 篇报道(全部)·入选 10-11 日报

核心速览 (Key Takeaways)

  • 小米 MiMo 团队发布 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 两款 MoE 模型,并公开技术报告。
  • 报告系统披露 Agentic RL 在 Rollout、环境与 Grader 三个维度的同步扩展路线:Pro 总参数 1.02T、激活 42B,单个 RL 步约产生 2.5 万条轨迹、27 亿至 37 亿 Token,RL 后训练算力成本约 260 万美元。

事件背景与详细解读

10 月 8 日,小米 MiMo 团队发布技术报告《MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement》,披露了一套规模化 Agentic RL 训练过程,做法是同时扩大训练 Batch、任务环境与 Harness,以及用于评判 Agent 行为的 Grader Compute,以探索模型持续自我改进的路径。此次发布包含 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 两个模型:Pro 总参数量 1.02T、每次推理激活 42B 参数;Flash 总参数量 310B、激活 15B 参数。两者均采用稀疏混合专家(MoE)架构,并在文本主干中混合局部滑动窗口注意力(SWA)与全局注意力(GA),支持百万级上下文训练。

报告称,MiMo-V2.6 把强化学习算力拆成 Rollout、Grading 和 Training 三个部分,三者独立扩展。实际训练中,每个 RL Step 先采样 1568 个 Prompt,每个 Prompt 同时生成 16 条 Rollout,即每一步产生约 2.5 万条轨迹,合计 27 亿至 37 亿 Token;其 RL 后训练算力成本约 260 万美元。

InfoQ 中文在 10 月 11 日的报道中称,该系列首次系统性实现 Agentic RL 在 Rol

AI 综合 1 篇报道生成 · 更新于 7 小时前

最新进展据 InfoQ 中文报道,小米 MiMo 团队发布 MiMo-V2.6-Pro 与 Flash 两款 MoE 模型及技术报告,系统披露了 Agentic RL 在 Rollout、环境与 Grader 三维度同步扩展的训练路线。Pro 总参数 1.02T、激活 42B,单个 RL 步产生约 2.5 万条轨迹、合计 27 亿至 37 亿 Token,其 RL 后训练算力成本约 260 万美元。

24 小时热度热度指数 100
刚上榜,走势正在积累
24 小时前现在

这件事的报道 点标题看原文

今天
  1. 据 InfoQ 中文报道,小米 MiMo 团队发布 MiMo-V2.6-Pro 与 Flash 两款 MoE 模型及技术报告,系统披露了 Agentic RL 在 Rollout、环境与 Grader 三维度同步扩展的训练路线。Pro 总参数 1.02T、激活 42B,单个 RL 步产生约 2.5 万条轨迹、合计 27 亿至 37 亿 Token,其 RL 后训练算力成本约 260 万美元。

    了解大模型 RL 后训练的真实成本与工程拆解

    InfoQ 中文AI 评分 62

同时在说的其他事

热度怎么算的?了解口径

热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。

本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。如权利人认为相关标题或摘要侵权,请通过页尾联系邮箱提供具体页面与权利依据,我们核实后会及时删除或替换。

爆
讨论快速增加
新
首报 6 小时内
发酵中
讨论仍在增加

回 AI 行业动态榜 →