小米釋出 MiMo-V2.6-Pro 與 Flash,披露 Agentic RL 路線
2026/10/10 — 10/10 18:20·1 個來源(全部)·1 篇報道(全部)·入選 10-11 日報
核心速覽 (Key Takeaways)
- 小米 MiMo 團隊釋出 MiMo-V2.6-Pro 與 MiMo-V2.6-Flash 兩款 MoE 模型,並公開技術報告。
- 報告系統披露 Agentic RL 在 Rollout、環境與 Grader 三個維度的同步擴充套件路線:Pro 總引數 1.02T、啟用 42B,單個 RL 步約產生 2.5 萬條軌跡、27 億至 37 億 Token,RL 後訓練算力成本約 260 萬美元。
事件背景與詳細解讀
10 月 8 日,小米 MiMo 團隊釋出技術報告《MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement》,披露了一套規模化 Agentic RL 訓練過程,做法是同時擴大訓練 Batch、任務環境與 Harness,以及用於評判 Agent 行為的 Grader Compute,以探索模型持續自我改進的路徑。此次釋出包含 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 兩個模型:Pro 總引數量 1.02T、每次推理啟用 42B 引數;Flash 總引數量 310B、啟用 15B 引數。兩者均採用稀疏混合專家(MoE)架構,並在文本主幹中混合區域性滑動視窗注意力(SWA)與全域性注意力(GA),支援百萬級上下文訓練。
報告稱,MiMo-V2.6 把強化學習算力拆成 Rollout、Grading 和 Training 三個部分,三者獨立擴充套件。實際訓練中,每個 RL Step 先採樣 1568 個 Prompt,每個 Prompt 同時生成 16 條 Rollout,即每一步產生約 2.5 萬條軌跡,合計 27 億至 37 億 Token;其 RL 後訓練算力成本約 260 萬美元。
InfoQ 中文在 10 月 11 日的報道中稱,該系列首次系統性實現 Agentic RL 在 Rol
AI 綜合 1 篇報道生成 · 更新於 7 小時前
最新進展據 InfoQ 中文報道,小米 MiMo 團隊釋出 MiMo-V2.6-Pro 與 Flash 兩款 MoE 模型及技術報告,系統披露了 Agentic RL 在 Rollout、環境與 Grader 三維度同步擴充套件的訓練路線。Pro 總引數 1.02T、啟用 42B,單個 RL 步產生約 2.5 萬條軌跡、合計 27 億至 37 億 Token,其 RL 後訓練算力成本約 260 萬美元。
- 熱度指數
- 100
- 全部來源
- 1
- 全部報道
- 1
- 首報
- 7 小時前
這件事的報道 點標題看原文
據 InfoQ 中文報道,小米 MiMo 團隊釋出 MiMo-V2.6-Pro 與 Flash 兩款 MoE 模型及技術報告,系統披露了 Agentic RL 在 Rollout、環境與 Grader 三維度同步擴充套件的訓練路線。Pro 總引數 1.02T、啟用 42B,單個 RL 步產生約 2.5 萬條軌跡、合計 27 億至 37 億 Token,其 RL 後訓練算力成本約 260 萬美元。
瞭解大模型 RL 後訓練的真實成本與工程拆解
InfoQ 中文AI 評分 62
同時在說的其他事
- 熱度指數 610OpenAI 回應解僱三名安全研究員:與安全擔憂無關15 個來源
- 熱度指數 493OpenAI 洽談 300 億美元融資,估值約 1.4 萬億美元14 個來源
- 熱度指數 447TypeSafe AI 融資 8.7 億美元,估值 75 億美元8 個來源
- 熱度指數 314微軟釋出 Decision-1 結構化決策模型5 個來源
- 熱度指數 262Anthropic 更新 Claude 使用規則,收緊選舉與武器條款7 個來源
熱度怎麼算的?瞭解口徑收起
熱度按 48 小時內有多少個獨立來源在說這件事算:同一個來源發多條只算一次,並按 24 小時半衰期衰減,所以排前面的是很多人在說的事。
本頁彙總公開訂閱源,標題與摘要由模型整理,版權歸原作者所有;重要資訊請回原文核對。如權利人認為相關標題或摘要侵權,請通過頁尾聯絡郵箱提供具體頁面與權利依據,我們核實後會及時刪除或替換。
- 爆
- 討論快速增加
- 新
- 首報 6 小時內
- 發酵中
- 討論仍在增加
