网界
网络资讯 网界财经 科技人物 数据洞察 行业动态 智能出行 智能手机 数码极客 商业资讯

小米MiMo-V2.6大模型RL训练全程直播 罗福莉确认技术细节将逐步开源

2026-09-17来源:互联网编辑:瑞雪

小米MiMo大模型团队近日在强化学习(RL)训练领域取得重要进展,其最新版本MiMo-V2.6的研发过程首次通过实时直播形式向公众开放。团队负责人罗福莉在社交平台宣布,该模型已进入大规模多任务智能体实验阶段,并计划在未来几周内逐步公开关键技术细节。这一举措被视为小米在通用人工智能(AGI)领域探索的关键突破,标志着其技术开放策略迈入新阶段。

据公开信息显示,MiMo-V2.6的研发聚焦于三大技术维度:在算力层面,模型实现了单步约20亿Token的完全异步并行处理能力,通过1568个提示词(Prompt)与16次迭代(rollout)的组合优化提升训练效率;环境构建方面,团队开发了支持多框架混合运行的代理式强化学习系统;评估机制则创新采用带测试用例的量化奖励模型,结合组内信用分配算法确保训练效果。这些技术突破共同支撑起模型在复杂任务处理中的性能提升。

实时训练页面披露的成本数据显示,MiMo-V2.6包含两个并行研发版本。其中Pro版本已持续训练1天19小时,累计消耗89万美元计算资源;Flash版本训练时长为1天14小时,成本达39.7万美元。双版本总投入已突破128万美元,相关数据每分钟更新,涵盖Token消耗量、训练进度等核心指标,为行业提供了可量化的研发参照。

该团队负责人罗福莉具有显著的技术背景,这位被业界称为"95后AI科学家"的研究者,此前曾主导达摩院多语言预训练模型开发,并参与DeepSeek-V2的核心架构设计。2023年11月加入小米后,她迅速组建专业团队推进MiMo系列模型研发。今年3月,其主导的上一代万亿参数模型Mimo-V2-Pro已在国际权威评测机构Artificial Analysis的全球榜单中位列综合智能第八、品牌排名第五,展现出强劲的技术竞争力。

此次技术开源与训练透明化策略,体现了小米对强化学习扩展定律(RL Scaling Law)的深度实践。通过公开工程实现细节,团队旨在打破传统大模型研发的"黑箱"模式,推动行业从经验驱动转向可复现的技术创新。这种开放姿态不仅为学术界提供了研究样本,也为产业界探索AGI商业化路径提供了新思路。