网界
网络资讯 网界财经 科技人物 数据洞察 行业动态 智能出行 智能手机 数码极客 商业资讯

小米MiMo-V2.6强化学习训练大揭秘:挑战规模边界,押注Agent时代

2026-09-17来源:互联网编辑:瑞雪

小米MiMo团队负责人罗福莉在社交平台宣布,团队正在推进的MiMo-V2.6模型已进入强化学习训练关键阶段。此次训练聚焦于突破传统强化学习的规模限制,通过扩大计算资源、训练环境复杂度及奖励评估机制三个维度,探索模型在复杂任务场景中的能力边界。据透露,团队将在未来数周内逐步公开技术细节,同时首次对外展示实时训练监控面板。

训练页面数据显示,MiMo-V2.6包含Pro和Flash两个版本,当前分别处于第12步和第17步训练阶段。Pro版本累计消耗251亿Token,训练成本约80.6万美元;Flash版本则消耗405亿Token,成本约35.4万美元。两个版本总成本已超116万美元,平均每小时计算成本达20.72万元人民币。尽管成本高昂,但团队强调此次公开的核心在于展示模型能力提升过程,而非单纯聚焦资源投入。

在计算规模扩展方面,团队将单个训练步的Token量提升至20亿级别,采用1568个提示词与16次并行推演的异步训练模式。这种设计使模型在面对任务时能同时生成多种解决方案,通过奖励反馈筛选最优路径。例如在编程任务中,模型可自主尝试不同算法,根据执行效率优化代码结构。罗福莉指出,这种大规模探索能力对Agent模型至关重要,尤其在需要多步骤决策的复杂场景中,模型需通过持续试错形成有效策略。

训练环境复杂度提升体现在多任务混合训练机制上。监控面板显示,当前训练任务覆盖视觉处理、代码生成、通用推理及对话交互四大领域,涉及GTA5游戏画面解析、代码库修改等20余种数据集。这种设计迫使模型在不同场景间快速切换,例如在完成视觉识别后立即转向代码调试任务。团队认为,单一能力优化已无法满足Agent时代需求,模型需具备跨领域任务处理能力才能适应真实应用场景。

奖励评估机制的革新是本次训练的另一重点。团队引入智能体组内贡献归因系统,结合测试用例与评分细则构建精细化反馈机制。在复杂任务中,模型需完成信息检索、方案制定、工具调用等多步骤操作,评估系统会针对每个环节的贡献度分配奖励值。数据显示,Pro版本的平均奖励值已从0.55提升至0.582,Flash版本从0.52升至0.570,表明模型的任务执行策略正在持续优化。

训练面板还透露了模型能力演进的关键指标。在软件工程能力测试中,Pro版本DeepSWE基准得分达63.72,Flash版本为60.77,显示模型在代码理解与复杂开发任务处理方面取得进展。更引人注目的是上下文记忆能力的突破,Pro版本平均上下文长度已接近10万Token,这意味着模型可持续追踪长达数万字的操作记录、工具反馈及任务状态,为完成跨时段复杂任务奠定基础。

此次公开训练过程在行业引发关注。与传统大模型发布时仅展示最终成绩不同,小米选择将训练细节透明化,包括实时计算成本、任务组成变化及能力提升曲线。目前两个版本的训练仍在持续,外界可通过监控面板观察计算投入与能力提升的关联性,以及环境复杂度对模型适应能力的影响。这种开放姿态或为AI研发领域提供新的观察视角,关于强化学习规模边界的探讨也将随着训练进展获得更多实证依据。

微信小店厂家代发全攻略:从基础操作到自动化管理,轻松提升效率
1. 订单自动同步,多店统一管理支持微信小店店铺授权绑定,订单自动同步至我打分销代发后台统一管理;同时兼容抖店、拼多多、淘宝等多平台订单,同时运营多渠道的商家无需切换多个后台,订单状态、发货进度实时可视。A…

2026-09-17

2026年中秋消费大变样:月饼旅游数码人情齐变,生活回归质朴本真
但今年中秋,大众彻底跳出商家和社交套路,消费不再为面子买单,只为体验和实用付费。不管是送礼、出游、买数码还是人情往来,所有消费行为都回归本质,这也是今年中秋消费风向彻底反转的最真实佐证。 结语:从端午礼赠…

2026-09-17

华为坤灵赋能中小企业智能化:一站式方案+智能运维工具双突破
这句话,恰好点出了华为坤灵在分销市场正在做的事,让中小企业智能化转型,不再是一件想都不敢想的事。 而华为坤灵这次的全面升级,正是把华为在ICT领域沉淀的技术、品控和方案能力,通过场景化打包、智能化工具、网格…

2026-09-17