MarketPeopleSecurity
MarketNewsTranslation pending

罗福莉称MiMo-V2.6研发挑战超过DeepSeek R1

小米MiMo负责人罗福莉称,MiMo-V2.6的研究创新与工程挑战超过其参与过的DeepSeek R1,并介绍了MixRL与MOPD的分工。

Report

罗福莉:MiMo-V2.6的研发挑战已超过我参与过的DeepSeek R1

动察 Beating AI 快讯,小米 MiMo 负责人罗福莉在 MiMo-V2.6 发布后进一步解释了这轮强化学习。她称,自己曾参与 DeepSeek R1,而 MiMo-V2.6 背后的研究创新和工程挑战,在她看来已经超过 R1。

她还解释了 MiMo 为什么同时使用 MixRL 和 MOPD。MixRL 是把代码、通用 Agent、视觉和网络安全等可验证任务混在同一轮强化学习里一起训练;MOPD 则负责处理超长、难验证或奖励较主观的任务,先单独训练,再把这些能力整合回主模型。

游戏、3D 这类任务一次运行时间太长,而且不好自动判断对错。如果和代码等任务放在同一轮 RL 里,会明显拖慢训练。MiMo 因此把这类任务单独训练,再通过 MOPD 把学到的能力合回主模型。

原文链接 https://m.theblockbeats.info/flash/368367

Additional interpretation

报道给出了明确发言主体和具体技术说明,但“挑战超过R1”属于负责人个人评价,现有材料未提供独立技术评测或模型效果数据。该消息体现小米大模型研发进展,但对关注资产的直接财务和市场影响有限。

关注后续官方信息,不根据单一消息做决定。

MiMo-V2.6的公开技术报告及独立基准测试

MixRL与MOPD的训练成本、稳定性和消融实验

小米将MiMo能力接入手机、汽车或其他产品的进展

Related Developments

Loading event timeline…