小米MiMo团队称MiMo-V2.6或完成开源模型领域最大规模单次强化学习训练
小米MiMo团队成员罗福莉表示,MiMo-V2.6可能完成了开源模型领域规模最大的单次强化学习训练之一,并发布了相关训练框架及蒸馏模型。
快讯正文
罗福莉:MiMo-V2.6或完成开源模型领域规模最大的单次强化学习训练之一
PANews 9月22日消息,小米MiMo团队成员罗福莉发文表示,MiMo-V2.6按算力规模计,可能是迄今开源模型团队开展的最大规模单次强化学习训练之一。团队在算力紧缺的情况下,投入数十人并持续较长时间推进强化学习扩展,模型能力在中期训练阶段形成,并通过大规模强化学习进一步释放。她称,团队针对代码等可验证的中等难度任务采用MixRL训练,对难以验证、超长周期或复杂度过高的任务则单独训练,再通过MOPD合并能力。为推动智能体强化学习研究,团队还发布了一个由MiMo强化学习轨迹蒸馏而来的Qwen模型、7000个多样化环境以及完整的强化学习训练框架。罗福莉表示,MiMo-V2.6只是起点,团队将继...
(点击下方链接阅读全文)
🔗 https://www.panewslab.com/zh/articles/01a0c87a-f732-71f7-8d45-45465db6d9d6
补充解读
消息源自PANews专业媒体,引用小米MiMo团队核心成员罗福莉的公开声明。内容涉及小米在AI大模型训练技术上的重大进展,属于科技行业重要动态,但非直接金融交易信号。
关注后续官方信息,不根据单一消息做决定。
MiMo-V2.6模型的实际性能评测数据
小米AI业务在财报中的具体进展
开源社区对MiMo训练框架的反馈
同事件进展
正在加载事件时间线…