亚洲财经

搜索

罗福莉:MiMo-V2.6的研发挑战已超过我参与过的DeepSeek R1

链上分析师罗福莉表示,MiMo-V2.6的研发挑战已超过她参与过的DeepSeek R1。在MiMo-V2.6发布后,她进一步解释了这轮强化学习的创新和工程挑战。罗福莉提到,MiMo同时使用mixrl和mopd,mixrl将代码、通用agent、视觉和网络安全等可验证任务混合在同一轮强化学习中训练,而mopd则处理超长、难验证或奖励较主观的任务,先单独训练,再整合回主模型。她指出,游戏和3D任务的运行时间较长,且难以自动判断对错,因此MiMo将这类任务单独训练,再通过mopd整合能力。