强化学习越练答案越单一?Meta新研究尝试让模型“按目标比例”保留多样性 来源:币圈快讯 发布时间:2026-09-25 10:10 阅读:3,110 栏目:币圈快讯 Meta AI在9月24日发布论文MaD-RL,关注大模型强化学习中的一个不太显眼却很实际的问题:训练通常只奖励单次输出是否得高分,模型可能逐渐把概率集中到一种解法或一种表达上。对于数学题,收敛到高成功率答案或许有利;但在合成数据、策略…… 关联币种加载中… 标签: 币圈快讯