NLP

越简单越好:小语言模型长思维链强化学习中奖励函数的选择

Luning Wang*, 张紫宸*, Junkuan Liu*.

我们比较了普通、余弦和动态三种奖励函数在小语言模型长思维链强化学习中的表现。实验中,设计最简单的普通奖励反而持续优于更复杂的方案,说明在激发小模型推理能力时,复杂奖励未必更有效。
越简单越好:小语言模型长思维链强化学习中奖励函数的选择