LLM

越简单越好:小语言模型长思维链强化学习中奖励函数的选择

Luning Wang*, 张紫宸*, Junkuan Liu*.

奖励函数决定推理模型更看重答案正确、推理长度,还是两者兼顾。我们用 GRPO 训练 Qwen2.5-3B,对比普通、余弦和动态奖励,看看在大模型上有效的长度惩罚是否也适合小模型。实验中,普通奖励让 MATH500 和 GSM8K 准确率稳定上升;余弦和动态奖励虽然缩短了推理过程,却让准确率下降且更不稳定。
越简单越好:小语言模型长思维链强化学习中奖励函数的选择