Projects

越简单越好:小语言模型长思维链强化学习中奖励函数的选择

Luning Wang*, 张紫宸*, Junkuan Liu*.

我们比较了普通、余弦和动态三种奖励函数在小语言模型长思维链强化学习中的表现。实验中,设计最简单的普通奖励反而持续优于更复杂的方案,说明在激发小模型推理能力时,复杂奖励未必更有效。
越简单越好:小语言模型长思维链强化学习中奖励函数的选择
MIA-Sort:高效排序染色质复合物的多重染色质互作分析工具
MIA-Sort 是一个 Python 生物信息学工具,用于从 Hi-C、Pore-C 等大规模数据中高效提取和排序染色质复合物。研究人员可以用它分析染色质环、条纹、喷流和枢纽等结构,从而研究环挤出机制。
MIA-Sort:高效排序染色质复合物的多重染色质互作分析工具