一项新研究以国际象棋为受控实验平台,系统探究了预训练与强化学习(RL)在推理任务中的交互关系。研究发现,给定RL计算量下的后训练性能可由预训练损失准确预测,且RL奖励曲线的斜率随预训练token数近似线性提升。在1B参数数学语言模型上,更长预训练的检查点在RL下性能更高、提升更快。
论文
·HuggingFace Daily Papers(社区热门论文)
从预训练到后训练:理解推理能力的强化学习缩放规律
— Understanding Reasoning from Pretraining to Post-Training