Nested-ReFT论文总结与关键部分翻译一、文章主要内容总结本文聚焦于大语言模型(LLMs)在数学推理等复杂任务中基于强化学习的微调(ReFT)技术,针对传统ReFT计算成本高的问题,提出了名为“Nested-ReFT”的新型框架,核心内容如下:1. 研究背景与问题ReFT的优势与局限:ReFT通过行为模型生成多个思维链(CoT)完成结果,结合可验证奖励函数优化模型,在数学推理等领域提升显著,但生成多个完成结果需大量推理步骤,导致训练计算成本高昂。现有方案痛点:传统ReFT中,行为模型与目标模型架构一致(如使用前一梯度步的目标模型),生成样本的计算资源与目标模型相当,且增加CoT完成结果数量虽能降低更新偏差,却进一步加剧计算开销。2. 核心框架:Nested-ReFT核心思路:借鉴离线强化学习(Off-Policy RL)和推测解码(Speculative Decoding),将目标模型的部分层作为行为模型,通过“动态层跳过”机制生成离线完成结果,降低推理成本。层跳过机制:定义“有效层集合”:排除模型最内层和最外层(距离边界b层内)的层,仅从中间层中随机跳过一定比例(x%)的层,确保模型生成的结构一致性(内层和外层对生成质量至关