首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
πRL——首个在线RL微调流式VLA π0/π0.5的框架:通过Flow-Noise和Flow-SDE实现精确对数似然估计,全面提升性能
📅 2026/10/4 1:56:07
✍️ 爱科研究院
👁 阅读 3,247
前言由于我司过去一年一直侧重这五大场景的落地机械臂的智能插拔与装配、人形灵巧操作、人形展厅讲解、人形搬运(含轮式和双足)、自动加油机器人而对于其中的「机械臂智能插拔与装配」而言如本博客之前的两篇文章所说《知识蒸馏RLDG先基于精密任务训练RL策略(HIL-SERL)得到的RL数据去微调OpenVLA最终效果超越人类演示数据》该文首发于25年8月底文中曾说如果想兼具精准度和泛化性RL微调vla 暂时最合适我估计RL结合VLA的方法很快会成为工厂里 智能机械臂的主流落地方法《ConRFT——Consistency Policy下RL微调VLA的方法离线通过演示数据微调(结合Q损失和BC损失)后在线RL微调且引入人工干预》该文首发于25年9月上旬我在该文中再次表达了类似的观点对于工厂里机械臂的智能化改造很显然如果用单纯RL的话其准度不错但泛化性不行如果想兼具精准度和泛化性RL微调vla 最合适故我相信RL结合VLA的方法很快会成为工厂里 智能机械臂的主流落地方法上面这两篇文章皆收录于此系列《精密插拔与装配从RL、VLA(含力/触)到RL微调VLA》中而通过本博客内的这个系列可知在线RL微调自回归VLA(比如openvla)已经不新鲜了甚至在线RL微调扩散策略 也已不新鲜『比如Learning multimodal behaviors from scratch with diffusion policy gradient及Diffusion policy policy optimization, 2024简称DPPO』但微调流式VLA则相对少见好在25年11.5日在我司实习的夏同学「其来自北京一985PS我司长沙具身总部一直在扩招985/211的硕士实习生如可来长实习欢迎私我」在公司群内分享了一则视频————号称【花式叠衣2.0】 VLARL再升级长程、丝滑、泛化自主叠衣想怎么叠就怎么叠我当时回复他道有出来个πRL——该视频 可能就类似这个模式在线RL优化π0/π0 5可能效果比x-vla 或π0/π0.5效果更好『(注只是可能尚非定论且目前πRL尚只在 “具身RL框架RLinf ”上跑尚未在真实机器人上验证估计25年12月份之内 会有新的进展』本文便来解读下这个πRL首个在线RL微调流式VLA的框架第一部分 πRL基于流式VLA的在线强化学习微调1.1 引言、相关工作、背景知识1.1.1 引言如πRL论文所述VLAs 的训练方法遵循如图1所示的标准预训练与有监督微调SFT范式在预训练的VLM基础上VLA 会首先在大规模、异构的人类演示数据集上进行微调然后在目标任务上进行有监督微调SFT以使其能力与特定的机器人形态与环境对齐然而依赖SFT会带来关键挑战构建大规模高质量的专家轨迹既费力又昂贵(Din 等2025)而且通过SFT获得的模型往往会过拟合于专家演示数据(Fei 等2025)近期的研究工作Zang 等2025Li 等2025aTan 等2025Liu 等2025b已探索通过强化学习RL扩展 VLA 的训练过程建立了如图1所示的预训练、SFT 及 RL 训练范式使 VLA 能够通过主动环境交互和制定更具泛化能力的策略将其性能提升至超越最初专家示范的水平然而这些强化学习的进展主要局限于自回归视觉-语言代理VLA领域典型代表包括 Open-VLA、OpenVLA-OFT它们采用离散动作解码器以自回归或并行方式生成输出这与基于扩散或流的 VLA 形成鲜明对比如π 系列模型 π0和 π0.5它们通过在流匹配(Lipman 等2022)中的迭代细化过程生成动作这种方式不仅能以高频率产生动作块还能完成高灵巧度的任务因此现有的 VLA-RL 算法无法兼容基于流的 VLA其根本挑战在于如何针对所执行的动作刻画对数似然Hutchinson,1989Chen 等2018对此来自♠Tsinghua University、♣Peking University、♢Institute of Automation, Chinese Academy of Sciences(即中科院自动化所)、♯Carnegie Mellon University、♢Infinigence AI、♡Zhongguancun Academ(即中关村学院)的研究者推出了πRL这是首个用于微调基于流的VLA(即π0和π0.5)的开源并行在线强化学习框架其对应的paper地址为π: Online RL Fine-tuning for Flow-based Vision-Language-Action Models其对应的作者包括Kang Chen♣,♡,∗、Zhihao Liu♢,♡,∗、Tonghe Zhang♯,∗、Zhen Guo♢、Si Xu♢、Hao Lin♢Hongzhi Zang♠、Quanlu Zhang♢、Zhaofei Yu♣、Guoliang Fan♢、Tiejun Huang♣、Yu Wang♠、Chao Yu♠,♡,†其对应的GitHub地址为github.com/RLinf/RLinf其对应的hf 地址为huggingface.co/RLinf且作者为了解决流匹配中难以处理的对数似然估计问题他们提出了两种解决方案Flow-Noise将可学习的噪声网络集成到去噪流程中并将该阶段建模为离散时间马尔可夫决策过程MDP以实现精确的对数似然估计Flow-SDE 则将普通微分方程ODE去噪流程转化为随机微分方程SDE在保证等效边缘分布用于探索的同时构建了将去噪流程与策略—环境交互耦合的两层 MDP并配合混合 ODE-SDE 采样技术来加速训练在构建的 MDP 和精确对数似然计算基础上πRL 通过近端策略优化即PPO算法进行进一步优化1.1.2 相关工作首先对于VLAVLA 模型最近通过集成多模态输入在机器人领域取得了显著进展实现了统一的感知、推理与控制。这一进展催生了一系列架构包括OctoTeam 等2024、RTBrohan 等2022、OpenVLA、OpenVLA-OFT、π0, π0.5 和GR00TBjorck 等2025OpenVLA 作为自回归VLA 架构的代表将动作空间离散化为符号化表示这使得基于语言条件的控制成为可能通过将动作作为VLM 词汇表的一部分进行处理但该方法在本质上限制了实现精细化运动所需的分辨率为了实现更加灵巧且连续的物理行为π0 和π0.5 作为基于流的VLA 架构的代表引入了基于流匹配的动作分块架构这使VLA 能够建模复杂的连续动作分布从而实现更为灵巧的物理行为而本文介绍的πRL则通过在线RL算法对π系列模型进行了进一步微调通过与环境的在线交互提升了其性能和泛化能力其次对于面向VLA的在线RL微调近期的研究越来越多地集中于利用在线RL提升VLA的性能和泛化能力。例如SimpleVLA-RL基于OpenVLA-OFT和GRPO展示了在数据稀缺情况下强化学习能够提升VLA模型的长程规划能力RL4VLA通过阶段性稀疏奖励实证评估了PPO、GRPO和直接偏好优化DPORafailov等2023发现PPO表现最佳VLA-RL提出了专用的机器人流程奖励模型并优化了数据处理流程iRe-VLA提出了在强化学习探索与SFT更新之间迭代的框架详见此文《iRe-VLA——RL微调VLA先SFT、后在线RL最后结合“离线演示和在线成功数据”对VLA做SFT(含GRAPE的详解)》RIPT-VLA将REINFORCE leave-one-outRLOOKool等2018算法应用于QueSTMete等2024和OpenVLA-OFT架构RLinf-VLA为大规模强化学习训练VLA模型提供了统一且高效的框架支持多样化的VLA——OpenVLA 和 OpenVLA-OFT 等架构以及 PPO、GRPO 等多种强化学习RL算法还有包括LIBERO 和 ManiSkill 在内的多种模拟器总之以上这些工作展示了强化学习微调 VLA 模型的有效性尽管这些方法展示了将在线RL应用于VLA的潜力但由于精确对数似然估计的挑战它们在基于流的VLA中的应用仍受限最后对于用于流模型的强化学习微调将RL与流模型结合是一种有前景的方法可以突破模仿学习的局限性。为此Flow-GRPOLiu 等2025a将确定性常微分方程ODE转化为等价的随机微分方程SDE以实现随机性探索在此基础上后续研究如 Mix-GRPOLi 等2025b和TempFlow-GRPOHe 等2025通过混合 ODE-SDE rollout 进一步加速训练ReinFlowZhang 等2025在流路径中注入可学习的噪声并将其转化为具有可计算似然的离散时间马尔可夫过程从而实现稳定的策略梯度更新——流策略优化FPOMcAllister 等2025将策略优化重构为最大化条件流匹配损失的优势加权比此外策略无关强化学习PA-RLMark 等2024能够通过监督学习将评论家优化后的动作蒸馏到策略中实现对各类扩散和 Transformer 架构的高效微调————通过强化学习引导扩散DSRLWagenmaker 等2025则在其潜在噪声空间中执行强化学习从而优化流策略而无需直接修改策略参数本身尽管以往的研究大多集中于非机器人任务或小规模、单一任务的机器人领域但πRL则针对更具挑战性的难题即对大规模基于流的VLA在复杂多任务机器人场景中的微调1.1.3 问题表述与基于流的VLA首先对于问题定义在πRL中作者将该任务形式化为一个MDP由元组定义状态被定义为机器人观测表示初始状态分布给定状态流式策略预测动作从而产生状态转移并获得奖励目标是学习一个策略使其在步时间范围内最大化期望的折扣回报通过策略梯度代理回报期望的梯度可以根据采样得到的轨迹进行近似(定义为公式2)其中的优势函数衡量动作价值Q (st, at) 相对于状态价值V (st)的相对优劣为策略更新提供了低方差的信号其次对于基于流的VLA而言π0 被设计用于将由RGB 图像、语言token和机器人本体感觉组成的观测映射为未来H 步动作序列其形式化为在该模型中VLM 从视觉和语言输入中提取特征而流匹配专家负责生成动作具体而言该模型学习一个条件向量场用于将标准高斯噪声分布变换为目标动作这是通过最小化条件流匹配CFM损失来实现的该损失将预测的向量场与真实向量场对齐『which aligns thepredicted vector fieldvθ with theground-truth vector fieldu』在这里条件概率路径从一个动作、随机噪声和流匹配中的连续时间生成一个带噪动作对于这个特定路径相应的真实向量场被定义为————若不太明白的话可以看下我博客内对π0的解读另 上面这段对应的论文原文如下图所示在推理过程中动作序列首先通过对噪声向量进行采样生成之后再通过基于前向欧拉方法将学习到的向量场在固定步数内迭代地集成不断细化1.2 πRL提出的两种方法Flow-Noise 和Flow-SDE现有的 VLA-RL 方法分别利用 OpenVLA 这类基础模型用于离散动作使用 OpenVLA-OFT 进行连续动作为计算动作对数似然离散模型Liu 等2025b对输出 logits 应用 softmax而连续模型Li 等2025a则将动作视为高斯分布并使用预测头来估计方差对于基于流的 VLA若直接计算精确的似然Hutchinson1989在去噪步骤较少时准确性较差。此外其常微分方程采样过程是确定性的缺乏探索性使其在强化学习中的实现较为复杂对此作者提出了 Flow-Noise 和Flow-SDE 两种技术方法使基于流的 VLA 更适用于强化学习如图 2 所示1.2.1 Flow-Noise(流噪声包含随机性注入和对数似然估计受 Reinflow『即Reinflow: Fine-tuning flow matching policy with online reinforcement learning』的启发如Reinflow论文所说精化随机策略对于连续控制问题至关重要 [49]然而对于条件流来说其样本路径由神经常微分方程ODE控制连对数概率这一衡量随机性的关键因素都可能难以获得并且在反向传播过程中不稳定。这一问题在只用极少去噪步数推断流策略时更加严重因为此时离散化误差会变大但推断成本却较低其次与离线强化学习方法相比在线强化学习微调要求策略在探索与利用之间进行权衡尤其是在稀疏奖励环境下 [20]然而对于具有确定性路径的条件流如何设计合理的探索机制仍然尚未解决对此他们提出了ReinFlow这是第一个能够稳定地在线微调一类流匹配策略的强化学习算法尤其能够在很少甚至仅一次去噪步骤中实现Reinflow的作者训练了一个噪声注入网络将流转换为具有高斯转移概率的离散时间马尔可夫过程从而实现精确且易于计算的似然度且设计允许噪声网络自动平衡探索与利用即该方法实现轻便内建探索机制并能广泛适用于各类流策略变体包括基于Rectified Flow [34]和Shortcut Models [18]参数化的模型作者在流匹配去噪过程中引入了可学习的噪声网络并在上文1.3.1节中详述的标准单层 MDP 框架下解决该问题通过将去噪阶段建模为一个离散MDP作者可以直接计算去噪序列的对数似然从而能够通过强化学习实现等价的策略优化1.2.1.1 随机性注入在Flow-Noise 中作者用神经网络对噪声调度进行参数化使注入噪声的幅度能够在训练过程中动态学习从而具有更大的灵活性如图3 所示『注意是一个去噪序列』上图是展示在流匹配过程中噪声注入的示意图以π0.5为例『至于π0.5的介绍详见此文《π0.5——推理加强的统一模型先高层预训练离散化token自回归预测子任务、后低层执行子任务(实时去噪生成连续动作)》』它融合了图像、语言和状态信息实现了统一的VLM输入30作者关注于单个环境时间步t 内的生成过程为了符号简洁省略时间下标t例如将写作并将预测速度记作在去噪过程中步进转移被建模为各向同性高斯分布其中均值由原始常微分方程的前向欧拉更新决定方差则由可学习的噪声网络控制这里是从噪声注入网络中学习得到的标准差该网络以动作和观测为条件。噪声网络与velocity网络联合训练但在微调后被弃用此时用于推理的策略为确定性策略1.2.1.2 对数似然估计在将策略梯度方法应用于基于流的VLA时主要挑战来自于最终执行动作的对数似然不可求解而在Flow-Noise中作者通过将整个去噪过程的联合对数似然的梯度替代到等式(2)的策略优化目标中从而解决了这一问题而这一做法在理论上受到了Reinflow的支持动作生成的推理过程被离散化为个均匀的步骤这定义了一系列时间点。步长被定义为在第个时间点的离散时间步为从开始到结束给定观测整个去噪序列的精确且易处理的对数概率如图2 所示并表述为在此基础上可以在标准的马尔可夫决策过程MDP框架内处理基于流的方法策略优化1.2.2 FLOW-SDE(流-随机微分方程)随机性注入、MDP建模、HYBRIDODE-SDE采样受到 Flow-GRPO的启发作者通过将去噪过程从 ODE 转化为 SDE 形式来增强随机探索能力。且进一步构建了两层 MDP将去噪过程与基于 DPPORen等2024的策略-环境交互耦合同时利用混合 ODE-SDE 采样技术加速训练过程1.2.2.1 随机性注入在 Flow-SDE 中作者将确定性常微分方程ODE转化为等效的随机微分方程SDE以保留生成动作的边缘概率密度如图3所示流匹配的确定性常微分方程采样轨迹特别是Rectified FlowLiu等人2022通过前向欧拉方法进行描述(定义为公式6)基于概率流ODE与SDE之间的联系作者可以将公式6中的确定性ODE转化为等效的SDE其中漂移项(drift term)修正了原始速度而扩散项(diffusion term)引入了噪声(定义为公式7)其中是控制噪声进度的标量函数是边缘分布的得分函数表示一个Wiener 过程如在Flow-GRPO 中所建立分数函数score function和速度场(velocity field)通过密切相关通过在公式(7) 中用速度场(velocity field)替换分数函数并将噪声调度设为其中控制噪声水平则得到了用于flow-matching 采样器的最终SDE 公式对该SDE 进行离散化可以看出转移概率是一个各向同性高斯分布其均值和方差表达如下1.2.2.2 MDP建模虽然Flow-Noise 用整个去噪序列的联合对数似然替代了最终执行动作的似然但作者在Flow-SDE 中将流匹配的去噪过程与环境交互结合起来具体而言作者将去噪过程中定义的内部MDP 嵌入到上文中所述的高层外循环MDP 以及环境MENV 中形成如图2所示的两层MDP其中各组成部分以环境时间和去噪时间来定义状态是由观测和动作状态组成的元组动作定义为内循环中下一个采样的去噪动作以及外循环中执行的动作(定义为公式10)其中是随机采样的噪声转移定义了状态的演化方式表述如下————对于内循环inner loop转移发生在不同去噪动作状态之间此时观测值保持不变下一步的动作状态由设定相当于内层 MDP 负责处理去噪的生成过程对于最终动作与外循环outer-loop环境交互根据环境动力学产生新的观测值相当于外层 MDP 对接真实环境交互同时动作状态从标准正态分布重新初始化奖励仅在去噪过程完成并与环境交互后才会发放如下所示在两层MDP 框架内估计动作对数似然的问题被转化为估计由于转移的高斯性质该估计可以直接计算1.2.2.3 HYBRIDODE-SDE 采样降低训练难度与所需的计算时间在所提出的两层MDP框架中有效轨迹长度等于环境交互步骤数与流匹配去噪步骤数的乘积。虽然这种建模方式使基于流的VLA能够进行强化学习训练但其MDP时域长度相比非迭代式VLA方法大大延长因此显著增加了训练的难度以及优化所需的计算时间为此作者采用了混合ODE-SDE 展开策略灵感来源于文本到图像生成方法如Mix-GRPOLi 等2025b和TempFlow-GRPOHe 等2025————具体而言在去噪过程中会随机选择一步作为由控制的随机SDE 转移而其余步骤则遵循由更新规则定义的确定性ODE 转移在这种表述下作者将状态之间的确定性ODE 转移视为环境级封装器并修正了先前两层MDP 的状态转移函数————具体来说在每个环境步t会随机选择一个去噪时间τt 用于策略的随机注入策略π 作用于该状态根据公式(10) 采样动作环境封装器随后执行所有后续的确定性步骤最终在新采样的时间时转移到下一个观测和下一个动作状态在此过程中策略的状态输入和动作输出与之前的两层MDP 表述保持一致从而确保了理论上的一致性1.2.3 策略优化包含算法与评价器设计1.2.3.1 算法给定所构建的流量策略MDP目标是学习能够最大化期望折扣回报的最优策略参数即策略。为此作者采用广泛使用的策略梯度算法PPO 来优化该策略π-系列模型Black 等2024Intelligence 等2025采用了基于块的动作生成方法。具体来说策略对于每一个观测输出一整个未来H 步的动作序列在这种方法中作者将整个序列视为一个单独的宏观步骤并将其对应的奖励定义为每一步奖励的总和这在RLinf-VLAZang等2025中被称为块级表述为了有效引导策略更新PPO采用广义优势估计GAESchulman等2015年来计算优势的低方差估计具体如下其中TD 误差为。这里是从评论家网络获得的状态价值函数是折扣因子是用来平衡优势估计中偏差与方差之间权衡的参数为方便大家更好的理解我再帮大家展开一下本质上来说和本博客之前的这篇文章《从零实现带RLHF的类ChatGPT逐行解析微软DeepSpeed Chat的源码》中对GAE的介绍 是一个意思从而有当然了如果你想看带数字的实际例子则可以参见此文《ChatGPT技术原理解析从RL之PPO算法、RLHF到GPT4、instructGPT》的此节「3.3.2 GAE之下的优势函数计算、回报序列计算、价值序列的迭代」再之后PPO将策略更新限制在一个较小的信任域内以防止出现较大且不稳定的更新其目标函数为其中clip 函数由超参数控制将比率限制在区间内以确保训练的稳定性————如果你对PPO的这个表达式不熟悉的话可以参见此文《强化学习极简入门通俗理解MDP、DP MC TD和Q学习、策略梯度、PPO》中的此节「4.4.2 PPO算法的另一个变种近端策略优化裁剪PPO-clip」在此更新后与旧策略之间的概率比率ρt(θ)呈现如下形式:分别对应于单层和双层MDP建模1.2.3.2 评价器设计继VLA-PPO相关工作Zang等2025Liu等2025b之后作者采用了如图4所示的共享actor-critic架构以实现内存高效的价值预测然而这两种基于流的VLA在处理本体感受状态时方式不同在π0中状态被输入到动作专家模型中而在π0.5中状态则与VLM中的提示嵌入进行了融合为此如下图右侧所示对于π0.5 变体作者将评价网络直接连接到VLM 输出上提供基于融合的图像、语言和状态输入的价值估计如上图左侧所示对于π0 变体由于其输入结构是耦合的其中动作专家需要同时获取噪声动作Aτt 和状态因此实现价值预测并非易事为此作者通过对整个去噪轨迹的价值估计进行平均来近似其形式如下1.3 实验结果// 待更
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/10/4 1:56:07
Java IO 核心总结:File 类、字节流与字符流详解
2026/10/4 1:51:07
在 agency-agents-zh 中启用产品经理智能体:从 PRD、机会评估到路线图与 GTM 的全生命周期实战指南
2026/10/4 1:51:07
从发酵罐到文献综述:化工生物工程毕设,AI 到底怎么搭着用才省心?
2026/10/4 3:36:12
SpringBoot+Vue车间管理系统:从数据库设计到业务落地
2026/10/4 3:36:12
光伏板数据集从labelimg标注到YOLOv8训练:VOC格式转换与实战避坑
2026/10/4 3:36:12
Java练手项目怎么选?从语法基础到框架实战的梯度路线
2026/10/4 3:36:12
基于 Spring Boot 的康健疗养中心残障人士康复训练管理系统
2026/10/4 3:36:12
无人机检测数据集处理与YOLOv8训练实战:从XML标注到模型部署
2026/10/4 3:31:12
模拟调制系统原理与MATLAB/Python仿真验证指南
2026/10/4 0:00:57
Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化
2026/10/4 0:00:57
多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系
2026/10/4 0:00:57
hindsight:面向LLM应用的事后可观测性工程实践
2026/10/4 0:00:57
Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化
2026/10/4 0:00:57
多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系
2026/10/4 0:00:57
hindsight:面向LLM应用的事后可观测性工程实践
2026/10/4 2:41:08
我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
2026/10/3 12:41:10
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026/10/3 15:20:14
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)