news 2026/9/3 1:50:46

在看完近50篇 VLA+RL 工作之后......

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
在看完近50篇 VLA+RL 工作之后......

主页:http://qingkeai.online/

原文:https://mp.weixin.qq.com/s/lfkwxQ-7N2jdVaOFAN5GmQ

随着基于大规模模仿学习的视觉-语言-动作 (VLA) 模型取得显著进展,将VLA强化学习 (RL)相结合已成为一种极具前景的新范式。该范式利用与环境的试错交互或预先采集的次优数据,进一步提升机器人的决策与执行能力。

本文对该领域的关键论文进行了分类整理,涵盖离线RL、在线RL、世界模型、推理时RL及对齐技术。

一、 离线强化学习 (Offline RL)

离线 RL 预训练的 VLA 模型利用人类演示和自主收集的数据进行学习,无需实时环境交互。

Q-Transformer: Scalable Offline Reinforcement Learning via Autoregressive Q-Functions
链接:https://arxiv.org/abs/2309.10150 代码:https://github.com/google-deepmind/q_transformer

Offline Actor-Critic Reinforcement Learning Scales to Large Models (Perceiver-Actor-Critic)
链接:https://arxiv.org/abs/2402.05546 代码:https://offline-actor-critic.github.io/

GeRM: A Generalist Robotic Model with Mixture-of-experts for Quadruped Robot
链接:https://arxiv.org/abs/2403.13358 代码:https://github.com/Improbable-AI/germ

ReinboT: Amplifying Robot Visual-Language Manipulation with Reinforcement Learning
链接:https://arxiv.org/abs/2505.07395

MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models
链接:https://arxiv.org/abs/2503.08007

CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning
链接:https://arxiv.org/pdf/2508.02219

Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models (ARFM)
链接:https://arxiv.org/pdf/2509.04063


二、 在线强化学习 (Online RL)

通过在环境中的试错交互,进一步优化 VLA 模型的性能。

1. 仿真环境内 (In Simulator)

FLaRe: Achieving Masterful and Adaptive Robot Policies with Large-Scale Reinforcement Learning Fine-Tuning
链接:https://arxiv.org/abs/2409.16578 代码:https://github.com/flare-vla/flare

Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone (PA-RL)
链接:https://arxiv.org/abs/2412.06685 代码:https://pa-rl.github.io/

Improving Vision-Language-Action Model with Online Reinforcement Learning (iRe-VLA)
链接:https://arxiv.org/abs/2501.16664

Interactive Post-Training for Vision-Language-Action Models (RIPT-VLA)
链接:https://arxiv.org/abs/2505.17016 代码:https://github.com/OpenHelix-Team/RIPT

VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning
链接:https://arxiv.org/abs/2505.18719 代码:https://github.com/vla-rl/vla-rl

What Can RL Bring to VLA Generalization? An Empirical Study (RLVLA)
链接:https://arxiv.org/abs/2505.19789 代码:https://github.com/S-S-X/RLVLA

RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback
链接:https://arxiv.org/abs/2505.19767

SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
周六上午10点!一起聊聊VLA强化学习训练框架:SimpleVLA-RL
链接:https://arxiv.org/pdf/2509.09674 代码:https://github.com/SimpleVLA/SimpleVLA

TGRPO: Fine-tuning Vision-Language-Action Model via Trajectory-wise Group Relative Policy Optimization
链接:https://arxiv.org/abs/2506.08440 代码:https://github.com/TGRPO/TGRPO

OctoNav: Towards Generalist Embodied Navigation
链接:https://arxiv.org/abs/2506.09839 代码:https://octonav.github.io/

RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models
链接:https://arxiv.org/pdf/2506.17639 代码:https://rlrc-vla.github.io/

RLinf: Reinforcement Learning Infrastructure for Agentic AI
下周二晚8点!和无问芯穹首席研究员林灏,一起聊聊具身智能 RL 训练框架 RLinf 的系统设计
链接:https://arxiv.org/pdf/2509.15965 代码:https://rlinf.github.io/

RLinf-VLA: A Unified and Efficient Framework for VLA+RL Training
VLA+RL 算法如何设计?从零上手 OpenVLA 的强化学习微调实践
链接:https://arxiv.org/pdf/2510.06710v1

2. 真实世界 (In Real-World)

RLDG: Robotic Generalist Policy Distillation via Reinforcement Learning
链接:https://arxiv.org/abs/2412.09858 代码:https://rldg.github.io/

Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
链接:https://arxiv.org/abs/2412.06685 代码:https://github.com/MaxSobolMark/PolicyAgnosticRL

Improving Vision-Language-Action Model with Online Reinforcement Learning
链接:https://arxiv.org/abs/2501.16664

ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy
链接:https://arxiv.org/abs/2502.05450 代码:https://github.com/ConRFT/ConRFT

VLAC: A Vision-Language-Action-Critic Model for Robotic Real-World Reinforcement Learning
链接:https://arxiv.org/abs/2509.15937 代码:https://github.com/VLAC-VLA/VLAC

Self-Improving Embodied Foundation Models (Generalist)
链接:https://arxiv.org/pdf/2509.15155


三、 世界模型 (World Model / Model-Based RL)


利用世界模型作为虚拟环境,实现低成本、安全的 VLA 策略后训练。

World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training
链接:https://arxiv.org/abs/2509.24948 代码:https://github.com/amap-cvlab/world-env

VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
链接:https://arxiv.org/pdf/2510.00406 代码:https://github.com/VLA-RFT/VLA-RFT


四、 推理时强化学习 (Test-Time RL)

在部署阶段利用预训练的价值函数进行实时优化或纠错。

To Err is Robotic: Rapid Value-Based Trial-and-Error during Deployment (Bellman-Guided Retrials)
链接:https://arxiv.org/abs/2406.15917 代码:https://github.com/notmahi/bellman-guided-retrials

Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance (V-GPS)
链接:https://arxiv.org/abs/2410.13816 代码:https://v-gps.github.io/

Hume: Introducing System-2 Thinking in Visual-Language-Action Model
链接:https://arxiv.org/abs/2505.21432 代码:https://github.com/Hume-VLA/Hume

VLA-Reasoner: Empowering Vision-Language-Action Models with Reasoning via Online Monte Carlo Tree Search
链接:https://arxiv.org/abs/2509.22643


五、 强化学习对齐 (RL Alignment)

旨在使 VLA 策略符合人类偏好或安全约束。

GRAPE: Generalizing Robot Policy via Preference Alignment
链接:https://arxiv.org/abs/2411.19309 代码:https://github.com/GRAPE-VLA/GRAPE

SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
链接:https://arxiv.org/abs/2503.03480 代码:https://safevla.github.io/


六、 其他分类 (Unclassified)

RPD: Refined Policy Distillation: From VLA Generalists to RL Experts
链接:https://arxiv.org/abs/2503.05833

总结


VLA 与 RL 的结合正处于快速爆发期。将模仿学习的大规模先验与强化学习的自进化能力相结合,是通向具身通用人工智能的关键路径。

都看到这了,点个关注再走吧🧐~

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/2 21:52:09

计算机专业毕业论文开题报告:研究方法写作示例与技术思路解析

写在前面:这篇文章适合谁?能解决什么问题? 这篇文章主要写给 正在准备计算机专业毕业论文开题报告的本科生,尤其是那些在撰写“研究方法”部分时,不清楚该写什么、怎么写、写到什么程度才算合格的同学。 我在实际指导开…

作者头像 李华
网站建设 2026/9/2 17:48:57

数据库性能优化实战手册:SQL 调优 + 架构优化全攻略

数据库性能优化实战手册:SQL 调优 + 架构优化全攻略 你是否遇到过这样的场景? 业务系统上线初期运行流畅,但随着数据量激增,查询响应时间从毫秒级飙升至数秒甚至分钟级;开发团队反复优化SQL语句,却发现性能瓶颈始终难以突破;运维人员面对高负载的数据库服务器,却找不到…

作者头像 李华
网站建设 2026/9/2 9:49:07

基于有限体积法(FVM)求解二维导热与对流问题

一、数学模型建立 1. 控制方程 二维稳态导热-对流方程: ∂∂x(k∂T∂x)∂∂y(k∂T∂y)q˙0\frac{\partial}{\partial x}\left(k\frac{\partial T}{\partial x}\right) \frac{\partial}{\partial y}\left(k\frac{\partial T}{\partial y}\right) \dot{q} 0∂x∂​…

作者头像 李华
网站建设 2026/8/31 20:26:11

step-audio-2 全场景接入实战手册:从配置到落地

一、前言:step-audio-2 接入价值与文档定位 step-audio-2 作为专注于音频生成、音频理解与音频编辑的AI模型,凭借高精度的音频生成还原度、全格式音频的解析与处理能力、兼容全生态工具的特性,成为企业级音频业务智能化升级的热门选型。本文将…

作者头像 李华
网站建设 2026/9/3 0:03:15

2025年黑客盗走35亿美元:Synbo解读加密货币最危险的真相

如果有一天,你打开加密钱包,发现资产不是下跌,而是直接被转走了,你第一反应会是什么?很多人会下意识觉得,这种事不会发生在自己身上,或者只是个别项目“倒霉”。但说实话,到了今天&a…

作者头像 李华
网站建设 2026/9/2 8:26:09

GPT进化论:大模型语言与AI的迭代差异及未来应用场景解析!

一、大模型语言与AI 什么是大模型语言? 大模型语言是指使用深度学习技术构建的大型语言模型。这些模型通常具有数十亿甚至千亿级别的参数,能够理解和生成自然语言文本。大模型语言的核心是Transformer架构,它通过自注意力机制和多层神经网络…

作者头像 李华