论文阅读:VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation
https://arxiv.org/abs/2307.15818
总览
VLA-OPD:通过 On-Policy Distillation,把 VLA 模型的离线 SFT 和在线 RL 连接起来
OPD 是什么,离线 SFT 是什么?
VLA: Vision Language Action, 视觉语言动作模型,机器人根据图像和语言指令输出动作OPD: On-Policy Distillation,在学生模型自己实际到达的状态上,让教师模型给监督信号Reverse KL(离线)SFT: Offline Supervised Fine-Tuning,用收集好的静态专家数据,对模型进行监督微调
(离线)SFT
SFT: 监督微调 Supervised Fine Tuning
...
这篇论文的核心:VLA 后训练方法
一个预训练好的 VLA 模型已经有一些通用能力了,但部署到具体机器人任务时还不够可靠,那后续应该怎么训练他,才能又快又稳又不遗忘原来的能力?