【AAAI 2026】ReconVLA:以重建式视觉监督实现精准机器人操纵|从机器人视觉表征对齐视角

发布时间:2026/8/9 20:10:19
【AAAI 2026】ReconVLA:以重建式视觉监督实现精准机器人操纵|从机器人视觉表征对齐视角 摘要本文解读 AAAI 2026 论文《ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver》。该论文提出ReconVLA一个以重建式视觉监督实现隐式 grounding 的视觉-语言-动作VLA模型通过融合注视区域gaze region重建、扩散 Transformer与大规模视觉预训练让机器人像人眼一样聚焦目标区域解决传统 VLA 视觉注意力分散导致的操纵失准问题。实验表明CALVIN ABC→D 第 5 子任务成功率 64.1%、平均完成长度 3.95/5ABCD→D 平均 4.23/5并在真机未见目标上保持可用基线近乎 0%为具身智能的视觉表征对齐提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQReconVLA 与显式 grounding 方法RoboGround、VIP有何区别为什么要重建注视区域而不是整幅图像思维链 grounding输出 bbox为什么效果差预训练数据是怎么得到的需要动作标注吗ReconVLA 在真实机器人上的表现如何ReconVLA 的损失函数包含哪几项参考链接论文基本信息项目内容标题英文ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver标题中文ReconVLA以重建式视觉监督实现精准机器人操纵作者Wenxuan Song, Ziyang Zhou, Han Zhao, Jiayi Chen, Pengxiang Ding, Haodong Yan, Yuxin Huang, Feilong Tang, Donglin Wang, Haoang Li机构香港科技大学广州· 西湖大学 · 浙江大学 · Monash University会议AAAI 2026arXivhttps://arxiv.org/abs/2508.10333项目网站https://zionchow.github.io/ReconVLA/背景与动机传统 VLA 模型RT-2、OpenVLA、RoboFlamingo、VLAS、UniVLA 等只监督动作输出模型虽然能在多模态理解基础上执行动作但视觉注意力往往呈弥散状态无法聚焦目标物体。论文通过注意力可视化发现在杂乱场景与长程任务中模型视觉 token 获得的注意力远低于语言 token常常聚焦错误区域导致操纵错误的对象。为什么这个问题重要精准的视觉 grounding 是 VLA 实现精确抓取的基础尤其体现在杂乱环境和长程任务中。例如把西瓜放进黄色碗里这类指令基线模型注意力分散在无关位置直接导致任务失败。现有 grounding 工作分两类都未从根本上修正注意力分配显式 groundingRoboGround、VIP借助 LISA、YOLOv11 等外部专家模型分割目标并作为额外输入增强感知但不提升策略自身的 grounding 能力且整图裁剪图的输入冗余反而损害空间理解。思维链 groundingECoT、GraspVLA先输出边界框坐标再输出动作坐标形式难以引导精确操纵直接回归坐标与动作数值对自回归 VLA 训练挑战极大。下表给出 CALVIN ABC→D 上 10 个代表性基线的完整结果附录 D 完整基线表。这个设置要求模型在未见背景环境 A/B/C 训练、环境 D 测试上完成 5 个连续子任务是检验泛化的硬基准Method1/53/55/5Avg LenUniPi (NIPS23)56.08.04.00.92SuSIE (ICLR24)87.049.026.02.69GEVRM (ICLR25)92.054.026.02.83GR-1 (ICLR24)85.459.640.13.06Vidman (NIPS24)91.568.246.73.42CLOVER (NIPS24)96.070.845.43.53VLAS (ICLR25)87.240.919.62.40RoboFlamingo (ICLR24)82.446.623.52.47OpenVLA (CoRL24)91.362.043.53.27UniVLA (RSS25)95.575.456.53.80ReconVLA (ours)95.676.964.13.95从历史脉络看附录 HVLA 领域经历了 RT-22023确立范式 → 生成式操纵方法UniPi、SuSIE、GR-1、3D-VLA 预测未来帧增强规划→ 显式/CoT grounding 与 ROSS 重建式视觉指令微调2024→ ReconVLA2026首次把注视区域重建作为 VLA 隐式视觉监督。ReconVLA 因此被视为机器人视觉表征对齐方向的奠基工作后续 Spatial ForcingICLR 2026等沿此脉络发展。研究主线从问题到结论图 7ReconVLA 研究主线流程图Mermaid——问题→动机→设计→方法→实验→结论边标注关键证据。基准/方法设计核心洞察人眼在操纵物体时只聚焦视野中的一小块区域即注视行为其余部分模糊。ReconVLA 把这个机制建模为重建目标——让模型从噪声中重建目标操纵区域gaze region重建过程成为视觉输出的隐式监督信号迫使模型把视觉注意力集中到正确目标同时增强该区域的细粒度感知并在长程任务中隐式促进子任务规划。图 1观察画面、gaze region 与注意力图可视化。长程任务 stack blocks 中ReconVLA 自适应调整 gaze region把视觉注意力引导到正确目标完成先抓起蓝块、再叠到粉块上的连续操作。三种 grounding 范式对比附录 A显式范式EG用 YOLOv11 检测目标并联合输入整图/裁剪图平均长度 3.61思维链范式CG输出边界框坐标仅 0.63ReconVLA 的隐式范式IG直接监督视觉输出达到 3.95。直接监督视觉输出既避免了输入冗余又绕开了坐标回归的联合训练难题。图 2三种 grounding 范式概念对比。(a) 显式外部 grounding 专家 整图/裁剪图输入(b) CoT先输出 bbox 坐标再输出动作(c) 隐式本文通过重建过程把关键区域作为隐式视觉监督。分类全景图 8VLA 视觉 grounding 方法分类全景Mermaid——显式 / CoT / 隐式 / 生成式四类范式及其代表方法。方法细节ReconVLA 由重建部分和动作部分组成基于 LLaVA-7bQwen2-7b 语言模型 SigLIP-so400m-patch14-384 视觉编码器构建图 3ReconVLA 架构多视角图像 文本指令输入动作部分输出离散动作 token重建部分以 reconstructive tokens 为条件从噪声 $z_t$ 去噪重建 gaze region 场景 token $z_0$。重建目标只重建目标操纵区域而非整幅图模拟人眼注视在潜在空间重建冻结 VAE 视觉 tokenizer 提取场景 token避免像素级冗余去噪过程促使模型捕获内在特征而非克隆 RGB 值。扩散重建轻量扩散 TransformerDiT作为去噪器以模型视觉输出 $h_R$ 为条件从噪声 $z_t$ 恢复 gaze region token $z_0$。重建损失采用去噪均方误差形式$L_{visual} E[||D(z_t; h_R, t) - \epsilon||^2]$。总损失$L L_{action} L_{visual}$其中 $L_{action}$ 为自回归动作预测的交叉熵$L_{visual}$ 为重建项。指令前缀交错附录 F指令 token 置于图像 token 之前图像 token 通过因果注意力融合指令信息保证模型处理与指令目标对应的视觉 token且不损害语言建模能力。大规模视觉预训练预训练数据来自 BridgeV2、LIBERO 与 CALVIN用微调后的 Grounding DINO 自动分割指令目标区域形成整图/裁剪图配对数据共10 万 轨迹、200 万样本。预训练与微调均同时回传重建与动作梯度保持优化目标一致性预训练不依赖动作数据原则上可融入任意规模的互联网视频实现 scaling。实验设计与结果评测协议CALVIN 基准基于 PyBullet 仿真与 Franka Panda 机械臂含 34 个任务、4 个环境A/B/C/D长程挑战为 5 个连续子任务500 次 rollout 评估各子任务成功率与平均完成长度。真机使用 6-DoF AgileX PiPer 机械臂、RealSense D515Eye-on-Base与 ORBBEC DabaiEye-on-Hand相机4 个任务水果入碗、叠碗、翻杯子、清理桌面各约 150 条轨迹、20 次测试并替换为未见目标检验泛化。图 4真机实验设置与四个代表性任务Stack bowls、Put fruit into bowl、Flip cups、Bus table。目标物体与背景颜色均含变体以测试泛化。主结果CALVIN ABC→DReconVLA 第 5 子任务 64.1%、平均长度 3.95全面超越 CLOVER45.4%、3.53、UniVLA56.5%、3.80与 OpenVLA43.5%、3.27在最后子任务上分别领先 18.7、7.6、20.6 个百分点。ABCD→D 更困难设置下平均完成 4.23/5、首任务 98.0%超过 GR-14.21与 RoboFlamingo4.08。范式对比附录 AParadigm1/53/55/5Avg LenBaseline无 grounding88.863.749.03.36EGYOLOv11 裁剪图输入94.470.950.23.61CGCoT 输出 bbox47.01.60.00.63IG本文95.676.964.13.95消融实验附录 BVariant1/53/55/5Avg LenFull重建 gaze 预训练95.676.964.13.95去掉预训练96.876.958.23.85去掉 gaze 区域重建全图89.867.746.53.42去掉重建纯动作基线88.863.749.03.36消融显示预训练贡献最大平均长度 0.53因为未见测试环境下定位目标并重建本身极难大规模预训练显著提升视觉生成泛化重建 gaze 区域优于重建全图——聚焦目标避免操纵错误物体而全图像素冗余在未见场景下难以重建。ABCD→D 完整对比附录 E3D-VLA 0.70 → GR-1 4.21 → VLAS 3.70 → RoboFlamingo 4.08 →ReconVLA 4.23。注意力可视化指令 put the watermelon into the yellow bowl 下基线注意力高度分散导致任务失败ReconVLA 精准聚焦西瓜。最难任务 stack block 成功率从 59.3% 提升到 79.5%20.2%。图 5CALVIN 与真机上的注意力图对比第 1 行基线注意力分散或聚焦错误区域导致动作失准第 2 行 ReconVLA 借助视觉监督信号聚焦目标区域精确完成操作。真机结果ReconVLA 在水果入碗与叠碗上接近或超过 90%四个任务全部优于 OpenVLA 与 PD-VLA未见目标上 OpenVLA/PD-VLA 近乎 0%ReconVLA 凭借大规模混合数据预训练仍能成功 grounding 并完成任务。图 6真机多任务结果4 个已知任务 2 个未见任务的成功率。ReconVLA 在 Put Fruit into Bowl 与 Stack Bowls 上接近或超过 90%在未见任务上显著优于 OpenVLA 与 PD-VLA。结果对比总结图 9结果对比总结Mermaid——第 5 子任务成功率 64.1%分别领先 CLOVER 18.7pp、UniVLA 7.6pp、OpenVLA 20.6pp真机未见目标仍可用。关键发现注意力分散是操纵失准的根因注意力可视化显示传统 VLA 视觉 token 获得的注意力远低于语言 token在杂乱/长程场景中聚焦错误区域。隐式 grounding 全面胜过显式与 CoT同基线受控对比 IG 3.95 EG 3.61 Baseline 3.36 ≫ CG 0.63平均完成长度。重建 gaze 区域优于重建全图去掉 gaze 区域后平均长度从 3.95 降至 3.42聚焦目标物体避免操纵错误对象。大规模预训练带来 0.53 平均长度增益10 万 轨迹、200 万样本BridgeV2/LIBERO/CALVIN Grounding DINO 自动配对显著增强未见环境的重建泛化。精确操纵大幅提升stack block 任务成功率 59.3% → 79.5%20.2%。真机未见目标泛化OpenVLA/PD-VLA 在未见目标上近乎 0%ReconVLA 仍可成功 grounding 并完成动作。局限性依赖 Grounding DINO 标注质量预训练数据的 gaze region 由检测器自动生成标注质量受检测器限制。真机评估规模有限4 个任务、每任务 20 次测试统计显著性空间有限。未见场景仍有挑战unseen 环境下定位与重建难度大预训练缓解但未消除。重建计算开销扩散去噪增加训练/推理计算高频控制场景需权衡延迟作者展望借助自动数据处理流水线融入互联网视频实现 scaling。常见问题FAQReconVLA 与显式 grounding 方法RoboGround、VIP有何区别显式方法依赖 LISA、YOLOv11 等外部专家分割目标并作为额外输入未提升策略自身的 grounding 能力且整图裁剪图的输入冗余损害空间理解ReconVLA 直接监督视觉输出通过重建目标区域隐式完成 grounding无需额外输入或输出。为什么要重建注视区域而不是整幅图像重建整图面临像素冗余在未见场景下极难完成只重建目标操纵区域模拟人眼注视行为引导注意力聚焦正确目标、增强细粒度感知消融显示重建 gaze 区域3.42明显优于重建全图的效果。思维链 grounding输出 bbox为什么效果差坐标形式不足以有效引导模型精确操纵目标位置且直接输出精准坐标与动作数值对自回归 VLA 的训练提出挑战CALVIN 上平均完成长度仅 0.63。预训练数据是怎么得到的需要动作标注吗预训练数据来自 BridgeV2、LIBERO、CALVIN 开源机器人数据集用微调后的 Grounding DINO 自动分割指令目标区域生成整图/裁剪图配对数据重建预训练不依赖机器人动作数据因此原则上可以融入任意规模的互联网视频。ReconVLA 在真实机器人上的表现如何4 个真机任务中水果入碗、叠碗接近或超过 90% 成功率全部优于 OpenVLA 与 PD-VLA在训练中未出现过的目标物体上基线几乎全部失效ReconVLA 仍能正确 grounding 并完成任务展示了视觉泛化能力。ReconVLA 的损失函数包含哪几项总损失为动作预测交叉熵 $L_{action}$ 与注视区域重建项 $L_{visual}$ 之和其中重建项为扩散去噪均方误差去噪器以模型视觉输出为条件从噪声恢复 gaze region 的场景 token。参考链接ReconVLA 项目主页含视频与演示arXiv 论文页ReconVLA (2508.10333)RT-2Vision-Language-Action Models Transfer Web Knowledge to Robotic ControlOpenVLAAn Open-Source Vision-Language-Action ModelGR-1A GPT-style Model for Robot Visual ManipulationGrounding DINOMarrying DINO with Grounded Pre-TrainingROSSReconstructive Visual Instruction Tuning给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件