
写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09导读折叠衣物看似只是“抓—放—再抓”却是机器人操作中很难泛化的一类任务布料会皱、滑、遮挡初始状态和材质变化极大双臂的微小配合误差还会在长轨迹中不断累积。许多现有 VLA 策略为单一衣物类别分别训练直接把多类任务混在一起训练又容易相互干扰最终得到一个什么都见过、却难以稳定完成任何一类折叠的策略。DeMaVLA 把问题定位为“可泛化的柔性物体操作”。它以 Qwen3-VL 为视觉语言骨干外挂一个专门处理机器人状态与连续动作的 Action Expert用 flow matching 生成双臂动作块预训练阶段使用约 5,000 小时真实双臂演示学习通用操作先验后训练阶段用混合折叠数据、训练时 Real-Time ChunkingRTC和人机协同 DAgger 处理部署时会遇到的失败状态。论文的论证顺序是Introduction 说明柔性物体折叠与单任务策略的矛盾Related Work 回顾 VLA 与交互式模仿学习Section 3 从数据、架构、训练和 DAgger 四部分构成模型主体Section 4 依次在 RoboTwin 2.0、真实家庭折叠基准和预训练数据规模上验证最后将结论收束到真实数据、动作效率与纠错数据的组合价值。猫先生认为这篇论文的可取之处在于没有把“泛化”归结为一个更大的模型。它把柔性操作拆成三种不同来源的能力大规模真机数据提供常识动作分支提供连续控制失败纠正数据提供恢复能力。论文标题DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation论文地址https://arxiv.org/abs/2605.31286论文 PDFhttps://arxiv.org/pdf/2605.31286论文源码https://arxiv.org/e-print/2605.31286原文脉络原文 Figure 1 先给出预训练数据的构成再在 Section 3.1 解释为什么宽泛的双臂操作数据能够迁移到折叠。Figure 2 将数据、模型、RTC、DAgger 与最终多衣物折叠连成闭环。随后 Section 4 分别检验仿真泛化、真机多任务成功率和数据规模效应这种安排使“模型设计有效”与“真实数据规模有效”能够被分开观察。1–2. Introduction 与 Related Work折叠不是单一抓取技能的重复刚性物体通常有稳定的几何边界和抓取点衣物、毛巾等柔性物体的形状取决于前一步动作视觉上还会产生遮挡、褶皱与自相似区域。一个策略若只在摆平的衬衫上训练换成被随意丢进篮子的裙子或毛巾很容易在取物、铺平、对齐任一环节偏离训练分布。已有 VLA 基础模型证明了视觉、语言和动作可以在一个策略中对齐但柔性操作往往仍被拆成类别专用策略。直接混合数据的另一个问题是任务干扰不同衣物、不同折叠顺序和不同中间状态对同一动作条件提出冲突。DeMaVLA 的目标不是定义新的折叠算法而是让一个双臂 VLA 在共享表示上获得跨类别的先验并在真实失败处持续补数据。Related Work 的另一条线是 DAgger。行为克隆只学习专家演示中出现过的状态而真实机器人一旦偏离之后的观察很可能没有对应示例。DAgger 让当前策略先执行在它真正犯错的位置请求专家纠正再把这类恢复轨迹并回训练集。论文采用 human-gated 版本人只在不安全、不稳定或明显次优时接管避免持续遥操作的高标注成本。3. The DeMaVLA Model数据、连续动作与失败恢复共同组成策略3.1 Pre-training Dataset宽泛双臂操作为折叠提供身体先验预训练数据约 5,000 小时来自真实世界的双臂人形机器人演示。它不只含折叠还覆盖家庭整理、物体转移、工业搬运和长时程双臂协作。作者的假设是伸手、接近、抓取、放置、双臂配合等基础技能可以跨任务复用而其中的折衣、卷毛巾、整理衣物等子集再把这些先验拉回柔性物体场景。图 1预训练数据同时保留广泛的双臂操作技能与折叠相关样本。来源论文 Figure 1。这张图也提示了一个容易被忽略的事实折叠并非占据数据的大头。模型是否能迁移不只取决于“看过多少衣物”还取决于其余任务能否提供有效的双臂协调和接触操作先验。论文的规模实验能证明更多数据有效但尚不能完全拆分“数据总量”和“数据配方”各自贡献多少。3.2 Model Architecture层对齐裁剪的 Action Expert在时刻t tt模型接收三路操作视角图像、语言指令、机器人本体状态q t q_tqt与带噪的未来动作块。观察上下文可写为O t [ I t 1 , I t 2 , I t 3 , ℓ t , q t ] O_t[I_t^1,I_t^2,I_t^3,\ell_t,q_t]Ot[It1,It2,It3,ℓt,qt]其中未来双臂连续控制序列为A t [ a t , … , a t H − 1 ] A_t[a_t,\ldots,a_{tH-1}]At[at,…,atH−1]。Qwen3-VL 编码视觉语言上下文Action Expert 将本体状态投影为 token并与带噪动作 token 一起处理预测将动作块去噪所需的向量场。这样做避免把连续控制硬离散成语言 token保留了双臂轨迹的平滑性。Action Expert 的设计是本文的工程核心。完整复制 VLM 的全部 Transformer 层虽然能在每层与视觉语言表示对应却会让 flow matching 的多次去噪非常昂贵。DeMaVLA 保留隔层的对应关系、裁掉约一半动作分支层相邻保留层直接连接仍可接收不同深度的 VLM 条件信息。最终模型包含 0.4B 视觉编码器、4.0B 语言模型和 2.2B Action Expert共 6.6B 参数。两条分支的职责也被刻意分开视觉语言骨干负责理解“折哪件衣物、放到哪里、当前布料呈什么状态”动作分支负责把这些条件与关节状态、连续控制噪声合并成未来轨迹。相比为每个任务单独训练视觉编码器或控制器这种分工让预训练中的视觉语言知识能够保留相比让通用 VLM 直接输出所有关节值它又给机器人专用 token 留出独立的计算路径。层对齐的价值正是在两者之间建立稳定接口。图 2Action Expert 从 Qwen3-VL 的层结构中裁剪得到下方展示了人机协同 DAgger 如何把失败修正重新聚合进训练数据。来源论文 Figure 2。猫先生认为隔层裁剪不是单纯“模型瘦身”。它保留 VLM 与动作分支的层级对应使动作 token 能在不重复运行完整语言模型的前提下获取多层语义条件这正对准了 flow matching 在推理中反复调用动作网络的成本问题。3.3 Model TrainingFlow Matching 与训练时 RTC 面向异步执行预训练采用条件 flow matchingAction Expert 学习在O t O_tOt条件下将噪声动作块逐步还原为连续双臂轨迹即建模p ( A t ∣ O t ) p(A_t\mid O_t)p(At∣Ot)。与动作离散分类相比这种生成式表述更适合多步、平滑且可能多模态的双臂控制。真实部署时模型计算下一动作块需要时间机器人却不能停住等待。训练时 RTC 将动作块分成两段已经承诺并将在等待期间执行的 prefix以及仍可预测的 postfix。训练时 prefix 保持干净、仅对 postfix 加噪并计算损失推理时策略据此生成与已执行动作连续衔接的后续轨迹。论文因此不依赖额外的推理时 inpainting 或梯度引导来处理异步动作块。3.4 Human-in-the-Loop DAgger只在策略偏离时收集高价值纠正混合折叠策略上真机后人类监控执行发生失败风险时用二元门g t g_tgt接管完成纠正后再交还策略。执行策略可概括为π e x e c ( o t ) g t π H ( o t ) ( 1 − g t ) π θ ( o t ) \pi_{\mathrm{exec}}(o_t)g_t\pi_H(o_t)(1-g_t)\pi_\theta(o_t)πexec(ot)gtπH(ot)(1−gt)πθ(ot)只记录接管区间内的人类动作并在每轮后聚合回训练集。这样收集的数据集中在抓取失败、布料未对齐或中间折叠姿态异常等策略自己会访问、而离线演示较少覆盖的状态。代价是仍需人类专家在线判断何时接管它减少标注量并没有消除真机采集成本。4. Experiments泛化、真机与数据规模分别提供什么证据4.1 RoboTwin 2.0先检查通用双臂操作是否受益RoboTwin 2.0 包含 50 个双臂操作任务分别在固定初始状态clean和物体姿态、场景布局变化的 randomized 设置下评测。DeMaVLA 在两种设置的平均成功率为 88.42% 与 86.78%高于 π0、π0.5、X-VLA、ABot-M0 和 LingBot-VLA。随机化设置仍保持接近 clean 的成绩支持其对姿态和布局扰动具有一定鲁棒性但这仍是仿真基准不能直接等同于布料在真实家庭环境中的泛化。4.2 Household Folding Benchmark一个 checkpoint 面对四类衣物真机基准使用 ALOHA 风格双臂机器人任务不从铺平衣物开始目标会被随机丢进桌旁篮子机器人须取出、放到桌面、展开、铺平并完成折叠。衬衫、裙子、裤子、毛巾各进行 20 次试验每类包含两组不同物品超过 5 分钟或衣物掉落桌面即失败。单任务衬衫折叠中DeMaVLA 达到 100.0% 成功率、平均 2:04π0 为 80.0%、2:13。多任务设置下同一个 DeMaVLA checkpoint 在四类衣物上的平均成功率为 92.5%对比 π0 的 76.3%平均完成时间为 2:18对比 2:26。毛巾提升最明显100.0% 对 55.0%。这些结果支持跨类别共享训练有正迁移但总样本量仍是每类 20 次置信区间和更大规模的材质、尺寸变化并未报告。公平比较方面论文说明两种方法在相同机器人硬件、控制频率、初始化协议与训练时 RTC 条件下评测这减少了异步执行机制带来的混杂因素。但 DeMaVLA 同时改变了预训练规模、动作分支设计和 DAgger 数据来源因此 π0 对比验证的是整套配方的优势不能从表中单独归因到裁剪、flow matching 或人机协同中的某一项。4.3 Pre-training Scaling Analysis5,000 小时带来的增益并非只体现在成功率为隔离预训练规模作者将 500、2,500、5,000 小时的 checkpoint 用相同衬衫后训练数据再评测。成功率从 55.0% 升到 70.0%、再到 100.0%平均完成时间从 3:34 缩短到 3:21、再到 2:04。它表明更大的真机预训练不仅提高任务是否完成也让动作序列更少绕行或更少触发失败超时。不过该实验仍把数据质量、任务覆盖与训练步数绑定在“数据小时数”中。它说明这套扩展配方有效却不能单独证明任何额外一小时演示都具有相同边际价值。5. Conclusion柔性操作的泛化需要“先验、效率与纠错”同时成立DeMaVLA 将广泛真实双臂预训练、层对齐裁剪 Action Expert、连续 flow matching、RTC 和 human-gated DAgger 组合成柔性操作的 VLA 路线。其真机结果表明一个策略可以在衬衫、裙子、裤子和毛巾之间复用部分折叠先验而不是为每个类别单独训练。猫先生认为最值得带走的不是“5,000 小时数据足以解决折衣服”而是柔性操作中的数据闭环应当分工通用演示教会策略怎样使用双臂任务数据教会它折什么人机纠正则教会它从自己造成的坏状态中回来。下一步需要验证的是这种闭环能否迁移到更多材质、更复杂衣物和不同机器人本体。参考资料Su et al., 论文 PDFSu et al., arXiv 页面Su et al., arXiv 源码包推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列