本期选取 arXiv 于 10 月 8 日提交的 5 篇视觉语言与具身智能论文。论文数字均来自官方摘要并归因于作者;本文未做独立复现。

1. VersaCamVLA:相机变化不该摧毁操作策略

论文:VersaCamVLA: Camera-Configurable VLA Policies for Robotic Manipulation · HF Papers · 提交于 2026-10-08

问题。 VLA通常依赖训练时固定的相机数量和姿态,部署时换相机或改变视角就容易失效。

方法亮点。 VersaCamVLA把任意数量、带位姿的 RGB 视图映射为固定大小的 scene tokens,再作为补充视觉条件接入预训练 VLA;作者用多信号目标视图预测和 Wrist-Augmented Pose Sampling 提供视角多样性,不依赖显式 3D 传感或新视角渲染。

证据。 摘要称,模型在 RoboTwin、LIBERO 和真实机器人平台上持续优于既有 VLA 与直接多视图基线,并在不同相机数量及未见相机姿态下保持更稳健表现。

边界。 摘要没有给出各平台的绝对成功率、相机极端遮挡条件或额外训练成本。

我的判断。 把“相机配置”抽象为可变输入接口,可能比给每种硬件单独训练一套策略更有迁移价值;但真实收益仍取决于视角覆盖是否足够。

2. GPD:把3D几何作为训练期特权

论文:Distilling Routed 3D Privilege for Spatial Reasoning in Vision-Language Models · HF Papers · 提交于 2026-10-08

问题。 VLM从 RGB 图像中缺少直接几何证据;只在最终答案上给奖励,无法定位深度或方向判断究竟错在哪里。

方法亮点。 GPD(Geometry-Privileged Distillation)在训练时把深度、语义和鸟瞰视角信息渲染成紧凑文本,作为教师侧的几何特权,并通过问题条件路由送入教师;部署模型仍只看 RGB。作者把特权 KL 主要施加到错误轨迹上,并与 GRPO 结合。

证据。 摘要报告 4B 模型在 VSI-Bench 上得分 57.1,在 MindCube、SPARBench、MMSI-Bench 和 ViewSpatial 上平均 37.6;消融结果支持问题条件路由及只对错误轨迹蒸馏的作用。

边界。 这些结果来自作者的训练和评测设置;摘要没有展开 3D 数据生成成本、不同场景的绝对分数和部署延迟。

我的判断。 这条路线的关键不是让模型部署时携带 3D 模块,而是把几何证据变成纠错信号;它更像“训练时看得更多,推理时保持轻量”。

3. PLaW-VLA:只预测与控制有关的未来

论文:PLaW-VLA: Predictive Latent World Modeling for Vision-Language-Action Policies · HF Papers · 提交于 2026-10-08

问题。 长时程控制需要预测世界如何变化,但逐像素重建会把大量与动作无关的视觉细节也纳入预测,增加世界模型负担。

方法亮点。 PLaW-VLA在预训练的预测型表示空间中建模任务相关的未来状态,用 Mixture-of-Transformers 同时接收观察历史、任务语义和预测状态,再通过结构化因果注意力生成动作。

证据。 作者报告其在 RoboTwin Hard Horizon III 上相对反应式策略提升 11.8 个百分点,在 zero-shot LIBERO-Plus 上相对重建型潜变量预测提升 1.77 个百分点;在相近策略表现下,推理延迟约为生成式 world-action modeling 的 1/19。

边界。 摘要没有给出完整成功率、硬件配置和延迟测量口径,也没有说明轻量未来预测在更大分布偏移下的失效模式。

我的判断。 世界模型未必需要“想象完整视频”;只预测能改变动作选择的状态,可能是让预测真正服务控制的更务实接口。

4. FLOWMEM:复用成功过的潜在推理

论文:Recompose and Refine Latent Reasoning Flows for Vision-Language-Action Models · HF Papers · 提交于 2026-10-08

问题。 VLA每次查询都重新生成潜在推理,即使此前已经执行成功,也不会复用那段计算经验。

方法亮点。 FLOWMEM把成功的潜在计算作为可复用经验,随着具身上下文变化动态检索和重组潜在片段,再用当前视觉与本体感觉证据进行修正,最后条件化动作生成,而不是简单追加固定检索文本。

证据。 摘要报告,在 RoboMME 和 LIBERO-Plus 上成功率分别为 48.0% 和 77.3%,相对无记忆策略提升 1.7 和 4.1 个百分点。

边界。 摘要没有说明记忆库规模、检索开销、失败轨迹如何处理,也未给出长时间运行时错误记忆累积的结果。

我的判断。 具身记忆的价值不只是保存“发生过什么”,而是保存可重组的“为什么这一步曾经有效”;这会把记忆模块从上下文外挂推向控制状态的一部分。

5. HWAM:把执行后的身体状态纳入世界动作模型

论文:Humanoid World Action Model With Joint State–Action Generation · HF Papers · 提交于 2026-10-08

问题。 人形机器人中,策略输出的参考动作还要经过全身控制、动力学和平衡约束;参考动作与实际执行的身体状态之间存在 action-execution gap。

方法亮点。 HWAM把执行后的本体感觉状态作为显式预测目标,与参考动作联合生成;训练包含策略、前向动力学和逆动力学三条路径,让动作、身体运动和视觉结果相互约束。

证据。 摘要称,HWAM在 LimX OLI 人形机器人的三个真实任务中取得评测基线最高成功率;在 Candy Picking 任务上成功率为 70.6%,对比 Fast-WAM 的 43.3%。

边界。 数字来自作者摘要;摘要没有给出任务样本量、硬件细节和不同接触条件下的分项结果,不能据此推断对其他人形平台的普适性。

我的判断。 对机器人而言,预测“动作会让身体变成什么状态”可能比只预测下一帧画面更接近控制本身;难点在于这类状态监督能否跨动力学系统迁移。

今日阅读线索

五篇论文把 VLM/VLA 的瓶颈从“再增加一个更大的视觉编码器”移向接口设计:相机变化被压缩成 scene tokens,3D 几何被转成训练特权,未来预测只保留控制相关状态,成功推理被重组进记忆,执行后的身体状态则回流到世界模型。共同待核对的是成本与迁移:这些表示在作者设置中有效,是否也能在新相机、新机器人和更长闭环里保持有效,仍要看完整实验与真实部署。