02

PAPER RADAR

VLM 论文速递

追踪视觉语言模型的新论文,提炼问题设定、方法亮点、实验结论与局限。

14
文章
每日精选
更新节奏

ARCHIVE

全部内容

  1. VLM 论文速递 #014|Puffin-World 把「原生 3D 世界状态」做进统一多模态架构:物理(重力场/纬度)+几何(深度)+外观(图像)三态共模、Puffin-16M 含 1500 万图文相机三元组与 100 万轨迹、全量开源;Principia 用「关系一致性」给视频模型考牛顿物理:8 大现象、6 个 SOTA 视频生成器全部 ≤0.42(VBench 却约 0.8),VLM 检测物理违规最佳仅 67%;WorldReward 用 VLM 成对偏好统一「动作一致性+视觉质量」评测相机条件世界模型,三维度超 GPT-5.5 达 3.42/1.45/3.56pt 并用于 HY-WorldPlay 1.5 RL 后训练;VT-Contrast 给 VideoLM 加表征级「时间反事实」对比目标(EMNLP 2026);LLaDA-Image 以全开放配方训练 6B DiT 图像生成器,Qwen-Image-Bench 开源双榜 SOTA(53.53/53.38)

    精选 arXiv 标注 2026-09-03 批次(2609.03xxx–2609.04xxx)五篇方向互补的工作:Puffin-World(cs.CV)把物理、几何、外观三种「世界状态」原生建模进统一多模态架构,配 Omni-Camera 表示与跨帧物理传播,数据 Puffin-16M 含 1500 万 vision-language-camera 三元组 + 100 万轨迹,代码/模型/数据全开源(作者含 Chen Change Loy 等);Principia(cs.CV)提出标定无关的「关系一致性」物理评测——8 大现象(重力/恢复系数/摩擦/转动惯量/抛体/动量/摆/弹簧振子),数千次生成中 6 个 SOTA 视频生成器最高仅 0.42(同期 VBench 均约 0.8),VLM 检测违规最佳 67%、多数接近随机;WorldReward(cs.CV)用 VLM 成对偏好把「动作一致性」与「视觉质量」统一成相机条件世界模型的奖励,WorldReward-Bench 三维度超 GPT-5.5 达 3.42/1.45/3.56pt,用于 HY-WorldPlay 1.5 RL 后训练在短到长时程都提升动作执行与视觉质量;VT-Contrast(cs.CV,EMNLP 2026 主会)对 VideoLM 晚期层末帧视频 token 施加按 Kendall tau 分级的时间反事实对比,不改架构、兼容多种训练任务;LLaDA-Image(cs.CV)用 6B 从零训练 DiT + 冻结 LLaDA2.0-Mini 理解模块,先图-only 预训练/中训练再对齐,Qwen-Image-Bench 英/中双轨 53.53/53.38 创开源 SOTA,权重/代码/配方全开放。

    • VLM
    • 多模态
    • 世界模型
  2. VLM 论文速递 #013|SolarWM 把视频世界模型做成「全开放地基」:1.43M 统一片段喂出 5B-33B 四模型、5 秒训练序列支持分钟到小时级实时交互;RIG-BENCH 系统性评测「推理驱动图像生成」:2000 样本暴露「局部合理、全局不合逻辑」缺口;RVSD 免训练解码把 token 稀疏化与语义空间视觉检索合二为一治幻觉;Web Agent 世界模型改用「预测状态匹配」训练——决策目标与生成目标对齐;TIC-Bench 用 2280 道题测「深度交错图文上下文」,10 个 MLLM 与人类专家差距明显

    精选 arXiv 2609.02xxx 批次五篇互补工作:SolarWM(cs.CV,2026-09-02)把 10 个数据集 1.43M 片段统一为带相机几何/质量元数据/溯源的对齐契约,在 Wan2.2/LTX-2.5/MiniMax-H3 上实例化四个 5B-33B 因果世界模型,仅用 5 秒训练序列即可支持分钟到小时级实时交互,数据/流程/权重全开源;RIG-BENCH(cs.CV)用 2000 个样本四类认知域(概念/变换/模式结构/场景)系统评测 Reasoning-driven Image Generation,发现 SOTA 统一生成模型普遍「局部合理、全局不合逻辑」;RVSD(cs.CV/cs.AI)以语义导向 token 选择 + 语义空间视觉检索(SSVR)在单次解码内同时完成稀疏化与视觉补偿,免训练缓解视觉幻觉并在长上下文下保持抑制;Discriminative World Models for Web Agents(cs.AI/cs.LG)提出 predicted-state matching 训练目标,让世界模型预测的表示必须能区分「真达状态」与「备选动作状态」,改善 WebPRMBench 动作排序与 WebArena-Lite 端到端成功率;TIC-Bench(cs.CV)覆盖逻辑/时间/空间三类共 8 种深度交错图文情境、2280 题,10 个 SOTA MLLM 在跨图文证据整合上与人类专家差距显著。

    • VLM
    • 世界模型
    • 视频生成
  3. VLM 论文速递 #012|TempCloze 给视频 LLM 出「完形填空」:31 个模型都能猜语义、却卡在时间对齐;IntroConformal 用模型自省信号给 LVLM 事实性上统计保证;S²Prune 空间结构化剪枝 576→32 个视觉 token 保住 79.3% 性能;MeRoPE 让相机可控视频生成对得上真实度量轨迹;一句话提示词即可洗掉隐形水印——OpenAI/Google 六款图像模型全中招

    精选 TempCloze、IntroConformal、S²Prune、MeRoPE、One Prompt Is Enough 五篇 2609.01xxx 批次论文:视频完形填空基准暴露 10 家闭源 + 21 家开源 Video-LLM 的 Alignment 时间对齐瓶颈;训练-free 共形风险控制用隐藏状态语义稳定性与「验证概率」给 LVLM 事实性提供有限样本分布无关保证;按空间覆盖 + Laplacian 方差分配预算的免训练视觉 token 剪枝(Qwen2.5-VL 上 32/576 token 保留 79.3% 性能);度量旋转位置编码以正交旋转块编码射线夹角、沿极线加视差先验,严格保范数地解决相机可控视频生成的大平移尺度失效;以及把「提示词重建」形式化为水印清洗攻击面——1800 张重建图显示 OpenAI/Google 六款图像编辑模型均可被一句话提示词洗掉隐形水印(Nano Banana 2 高保真重建下 DwtDct 仍可被洗)。

    • VLM
    • 视频理解
    • 评测基准
  4. VLM 论文速递 #011|单次前向可解释视觉搜索:VisLens 比训练-free 多轮方法快至 22.2x;空间 Matryoshka 训练让文档检索一次编码吃遍多级压缩;SpanCalib-VLM 给幻觉 span 检测装上校准;组合式视频 grounding 基准暴露 11 个模型集体翻车;LightNav-0 直接调用 VLM 空间智能做通用导航

    精选 VisLens、ColSNAP、SpanCalib-VLM、CompSTVG/CurrSTVG、LightNav-0 五篇论文:logit lens 单次前向完成 MLLM 细粒度视觉搜索(比 Thyme 快 8.5-9.9x、比训练-free 多轮方法快至 22.2x);嵌套空间平均池化让 late-interaction 文档检索一次编码支持多级压缩;生成式+判别式混合双系统拿下 SHROOM-Visions 校准相关 0.41、干净响应 IoU 0.91;组合式 STVG 查询让 11 个模型表现骤降、课程 RL 最大增益落在最难查询;以及用统一 token 接口唤醒 VLM 空间智能的通用具身导航模型(10 个仿真设置 SOTA)。

    • VLM
    • 视觉搜索
    • 文档检索
  5. VLM 论文速递 #010|视频 grounding 并行解码:延迟降 79x;MLLM 的 ViT 注意力头竟分「前景/背景」专家;RL 后训练教会 VLM 抓「做错事」;3D 胸部 CT 的解剖路由对比学习;给低视力用户的显著性排序 VLM

    精选 Locate Anything in Videos(PTD)、Semantic Head Specialization、Post-Training VLMs for Video Mistake Detection(MD-VQA)、ARC-CT、Salience-LLaVA 五篇论文:视频 grounding 延迟降 79x、吞吐升 92x;ViT 注意力头分化为物体/背景专家、混合注意力 6.5x 省算力打平全注意力;RL 后训练在 EP-VQA 上比最强基线高 11.6%;无标注 3D 胸部 CT 对比学习拿下 18 异常 0.86 AUC;以及让 VLM 按重要性顺序描述场景的低视力辅助框架。

    • VLM
    • 视频理解
    • 注意力机制
  6. VLM 论文速递 #009|VLM 内部藏着「视觉检索头」;两个 PACE 同日登场——一个 3.1x 加速推理、一个专攻长视频证据;兽医病理基准 VIPER;无人机跨视图定位 UniGeo

    精选 Retrieval Heads Meet Vision、PACE(Pixel-Adaptive Condense and Extract)、PACE(Progressive Acquisition of Critical Evidence)、VIPER、UniGeo 五篇论文:1.7%-2.6% 的注意力头承担 VLM 视觉 grounding 的因果职责(mask 掉 20 个最多掉 80 个准确点)、10% 视觉 token 换 3.1x 首 token 加速、长视频问答 42.6% 准确率与 66.9% 线索恢复、首个专家策展的毒理病理基准、以及把文本-图像匹配升级为理解-生成-验证三段式的跨视图地理定位。

    • VLM
    • 可解释性
    • 推理加速
  7. VLM 论文速递 #008|表格只要 64 个 token、告别截图点击的 GUI 接口、解耦规划与控制的具身 Agent、医学 VQA 落地到像素、多模态 Agent 的记忆森林

    精选 A Table Is Worth 64 Tokens、ASIL、Instruct-to-Act、MedREAL、GraphMemix 五篇论文:像素级表格压缩让长文档 QA 省 41% token 且 +7 准确点、以结构化状态与语义动作替代截图点击的软件操作接口、把 VLM 规划与世界模型控制解耦的具身系统、从临床推理对齐到像素级分割的医学多模态框架、以及用证据森林组织多模态长期记忆的组合优化方法。

    • VLM
    • 文档理解
    • GUI Agent
  8. VLM 论文速递 #007|跨具身视频世界模型、VLM 里的「视觉检索头」、重访记忆评测、视觉文字纠错、10% token 的快速推理

    精选 CLAP、Retrieval Heads Meet Vision、R2M-Bench、ReViCo、PACE 五篇论文:以互联网级异构视频训练的跨具身视频世界模型(零样本物理模拟)、定位 VLM 中因果负责图文对齐的约 2% 注意力头、区分「重访记忆」与「时序稳定」的相对一致性评测、暴露 VLM 视觉文字理解与人类差距的纠错基准,以及把 VLM 推理提速 3.1 倍的统一「压缩-抽取」框架。

    • VLM
    • 世界模型
    • 可解释性
  9. VLM 论文速递 #006|原生视觉推理测试台、人类视频即任务说明、VLA 流式时序、600 万参考视频编辑数据、代码作为世界大脑

    精选 VBVR-Pro、Zero-WAM、StreamPI、RefVideo-6M、Code World Model 五篇论文:可验证奖励的视觉推理闭环测试台、以人类视频为上下文说明的具身世界动作模型、零新增参数的 VLA 流式时序框架、600 万参考的视频编辑数据集,以及"代码+视频渲染"的世界模型新范式。

    • VLM
    • 世界模型
    • 具身智能
  10. VLM 论文速递 #005|1000 万小时开放视频数据、世界模型是否真的听指令、以及 VLM 的战术推理短板

    精选 LAION-BVD、WorldEcho/WorldSync、PhysMLLMs、DoublesEval、TurboT2VA 五篇论文:开放视频数据基础设施、世界模型动作遵循诊断、视频分割空间先验、多智能体战术推理评估与音视频生成加速。

    • VLM
    • 数据集
    • 世界模型
  11. VLM 论文速递 #004|从预测像素到预测几何、从看视频到懂意图、以及提示词的权威问题

    精选 GeoWAM、JoyAI-Echo-1.5、IntentQA、DG-Mem、TOWN-VLA 五篇论文:世界模型的状态空间、长程音视频生成、视频意图推理、Agent 记忆与提示词注入风险。

    • VLM
    • 世界模型
    • 视频生成
  12. VLM 论文速递 #003|更少的 token、更难的时序与关系推理、以及可验证的安全

    精选 E2S-Pruner、TimeCatch、EviSafe 等五篇 8 月 24 日论文:VLM 的挑战正在从“看清”转向“连续、可靠、负得起责任”。

    • VLM
    • 视觉推理
    • 模型效率
  13. VLM 论文速递 #002|从“答对”走向证据、长视频与视觉规划

    精选 VideoChat3、E-VQA、SynthDocBench 与 RxBrain:VLM 正在同时补齐高效视频感知、可验证证据、长文档诊断和视觉化规划。

    • VLM
    • 视频理解
    • 视觉推理
  14. VLM 论文速递 #001|一篇新工作应该怎样读

    用问题、方法、证据和边界四个层次快速拆解视觉语言模型论文,避免只记住模型名称和榜单数字。

    • VLM
    • 论文阅读
    • 研究方法