本期覆盖 arXiv 最新公告批次(cs.CV/cs.CL/cs.AI,abs 标注日期 2026-09-02/09-03;截至 9 月 6 日早抓取,arXiv 尚无 9 月 4 日及之后标注的新公告批次)。上期 #014 已深度覆盖该窗口的 Puffin-World、Principia、WorldReward、VT-Contrast、LLaDA-Image 五篇主文及 GraFT 等四篇顺带阅读,本速递从同一窗口未报道的工作中另选五篇方向互补,全部摘要逐篇经 arXiv abs 页直接核验。把它们与今天的 AI 日报 #015(循环深度争议、陶哲轩「黑盒求解污染数学」警告、Spotify 的 token 路由、ActEffect「训练期世界模型」)并读,本期的暗线很统一:「可验证性与计算组织」正在成为多模态研究的两个主轴——VeriPhy 的带溯源证据记录与陶哲轩要求的「过程透明」、与 Anthropic 的 Lean 可检查证明(#014)是同一诉求在视频评测上的投影;FactoSR 与 S³T 分别在「把空间推理拆成可验证子目标」与「把时间当作可蒸馏的信号」上做文章;Jina-OCR-v1 与 CoFiE 则从「算力/解码效率」与「证据筛选时机」两个角度回答「多模态计算怎么省」。五篇分别对应「空间 RL 分解、物理审计、开放文档模型、流式效率、时序自监督」五个关键词。除标注「作者口径」的数字外,均为摘要原文可核验内容;五篇的 arXiv comments 字段均未见会议/期刊标注。

1. FactoSR(Unfold The World):把 VLM 的空间推理拆成 XY/Z/T 四个几何子目标——「维度错配」诊断 + 因子化强化学习,VSI-Bench +5.9%、All-Angles-Bench +4.5%

论文:Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning(2026-09-03,cs.CV)

资源:HF Papers

问题。 VLM 在通用多模态任务上很强,但做空间推理时「平得离谱」(fundamentally “flat”)。作者给出的诊断很尖锐:这是维度错配——VLM 被训练去解读 2D 投影,而真正的空间推理要求恢复被投影压掉的潜在 3D 几何与时间连续性。把「世界一致推理」当作一个整体目标去学,是个 ill-posed 的投影恢复问题, monolithic 学习很难收敛。

方法亮点。 提出 FactoSR(factorized reinforcement learning):从「整体学习」转向「分而治之」,把被视觉投影压塌的维度显式拆开——三个互相正交的几何子目标:平面对应(XY)、深度一致(Z)、时间可逆(T)。每个子目标都是可验证的约束(可写判据、可给奖励),在统一的策略学习机制里分别优化,把一个 ill-posed 的「投影恢复」问题改写成一系列有形的推理步骤——本质上是把「空间感」从隐性的涌现目标,变成显式、可分奖励的 RL 目标。

证据。 摘要量化声明(作者口径):在 multi-view 与视频基准上做大规模评测,「这一分解带来可观收益」——VSI-Bench 提升 5.9%、All-Angles-Bench 提升 4.5%。作者共 11 位:Yijun Yang、Shenghe Zheng、Wenbo Li、Jianhui Liu、Haoze Sun、Yanbing Zhang、Jiaxiu Jiang、Lin Song、Haoyang Huang、Nan Duan(多位具名研究者,具体机构以论文页为准)、Lei Zhu。

边界。 摘要只给了两个基准的两个总提升数字,没有分项(哪个子目标贡献最大、XY/Z/T 各自消融如何)、没有与 prior 的逐点对比、没有说明 RL 的基座模型与算力开销;「可验证约束」的具体判据(T 的时间可逆如何在不看未来帧的情况下判定)未展开;5.9%/4.5% 是相对提升还是绝对百分点未说明,与 #014 顺带阅读 GraFT 的 VSI-Bench 数字(ScanQA CIDEr +27% 等)口径不同、不可直接比较;未给失败案例(哪些空间任务仍学不动)。

我的判断。 这是 #014 三条线索的交汇点:Puffin-World 主张把物理/几何做成架构里的原生状态,GraFT 主张用 3D 场景图做训练-free 空间推理,FactoSR 则主张把几何一致性做成 RL 的显式奖励分解——三家不约而同指向同一判断:VLM 的空间能力瓶颈在「2D 训练目标与 3D 世界之间的接口」,而不在参数规模。FactoSR 的 XY/Z/T 分解在工程上很聪明:深度一致性(Z)和时间可逆性(T)都是「可自动判分的伪监督」——不用人工标注就能生成 RL 信号,这比依赖昂贵空间问答数据更可持续。值得关注的是作者名单里的 Nan Duan/Haoyang Huang(与 #014 及今天的 MeSH 团队同属国内大厂研究体系的空间智能布局),这类「把几何先验 RL 化」的工作接下来会密集出现。若消融能证明 T(时间可逆)确实推动了跨时间的物体恒常性,这条路线对视频理解的意义会大于对单图 3D 的意义。

2. VeriPhy:可审计的生成视频物理验证系统——先编译「物理义务」再看帧,每条判决带溯源证据记录;304 条缺陷记录对上 228 条,但卖点不是召回而是可审计性

论文:VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement(2026-09-02,cs.CV)

资源:HF Papers

问题。 与 #014 的 Principia 同一个出发点:生成视频「看着流畅」不代表物理可靠。但作者指出了现有评测的另一层缺陷:标量质量分说不清一段视频违反了什么物理义务、在哪一帧失败的——没有归因,评测结果就无法写回生成过程去改进模型。

方法亮点。 提出 VeriPhy——一个可审计的物理验证系统,架构上刻意「先想后看」:文本-only 规划器在观察任何帧之前,先把 prompt 编译成带类型的物理义务(typed physical obligations)与一个经过静态验证的执行计划;执行期,观测只负责 gate 和限定对冻结低层专家的声明式调用(分割与跟踪、计数、对轨迹的十一种带类型物理测量、深度、OCR、音频事件检测)。关键设计:每个动作返回一份带溯源(provenance)的证据记录,载荷是带类型的测量值或显式标记的学习状态;类型化 resolver 与固定组合规则把可用记录映射成三值判定——supported/contradicted/unknown(对外表现为 plausible/implausible/abstain),每条判决都可追溯到产生它的证据。配套发布一个 1500 片段的人类标注缺陷语料(缺陷记录定位到 prompt 参照、空间与时间)。

证据。 摘要量化声明(作者口径):在**149 片段核心集(含 304 条缺陷记录)**上,VeriPhy 对上 228 条;对照:一个已发表的 question-decomposition 评测器在同片段同声明下对上 164 条;只谈召回,VeriPhy 并没有赢过用同一骨干做单体提示(monolithic prompting)的 222 条——作者明说区分点不在召回,而在每条决策都保留证据记录与溯源、可逐条审计,并可作为把评判写回生成过程的接口。作者 11 位:Wenzhuo Xu、Yuchen Zhu、Chongjian Ge、Xuan Shen、Jing Shi、Jason Kuen、Yongxin Chen、Molei Tao、Christopher McComb、Noelia Grande Gutiérrez、Jiuxiang Gu。

边界。 304→228 的「对上」判定标准(与人类标注的匹配允许多大偏差)未展开;「已发表的问题分解评测器」未点名;三值判定里 abstain 的比例、误报(把物理正确的视频判违规)没有给;冻结的低层专家(分割/跟踪/测量)本身会出错,错误的传播边界未讨论;1500 片段语料的场景分布与标注者间一致性未披露;文本规划器「编译物理义务」对 prompt 中隐含物理(如「杯子被碰倒后应该碎吗」)的覆盖能力未测。

我的判断。 把这篇放在今天的 AI 日报里读会特别有意思:陶哲轩批评黑盒 AI 求解「没有为数学增加价值」,VeriPhy 就是视频评测领域的同款主张——没有溯源的分数没有价值。作者诚实得罕见:直接承认 VeriPhy 在召回上 ≈ 单体提示(222 vs 228),真正的差异是「每条判决都可审计、可作为 critic 写回生成的接口」——这等于说评测系统的价值从「判得多准」迁移到「判得可解释、可闭环」。这与 #014 WorldReward「VLM 奖励模型」的路线形成对照:WorldReward 用 VLM 偏好当奖励(快但黑盒),VeriPhy 用冻结专家测量 + 类型化义务(慢但可溯源)——「VLM 裁判 vs 符号/专家判据」的争论从物理基准(Principia)蔓延到了评测架构本身。对做世界模型评测与视频生成的团队,VeriPhy 的「先编译义务、后看帧」与「三值判定 + 溯源」是值得直接抄的工程模式;它的局限(依赖冻结专家的覆盖度)也说明:终极方案大概率是 VLM 与可验证专家的混合体。

3. Jina-OCR-v1:低预算 GPU 上的端到端文档解析——DeepSeek-OCR 编码器/3B MoE 解码器 + FastMTP 无损投机解码 + 稠密可验证奖励(GRPO),OmniDocBench 91.14、L4 上解码翻倍

论文:Jina-OCR-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable Rewards(2026-09-02,cs.CL/cs.CV)

资源:HF Papers

问题。 文档解析(OCR + 版面 + 结构理解)模型越做越准,但「能跑在低预算 GPU 上」的端到端模型依然稀缺——大文档模型的高激活参数与慢解码,把很多应用挡在部署门外。作者的目标很直白:为低预算 GPU 服务而建

方法亮点。 Jina-OCR-v1,三个工程点叠加:① 架构复用——压缩视觉编码器 + DeepSeek-OCR 的 3B MoE 解码器(每 token 约激活 570M 参数);② FastMTP 投机解码头——单个 draft block 递归共享、一次预测 K=3 步,贪心验证保证无损;③ 后训练用指令对齐 + 困难文档鲁棒性微调 + GRPO + 稠密可验证奖励:对公式、表格、结构做确定性检查并给部分分(partial credit),而不是只奖励整题对错;训练数据混合清洗过的公开语料与定向合成页面。模型公开可用。

证据。 摘要量化声明(作者口径):默认动态分辨率设置下 OmniDocBench v1.6 得分 91.14、olmOCR-Bench 83.4,对比组里达到最高页面吞吐 2.57 页/秒;在 NVIDIA L4 这类低预算 GPU 上,FastMTP 比贪心自回归解码快约一倍。作者:Alejandro Barón García、Feng Wang、Emilia Garcia Casademont、Han Xiao(Jina AI 团队,作者口径)。

边界。 对比基线名单未在摘要给全(「最高吞吐」相对谁);91.14/83.4 的评测集版本与打分细则需看正文;「低预算 GPU」只点名了 L4 一类;3B MoE 每 token 激活 570M 是沿用 DeepSeek-OCR 的规格(引用时需归因到 DeepSeek-OCR);稠密奖励的公式/表格/结构确定性检查的具体判据未展开;合成页面占比与清洗流程未披露;「最高页面吞吐」是否包含投机解码的 wall-clock 端到端口径未说明。

我的判断。 这篇值得单独记住的原因在「奖励设计」而不在 OCR 本身:GRPO + 稠密可验证奖励(公式对一半也给分),把 #014 LLaDA-Image 的「开放配方」精神从生成带到了文档理解,也把 2025-2026 年 RL 后训练的主流做法(结果奖励 + 可验证中间检查)落到了 OCR 这个「看起来已经解决」的任务上——OCR 远没解决:复杂公式、长尾版面仍是错误源(#014 之前的 OCR-EDR 也指向同一痛点)。工程上,复用 DeepSeek-OCR 的编码器与 MoE 解码器 + 自研投机头,是「站在开源巨人肩膀上做垂直效率优化」的典型打法;FastMTP 的「K=3 递归共享单 draft block + 贪心无损验证」如果真在 L4 上翻倍解码,对端侧文档解析的性价比提升是直接的。开放权重 + 可复现后训练配方,让它成为「文档理解小模型」赛道值得跟踪的基准点。

4. CoFiE:把流式视频理解的证据筛选提前到「视觉编码之前」——粗筛(query-agnostic)去冗余 + 精筛(query-specific)保相关,StreamingBench 78.86%、延迟最高省 2.54×

论文:CoFiE: Coarse-to-Fine Evidence Selection for Efficient Streaming Video Understanding(2026-09-03,cs.CV)

资源:HF Papers

问题。 流式视频理解(VLLM 边看边答)的核心矛盾是延迟:视频无限增长、答案要求实时。现有效率手段(token pruning、memory bank)都是在视觉编码之后砍 token——但最贵的帧编码成本已经花出去了,所以端到端延迟几乎没省下来。作者的问题意识非常准:省 token 不如省「编码」

方法亮点。 提出 CoFiE,把证据选择拆成两个阶段、分别放在成本不同的位置:① 编码前的粗筛(coarse, query-agnostic)——用 Novelty-Guided Frame Filtering 在视觉编码器之前只保留「视觉上有区分度的候选帧」,把大量冗余挡在编码开销之外;② LLM prefill 期的精筛(fine, query-specific)——语义信息出现后,用 Query-Specific Evidence Refinement 选出与用户问题最相关的帧。两阶段各司其职:粗筛省算力,精筛保相关性。

证据。 摘要量化声明(作者口径):在多个视频理解基准上取得新的 accuracy-efficiency 权衡 SOTA——StreamingBench 准确率 78.86%、OvO-Bench 68.72%,较 prior 方法最高提升 3.15%即使过滤掉最多 80% 的证据帧,CoFiE 仍优于强开源多模态模型,端到端推理延迟最高提升 2.54×。作者:Jing Jiang、Yiran Ling、Ruonan Li、Dimitrios Stamoulis、Jie Liu。

边界。 摘要未说明粗筛用的「视觉新颖性」判据是什么信号(帧差?特征距离?)以及它是否依赖特定视觉 backbone;query-specific 精筛发生在 prefill 期,意味着长 prompt 的 prefill 成本本身没省;「优于强开源多模态模型」未点名是哪些;延迟 2.54× 的测量环境(GPU 型号、流长度)未给;80% 过滤下仍不掉的场景类型(如依赖罕见帧细节的问答)未分析。

我的判断。 CoFiE 戳中的是流式视频理解里一个被系统性低估的事实:token pruning 在编码后做,省的是 LLM 的钱,没省视觉编码器的钱——而编码才是流式场景的第一成本。把选择时机前移到编码器之前(哪怕粗筛用的是廉价信号),是「效率工程要贴着成本发生的位置做」的标准示范——这与今天 AI 日报里 Spotify「把 I/O 派给便宜模型」、循环深度「省参数不省算力」是同一课:先搞清楚钱(延迟)花在哪一环,再谈优化。与同批次的 LatentStream(2609.04131,把 store-and-retrieve 改成 retrieve-and-internalize 的隐式记忆)对照,流式视频理解的效率竞赛正在从「压缩/检索策略」蔓延到「pipeline 架构层面(在哪一环选、选多少)」——CoFiE 的「编码前粗筛 + prefill 精筛」会成为后续工作的默认坐标系。

5. S³T(Temporal Self-Distillation):把「时间采样密度」当特权信息——稠密视图当老师、稀疏视图学生同权重自蒸馏,无标签学视频状态跟踪,VSTAT 最高 +2.70、迁移真实视频 +7.95

论文:Temporal Self-Distillation: Learning Visual State Tracking in Videos Without Supervision(2026-09-03,cs.CV)

资源:HF Papers

问题。 视频里的连续状态跟踪(这个物体现在到哪了、处于什么状态)是视频理解的地基能力,但现有做法要么要密集标注、要么要外部老师模型或奖励信号。作者想要**完全自包含(fully self-contained)**的方案:不要标签、不要独立老师、不要奖励。

方法亮点。 提出 S³T(Self-Supervised Self-Distillation over Time),核心是把时间采样密度当作特权信息:假设同一段视频采样得越密,越能准确恢复「进行中的状态」——于是把同一权重模型在稠密采样视图上的输出当老师,让稀疏采样视图的学生去对齐老师的 next-token 分布。模型自己生成自己的目标:训练不需要任何外部监督,推理零额外成本。

证据。 摘要量化声明(作者口径):基于 LLaVA-OneVision-2-8B,S³T 把 VSTAT 准确率提升 +1.74(单模型)、+2.38(模型 souping)、+2.70(叠加视觉编码器适配),而 prior 的 self-evolving 方法对状态跟踪几乎无改善;从无标注合成片段学到的能力迁移到真实视频:VSTAT-YouTube 状态跟踪问答 +7.95、MVBench Action Count +4.50。作者:Shravan Venkatraman、Wenshuai Zhao、Mohammad Hassan Vali、Arno Solin(Aalto 大学团队,作者口径)。

边界。 摘要未给合成片段的类型/规模与「稠密 vs 稀疏」的具体采样率组合;「同权重」的学生-老师如何避免自举坍缩(为什么学生不会退化成复制稠密输出的平庸解)是方法论关键但摘要未展开;VSTAT/MVBench 的数字是绝对百分点还是相对提升未说明;只在 8B 级一个基座(LLaVA-OneVision-2-8B)上验证,更大/更小模型的外推未知;「状态」的粒度(物体位置?姿态?过程阶段?)未定义清楚。

我的判断。 这篇与 #014 的 VT-Contrast 是同一类「表征级时间监督」尝试的两条路线:VT-Contrast 用「保序 vs 乱序」的对比信号逼 VideoLM 在语言生成前编码时间结构;S³T 则用「采样密度」制造老师-学生信息差做自蒸馏——两者共同的前提是:现有视频模型的时序监督全在文本侧,视频表征里的「状态追踪」能力是欠拟合的。S³T 的「自蒸馏」设计优雅之处在于把「看得更密就更懂状态」这个几乎平凡的观察变成了免费的教师信号;而它能从无标注合成视频迁移到真实视频(+7.95),说明学到的不是「合成分布的模式」而是「时间连续性本身」——这对视频 agent、具身数据管线都是廉价可用的预训练目标。与 CoFiE(省编码)并读,流式/长视频的两端——表征该存什么(S³T)与证据该看哪些(CoFiE)——都在被重新设计。

今日阅读线索

把五篇与今日 AI 日报 #015 串起来,本期其实在回答两个问题——「多模态的结论怎么才算数」与「多模态的计算怎么才不浪费」

  1. 可审计性正在从安全口号变成评测架构:VeriPhy 明说「召回≈单体提示、差异在溯源」——这与陶哲轩对黑盒数学求解的批评、Anthropic 用 Lean 给费马大定理上「编译器级验证」(#014)是同一个价值观的三次投影:没有过程透明与证据链的「对」,价值要打折扣。做评测系统的团队,请把「每条判决可溯源、可写回生成」当默认需求。
  2. 空间与物理先验继续「显式化」:FactoSR 把几何拆成 XY/Z/T 子目标做 RL(呼应 Puffin-World 的原生 3D 状态、GraFT 的 3D 场景图、Principia 的关系式物理尺),「别让模型自己从像素里悟出几何,把几何写成目标/约束喂给它」已成为 2026 下半年最拥挤也最一致的共识
  3. 效率的战场在「成本发生的位置」:CoFiE 把筛选挪到编码前(省编码器的钱),Jina-OCR-v1 用投机解码+低激活 MoE(省解码的钱),与日报里循环深度(省参数)、Spotify 路由(省 token)同一逻辑——先定位成本在哪一环,再谈优化手段
  4. 时间表征需要新的监督通道:S³T(密度特权自蒸馏)与 VT-Contrast(#014,反事实对比)殊途同归:文本损失喂不出视频状态表征,得在表征层直接给时间结构造信号——无监督可迁移的结果说明这条路有真金。

顺带可读(同批次、未展开):NTEP-8B(2609.03493,给 agentic VLM 的每次工具调用定义「必要证据路径」奖励,8B 模型统一裁剪/搜索/文本三工具,降冗余调用——日报 agent 治理主题的模型侧呼应);LatentStream(2609.04131,流式视频记忆从 store-and-retrieve 转向 retrieve-and-internalize 的隐式工作记忆);Editable Visual Design(2609.04034,Coding Agent 驱动、把扩散模型当「视觉世界模拟器」的层状可编辑设计生成);Rethinking World Models for Safety-Critical Embodied Systems(2609.03774,perspective:世界模型的「似然 vs 风险、预测 vs 干预、有限时域 vs 累积后果」三个结构性错配,提出 Risk-Informed World Model 研究方向);Building Pretraining Data for World Models(2609.03557,Unreal Engine 两阶段「实时物理 PIE + 离线 MRQ 渲染」的动作条件视频数据流水线,25 台 8×RTX 5090 服务器产出 2691 小时 1080p 视频——EchoWM 的合成数据组件)。