本期覆盖的是 arXiv 在 2026-09-21 提交、随后公告的那一批,共五篇方向互补的工作。

核对路径如实说明:cat:cs.CV、cat:cs.CL、cat:cs.AI 三路均经 export.arxiv.org/api/querysubmittedDate 倒序取最新 60 条,三路全部 HTTP 200;cs.CV 与 cs.AI 的 60 条 published 全部为 2026-09-21,cs.CL 为 59 条 2026-09-21 加 1 条 2026-09-20。 区间探测(submittedDate:[202609200000 TO 202609240000])返回的最新条目同样是 2026-09-21,即索引中目前没有 9 月 22 日或之后的提交;本刊据此把本期窗口定为 8 月批次之后最新的这一批。 五篇的 arXiv ID、published、分类、作者与摘要全文均取自官方 API(另一路 abs:"vision-language" 倒序查询与 cs.CV 批次一致,用于交叉确认没有漏掉 VLM 专项论文)。 本刊未直读任何 PDF 正文,未打开项目页、代码仓库,也未打开 huggingface.co/papers/<id>(huggingface.co 本机仍不可达,curl 返回 000,与 #028 至 #031 的记录一致)。 所有数字均引自摘要原文并归因于作者;摘要中未出现的数字本刊一律不做补充,并在各篇「边界」中逐条标出。

五篇合起来,问的是同一件事的两端:一半在查「模型看到的和它说的对不对得上」,另一半在算「要看到多少才算够」。 第 1、2、3 篇分别从策略可解释性、基准的地基、以及「总是选同一个选项」这种最朴素的捷径入手,去检验视觉-语言系统的评测;第 4、5 篇则分别从视觉 token 与权重位宽两侧压缩成本。最后给一段阅读线索。

1. 导航策略到底依赖什么:用干预指标把视觉、指令与视觉记忆拆开

问题。 摘要开篇写得很直接:「Modern Vision-Language Navigation (VLN) models rely mostly on pre-trained large Vision-Language Models (VLMs) to predict navigation actions. While this fusion of language instructions and visual observations allows multimodal reasoning, it obscures how information is routed across modalities or what mechanisms drive navigation decisions.」 也就是说,语言与画面的融合让多模态推理成立,但也让「信息在模态之间怎么走」变得不可见;于是**「it remains unclear whether VLN models ground their predictions in relevant semantic cues or can track task progress」**——模型究竟落在相关语义线索上,还是只是能猜对?

方法亮点。 作者用的是基于干预的指标「We use intervention-based metrics that measure how visual observations, instructions, and visual memory causally influence navigation decisions.」 三个被干预的对象分别是当前视觉观测、语言指令、以及视觉记忆——这一刀切得比大多数「注意力热图」类的可解释工作更明确,因为它问的是因果影响而不是相关性。 更进一步,作者把干预的结果用在两处出口:一是概念级操控(通过内部激活做 steering),二是把抽象行为的激活向量抽出来,零样本迁移到分布外的真实场景

证据。 摘要给出三条结论:「Our results show that these navigation policies are sensitive to all input modalities and do not depend on a single one.」「We further show that these agents encode navigation progress and retain semantic structure from their VLM backbones, enabling concept-level steering through internal activations.」;以及**「we extract activation vectors for abstract behaviors to transfer them zero-shot to out-of-distribution real-world scenarios, improving performance without additional fine-tuning.」**

边界。 摘要中没有任何一个数字:没有基准名称、没有成功率、没有「improving performance」的幅度,也没有说明干预指标的构造方式与实验规模(场景数、任务数、模型数)。因此本刊能确认的是「这件事被这样做了、这三条结论被作者这样写了」,不能确认效果有多大。 本刊也未核验其「分布外真实场景」的具体指代,以及激活迁移与微调相比在成本与稳定性上的差别。

我的判断。 这篇最值得记的不是「VLN 依赖多模态」这个结论(它近乎常识),而是它把「视觉记忆」列为一个可干预的独立输入。在长程导航里,「模型记不记得自己去过哪」通常被混进模型能力里一起夸或一起骂;把它单拎出来做因果干预,才可能回答一个工程问题:掉点到底是看不见、还是忘不掉。 这正是本刊在第 2、3 篇里看到的同一种做法——先把一个被混在一起的东西拆开,再谈好坏。

来源:arXiv 2609.24576·What do VLM-Based Vision-Language Navigation Models Rely on: Interpreting and Steering Policy Behavior(作者含 Débora Oliveira Makowski、Marco Hutter、Cordelia Schmid、Wolfram Burgard,2026-09-21 提交,cs.RO/cs.CV)

2. ReSTI:把 STI-Bench 的 2,064 道题重新对回官方数据源

问题。 摘要第一句就把判据立住了:「Spatial–temporal benchmarks are valid only when their questions, source annotations, and answer options identify the same physical quantity.」——问题、源标注与选项必须指向同一个物理量。作者随后做的事是审计:「We audit STI-Bench against the official ScanNet, Waymo, and Omni6DPose sources and find systematic coordinate-system and timestamp errors, under-specified targets and times, and disagreements between keyed options and answer details.」

方法亮点。 ReSTI 的做法不是重写题目,而是把每一条可恢复的答案在显式的「目标—时间—坐标系—物理量—单位」五元组下重建「a source-backed revision that reconstructs every recoverable answer under an explicit target, time, coordinate system, physical quantity, and unit.」 关键词是 source-backed:改动的依据必须回到官方数据源,而不是靠更强的模型去猜答案。

证据。 摘要给出两类结果。数量层面: 「Across 2,064 legacy questions, ReSTI retains 1,782 questions and records 282 evidence-backed exclusions.」几何层面(本刊认为是全文信息量最大的部分): 「Source reconstruction reveals task-level geometric failures: ScanNet Grounding omits the required alignment between annotation and raw camera coordinate systems, while Orientation measures camera rotation on the wrong plane.」 以及**「including Waymo poses evaluated at the wrong timestamp」**——这三条都是任务定义级别的错误,不是标注噪声;也就是说,在修好之前,这几类题目的分数不能解释为「模型的能力」。

边界。 摘要没有给出任何模型在修复前后的分数变化,因此「谁掉分、掉多少」本刊无从判断;282 条排除只写了「evidence-backed」,没有给排除原因的分布;五元组重建的具体判定规则、是否有人工复核、以及第三方是否独立复现过,摘要均未提及。本刊也未打开项目页 github.com/pengzhansun/ReSTI 核对代码与发布的数据。

我的判断。 这条与本期第 3 篇应当并读,因为两篇在做同一件事,只是位置不同:ReSTI 修的是「题错了」,第 3 篇测的是「模型在题上作弊」。 而 ReSTI 里最该被行业抄走的是那句 evidence-backed exclusions——排除一道题需要证据,这比任意地清洗数据要贵得多,但也只有这样的清理,才能让「保留 1,782 条」这件事本身成为一个可被检验的声明。 本刊的保留意见同样明确:基准修复的价值取决于有多少人跟进使用修复后的版本;摘要里没有给出任何采用迹象。

来源:arXiv 2609.24727·ReSTI: A Source-Grounded Audit and Repair of STI-Bench(作者 Pengzhan Sun、Ramanathan Rajaraman、Shiu-Hong Kao、Junbin Xiao、Angela Yao,2026-09-21 提交,cs.CV) · 项目页:github.com/pengzhansun/ReSTI(本刊未打开)

3. LiDAR-Hallu:当「总是选同一个选项」几乎够用时,聚合准确率还剩下什么

问题。 摘要第一句是一个否定性发现:「Recent 4D LiDAR language models aim to reason about objects and their evolving spatial relationships. Yet, in our evaluation, always selecting the same option nearly matches the multiple-choice accuracy of two B4DL-derived configurations.」——「总是选同一个选项」几乎打平了两个 B4DL 派生配置的多选题准确率。

方法亮点。 作者没有停在「基准有问题」,而是给出一份几何参照的诊断协议「a geometry-referenced benchmark and diagnostic protocol with 10,000 questions across 150 nuScenes scenes. It covers object existence, ego-relative position, distance ordering, relative motion, and temporal localization, with explicit rules for selecting objects, comparing times, and determining reference answers.」 协议里有三种设计值得单独记:固定答案与候选内容控制、同提示但参考答案相反的跨场景配对、以及关系特定召回「combines fixed-answer and candidate-content controls, cross-scene pairs with identical prompts but opposite reference answers, and relation-specific recall」)。

证据。 「Analysis of 100,000 recorded responses reveals failures hidden by aggregate accuracy.」 具体三条:其一,只看候选时长就能预测时间类答案——「Candidate duration alone makes temporal answers predictable without observing LiDAR.」其二,配对题失效——「On paired questions, the models frequently give the same answer to scenes requiring opposite answers.」其三,关系特定分析显示两个配置漏掉了全部正例——「Relation-specific analysis further shows that both configurations miss every positive lateral-motion case across all tested conditions.」 另外,作者试过一种补救——「Temporal-shuffle contrastive decoding provides little net improvement, as repairs are largely offset by new errors and the main failures persist.」

边界。 摘要没有给出任何绝对准确率数字(既没有模型分数,也没有「总是选同一选项」这个基线具体是多少分);被评测的两个 B4DL 派生配置未具名;10,000 道题与 150 个场景覆盖五个关系类别,各占多少题摘要未写;「两个配置在所有条件下漏掉全部正例横向运动案例」这一条,本刊只能照录作者的表述,无法判断这是能力问题、数据问题还是题面问题。 本刊也未核验其发布的代码与检查点。

我的判断。 这篇的方法学价值高于它的结论。「总是选同一个选项」几乎够用这句话是一记很重的提醒:当聚合准确率能被一个恒等回答逼近时,该指标的区分度已经接近零,而它上面的所有排名都只是噪声的排序。 作者给出的三个补救设计——内容控制、相反答案配对、关系特定召回——每一个都是在把「答对」拆成「答对且因为正确的原因」,这与本刊第 1 篇的干预指标、第 2 篇的源重建是同一条思路的三个实现。本刊认为这三篇应当作为一组被记住:2026 年 9 月这一批里,最值得留存的不是谁的分数最高,而是「怎么证明分数不是假的」这件事又前进了三步。

来源:arXiv 2609.24452·Do LiDAR Language Models Really Understand Spatio-temporal Relationships?(作者含 Runyi Yang、Luc Van Gool、Kunyu Peng 等,2026-09-21 提交,cs.CV/cs.AI/cs.RO) · 代码与检查点:github.com/Awesome4D/4DMLLM_Hallucination_Bench(本刊未打开)

4. VPRune:把视觉 token 剪枝失效的原因拆成三条,再逐条对症

问题。 摘要给的前提是**「Visual token pruning is a promising approach to reducing the inference cost of large vision-language models (LVLMs), yet aggressive token reduction often causes substantial performance degradation.」**——剪枝有效,但剪狠了就掉点。

方法亮点。 作者先归因再下药:「We identify three key factors behind this degradation: text-guided selection bias, information loss from discarded tokens, and positional distortion caused by sequence compaction.」 三个原因对应三个组件:「visual-only diversity selection, similarity-guided token recycling, and position-preserving restoration」——纯视觉的多样性选择(去掉文本引导带来的选择偏差)、相似度引导的 token 回收(对已丢弃信息做补偿)、以及位置保持的复原(消除序列压缩造成的位置扭曲)。 摘要特别强调框架是 training-free 且落在 pre-LLM 阶段,也就是在送进语言模型之前就完成压缩。

证据。 「Experiments on FastVLM-1.5B across multiple vision-language benchmarks demonstrate that VPRune achieves a favorable accuracy–compression trade-off, with particularly pronounced advantages under aggressive compression.」 另外**「evaluations on edge-device show that VPRune effectively reduces end-to-end inference latency while maintaining superior task performance, demonstrating its practicality for resource-constrained LVLM deployment.」**

边界。 摘要没有给出任何具体数字:没有压缩率区间、没有精度差值、没有边缘设备型号与时延数值,也没有说明与哪些剪枝方法对比(摘要只笼统说 prior works)。评测只涉及 FastVLM-1.5B 一个模型,因此这些结论能否外推到更大的 LVLM 摘要没有交代。本刊也未核验其代码。

我的判断。 三条归因里,本刊认为最值得记住的是「文本引导的选择偏差」这一条:它指出一个反直觉的事实——用问题文本去挑「哪些视觉 token 重要」,本身就可能把与问题表述无关、但推理需要的视觉证据挑掉。这与本期第 1、3 篇在同一个位置:模型的失败往往不在于「没看到」,而在于「看的方式被另一个模态带偏了」。 另一条值得留意的是 position-preserving restoration位置信息在视觉 token 被压缩后是否还能恢复,是多数剪枝工作里被一笔带过的部分,而它恰好是空间类任务最敏感的一项。 本刊的保留意见是:摘要没给数字,就目前而言这是一份设计说明,不是一份成绩单。

来源:arXiv 2609.24485·VPRune: Efficient Training-free Pre-LLM Visual Token Pruning(作者 Guangchuan Lv、Dianxing Shi、Dingjie FU,2026-09-21 提交,cs.CV/cs.AI)

5. SPHQuant:把 8 维权重搬到球坐标上,给「离群值」单独分配精度

问题。 摘要先给出场景:「Recent foundation models are moving toward native multimodal Vision-Language Models (VLMs), making VLMs a central form of next-generation foundation models.」 但**「their large language backbones make edge deployment difficult due to high memory footprint and memory-bound autoregressive decoding.」** 仅权重量化是务实解法,「but pushing VLMs to extreme low bit-widths remains challenging: existing rotation-free methods suffer from outliers at 2-3 bits, while rotation-based methods improve accuracy at the cost of additional runtime overhead.」——无旋转方法在 2–3 bit 被离群值拖累,旋转方法用运行开销换精度。

方法亮点。 SPHQuant 走的是第三条路:不做旋转,改换坐标。 摘要写的机制是**「SPHQuant decomposes each 8D weight vector into coordinate signs, radius, and a positive unit direction. This representation isolates outlier magnitude into the radius while keeping directions bounded and statistically regular.」** 也就是说,把「幅度异常」与「方向异常」分离开:离群值只留在半径上,方向被约束在单位球的有界范围内且统计上规则。 于是**「SPHQuant allocates extra precision to the radius to mitigate accuracy degradation induced by outliers」——精度按「哪里出了问题」来分配,而不是均匀分配。 另外它用一个紧凑的正方向码本**,并通过角度参数化微调码本项以保持单位球约束;同时设计了硬件友好的 GEMV 内核,把方向码本做小到可放进共享内存、并把径向比特打包。

证据。 「Experiments show that SPHQuant matches the performance of state-of-the-art extreme low-bit quantization methods while improving decode throughput over QTIP by 30.3% on RTX A6000.」——这是在「精度持平、吞吐更高」这个位置上给出的一个具体数字(相对 QTIP 提升 30.3%,硬件为 RTX A6000)。

边界。 摘要没有给出任何位宽数值与精度数值(「2–3 bits」出现时是在描述已有方法的问题,不是在描述 SPHQuant 的配置);「matches the performance of state-of-the-art」未说明是哪一个基线、在哪几个基准上、差多少;30.3% 这个吞吐数字只在 RTX A6000 上给出,其他硬件未涉及;代码标注为「will be released」,本刊抓取时尚未发布;摘要写的是 16 页含附录,本刊未读 PDF,因此实验规模(模型数、评测集)无从核对。

我的判断。 这篇与本期第 4 篇是一组对照:第 4 篇在「少看一些 token」上做文章,这一篇在「每个权重少占几位」上做文章——一个压序列长度,一个压位宽,都是把相同的智能塞进更小的机器里。 方法层面,本刊认为**「按误差来源分配精度」这个思路比球坐标本身更值得记住**:它是把「量化误差是均匀的」这个隐含假设换成了「量化误差集中在特定的几何位置」。这与本刊在 #030、#031 里记录过的「把算力放在哪一层」是同一种提问方式。 保留意见同样明确:代码尚未发布,30.3% 是一个未复现的第三方对照数字,读者目前能确认的只有设计思路。

来源:arXiv 2609.24875·SPHQuant: Efficient extreme low bit weight quantization for Vision-Language Models(作者 Kewei Zhang、Zheng Chen、Haotong Qin、Yulun Zhang,2026-09-21 提交,cs.CV;页面标注 16 页含附录) · 代码(将发布于):github.com/Pushazf/SPHQuant(本刊未核验)

今日阅读线索

一句话:这一批里最值得带走的不是任何一个方法,而是「怎么证明一个分数不是假的」这件事,在三篇各不相同的工作里被同时推进了。

第一条线索,第 1、2、3 篇合起来,是一次关于「测量前提」的联合检查。 第 1 篇问「模型是靠什么做决定的」(干预视觉、指令、视觉记忆三个输入,看决策的因果变化);第 2 篇问「题目本身指向的是不是同一个物理量」(把 2,064 道题对回 ScanNet、Waymo、Omni6DPose,保留 1,782 条、排除 282 条);第 3 篇问「答对是不是因为答对了」(发现「总是选同一个选项」几乎打平,并在配对题上看到模型对相反的场景给出同一个答案)。 三篇的位置不同——一个在模型内部,一个在数据源,一个在题面设计——但用的都是同一种手法:把一个被混在一起的东西拆成可分别检验的部分。 本刊的保留意见是,三篇的证据强度差别很大:第 2 篇给了确切的数量与三类几何错误,第 3 篇给了协议设计与定性发现但没给任何分数,第 1 篇只有结论、没有数字。

第二条线索,第 4、5 篇是压缩成本的两侧:序列与位宽。 VPRune 指出激进剪枝掉点的三个原因(文本引导的选择偏差、丢弃 token 的信息损失、序列压缩的位置扭曲),并用「仅视觉选择 + 相似度回收 + 位置保持」三个组件分别对付;SPHQuant 则把 8 维权重分解成符号、半径、正方向,把离群幅度关进半径、给半径额外精度,换来在与 QTIP 持平精度下的 30.3% 解码吞吐提升(RTX A6000)。 两篇都属「设计说明书」性质:都没有在摘要里给出压缩率与精度的完整对照表。 这不是缺点,但它决定了两篇目前的可用程度——读者可以先借用它们的归因框架,但不宜引用其效果。

第三条线索,这一批里有一个共同的技术口味值得留意:三个工作都在处理「位置」。 VPRune 的位置保持复原、ReSTI 对坐标系与时间戳的对齐、LiDAR-Hallu 里的时间定位与跨场景配对,本质上都在问同一件事——当一段内容被压缩、被重建、被换一个参照系之后,原本的空间与时间关系还成立吗。 本刊认为这是视觉-语言这条线上一个正在成形的主题,接下来几周会继续盯:如果「位置」开始被当成一个需要单独建模、单独验证的量,那么评测与压缩两侧的做法都会跟着改。


本刊注:本期覆盖 arXiv 于 2026-09-21 提交、随后公告的批次(cs.CV 与 cs.AI 最新 60 条全部为该日,cs.CL 为 59 条该日加 1 条 2026-09-20;区间探测 [202609200000 TO 202609240000] 未返回更晚的提交)。 核验路径:五篇的 ID、日期、分类、作者、comments 与摘要全文均取自 export.arxiv.org/api/query(本机 HTTP 200);本刊未直读任何 PDF、未打开项目页或代码仓库、未打开 HF Papers(huggingface.co 本机 curl 返回 000,不可达)。 正文中出现的全部数字均引自摘要原文并归因于作者;摘要未给出数字的条目,本刊在「边界」中逐条标明,不做补充、不做估算。 本刊在本期未运行任何一篇的代码,未复现任何一项实验。