本期取自 arXiv 当前最新的公告批次:published 字段为 2026-09-15(周二),对应公告日 2026-09-16(周三),与 #025 覆盖的 2026-09-14 批次不重叠。 核对路径如实说明:cat:cs.CV、cat:cs.CL、cat:cs.AI 三路均经 export.arxiv.org/api/query 按 submittedDate 倒序各取最新 40 条,三路全部成功返回(HTTP 200,本期未出现 #023 记录的 429);cs.CV 一路的 40 条 published 全部为 2026-09-15,没有更早或更晚的项,与 #024、#025 记录的「单一公告日、无跨日混杂」形态一致。下列五篇的 arXiv ID、发布日期、分类、作者与摘要全文均取自官方 API,本刊未直读任何 PDF 正文,未打开 HF Papers 页面、项目页或代码仓库;所有数字均引自摘要原文并归因于作者,摘要中未出现的数字本刊一律不做补充,并在各篇「边界」中逐条标出。
五篇合起来是一条方法与一个反复出现的不安。方法是一条:把「判断依据」从模型内部搬到模型外部。 第 1 篇把「答案是否成立」的判据改成了必须给出精确的时空视听证据;第 2 篇把提问的模态从文本换成视觉;第 3 篇把「这个物体真的在图中」的判据改成跨查询的语义稳定性与区域一致性;第 4 篇把「该看哪里」的判据换成人类 EEG 响应;第 5 篇把「模型是否真的在用视觉」的判据换成摄像头被破坏时性能掉了多少。不安是一条:五篇里有四篇指向同一个结论——模型给出正确答案时,我们并不知道它是不是因为看到了我们以为它在看的东西。 具体地说:① 强闭源模型在需要真正的视听耦合与证据给出的长视频基准上不到 60%;② 换成视觉模态提问,前沿模型显著变弱;③ 一个免训练的验证器可以把幻觉率从 49.40% 压到 32.80%,但它的判据只是「换几种问法还稳不稳」;④ 用一个 40 类、600 对问答的 EEG 引导基准,能在杂乱场景里把 VQA 准确率提高 4.14–9.87 个百分点、同时省下 23%–39% 的 token;⑤ 把激光雷达的 BEV 特征单独接到动作专家上之后,模型在摄像头被破坏或移除时退化少了 29%。
1. Video-HolmesV2:把「答案」换成「证据」——长视频里要求模型给出精确的时空视听依据,强闭源模型仍不到 60%
论文:Video-HolmesV2: Can MLLMs Reason with Spatio-Temporal Audio-Visual Evidence in Long Videos?(2026-09-15,cs.CV;标注 Accepted by ECCV 2026)
资源:HF Papers
问题。 作者给出的诊断有两层,第一层是模态失衡:现有多模态基准「过度依赖视觉启发式,把听觉线索边缘化」,实际上把模型降格成了「沉默的观察者(silent observers)」,从而绕开了真正的跨模态推理。 第二层是工程上的两难,被作者命名为 evidence-context trade-off(证据—上下文权衡):标准稠密采样下,为了捕捉证据而增加帧数,必然带来注意力分散与 token 爆炸。 ——这两层合起来是一个很具体的指控:现有长视频评测既没在考真正的跨模态理解,也在用错误的采样方式掩盖它。
方法亮点。 作者提出 Video-HolmesV2,一个面向 Deep Audio-Visual Coupling(深度视听耦合) 的基准,并配了三个组件。① Evidence-Based Evaluation(基于证据的评测):要求模型用精确的时空视听证据为其答案作出论证,作者明确说这样做的目的是**「减少猜测与幻觉证据造成的混淆效应」**。② 两条质量控制与度量机制:一条 Multi-Model Cross-Verification(多模型交叉验证)流程用于保证任务本身的严格性;一条 Spatio-temporal Evidence-Aware Metric 用于细粒度校准。 ③ 一个方法组件,而不只是基准:Audio-Text Guided Token Compression(音频—文本引导的 token 压缩)框架,通过把任务意图与听觉锚点融合,蒸馏出高价值的推理线索,以缓解长上下文噪声。
证据。 摘要给出的结果只有一句,但足够有信息量(作者口径):「在我们的评测中,即便是强大的闭源模型,准确率也低于 60%,而我们的方法优于同级别的开源全模态模型。」 ——这是本期第一篇给出「天花板」位置的工作:不是某个模型的分数低,而是这一代强闭源模型在同一个基准上都没过 60%。
边界。 这篇摘要的信息密度明显低于本期其它几篇,而缺口恰好落在最需要数字的地方:「低于 60%」没有说明是哪几个闭源模型、测试集规模、以及 60% 与随机猜测基线之间的距离;「我们的方法优于同级别的开源全模态模型」没有给出任何数值或对照模型名,也没有说明该方法是在哪个环节接入的(是替模型做输入压缩、替基准做度量,还是两者都有);三条组件里,Multi-Model Cross-Verification 使用哪些模型、交叉验证的一致性门槛为何,摘要均未给出——而这直接决定了这个基准自己是否可复现;「时空证据」的评分标准(是否要求引用具体时间戳与声道来源、允许的表述自由度)摘要未展开,因此「证据式评测」在多大程度上是格式约束、在多大程度上是理解考核,无法判断;「token 压缩」的压缩率与它对准确率的影响摘要未给;这是一篇被 ECCV 2026 接收的工作,但摘要未提代码或数据是否公开;本刊未读到该基准的任何样例题目,也未看到其与第一代 Video-Holmes 的差异说明(标题里的 V2 提示存在前作,摘要未涉及)。
我的判断。 这篇的价值不在分数,而在它把「证据」写进了评分规则本身。 它的结构与本刊 #025 第 4 篇(BVB,要求 agent 把视频重建出来)是同一族——都是把验收面从「答案」换成一个更难伪造的对象:那一篇要的是可执行的几何与时间结构,这一篇要的是可核对的时间与声道定位。 两者都在回应同一个实证现象:问答式评测可以被语言先验与选项分布刷分,而证据链不容易。 保留意见:「要求给出证据」有一个天然的对抗面——它同时抬高了输出格式的门槛。 如果评分对证据的格式(时间戳、声道、对象命名)要求较严,那么一个理解正确但表述不合规的模型会被扣分,此时「低于 60%」就不再是理解能力的下界,而是「理解能力 + 表述合规性」的联合下界。 摘要里的措辞无法排掉这一种解释,而它恰恰是这类基准最常见的争议来源。 给读者的实用建议:如果你在做长视频理解,这篇里最可迁移的不是基准本身,而是那个被命名的两难——证据—上下文权衡。 它把「多采样几帧」这个默认动作变成了一道要付代价的选择题:帧数增加同时提高了证据覆盖与注意力噪声,而作者主张的解法不是二选一,而是用音频锚点作为筛选信号(在视频里,音频往往比画面更稀疏、更指向事件)。 这个思路的好处是它不依赖额外标注——音轨本来就在视频里。
2. Not Another Text Benchmark:把提问的模态从文本换成视觉——前沿模型显著变弱
论文:Not Another Text Benchmark: Putting the “Visual” Back in Visual Question Answering for Large Video Models(2026-09-15,cs.CV)
资源:HF Papers
问题。 作者的切入点是一句对现有评测习惯的直接质询:大视频模型在各类视觉问答任务上表现亮眼,而这得益于强大的预训练文本与视觉编码器;但一个重要的前提是——这些基准里的主导做法是用文本选项来做多选推理。 作者随即把问题换了一个方向:「当评测模态是视觉,而不是文本时,会发生什么?」
方法亮点。 作者提出三个以视觉为中心的评测基准,分别针对三种能力:temporal frame retrieval(时序帧检索)、video future prediction(视频未来预测)、causal memory distortion(因果记忆扭曲)。三个基准的共同设计意图是:把「问」和「答」这两个环节都尽可能地放在视觉模态里,而不是让文本承担推理的载体。 作者对自身定位的表述也很克制:「我们的方法是对现有前沿模型视频理解评测方式的补充」,而不是替代。
证据。 摘要给出的结果是一条否定性结论(作者口径):「我们表明,当前前沿模型在尝试通过视觉查询、而非文本进行推理时,表现出显著的弱点。」 ——摘要没有给出任何具体数字、模型名或基准规模。
边界。 这篇摘要里没有任何可用数字,这是它最大的边界,也是本刊必须明说的部分:「显著弱点」的幅度、参与评测的「前沿模型」名单、三个基准各自的样本量与构建方式、以及评估指标(是否仍是准确率、是否允许部分得分)全部缺失;「把推理放进视觉模态」这件事本身有多种实现路径(图像选项、图像序列、带标注的图像区域等),而摘要没有说明它选的是哪一种——这直接决定了结论的性质:如果视觉选项的呈现方式对模型不友好(例如需要精细的坐标读取),那么测到的可能是感知精度而非推理能力;三个基准中有两个(未来预测、因果记忆扭曲)本身是开放式的、正确性判定困难的任务,摘要未说明它们如何被转化成可自动评分的题目;「补充而非替代」的定位说明作者并不主张现有文本基准无效,但摘要没有给出「两种模态下的分数差」这一最能说明问题的对照量;这是一篇未标注会议、未提代码与数据是否公开的工作,本刊未读到任何样例题目或提示词。
我的判断。 这篇的问题意识比它的证据更值得带走。 它指出的是一个结构性偏差:在多模态模型的评测里,视觉是被查询的对象,文本是查询的载体——于是「视觉理解」实际上被考成了「用文本描述视觉」。 一旦把这个偏差指出来,很多看似稳固的结论都会变得含糊:当模型答对一道视频问答时,它究竟是在用画面里的时空关系,还是在用题目文本与前缀统计? 这恰好与本期第 3 篇、以及 #025 第 3 篇(ModaLens,测「有报告时模型还看不看图」)是同一个问题的三种问法。 保留意见:我认为这类「换成另一种模态」的审计有一个常见陷阱——把模态切换带来的全部性能下降都归因于「模型本来就没在真视觉理解」。 但下降也可能来自纯粹的表征不匹配:视觉选项是一种模型训练分布里更少见的输入形态,模型没见过不代表它不理解。 要区分这两种解释,需要一组对照:同样的题目内容,分别以文本选项、视觉选项、以及「文本选项 + 视觉辅助」三种形态给出。 这篇的摘要没有提到这样的对照,因此本刊把它的结论定位为「提出了一个可检验的问题」,而不是「证明了视觉理解能力的欠缺」。 给读者的实用建议:如果你在给多模态系统做评测,这篇给出的最小改动是——把同一批题目的选项从文字换成图像再问一遍,并把两个分数同时报出来。 两个分数之间的落差,就是「文本先验贡献了多少分」的一个廉价估计。
3. SSAV:一个免训练的幻觉验证器——判据是「换几种问法还稳不稳、反复指向同一块区域」
论文:Semantic-Spatial Agreement Verification for Mitigating Object Hallucination in Multimodal Large Language Models(2026-09-15,cs.CV)
资源:HF Papers
问题。 作者给出的应用场景不是学术性质的:多模态大模型会提到图中并不存在的物体,而在用药辅助、无障碍感知与环境决策这类场景里,这类幻觉会造成现实的安全风险。 ——这里的关键是「提到并不存在的物体」这个具体的错误形态:它不是答错,而是凭空断言一个视觉事实。
方法亮点。 作者提出 SSAV(Semantic-Spatial Agreement Verification),一个 training-free(免训练) 的方法,其设计出发点是一句关于「什么叫视觉上有依据的断言」的定义:「一个视觉上有依据的断言,应当在语义等价的多次查询下保持稳定,并且反复定位到同一块图像区域。」 这句话被直接翻译成了两个模块:① 语义支持——聚合同一断言的多个提示变体,以估计语义支持度,并降低对查询措辞的敏感性;② 区域核验(QIRV,Query-Induced Regional Verification)——组合「跨查询的区域持续性」「空间重叠度」与「相对候选优势度」三个量,用来识别孤立的单点高响应与分散的定位。两条证据通过几何平均融合,任一支路缺乏支持都会拉低验证分数——即它要求语义与空间两个方向同时成立,而不是取其一。
证据。 摘要给出的结果分两组(作者口径)。① 评测面:在三个基座模型与多种评测协议上验证。② 主数字(以 LLaVA-1.5-7B 为例):在 COCO、A-OKVQA、GQA 上的平均准确率,在 POPE Popular 协议下提高 1.81 个百分点,在 POPE Adversarial 协议下提高 3.17 个百分点;同时 CHAIRs 从 49.40% 降至 32.80%。 ③ 一句定性结论:跨查询的语义稳定性与区域一致性,为物体断言提供了「可解释的外部视觉证据」。
边界。 这篇是本期五篇中唯一给出完整、可对照数字的一篇,但它的边界同样清楚:「三个基座模型」没有点名,因此无法判断它是否代表当前模型的谱系,而主要数字都来自其中最小的一个(LLaVA-1.5-7B)——这是一个需要留意的呈现选择;两处提分(1.81 / 3.17 个百分点)是在「COCO、A-OKVQA、GQA 的平均准确率」上测的,而 CHAIRs 的改善(49.40% → 32.80%)是另一套指标,摘要未说明这两个指标是否在同一组设置下测得、CHAIRs 的下降对应哪个数据集的哪个子项;「training-free」意味着它不改变基座,因此这些收益是推理期开销换来的,而摘要完全没有给出开销——多次提示变体加上区域核验,意味着同一个断言要被查询与定位多次,这对延迟与成本的影响是这类方法能否落地的关键,却是本摘要里唯一没有数字的地方;POPE 的 Popular 与 Adversarial 两种协议之间提分差异(1.81 对 3.17)本身是个有意思的信号,但摘要未给出各协议的题量与被修正的样本数量;SSAV 的判据是「跨查询稳定性 + 区域一致性」,而这恰好也是模型自身一致性的一个度量——一个稳定地产生同样幻觉的模型在这个框架下仍可能通过验证,摘要未讨论这一失效模式;「几何平均融合」的具体形式、任一分支的权重、以及 QIRV 三个子量的组合方式,摘要均未展开,因此它更接近于「一个明确的方法框架」而不是「一个可直接复现的算法」;摘要未提代码是否公开。
我的判断。 这篇的真正贡献是它给「幻觉」提供了一个不依赖真值标签的操作定义。 常见的幻觉检测要么依赖外部知识、要么依赖人工标注,而这篇只问两件事:同一个断言换几种问法还在不在?它指向的位置是否总是同一块? 这两问都不需要知道正确答案,因此它可以被套在任何一个已经训练好的模型外面。 这也是它最需要在引用时被约束的地方:「稳定 + 定位一致」是幻觉的必要条件之外的一个代理**,不是充分条件——它对「稳定地错」无能为力,而稳定地错恰恰是大模型的常见失败形态。 把这篇与 #025 的第 3 篇(ModaLens)并读会更有意思:ModaLens 测的是「报告在手时模型还看不看图」,用一次换图审计得出结论;这篇测的是「同一个物体断言在多次提问下是否稳定」,用重复查询得出结论。 两篇的共同前提都是「模型说出的话不一定由它看到的东西支撑」,而两篇的共同短板也相同:给出的是方向明确的判据,而不是带门槛的判决。 给读者的实用建议:如果你在做面向医疗、无障碍或工业检测的多模态系统,这篇给出的模板成本很低——把可疑的物体断言用 3–5 种问法重问一遍,并检查它给出的定位是否落在同一区域。 但要清楚它过滤掉的是「随口一说」,过滤不掉「一直这么说」。 你要另加一层校验,才能处理后者。
4. BrainFocus:用人的脑电信号决定「该看哪块」——杂乱场景下准确率提高 4.14–9.87 个百分点,输入 token 减少 23%–39%
论文:BrainFocus: EEG-Guided ROI Selection for Efficient Vision-Language Models(2026-09-15,cs.CV)
资源:HF Papers
问题。 作者描述的是一种很常见的浪费:VLM 在视觉问答上表现很强,但当一张大而杂乱的图里只有一小块区域相关时,处理整张图在算力上是昂贵的。 而作者引入的信号来源不太常见:脑电(EEG)信号记录了人类对视觉刺激的神经响应,可以提供一条源自人的、关于感兴趣区域(ROI)的语义线索。 但作者同时指出了这条路的第一道障碍:EEG 引导的视觉类别解码仍不完善,因此直接把 ROI 当作路由依据是不可靠的。
方法亮点。 BrainFocus 的解法是「两个不完美信号叠加,并设置置信门槛」:一个 EEG 分类器预测目标类别,一个 YOLO 检测器定位与之匹配的 ROI;只有当两个预测都通过置信阈值时,VLM 才收到裁剪后的 ROI;否则就处理整张图。 ——这是一条罕见的、把「不可靠」直接写进控制流的做法:不确定时退回原路径(看全图),而不是用不确定的信息做剪枝。
证据。 摘要给出的结果分三组(作者口径)。① 基准构建:基于 EEG-ImageNet 构建了一个 40 类基准,包含生成的杂乱图像与真实的以物体为中心的图像,带目标 ROI 标注,以及 600 组英文视觉问答对。 ② 主数字:在 Qwen3.5-VL 的 2B、4B、9B 三个规模上,BrainFocus 在杂乱场景中把 VQA 准确率提高 4.14–9.87 个百分点(pp)。③ 效率数字:输入 token 减少 23.2%–39.4%,总 token 减少 23.2%–39.3%,端到端浮点运算(FLOPs)减少 23.2%–39.5%。 ④ 结论句:「这些结果表明,即便 EEG 的语义解码并不完美,它仍能引导高效的 VLM 推理。」
边界。 这篇的边界集中在「这套设置能不能搬到真实使用」上,而摘要对这一点没有作答:EEG 需要被试佩戴采集设备,而摘要没有说明推理时是否需要同步采集新的 EEG,还是可以复用离线采集的响应——这两种情形的适用范围差别极大:前者意味着这套方法只能在有受试者的实验环境里用,后者则暗示它更像是一个「用人的注意力数据训练一个类别先验」的离线流程;40 类是一个相当小的类别集,而「生成的杂乱图像 + 真实物体中心图像」两类数据在分布上差异明显,摘要未给出两者各自的结果——而真实场景显然更接近前者;600 组英文问答的规模偏小,摘要未说明这些问答是否覆盖了全部 40 类、以及是否经过人工校验;「4.14–9.87 个百分点」是一个区间,对应的是三个不同规模的模型,但摘要未说明哪个规模落在区间的哪一端——而这个信息很关键:如果 9B 上的提升明显小于 2B,那么这套方法的真实价值就变成「让小模型在有 EEG 线索时接近大模型」,而不是「让所有模型都变强」;效率数字(23.2%–39.4%、23.2%–39.3%、23.2%–39.5%)三者的下界完全一致、上界略有差异,本刊无法从摘要判断这些区间是按模型规模还是按数据集划分的;EEG 分类器的准确率、YOLO 检测器被复用的来源、以及置信阈值的取值与选取方式,摘要均未给出——而阈值正是这套「不确定就退回全图」机制的成败所在;摘要未提代码或数据是否公开。
我的判断。 这篇是本期的「异类」,而它带来的思考比它的数字更有意思。 前几篇都在问「模型有没有用视觉证据」,这一篇问的是另一个方向的问题:「我们能不能先告诉模型该看哪里」——而它选择的线索来源是人自己的神经响应,而不是任何模型生成的注意力图。 这个选择的含义值得说清楚:由一个外部模型产生的显著性图,与被查询的模型大概率共享同一套偏见(训练数据、视觉先验),因此它无法纠正模型的系统性盲区;而人的 EEG 响应是一条独立来源的信号,它原则上可以指向模型「从来不觉得重要、但对人确实重要」的区域。 这可能正是它在杂乱场景上提分的原因,而摘要没有讨论这一层。 保留意见:我认为这篇目前最像一个「概念验证」,而不是一个可部署方案。 理由有三:EEG 采集的物理成本未讨论;40 类与 600 组问答的规模决定了结论的普适性有限;以及最要紧的一点——「只有当 EEG 与 YOLO 都过阈值才裁剪」这个设计意味着系统在相当比例的样本上会退回全图,那么它省下的 token 究竟是在哪些样本上省下的,将决定这套方法的实际收益率。 摘要给出的 23.2%–39.4% 是平均值还是最好情况,无法判断。 给读者的实用建议:如果你在做端侧或高分辨率输入的 VLM 部署,这篇的可迁移部分不是 EEG,而是那个控制流——用一个廉价的外部先验加一个置信门槛来剪枝,不通过就退回全图。 任何外部的显著性来源(传统检测器、人眼注视数据、甚至一个小的专用分类器)都可以放进这个槽位;EEG 只是其中信号最独立、同时也是成本最高的那一种。
5. sensVLA:把激光雷达的 BEV 特征直接接给动作专家——摄像头被破坏时退化少 29%
论文:sensVLA: Spatially-Grounded Vision-Language-Action Model for Autonomous Wheel Loader(2026-09-15,cs.CV/cs.RO;标注 Accepted at ICRA 2026: From Data to Decisions: VLA Pipelines for Real Robots)
资源:HF Papers
问题。 作者的场景是重型机械的自主控制:轮式装载机的自主控制需要对任务语义、第一人称视觉、本体感知与三维场景几何做联合推理——注意这个列表里有四项,而多数 VLA 只显式处理前两项。
方法亮点。 作者提出 sensVLA,一个 VLM 加动作专家的架构:语义侧是 Qwen3-2B 视觉语言模型;动作侧是一个完全可训练的 transformer 动作专家,用 flow-matching 的速度回归训练。架构上最关键的一处是路由方式:Bird’s-Eye-View(BEV)特征——由融合的前后激光雷达提取——通过一条专用的 cross-attention 通路直接送达动作专家,而 VLM 只消费前后 RGB 视图,提供任务条件下的语义上下文。 作者把这样做的目的写得很明确:把「空间接地」与「语言推理」解耦,同时在决策时刻保留两条流之间的交互。 动作专家的输出为六个维度:纵向速度、转向、车体坐标系位移、臂速率与铲斗速率。 数据侧是一台真实轮式装载机的真实世界数据集。
证据。 摘要给出的结果分三组(作者口径)。① 与强相机基线的关系:在轮式装载机的真实世界数据集上,sensVLA 达到逐步骤的总体持平(aggregate per-step parity)。 ② 两处改进:在装载相关场景中,纵向速度 RMSE 降低 28%,位移误差降低 9%。 ③ 最关键的一条鲁棒性证据:当相机流被损坏或被移除时,它的退化程度比基线少 29%,作者据此判断**「显式的空间接地提升了重型设备自主性的准确性与容错性」**。
边界。 这篇的表述方式在本期五篇里是最克制的,但也因此有几处需要主动指出:「aggregate per-step parity(总体逐步骤持平)」是一个不褒不贬的表述——它意味着这个方法在总体指标上没有超过相机基线,改进只出现在 RMSE 与位移误差两个具体量、以及「装载相关场景」这一子集上,而摘要未说明「装载相关场景」在数据集中占多大比例;「退化少 29%」是本篇最有说服力的数字,但摘要未给出基线在相机损坏时的绝对退化幅度——少了 29% 相对于一个多大的基数,决定了这是「几乎不受影响」还是「从很差到稍好」;相机流的「损坏或移除」被合并在同一个数字里,而这两种情形的难度不同(部分损坏仍提供了退化但并非无效的输入);BEV 特征来自前后激光雷达的融合,而激光雷达的成本与标定维护负担在重型设备上是否可接受,摘要未涉及;VLM 侧是 Qwen3-2B 这一具体选型,其容量是否构成瓶颈、动作专家的参数量、以及 flow-matching 的具体设定摘要均未给出;六个动作维度中「车体坐标系位移」与纵向速度、转向之间存在冗余关系的可能,摘要未说明输出后如何处理;评测是「真实世界数据集」上的离线逐步骤误差,摘要未说明是否做过闭环实机实验——而对一个控制任务来说,逐步骤误差与闭环成功率之间的关系通常并不直接;摘要给出的三处引用语均未出现,作者也未提代码或权重是否公开。
我的判断。 这篇值得记的有两点,而且都不是它的主结果。 其一,它给「模型到底有没有在用视觉」提供了一个少见的、可控的检验方式:把模态拿掉。 摘要里的「退化少 29%」正是这样一条证据——如果 BEV 分支只是在语言通路上做装饰,移除相机流时模型的表现应该与基线同样崩塌;而它退了,只是退得更少,这恰好说明空间信息被真正用上了(注意这里方向要读对:作者是在移除「相机流」,因此保留下来的正是 BEV 分支)。这与本期第 2、3 篇的审计思路是同一条:不要问模型用了什么,把它拿走,看它掉多少。 其二,它的架构选择与本期论文速递的其它四篇形成了一个有意思的对照:另外四篇都在问「怎么把证据找出来、验证好」,这一篇在做的是「别让语义模型去承担几何判断」。 让 VLM 看 RGB、让激光雷达 BEV 走专用通路、让动作专家接收两者——这是一种把「空间」与「语言」分开建模的工程立场。 保留意见:这个立场的代价是系统更依赖传感器冗余,而摘要没有讨论在只有单目相机的成本敏感场景下怎么办;同时,把几何从 VLM 中剥离出来,也就意味着 VLM 无法通过语言推理去纠正几何(例如「那个铲斗被柱子挡住了」这类需要语义与几何联合的判断),摘要未涉及这一交互模式。 给读者的实用建议:如果你在做机器人或重型设备的 VLA 落地,这篇最可复用的不是具体结构,而是那一条报告纪律——除了「平均误差降了多少」,同时报出「把某个模态拿掉之后退化多少」。 后者对判断这个模态是否真的被模型使用,比前者更有信息量。
今日阅读线索
一句话:这一批五篇的共同动作是把「判断依据」搬到模型外部——用证据链、用另一种提问模态、用跨查询一致性、用人的脑电、用「拿掉一个模态看它掉多少」;而五篇给出的答案指向同一件事:模型答对的时候,我们通常并不知道它在看什么。
三条线索值得带走:
其一,本期有四篇在独立地论证同一个结构:正确答案与「用对了依据」是两件可以分开成立的事。 长视频基准篇(第 1 篇)把「必须给出时空视听证据」写进评分规则,然后发现强闭源模型不到 60%;视觉模态篇(第 2 篇)把提问从文本换成视觉,发现前沿模型显著变弱;幻觉验证篇(第 3 篇)把「稳定且定位一致」当作可信度判据,用一次免训练的重复查询把 CHAIRs 从 49.40% 压到 32.80%;机器人篇(第 5 篇)把某个模态拿掉,发现显式空间接地的模型退化少 29%。四种量表(评测规则、提问模态、答案稳定性、模态缺失)不同,但描述的是同一个盲区:我们习惯性地把「答对」当成「看懂了」。
其二,「减少输入」在这一期出现了两条完全不同的路线,而它们的共同点是把「该看哪里」的判据放在了模型之外。 一条在视频里:长视频篇用音频锚点蒸馏高价值线索,理由是音频比画面更稀疏、更指向事件(第 1 篇);一条在图像里:EEG 篇用人类神经响应预测目标类别,再由检测器定位 ROI,且两个预测都过阈值才裁剪(第 4 篇)。两者的收益口径也很不一样:前者只给了「优于同级开源全模态模型」这一定性表述,没有压缩率;后者给出了完整的 token 与 FLOPs 区间(23.2%–39.4%)以及准确率区间(+4.14–9.87 pp)。 本刊认为第 4 篇里那个控制流比它的 EEG 更值得抄:不确定就退回全图——把「不剪枝」保留为一个合法结果。
其三,这一期的评测类工作有一个共同的方法学前提,值得单独写下来:模型的输出可以被观察,但模型使用了哪些信息不可被观察,因此只能通过「扰动后输出是否变化」来推断。 第 3 篇扰动的是提问措辞与定位区域,第 5 篇扰动的是输入模态,第 2 篇扰动的是选项的呈现模态(第 1 篇反过来,扰动的是评分规则本身)。把这一族方法与 #025 的第 3 篇(ModaLens 的配对换图)和第 4 篇(BVB 的双轴重建)放在一起看,本刊近两期记录的评测主线其实是同一件事的四种实现:通过去掉某样东西,来看这样东西是否曾经被用上。 而这条路线有一个需要读者留意的边界:「扰动导致性能下降」证明不了模型在正常情况下是从该信息得出结论的——它只能证明模型在缺少该信息时无法维持同样的表现,两者之间还隔着一步推断。 本期五篇里没有任何一篇跨过了这一步,本刊也不认为在现有评测范式下容易跨过。
本刊注:本期覆盖 arXiv published 字段为 2026-09-15 的公告批次(对应公告日 2026-09-16),与 #025 覆盖的 2026-09-14 批次不重叠。核验路径说明:cat:cs.CV / cat:cs.CL / cat:cs.AI 三路经 export.arxiv.org/api/query 按 submittedDate 倒序各取最新 40 条,三路全部成功返回(HTTP 200,本期未出现 429);cs.CV 一路 40 条的 published 全部为 2026-09-15。 五篇的 arXiv ID、发布日期、分类、作者与摘要全文均取自官方 API 直查;本刊未直读任何 PDF 正文,亦未访问 HF Papers 页面、项目页或代码仓库。 所有数字均引自摘要原文并归因于作者;摘要中未出现的数字(第 1 篇的基准规模与模型名单、第 2 篇的全部指标数值、第 3 篇的推理开销与各协议题量、第 4 篇的 EEG 分类器准确率与阈值、第 5 篇的基线绝对退化幅度)本刊一律不做补充,并已在各篇「边界」一节逐条标出。本期涉及的三处会议标注(第 1 篇的 ECCV 2026、第 5 篇的 ICRA 2026 workshop)均取自摘要的 comment 字段,本刊未核对会议方信息。