本期取自 arXiv 当前最新的公告批次:published 字段为 2026-09-17(周四),对应公告日 2026-09-18——与 #027 覆盖的 2026-09-16 批次不重叠。 核对路径如实说明:cat:cs.CV、cat:cs.CL、cat:cs.AI 三路均经 export.arxiv.org/api/query 按 submittedDate 倒序各取最新 80 条,三路全部成功返回(HTTP 200,本期未出现 #023 记录的 429);三路各 80 条、合计 240 条,去重后 213 条,其中 published 为 2026-09-17 的有 204 条、为 2026-09-16 的有 9 条(后者与 #027 批次重叠,本期已剔除),没有更早的条目,与 #024 至 #027 记录的「单一公告日为主体、无跨日混杂」形态一致。下列五篇的 arXiv ID、发布日期、分类、作者与摘要全文均取自官方 API 与 arxiv.org 摘要页,本刊未直读任何 PDF 正文,未打开 HF Papers 页面、项目页或代码仓库(第 2 篇文中给出的代码地址本刊亦未打开);所有数字均引自摘要原文并归因于作者,摘要中未出现的数字本刊一律不做补充,并在各篇「边界」中逐条标出。
五篇合起来问的是同一个问题的五个侧面:「模型说出的东西,它能不能指出对应哪里。」 第 1 篇从输入侧给出一个反直觉的机制——问题的措辞会以两种相反的方式改变 VLM 的抗损能力,而二者的共同来源是「被问题条件化的跨模态注意力在图像 patch 上诱导出的一个频谱滤波器」;把提示词写啰嗦,在 8B 模型上把漂移方差降低 70–81%。 第 2 篇把「先找哪里、再看什么」拆成两个资源需求不同的动作——受控诊断显示,定位(localization)能承受比识别(recognition)大约 3 到 4 倍更强的 token 压缩,而作者据此用区域级强化学习去优化一个只有它被更新的候选网络,在六个细粒度基准与四个 MLLM 主干上,于每个 token 预算下都优于基模型,并以约 4 倍的更少视觉 token 超过后者最大预算时的准确率。 第 3 篇把「接地」变成一个有规模的度量对象——用掩码后困惑度变化来自动归因答案所依据的版式元素,得到 237k 文档、296k 问答对的元素级接地基准,结论是「更大的模型普遍答得更准,但即使最强的模型也常常定位不到支撑元素」。 第 4 篇把「时间」当成被测对象——在 34,114 条训练样本与 7,000 条测试样本的诊断套件上,五个开源 omni 模型在同步性判断上全部低于 0.556 的多数类基线。 第 5 篇问的是「不在场的东西」——否定理解上,模型吃力而传统指标在语义反转下完全崩塌。 另附一篇(第 6 节)问「看过之后还记不记得」。
1. 跨模态注意力像一个频率滤波器:问题写得啰嗦反而让 VLM 更抗损,问得越细反而更脆——8B 模型上漂移方差降低 70–81%
论文:Cross-Modal Attention Acts as a Frequency Filter: Why Verbose Prompts Improve Robustness in Vision-Language Models(2026-09-17,cs.CV/cs.AI)
资源:HF Papers
作者:Farooq Ahmad Wani、Maria Sofia Bucarelli、Mujtaba Hussain Mirza、Oleksandr Pryymak、Aryo Pradipta Gema、Iacopo Masi、Pasquale Minervini、Fabrizio Silvestri
问题。 作者的出发点是本刊这几期反复出现的那类现象:「Vision-language models (VLMs) are fragile under image corruption.」 ——而他们发现有一个变量会以两种相反的方向改变这种脆弱性,并且这个变量是提问的人随手就能改的:措辞。
方法亮点。 这篇的方法部分很简洁,核心是一个可以被检验的机制假设。① 两个相反方向的效应被先分开陈述。 让模型更鲁棒的一侧: 「Verbose questions make VLMs substantially more robust—e.g., rephrasing “Is there a cat?” into “Please look carefully and answer: is there a cat?”.」 ——注意这个改写的具体形态:它没有增加任何与任务相关的信息,只是把同一件事说得更长、更礼貌。 让模型更脆弱的一侧: 「Conversely, VLMs become more fragile under corruption when the question is semantically complex or finer-grained, e.g., “what colour is the cup left of the chair?” instead of “is there a cup?”.」 ② 两者的共同解释: 「Both effects stem from question-conditioned cross-modal attention, which induces a spectral filter over image patches: verbose questions broaden its frequency support, while fine-grained questions concentrate it onto fewer visual scales.」 ——本刊认为这是本期定义得最清楚的一个可证伪命题:注意力在这里被描述成一个作用在图像 patch 上的滤波器,而它的作用范围由问题决定。 ③ 由此推出一个关于「错在哪里」的预测: 「The model’s answer drifts most when this filter and the corruption sit on the same spatial frequencies.」 ——即错误不是均匀发生的,而是当干扰的频率与模型当时关注的频率重合时最严重。这一条如果成立,它就把「鲁棒性」从一个总分变成了一个频率匹配问题。
证据。 摘要给出的量化结果只有一组,但带对照(作者口径):测的是 Qwen3-VL 与 LLaVA-OneVision 两个族,数据集是 GQA 与 CLEVR;核心数字是「verbose paraphrasing reduces drift variance by 70–81% on the 8B models」;并在结尾给出一个可操作的落点: 「The practical recipe—pad the prompt—further yields measurable gains in accuracy, even under image corruption.」
边界。 这篇的问题与本期第 5 篇恰好相反——它有数字,但只有一个维度的数字;它的缺口集中在「这个机制被证到什么程度」上:全部结果只在 Qwen3-VL 与 LLaVA-OneVision 两个族、GQA 与 CLEVR 两个数据集上取得,而 GQA 与 CLEVR 都属于结构化的合成或半合成问答数据,其图像损坏的形态与真实拍摄退化是否可比,摘要未说明;70–81% 是一个区间,且摘要明确限定在「the 8B models」——其他规模的结果摘要未给,本刊因此无法判断这个效应是否随规模变化;两个方向效应里只有「啰嗦变鲁棒」这一侧给出了数字,「问得太细变脆弱」这一侧在摘要中是定性的;「spectral filter(频谱滤波器)」与「frequency support(频率支撑集)」都是由作者引入的机制性词汇,摘要未给出滤波器的具体构造(是从注意力权重直接读出,还是拟合出来的),也未给出「频率」的定义方式,因此「滤波器与损坏处在同一空间频率」这一关键句在摘要层面无法被复现;摘要提到了 Qwen3-VL 与 LLaVA-OneVision,但没有点出所用 checkpoint 的具体版本,而这两族在近一年内都多次更新;摘要未提代码或数据是否公开,也未标注会议。
我的判断。 这篇的贡献可以压缩成一句可以被直接使用的话:在同样的模型与同样的图下,「怎么问」决定了两件事——模型看哪一种尺度的信息,以及它会被哪一种尺度的噪声打中。 如果这个机制成立,它对做多模态落地的人有一条非常便宜的推论:提示词的措辞不是风格问题,而是输入侧的一个可调参数,并且它的作用方向与直觉相反——更啰嗦反而更稳,更精确反而更脆。 本刊认为这一条与 #027 第 3 篇(同样的提示词配不同框取方式的图,物理术语占比分别是 45% 与 40%,纯文本 18%)是同一条线上的两块:那篇证明「图怎么拍」是一个未声明的方差来源,这篇证明「话怎么说」也是。 两者都指向同一件事:多模态评测里,输入侧的每一个摆布方式都在改变结果,而目前被显式声明的只有很少几个。 保留意见:我认为这篇最需要读者留意的是它的证据结构与它的结论强度之间的落差。 「频谱滤波器」这个比喻很吸引人,但摘要给的全部量化证据是一组方差下降的百分比,落在一个 8B 的规模上;而让人印象最深的那个说法(「模型答错最多的时候,是滤波器与损坏处在同一空间频率上」)在摘要里是解释而不是实验结果。 换句话说,这篇提供的是一个假设加一组支持性数字,而不是一个被证实的机制。 另外,「pad the prompt」这个配方在工程上便宜到几乎不像真的,这类结论恰恰最需要独立复现——它如果错了,代价是所有人的提示词都变长。 给读者的实用建议:如果你在做 VLM 的鲁棒性评测,这篇给出的最小实验成本很低——把同一批问题在「原始措辞」「冗长改写」「细粒度改写」三种条件下各跑一遍,并额外在某一种图像损坏(如高斯噪声)的不同强度下重复。 如果三个版本的分数差异明显,你就已经在一个真实系统里复现了这篇的核心主张。
2. Vision-RL2:定位比识别更能忍受 token 压缩,于是用区域级强化学习让候选网络学会「该看哪里」——约 4 倍更少视觉 token 达到原有最大预算的准确率
论文:Region-Level Policy Optimization for Fine-grained MLLM Perception(2026-09-17,cs.CV)
作者:Yuheng Shi、Xiaohuan Pei、Minjing Dong、Chang Xu
问题。 作者的切入点是一个成本权衡,而不是一个能力缺口:「Fine-grained visual perception in MLLMs is commonly improved by raising the resolution, but the added visual tokens inflate vision-encoding and language-model prefilling costs.」 ——随后他们把「细粒度感知」拆成两个动作,并指出这两个动作对分辨率的要求并不相同。
方法亮点。 三步,每一步都值得单独记。① 一个受控诊断,也是全篇最可迁移的一条: 「We show that the two operations underlying fine-grained perception, localizing the region of interest (RoI) and recognizing its content, have different resolution requirements. In a controlled diagnostic, localization tolerates roughly 3 to 4 times stronger token compression than recognition」 ——作者由此推出的策略是「localizing from a coarse view and concentrating resolution on the selected evidence」。 ② 两条现成路线的失败模式被分别点出,而且失败原因很具体: 「Decoding coordinates with the MLLM can be trained end-to-end from answers, but costs a full model pass per query and depends on grounding ability. A lightweight proposal network distilled from the model’s attention is fast, but inherits the noise of its attention targets.」 ——更关键的是第三句,它说明了为什么需要一个新目标函数: 「The RoI from the proposal network reaches the answer through a discrete region choice, so its faithfulness to the answer cannot supervise the network.」 ③ 于是做法是把「区域」当成动作,用一个冻结的读者来打分: 「We therefore optimize the proposal network with region-level reinforcement learning, which we call Vision-RL2. It treats coherent regions as actions, and a frozen MLLM reader scores each one by how its removal changes the answer likelihood.」 ——两个目标函数的分工写得也很明确: 「Complementary subtractive and additive objectives suppress distracting proposals and recover missing evidence, updating only the predictor without region annotations, response sampling, or reasoning trajectories.」 ——注意这一句里的三个「without」:不需要区域标注、不需要采样回答、不需要推理轨迹。 ④ 最后一步是把细化后的候选用于稀疏编码: 「The refined proposal further enables a sparse encoding that magnifies evidence and excludes background tokens.」
证据。 摘要给出两组结果(作者口径),措辞都是比较级:范围是「six fine-grained benchmarks and four MLLM backbones」;两条结论分别是「Vision-RL2 improves accuracy over the base model at every token budget」与「surpasses its largest-budget accuracy with about 4 times fewer visual tokens」。
边界。 这篇是本期五篇中「结论最实用、但可核验信息最少」的一篇,缺口集中在具体性上:六个细粒度基准没有列名——因此读者无法判断它们是否集中在同一类任务(例如都是密集描述或都是文档类); 四个 MLLM 主干没有点名,规模、族系与是否包含闭源模型均未给出;全文没有任何一个绝对数字——没有准确率数值、没有 token 预算的分档值、没有基线的名称与分数,「improves」与「surpasses」的幅度一概缺失;「约 4 倍更少视觉 token」是本篇最具体的量化表述,但它比较的是「本方法在较小预算下的准确率」与「基模型在最大预算下的准确率」,这是一个跨预算比较,摘要未说明两侧的预算是多少,也未说明这个比较对全部六个基准是否一致成立;「3 到 4 倍更强的 token 压缩」这一关键诊断,摘要未说明「压缩」的具体方式(是均匀下采样、池化还是剪枝),也未说明它是在哪个模型上做的;「a frozen MLLM reader scores each one by how its removal changes the answer likelihood」是一个很强的设计,但摘要未说明这个打分器的固定成本是否被计入「约 4 倍更少 token」的核算;作者给出了代码地址,本刊未打开。
我的判断。 这篇最值得带走的一句话是那个受控诊断,而不是它的方法名字。 「定位能忍受 3 到 4 倍更强的压缩,识别不能」——如果这个不对称成立,它给出了一个关于多模态架构的相当硬的推论: 不要把 token 预算在同一层级上均匀分配,因为模型做「找哪里」和「看什么」这两件事所需要的视觉精度本来就不是一个量级。 这与 #027 记录的两条线索合起来看会更清楚:那期第 1 篇(OCR 头其实是通用语义头)说明图像语义在很浅的层就已经与语言对齐,#027 第 2 篇(可解码但被错误路由)说明问题常在输出端; 而这一篇报告的是第三种情况:信息够用,只是被分配在了错误的精度上。 三者并不冲突,它们分别指出「表征」「路由」「分配」三个位置都可能成为瓶颈。 保留意见:我认为这篇当前更像一个方法性主张加一个漂亮的诊断,而不是一个可比较的结果,主要原因是它的结果全部以比较级出现且不给数字。 「大约 4 倍更少视觉 token 达到最大预算准确率」这句话里,最有信息量的其实是分母——如果基模型的最大预算本身并不高,那这个 4 倍的意义就有限。 在缺少预算数值的情况下,读者无法判断这个效率提升值多少。 另外,「region-level RL」这个命名下,真正决定成败的是那个奖励信号(用冻结读者的答案似然变化来打分);摘要里它只占一句,而这可能才是整个工作最难复现的部分。 给读者的实用建议:如果你在做高分辨率多模态落地(OCR、GUI、文档、密集描述),这篇给出的最小可用改动不是照搬它的 RL,而是先验证那个不对称——在同一模型上分别把视觉 token 压到 1/2、1/4、1/8,看「定位」类指标与「识别」类指标各掉多少。 如果掉幅差异明显,你就有理由把预算从整图均匀分配改成「粗看 + 局部放大」的两段式结构。
3. DocAttriBench:用掩码后的困惑度变化自动给答案定位到版式元素,得到 237k 文档、296k 问答对——而即使最强的模型也常常指不出支撑元素
论文:DocAttriBench: Benchmarking Answer Grounding in Document Visual Question Answering(2026-09-17,cs.CV)
作者:Luca De Grandis、Silvia Cappelletti、William Raccagni、Marcella Cornia、Lorenzo Baraldi、Rita Cucchiara
问题。 作者给出的是一个既有基准的缺陷诊断,而且把「为什么没有更好的基准」也一并解释了:「Answer grounding in document visual question answering remains an open challenge: most benchmarks lack grounding annotations or provide limited-quality labels, while constructing grounded datasets still requires costly manual effort.」 ——注意这句话里的因果链:标注质量差是因为人工成本高,而人工成本高是因为标注粒度细。
方法亮点。 这篇的贡献是「用模型替代人工来标注,再拿这批标注去考模型」——作者很清楚这个结构需要解释,而他们给的解法是把标注方法本身也做成一个可描述的机制: 「To build DAB, we propose a Mask-based Perplexity-Derived Attribution method (MAPPET) that combines document layout and language modeling to identify the most informative element for each answer.」 ——具体判据是: 「MAPPET measures the increase in perplexity after masking candidate elements and attributes the answer to the element contributing most to model confidence.」 ——换句话说,「哪个元素对答案最重要」被操作化为「遮住它之后模型最没把握」。 被标注的对象粒度也写明了: 「grounding answers to specific layout elements such as text blocks, tables, and images」。
证据。 摘要给出三组数字与一条结论(作者口径)。① 规模: 「Applying MAPPET to multiple existing Document VQA datasets yields DAB, with 237k documents and 296k question-answer pairs with element-level grounding.」 ② 评测设计: 「We benchmark grounding-capable multimodal LLMs on DAB, evaluating answer accuracy, attribution accuracy, and overall answer quality.」 ——三个指标并列这一点值得注意:答案对、指向对、整体质量,是三件不同的事。 ③ 核心结论: 「Results show that while larger models generally achieve higher answer accuracy, even the strongest models often fail to localize the supporting elements.」 作者的定位表述是: 「DAB provides a scalable benchmark for developing grounded, verifiable, and trustworthy Document VQA models.」
边界。 这篇的边界与第 2 篇不同——它有规模、有方法、有相对明确的结论,但核心缺口在于「它的标准答案是怎么来的」:MAPPET 的判据是「掩码后困惑度上升最大」,这意味着 DAB 的接地标签本身来自一个语言模型对版式元素重要性的排序,而不是来自人工判断、点击数据或文档结构真值——摘要未说明这个判据所用的语言模型是什么、掩码是逐元素还是成组进行、以及元素之间存在依赖(例如一段表格的标题与表格本身)时该方法如何处理;因此「甚至最强的模型也常常定位不到支撑元素」这一结论,严格来说衡量的是「模型与 MAPPET 的一致性」,而不是「模型与人类标注者的一致性」;「multiple existing Document VQA datasets」没有列名,因此本刊无法判断 DAB 的任务分布是原有的哪几类,也无法评估它是否覆盖了表格、公式、多栏排版等高难版式;全文没有出现任何一个具体分数——没有答案准确率、没有归因准确率、没有「常常失败」的量化阈值,也没有参与评测的模型名称与数量;「237k 文档 / 296k 问答对」是两个体量很大的数字,但摘要未说明其中多少来自已有数据集的重新标注、多少是新增的,也未说明文档是否去重;作者给出了数据集与代码地址,本刊未打开;摘要未标注会议。
我的判断。 这篇是本期最接近「把一件大家默认略过的事变成可测量对象」的一篇,而它最有价值的产出恐怕不是那个基准,而是 MAPPET 这个标注套路。 理由很直接:文档问答里的「答案在哪」长期没有大规模真值,人工标注成本高到无法随数据量线性扩展,而 MAPPET 把这个问题转成了「做一次消融实验」——这一转换的成本是算力,不是人力。 本刊认为这与 #027 第 4 篇(RankGround 承认「不存在现成的排序数据集,我们从既有的接地数据集构造排序监督数据」)是同一类做法的两个版本:当监督信号缺失时,用模型自身的行为(注意力、似然、困惑度)去把监督信号造出来。 这个套路的效率很高,但它有一个必须被声明的前提——造出来的标签与人类判断的一致性有多高。 本文摘要没有给这个数字,而它是决定 DAB 能不能被当作「基准」的关键。 保留意见:我认为这篇目前是一份很完整的「方法 + 资源」声明,但还不足以支撑它那句结论的语气。 「即使最强的模型也常常定位不到支撑元素」是一个相当重的判断,而摘要没有给出任何数值、没有点出任何模型、也没有说明「常常」是多少。 同时,「归因准确率」这个指标的分母是 MAPPET 的标签,如果 MAPPET 本身有系统性偏好(例如倾向于把答案归给文本块而低估图表),那么模型的失败里会混入一部分标签噪声。 这一点在摘要里没有被讨论。 给读者的实用建议:如果你在做文档理解或 RAG 的可验证性,这篇给出的最小可借用的东西是那个三指标框架——把「答对」「指出依据」和「答案质量」分开报告。 很多系统在这三项上会呈现明显不同的排序,而目前绝大多数文档问答的评估只报第一项。
4. AVTrace:能描述视频内容的 omni 模型,能不能说出事件在什么时候发生——五个开源模型在同步性判断上全部低于 0.556 的多数类基线
论文:AVTrace: Diagnosing Audio-Visual Temporal Reasoning in Omni Models(2026-09-17,cs.CV/cs.AI)
资源:HF Papers
作者:Longyin Zhang、Parth Sakhare Mahendra、Chengwei Wei、Ning Zhang、Lim Ming Chong、Sirui He、Ai Ti Aw
问题。 作者的问法是把「描述」与「定位」直接对立起来,而且用的是一个反问:「Omni models can describe video content, but can they locate events in time, preserve event order, and judge audio-visual synchronization?」 ——三个子问题分别对应位置、顺序与跨模态一致性。
方法亮点。 这篇的重点在评测面设计,而不是模型方法。① 覆盖面: 「AVTrace (Audio-Visual Temporal Reasoning Assessment and Capability Evaluation), a silver-standard diagnostic suite spanning onset and span grounding, synchronization, next-step prediction, cross-modal localization, chain parsing, and event-conditioned comprehension.」 ——本刊注意到作者把七个任务里的每一个都点了名,这在本期五篇中是少见的。 ② 规模: 「34,114 training examples and category-balanced development and test splits of 3,500 and 7,000 examples.」 ③ 评测纪律写得比较明确,且是本期少见的: 「We evaluate five open omni models under their respective input configurations using reference-blind response normalization followed by deterministic scoring.」 ——两个限定词值得单独标出:一是「under their respective input configurations」(各模型用自己的输入配置,而不是统一配置),二是「reference-blind response normalization」(在归一化时不让评分环节看到参考答案)。 「silver-standard」这个自我限定也出现在摘要第一句里,作者没有把它写成 gold standard。
证据。 摘要给出的结果分四组(作者口径)。① 主结果: 「All five off-the-shelf systems score below the test split’s majority-label baseline of 0.556 on synchronization verification, and obtain low scores on chain parsing and event-conditioned grounding and comprehension.」 ——本刊认为「低于多数类基线」这个表述比任何具体分数都重要:它说明这些模型在这个子任务上不比「永远选最常出现的那个标签」更好。 ② 扰动实验: 「Development-set perturbations reveal task-dependent sensitivity in Qwen3-Omni-30B to modality removal and changes in visual input processing, without isolating their underlying causes.」 ——注意后半句,作者自己写明没有分离出原因。 ③ 后训练: 「Parameter-efficient temporal post-training improves Gemma4-E4B-it on several benchmark metrics.」 ④ 一项反向对照,也是本篇最值得记的一句: 「On three external image benchmarks, task metrics change modestly, including some degradations, while teacher-forcing perplexity decreases.」 ——即后训练让困惑度下降,但外部图像基准的指标只小幅变化、其中还包含退步。 作者的总结句是: 「These findings show that semantic reference-text overlap should not be treated as a proxy for temporal localization, and that AVTrace can identify task-specific weaknesses while providing a testbed for temporal post-training.」
边界。 这篇的边界性质与其他几篇都不同——它的问题不在数字少,而在「这些数字衡量的对象」上:「silver-standard」是作者自己的定性,摘要未说明标签由谁生成、多少人参与、一致率是多少——这直接决定了 0.556 这条基线的可比性;五个开源 omni 模型没有列名,只有「five open omni models」——本刊无法判断它们的规模与发布时间的分布;摘要后半段单独点出了 Qwen3-Omni-30B 与 Gemma4-E4B-it 两个,但未说明它们是否是那五个之内的两个;「0.556」是测试集上同步性验证任务的多数类标签基线,而不是任何模型的实际分数——因此读者只能知道所有模型都低于它,无法知道低多少,也无法知道最差与最好之间差多少;七个任务里只有同步性验证一个给了基线数字,其余六项只有「low」这样的定性描述,而「low」相对什么而言摘要未说明;「34,114 条训练样本」的存在意味着这套诊断本身被用作后训练数据,而作者报告的后训练增益只发生在 Gemma4-E4B-it 一个模型上——因此「诊断套件可以当训练台用」这一结论的支撑是很窄的;「reference-blind response normalization」与「deterministic scoring」两个说法都省略了具体实现,摘要未给出归一化规则与评分函数的定义;摘要未提代码或数据是否公开,也未标注会议。
我的判断。 这篇最值得带走的是那组「困惑度下降但任务指标没怎么变」的对照,而不是「五个模型都不及格」这句话。 理由是这样的:在后训练里,困惑度下降通常被当作「学到了」的证据;而作者在同一段里报告,外部图像基准上「task metrics change modestly, including some degradations」。 这是一个很少被写进摘要的负面结果,而它的含义很具体—— 在时间定位这类任务上,语言建模目标的改善与任务指标之间可能存在脱钩。 这与 #027 第 2 篇(可解码但被错误路由)在结构上是同一种发现的不同版本:都说「内部指标变好」不等于「输出变对」。 另外,「低于多数类基线」这一条,本刊认为应当被当作多模态评测报告纪律的范例来读—— 一个不给基线的「准确率 0.4」听起来像中等水平,但配上「多数类基线 0.556」之后,它才变成「模型在这个任务上什么都没学到」。 本刊希望看到更多评测在给出分数的同时给出多数类基线。 保留意见:我认为这篇当前最需要被追问的是它的标签可信度,也就是那句「silver-standard」。 一个诊断套件的价值完全取决于它的答案是否站得住;而时间定位任务恰恰是最容易出现「多个合理答案」的一类(边界模糊、事件可重叠、采样率影响起止点)。 摘要没有给出标注过程与一致率,因此我暂时只能把这套基线数字当作一个内部基准来看,而不是当作一个可以跨论文引用的绝对量。 给读者的实用建议:如果你在做视频或多模态时序任务,这篇可迁移的最小做法是——在你的评测里至少加入三项「无捷径基线」:多数类标签、随机时间戳、以及直接复制输入中的时间词。 第三项尤其值得做:它能立刻暴露模型是在做定位,还是在做语言层面的模式匹配。
5. 否定理解:模型在语义反转下吃力,而传统指标「完全崩塌」——作者提出结构化的 CESG 评分,并把它限定在安全认知这一维度上
论文:Benchmarking MLLMs via Cognitive Expected Scene Graph for Safety-Critical Visual Negation Understanding(2026-09-17,cs.CV)
资源:HF Papers
作者:Zhiyun Jiang、Hanyong Wang、Binbin Liang、Yu Xie、Menglong Yang、Wei Li
问题。 作者的动机陈述属于「先定义边界再谈能力」的一类:「True machine intelligence requires transcending passive pixel registration to master top-down functional reasoning over absent information via visual negation understanding.」 ——随后他们指出这个方向的两个既有障碍: 「unconstrained visual negation paradigms remain overly open-ended, and pervasive affirmation bias causes both existing Multi-Modal Large Language Models (MLLMs) and evaluation metrics to fail under negative semantics.」 ——注意这句里的一个细节:「肯定偏置」同时打击了模型和指标。 ——而作者的应对方式不是扩大范围,而是收窄: 「we first anchor the boundaries of negation reasoning within specific cognitive goals. Specifically, by focusing on safety as a highly pragmatic and critical cognitive dimension, we define the task of Scene Negation Understanding under Safety Cognition (SNUS).」
方法亮点。 两个部件。① 数据: 「Under this framework, we construct a high-fidelity negative caption dataset mapping dense assertions of localized hazards.」 ——本刊注意到这里的用词:不是「一张图配一句否定描述」,而是「对局部危险做密集断言」。 ② 指标: 「we propose the Cognitive Expected Scene Graph (CESG) Score, a structure-grounded, polarity-aware evaluation metric.」 ——两个限定词是关键:结构接地(structure-grounded,即指标挂在场景图结构上)、极性感知(polarity-aware,即区分肯定与否定)。
证据。 这篇的摘要没有给出任何数字,全部结果都是定性的: 「Extensive experiments demonstrate that while current models struggle on the task, traditional metrics completely collapse under semantic reversals. Conversely, our framework delivers a solid benchmark for SNUS, providing a rigorous foundation to advance risk-aware situational comprehension and counterfactual cognition.」 ——「completely collapse」是本期五篇中最强的一个措辞,而它没有任何数字支撑。
边界。 这是本期五篇中证据最薄的一篇,而且缺口与前四篇不同——它缺的是「规模」与「量化」这两样最基本的东西:全文没有出现任何数字——没有数据集规模、没有参与评测的模型数量与名称、没有模型得分、没有「传统指标崩塌」的幅度;「high-fidelity negative caption dataset」的规模、来源(是新建、改写还是从已有安全数据集转换)、以及标注流程均未给出——而「高保真」是一个没有任何操作化定义的形容词;CESG 是本文作者提出的指标,而它要证明的那件事(传统指标在语义反转下崩塌)本身也是用这个新指标来衡量的——摘要未说明 CESG 是否与人工判断做过一致性校验,因此读者无法判断「崩塌」是客观现象还是指标替换带来的定义变化;「safety」这个收窄看起来是合理的,但摘要未说明危险类别覆盖哪些场景(工业、交通、家庭?),也未说明「localized hazards」的判定由谁做出;摘要未提代码或数据是否公开,也未标注会议。
我的判断。 这篇涉及的问题是真的,而它给出的解答目前还只是一个框架。 「否定」在多模态里之所以长期是硬骨头,原因本刊认为有两条:一条在数据侧——训练语料里「有 X」的表达远多于「没有 X」,而「没有 X」在图像上不留下任何局部特征;另一条在指标侧——许多描述类指标(如 CIDEr、BLEU 一类基于词重叠的做法)对否定的处理本质上是失灵的,因为「有一只猫」与「没有一只猫」共享了大部分词。 本文的第二个论点因此比第一个更有说服力,而它也是本篇唯一有可能被广泛引用的一点: 如果一件工作想报告「模型理解否定」,它必须同时报告所用的指标能不能区分否定。 保留意见:我认为这篇当前不足以支撑「传统指标完全崩塌」这一措辞,因为读者手上没有任何一个可比的数字,而且衡量崩塌的工具是作者自己新提出的。 一个更稳的写法应当是:给出若干个已有指标在同一批数据上的分数,展示它们在肯定与否定两种条件下的差距——如果这个差距足够大,结论自然成立,无需形容词。 本文是否这么做了,摘要里看不出来。 另外,「先收窄到安全认知」这个选择是明智的(开放域的否定确实无法定义),但它也意味着这篇的结果不能外推到一般性的否定理解。 给读者的实用建议:如果你在做多模态安全或风险识别,这篇给出的最小可用动作是——把你现有评测里所有含「没有」「未」「不存在」的样本单独切出来,跑一次现有指标。 如果你发现模型在这些样本上的表现与整体差距很大,你不需要这篇论文也能确认问题存在;而这篇的价值,在于它提示了一个可能的修补方向:让指标挂在结构上,而不是挂在词上。
6. 另附一篇:4D 基础模型能记住自己看过什么吗——用 360° 视频作为全知真值的 PersistBench,答案是「看见不等于记住」
论文:Can 4D Foundation Models Remember?(2026-09-17,cs.CV)
作者:Guangzhao He、Hadar Averbuch-Elor、Wei-Chiu Ma
要点(作者口径)。 问题设定: 「Current 4D foundation models, such as camera-controllable video models or 4D reconstruction models, can perceive and reconstruct dynamic environments, but how well they remember what they have perceived remains an open question.」 既有基准的缺陷被指出得很具体: 「Existing benchmarks largely rely on pixel-level metrics and lack ground truth for objects once they leave the field of view, making them unable to evaluate visual memory in an object-centric manner against references.」 ——这句是这一篇的方法论核心:物体一旦离开视野,就没有参考真值,因此无法评估「它是否还记得」。 解法: 「we introduce PersistBench, a dataset and metric suite that leverages 360° videos as omniscient ground truth and proposes three evaluation aspects: object permanence, motion continuity, and appearance preservation.」 ——用 360° 视频做全知真值,这个设计值得单独记:它让「离开当前视角仍在画面里」成为可核验的事实。 结果: 「Evaluating various models across diverse categories reveals that current models can only maintain short-term consistency that degrades significantly once objects leave the field of view.」 作者把结论压成一句短语: 「seeing is not remembering」。
本刊为何把它放在另附一节。 本刊的收录标准是「与 VLM 主线相关」,而 4D 基础模型(相机可控视频模型与 4D 重建模型)在评测形态上属于视觉生成与重建一侧,不是本期五篇所共同关注的「语言-视觉接口」问题,因此不并入正文五篇。 但它在方法论上与本期第 3 篇(DocAttriBench)是同一条线上的两件事,因此值得单独记一笔: 两篇都在抱怨同一件事——既有基准没有可用的参考真值,因此只能用像素级或词重叠级的代理指标;而两篇采取的解法方向相反: DocAttriBench 是用模型行为(掩码后的困惑度变化)去造真值,PersistBench 是用另一种采集方式(360° 视频)去补真值。 前者便宜、可扩展,但真值本身依赖模型;后者昂贵、但真值是物理世界给的。 本刊认为这是一个值得跟踪的分岔口。
待观察(另附一篇)。 该文为预印本,摘要未给出数据集规模、视频数量、模型数量与名称,也没有任何具体分数——「degrades significantly」是定性表述;三个评测维度(物体恒存、运动连续性、外观保持)各自的度量方式摘要未给出;「360° 视频作为全知真值」有一个本刊希望看到但摘要未讨论的前提:360° 相机同样存在遮挡、分辨率分配与拼接误差,因此「全知」是对轨迹而言的,不是对像素而言的;作者给出了项目页地址,本刊未打开,因此数据集与代码的公开状态本刊无法确认。
今日阅读线索
一句话:这五篇从输入、分配、接地、时间、否定五个位置问同一件事——模型说出的东西能不能指向一个具体的位置;而五篇给出的答案可以合成为一句:现在的问题多半不在「有没有看到」,而在「有没有指对」,并且在两个方向上(不该说的说了、该指出的指出了)评测本身都还没有准备好。
三条线索值得带走:
其一,本期第 1 篇与第 2 篇构成一组很有代表性的对偶,而它们的落点恰好相反。 第 1 篇说的是:输入的措辞会改变模型关注的视觉尺度,而改变方向与直觉相反——写得啰嗦更稳,问得精细更脆,8B 模型上漂移方差降低 70–81%。 第 2 篇说的是:模型做「找哪里」与「看什么」所需的精度本来就不一样,前者能承受约 3 到 4 倍更强的压缩;于是把预算从均匀分配改为「粗看 + 局部放大」,可以在约 4 倍更少的视觉 token 下达到原有最大预算的准确率。 两篇合起来指向一个共同结论:视觉 token 的「多少」不是关键变量,「分给了哪一层」才是。 这与本刊 #027 记录的两条(表征早已与语言对齐、瓶颈在读出与路由)连起来看,本期补充的是第三个位置——不是表征的问题,也不是路由的问题,而是精度分配的问题。 保留意见:第 1 篇只有一个规模(8B)与两个数据集(GQA、CLEVR)上的数字,第 2 篇完全没有绝对数字;两篇的方法论主张都比它们的证据更引人注意,本刊建议读者在两篇都被独立复现之前,把它们当作待验证的工作假设而不是可用配方。
其二,本期第 3 篇与第 4 篇各自给出了一个「基准应该怎么报」的示范,而这两个示范恰好是互补的。 第 3 篇给的是三指标框架——答案准确率、归因准确率、整体答案质量——这三项衡量的是三件不同的事:答对、指出依据、以及答案本身好不好。 第 4 篇给的是基线纪律——在给出任何分数之前,先给出多数类基线(这里是 0.556),于是「五个模型全部低于基线」这句话本身就完成了判断,不需要额外的形容词。 本刊从 #026 起就在记录评测类工作的这类改进(那一期记录的是物理基准请专家逐题复核后分数被系统性修正,以及 Not Another Text Benchmark 把选项从文本换成图像); 到本期,本刊认为可以把它归纳成一条对读者有用的检查清单:读到任何一个多模态分数时,先问三件事——基线是什么、指标区分了什么、真值从哪来。 第 3 篇的真值来自模型行为(MAPPET),第 4 篇的真值来自人工标注但自称「silver-standard」,这两处的可信度都需要读者自己判断。
其三,本期第 5 篇与第 2、3 篇的关系,是本刊认为最值得留意的一条间接线索:本期有三篇都在讨论「模型指出依据」的能力,而只有第 5 篇指出了一个更难的版本——当依据是「不存在的东西」时,连衡量它的指标都需要重做。 第 2 篇与第 3 篇处理的是「依据存在但没被指出」:一个是被压缩掉了位置信息,一个是被指到了错误的版式元素。 第 5 篇处理的是「依据不存在」:该被注意到的是「没有 X」,而它在图像上不留下局部特征,在指标上也被词重叠掩盖。 作者给出的措辞是「traditional metrics completely collapse under semantic reversals」,而其证据的薄弱(无数字、指标由作者自提)本刊已在第 5 篇的边界中标出。 但问题本身是站得住的,而它与本期另五篇一起,构成本刊近三期在追踪的同一件事的三个版本: 多模态评测目前最缺的不是更难的问题,而是「模型凭什么这么说」这一环的公共记录。
另附一篇(第 6 节,PersistBench)与本期第 3 篇在真值问题上恰好构成一组对照,已在第 6 节内说明,此处不再重复。
本刊注:本期覆盖 arXiv published 字段为 2026-09-17 的公告批次(对应公告日 2026-09-18),与 #027 覆盖的 2026-09-16 批次不重叠。核验路径说明:cat:cs.CV / cat:cs.CL / cat:cs.AI 三路经 export.arxiv.org/api/query 按 submittedDate 倒序各取最新 80 条,三路全部成功返回(HTTP 200,本期未出现 429);三路各取 80 条、合计 240 条、去重后 213 条,其中 published 为 2026-09-17 的 204 条、为 2026-09-16 的 9 条(后者与 #027 批次重叠,已剔除),没有更早的条目。 六篇正文的 arXiv ID、发布日期、分类、作者与摘要全文均取自官方 API 与 arxiv.org 摘要页直查;本刊未直读任何 PDF 正文,亦未访问 HF Papers 页面、项目页或代码仓库(第 2 篇的代码地址、第 3 篇的数据集页、第 6 篇的项目页本刊均未打开)。 所有数字均引自摘要原文并归因于作者;摘要中未出现的数字(第 1 篇的滤波器构造与 checkpoint 版本、第 2 篇的基准与主干名单及全部绝对数值、第 3 篇的模型名单与三项指标的具体分数、第 4 篇的五个模型名单与同步性验证之外六项任务的分值、第 5 篇的全部量化结果与数据集规模、第 6 篇的全部量化结果)本刊一律不做补充,并已在各篇「边界」与「待观察」中逐条标出。* 第 6 篇(PersistBench,2609.20819)仅记录摘要要点,未列入本期正文五篇,理由已在第 6 节内说明。 本期五篇均未标注会议;各篇摘要中的「silver-standard」「high-fidelity」「substantially」等定性措辞,本刊照录并已在边界中标出其无数字支撑。*