本期取自 arXiv 当前最新的公告批次:published 字段为 2026-09-14(周一),对应公告日 2026-09-15(周二),与 #024 覆盖的 2026-09-11 批次不重叠。 核对路径如实说明:cat:cs.CV、cat:cs.CL、cat:cs.AI 三路均经 export.arxiv.org/api/query 按 submittedDate 倒序各取最新 40 条,三路全部成功返回(HTTP 200,无 429)cs.CV 一路的 40 条 published 全部为 2026-09-14,没有更早或更晚的项,与 #024 记录的「106 条去重后全部为 2026-09-11」形态一致。下列五篇的 arXiv ID、发布日期、分类、作者与摘要全文均取自官方 API,本刊未直读任何 PDF 正文;所有数字均引自摘要原文并归因于作者,摘要中未出现的数字本刊不做补充。

五篇合起来是一条方法与一条底线。方法是一条:把「对照项」换掉。 这五篇都没有做新任务,它们各自把评测或传输里的某个默认对照换成了另一个东西——第 1 篇把输入条件从「与训练一致」换成「与训练冲突」;第 2 篇把「发送多少视觉 token」从固定比例换成由问题决定;第 3 篇把「被问的那张图」换成另一张(配对换图审计);第 4 篇把「评测方式」从问答换成程序化重建;第 5 篇把「相似度」换成经过人类判断校准的分数。底线是一条:换掉对照之后,五篇给出的答案都不太客气。 ① 视频模型在没有能力的地方其实有信号——它只是不用,而且这个「用不用得上」存在一条清晰的深度边界;② 隐私防护可以做到「少发 60% 的 token 而不掉性能」,但攻击成功率从 0.99 只降到 0.76–0.79③ 一份已经包含答案的报告会让医学 VLM 对图像变化的敏感度从 20.94% 掉到 4.26%④ 一个能把视频「重建得很像」的 agent,只保留了 53.7% 的时空事实⑤ 把图文相似度做成标定分数时,「检索性能」「与人类判断的一致性」「阈值标定」是三个会互相打架的目标。

1. A Chosen Future Can Still Be Rewritten:视频模型「会正确的运动但不用它」,而且存在一条清晰的深度边界

论文:A Chosen Future Can Still Be Rewritten: Causal Writability in Video Models(2026-09-14,cs.LG/cs.CV;34 页 33 图)

资源:HF Papers

问题。 作者的提问方式很干净:当一个视频模型生成了物理上错误的运动,究竟是它没学会正确的运动,还是学会了但没有用上? ——这个区分决定了「加数据」「改架构」和「改干预方式」哪一条才是正确的修法。

方法亮点。 作者把问题做成了一个可以分离两种解释的受控实验:训练数据中红色物块的振荡是慢的、蓝色物块的振荡是快的;测试时给一个「红块被观测到快速运动」的冲突条件。 在这种冲突下,即使模型生成了慢动作,一个「由简单物理变量预测出来的低维编辑(low-dimensional edit)」也能把正确的快速运动恢复出来。 作者给这个能力起名为 causal writability(因果可写性)——它指的不是「模型输出正确」,而是「模型的中间状态仍然可被指向正确方向地改写」。

证据。 摘要给出的结果分四组(作者口径)。① 一条尖锐的深度边界在固定强度(fixed strength)下,同一个编辑在边界之前能改变视频、在边界之后不能;作者把这条边界称为该次写入的 commitment(承诺点)——即模型在某个深度上已经把选择「定死」了。 ② 但信号并没有消失运动信号仍然存在,一个更强的下游写入可以恢复物理运动——代价是「过大的增益会过冲(overshoots)」,也就是存在一个有用的区间而不是单调的关系。③ 有预测力「早期因果可写性」可以预测哪些错误会被后续训练纠正——那些在更多网络深度上可写的错误,比那些最终持续存在的错误,更容易被训练修正。 ④ 可推广性作者在一个预训练的 1.3B 视频模型上复现了因果可写性及其尖锐的闭锁(closure),以此支持该现象在模型规模与训练范式上的通用性。

边界。 这套实验的受控程度同时是它的长处与它的局限「红块慢、蓝块快」的两类合成运动是一个刻意简化的代理任务摘要没有说明它在自然视频、多物体交互或文本条件生成上是否仍成立——而「因果可写性」这个概念的实用价值,恰恰取决于它在真实生成模型里是否可测「低维编辑由简单物理变量预测」是被研究的最关键的一步,但摘要没有说明这些物理变量是什么、如何取得、是否需要知道模型生成的「正确答案」才能构造——如果构造编辑需要先知道正确运动,那它在实际纠错中的可用性会大打折扣「固定强度下的尖锐边界」是一个很强的结构性主张摘要未给出边界的位置随模型深度、层类型或规模如何变化「过大的增益会过冲」说明存在最优强度,但摘要没有给出该强度如何选取「早期可写性预测后期可被纠正」是一条相关性主张,摘要未给出预测的准确率、样本量或对照基线1.3B 是摘要中提到的最小规模复现,本刊未读到更大规模的验证这是一篇 34 页 33 图的长文,摘要密度有限,摘要未提代码或权重是否公开。

我的判断。 这篇是本期最「方法论」的一篇,而它真正的贡献不是那个名字,而是它把「模型不做得对」这件事拆成了至少三种状态:没学会、学会了但被覆盖、学会了且可被改写。 这个三分在工程上是有直接后果的——如果失败主要落在第三种状态上,那么对一个已经训练好的模型,「加数据」可能不如「在中层做一次定向干预」划算而第 2 条「边界之后写入仍存在,只是需要更大增益」说明这个干预不是二元可控的,存在一个容易过冲的窗口。 保留意见这类机制研究最常见的失败模式是被过度推广——在「红块/蓝块」上得到的尖锐深度边界,很可能与特定架构、特定数据集(两类周期运动)和特定训练配方绑定摘要给出的唯一推广证据是「在另一个 1.3B 模型上复现」,这只能说明它不是某一个 checkpoint 的偶然,不能说明它是生成模型的一般性质。 另外,摘要里「causal」一词用得比惯常更宽它测的是「干预模型内部状态能否改变输出」,这更接近机制可解释性里的可干预性(intervenability),而不是严格意义上的因果推断——读者在引用这个词时应留意这一点。 给读者的实用建议: 如果你在做视频生成或世界模型,「模型在冲突条件下失败」这个现象本身值得单独建一个探针——因为这条工作提示的是,失败的成因至少有两个不同的指纹:一个在中层可写、一个在任何深度都不可写。

2. Don’t Send What You Don’t Need:按问题裁剪视觉 token,用约 40% 的预算守住 VQA 精度,把成员推断攻击成功率从 0.99 降到 0.76–0.79

论文:Don’t Send What You Don’t Need: Question-Guided Token Pruning as a Privacy Defense for Vision-Language Models(2026-09-14,cs.CV/cs.AI/cs.CR)

资源:HF Papers

问题。 作者的场景设定很实际:VQA 与 VLM 越来越多被用在隐私敏感且带宽受限的环境联邦学习(FL)、拆分学习(SL)与 U 形拆分学习(USL)都能让原始数据留在本地但把全部视觉 token 跨模型分片传输依然昂贵,并且可能暴露隐私信息。 ——换句话说,问题不在「要不要上传原图」,而在「即使只传特征,传得太全也会泄露」。

方法亮点。 作者提出 QPriv-VL:一个面向 FL、SL、USL 的、由问题引导且隐私感知的视觉 token 裁剪(pruning)框架——它在传输之前,按「任务效用」与「隐私敏感度」两个维度决定保留哪些视觉 token。 核心组件是一个轻量的 Dynamic Threshold Predictor(DTP,动态阈值预测器)在一次前向中同时估计样本级的裁剪比例与 token 级的保留掩码DTP 把两种信号合起来① 由视觉 patch 与池化后的问题嵌入之间的跨模态相似度算出的「问题相关性」② 由冻结的 DINOv2 特征导出的「敏感度信号」这套设计的目标是「抑制可能敏感的区域,同时保留对回答该问题有用的 patch」,而且明确声称不需要敏感度标签(without requiring sensitivity labels)。

证据。 摘要给出的结果分三组(作者口径)。① 评测面在 GQA、OK-VQA、VQAv2、SLAKE、VQA-RAD 与 PathVQA 六个数据集上,对抗四类隐私攻击:FSHA、FORA、iDLG,以及属性推断型成员推断攻击(attribute-inference MIA)。 ② 主要数字DTP 在与固定比例裁剪(fixed-ratio pruning)持平或更好的同时,使用的传输 token 显著更少在 VQA-RAD 上,它把成员推断攻击的成功率从 0.99 降到 0.76–0.79相对固定比例裁剪降低了 FSHA 与 FORA 的重建 PSNR并在约 40% 的原始视觉 token 预算下保持了有竞争力的 VQA 精度(preserves competitive VQA accuracy)③ 机制层面的两个观察敏感度排除比(sensitivity exclusion ratio)为 1.20 ± 0.18,表明模型确实在优先移除隐私敏感的 patch可解释性分析显示,保留策略会随问题语义而调整,而不是依赖通用的视觉显著性(generic visual saliency)。

边界。 最重要的边界是那个「0.76–0.79」本身攻击成功率从 0.99 降到 0.76–0.79 是一个明确的相对下降,但在绝对值上它仍然意味着「大约四分之三的成员推断尝试仍然成功」——摘要没有为「这个水平在部署上是否可接受」给出任何门槛,而本刊认为这才是读者最需要的那个数「有竞争力的 VQA 精度」没有给出任何数值因此「40% 预算下不掉性能」这个结论目前只有方向,没有幅度也没有说明 40% 是六个数据集的平均还是某一个数据集的结果「相对固定比例裁剪降低了 FSHA 与 FORA 的重建 PSNR」同样只有方向没有 PSNR 数值敏感度信号来自冻结的 DINOv2,这是一个通用视觉骨干而不是隐私模型因此「敏感」在这里是一个代理概念——「不需要敏感度标签」既是这套方法的卖点,也意味着它无从校验自己移除的是否真的是「该移除的东西」四类攻击族并不穷尽(例如未提到针对医学影像的扩散式重建或针对性梯度反演),且攻击强度设定未在摘要中说明1.20 ± 0.18 这个比值的定义(相对什么基线、如何统计)摘要未给出六个数据集中有三个是医学 VQA 数据集(SLAKE、VQA-RAD、PathVQA),而主要数字都来自其中之一这是一个需要留意的选择性呈现可能摘要未提代码或模型是否公开。

我的判断。 这篇的价值不在数字漂亮,而在它把「隐私」从一个声明变成了一个可以用四个攻击族测量的量——「裁剪多少 token」这个决定,从此可以被写成一条「效用—泄露」曲线的取点问题,而不是一个凭直觉设置的超参。 它与本刊 #024 第 3 条(QPriv 之外,VideoXAgent 用「按需取证」替代「稠密打包」)在结构上同源都是「不要一次把全部证据送过去,按需要发」区别是 #024 那篇省的 token 是为了省钱,这篇省的 token 是为了少泄露。 保留意见我认为这篇目前最缺的不是方法而是门槛——0.76–0.79 的攻击成功率在一个医疗场景里应当被读作「仍未解决」,而不是「已显著缓解」而摘要的措辞(「matches or outperforms」「preserves competitive」)恰好选择了不给出那个最容易引起追问的数字给读者的实用建议如果你在做拆分学习或端侧 VLM 部署,这篇给出的是一个可复用的设计模板(问题相关性 × 冻结骨干的敏感度,单次前向同时出比例与掩码),但请在做任何部署决策前要求作者补三张表:六个数据集各自的 VQA 精度、四种攻击的逐项成功率,以及「敏感度排除比」的定义。

3. ModaLens:一次配对换图审计——只要报告在手,医学 VLM 对图像变化的敏感度从 20.94% 掉到 4.26%

论文:ModaLens: Measuring Image Sensitivity in Report-Conditioned Medical VLMs(2026-09-14,cs.CV/cs.AI)

资源:HF Papers

问题。 作者的题设只有一句话,但刺得很准:一份放射学报告本身已经能回答一个临床问题,因此很难分辨一个视觉语言模型究竟有没有在用图像。 ——这不是在问「模型答得对不对」,而是在问「模型答对的时候,看的是图还是文字」。

方法亮点。 ModaLens 是一次配对换图审计(paired image-swap audit)它测量的是「报告可用性如何改变图像敏感度」。具体设定:模型为 MedGemma-27B;数据为来自 293 名患者的 3,199 组配对 MIMIC-CXR 病例;每一例问全部 14 个问题(13 个具体发现 + 1 个复合问题);对每一次试验,把图像替换成「另一项检查」的图像——通常是同一名患者的——而问题与报告保持不变。 ——关键设计是「通常同一患者」这使替换图在解剖上高度相似,从而把「模型是否依赖这张图的具体内容」放大成一个更锐利的检验。

证据。 摘要给出的结果分三组(作者口径)。① 主数字在一条显式作答指令下,模型生成的答案在「有报告」时于 4.26% 的试验上发生变化,在「无报告」时于 20.94% 的试验上发生变化配对差值(paired increase)为 16.7 个百分点,按患者聚类的 95% 置信区间为 15.6 到 17.7——即报告可用性降低了换图敏感度。 ② 稳健性用原始提示词、以小写首 token 读取时,得到的是 4.70% 对 17.07%(方向一致);并且替换图像还会移动连续的答案分数,即使在二元预测没有改变的情况下。 ③ 机制与可复现性标签本身是从报告中导出的,这限制了对「视觉正确性」下结论的能力;该方向在另外两个模型谱系中可复现(the direction replicates in two further model lineages)代码、确切提示词与每个数字的运行记录在 github.com/criticaldata/MODALENS。

边界。 这篇的边界写得比多数论文更诚实,而其中三条对读者最重要① 作者自己指出「标签来自报告」,因此本刊不建议把它读成「模型看错了图」——它测的是「输出对图像的敏感度」,不是「视觉判断的正确性」;一个模型完全可能对图像敏感却是敏感在错误的特征上。 ②「有报告时 4.26%」不是零即报告在手时图像仍然在轻微地起作用(约 1/23 的试验会因换图而改变答案);摘要没有讨论这个残差是有意义的视觉依赖还是噪声。 ③「另外两个模型谱系方向可复现」没有给出幅度、模型名或数据集是否一致——而方向可复现与幅度可复现是两件不同的事如果另外两个模型是 18% 对 12%,结论会完全不同。 另有四点值得记:主结果只给出 MedGemma-27B 一个模型数据集只有 MIMIC-CXR 一个,单中心、单一影像模态「通常是同一患者」是一个会显著影响结果的设计选择(同一患者的两次检查差异可能极小,这让审计更严格,但也让「4.26% 对 20.94%」的差距更依赖这个选择的强度),摘要未说明非同患者替换占多大比例14 个问题全部为发现级与复合问题,未见「必须看图才能答」的问题类型(例如定位、比较、左右侧)是否单独统计本刊未直读其 GitHub 仓库,无法确认运行记录是否覆盖了摘要中的每一个数字。

我的判断。 这是本期最应该被临床 AI 团队直接拿去用的一篇,因为它的方法成本极低、而它测的东西此前几乎没人测「模型在有文本捷径时,还会不会看图」不是靠消融训练能回答的问题,而是靠一次换图就能测出来的审计。 把这条与 #023 第 1 篇(New Evidence, Same Choice:把「该不该再测一次」单独拿出来考)并读,两篇在做同一件事——把评价体系默认忽略的一个行为维度单独变成一道可打分的题。 保留意见「4.26%」这个数字在直觉上很刺眼,但它的解释有两种,而这篇文章目前只排除了其中一种一种解释是模型在报告可用时把图像当成了冗余输入(这确实是一个失败模式,因为临床上报告可能有误);另一种解释是「通常同一患者」的替换图本来就没有可区分的信息,因此 4.26% 是设计使然。 摘要没有给出「非同患者替换」条件下的对照数字而这一条对照恰好能把这篇文章从「一个令人不安的发现」变成「一个已被归因的发现」。 给读者的实用建议如果你想在自己的多模态系统上抄这个审计,把「换图」拆成两个强度分别测——同一患者的另一次检查,以及另一名患者的检查。两个数字之间的落差,就是「模型有没有在看图」这件事的信息量。

4. BVB:用「能不能在 Blender 里重建」替代问答——最好的模型拿到了 88.6 的感知相似度,却只保留 53.7% 的时空事实

论文:BVB: Benchmarking Agentic Video Understanding via Programmatic Reconstruction in Blender(2026-09-14,cs.CV)

资源:HF Papers

问题。 作者的出发点是一个很干脆的断言:多模态 agent 已经能通过写代码在 Blender 这类软件里造出复杂视频(不依赖扩散模型),但视频理解基准仍然主要用问答来评。 如果 agent 真的理解了一段视频,它就能把这段视频程序化地重建出来。 ——这等于把「理解」的验收标准从「能回答关于它的问题」换成了「能从零把它造出来」。

方法亮点。 BVB(Blender-VideoBench)要求 agent 把真实世界视频重建为 Blender 里的动画场景。 为保证可比性:每个 agent 都通过一个轻量 harness(Mini-BVB)在完全相同的沙箱里、在共享的成本上限下编写重建程序评测时从重建场景的动画相机渲染,并在两个轴上评分① Dual VQA——衡量重建保留了多少时空事实(spatiotemporal facts)② Latent Similarity——衡量重建与源视频在感知上有多接近总分是二者的平方根均值(square-root mean),设计意图是奖励均衡的表现——即在一个轴上极强、另一个轴很弱不会得到高分。

证据。 摘要给出的结果分四组(作者口径)。① 规模评测了来自 10 个模型族的 51 个配置,并从语义保留、感知相似度、推理开销(reasoning effort)与成本四个维度做了分析。② 主数字最好的模型达到 88.6 的 Latent Similarity,但只保留了源视频中原本答对的那部分时空问题中的 53.7%③ 一个反直觉的干预结果增加推理(additional reasoning)会改善视觉相似度,却不会缩小事实准确度上的那道缺口。 ④ 一条人类关联性验证在一项 15 名评分者、5 个配置的盲评中,Latent Similarity 与人类偏好强相关。

边界。 「88.6 对 53.7%」这个落差是本篇的传播点,也是最需要被追问的地方这两个数不在同一量纲上(一个是相似度指标、一个是保留率),而「平方根均值」把两个异质量纲合成了一个总分——摘要没有给出各配置的具体总分,也没有给出两个轴各自的权重敏感性分析因此「均衡」这个设计意图是否真的在实践中成立,本摘要无法判断「人类偏好与 Latent Similarity 强相关」的验证只有 15 名评分者与 5 个配置,样本极小且它验证的是「感知相似度」这一轴,没有对应地验证「Dual VQA 保留率」是否也与人判断一致——而这恰恰是本文主张「语义保留是主要挑战」所依赖的那一轴「共享成本上限」的具体值与「Mini-BVB」的实现细节摘要未给因此「51 个配置可比」这句话无法被独立检查用 Blender 编程重建来测「视频理解」有一个天然混淆它同时测了编码能力(把理解翻译成可运行的程序)——一个理解得很好但不会写 Blender 脚本的模型会在这里被低估摘要未给出对这一混淆的对照实验(例如给人类同样的预算让人重建,或分离「写出正确脚本」与「脚本渲染出正确画面」两个阶段)「真实世界视频」的来源、数量与分布摘要未说明「推理开销」是作者自定的度量,其定义未给出摘要未提代码、数据或 harness 是否公开。

我的判断。 这篇的贡献在于给「视频理解」找到了一个比问答更难作假的验收面——问答可以被语言先验与选项分布刷分,重建不能重建要求模型把「相机怎么动、物体在哪、先后关系如何」全部外化成可执行的几何与时间结构。 而它给出的结果与本期第 1 篇形成了一个有意思的呼应第 1 篇说视频模型内部有正确的运动信号却输出错误的运动;这篇说 agent 能重建出「看起来很像」的结果却丢掉了近一半事实。 两篇从不同方向指向同一个结论:在视频这件事上,「像」与「对」是两个可以独立失败的量——而目前的评测习惯(相似度、FVD、人眼偏好)主要量的是「像」。 保留意见我认为本文最强的结论其实是那句不起眼的否定结果——「增加推理改善视觉相似度,但补不上事实缺口」它说明这道缺口不是靠「多想一会儿」能填的,而这恰好与 #024 记录的 VideoXAgent(长视频靠逐步取证而非一次看全)形成对照:那篇主张的是「换交互方式」能提升事实获取,这篇主张的是「加推理」不能。 给读者的实用建议如果你在评估视频理解系统,本文提供的最可迁移做法不是 Blender,而是「双轴 + 不许偏科」的评分结构——感知相似度与人可核验的事实保留率必须分别报告,任何单一总分都应该被要求给出两轴的分解。

5. Congruency Score:把「长文本图文一致性」做成标定分数——检索性能、人类一致性、阈值标定是三个会互相打架的目标

论文:Human-Grounded Calibration for Long-Text Image-Text Congruence in Vision-Language Models(2026-09-14,cs.CV/cs.CL;3 图 2 表)

资源:HF Papers

问题。 作者的题设是一个正在变得普遍的工程需求:当视觉语言系统需要判断一段详细文本描述是否匹配视觉内容时,「长文本图文一致性打分」就变得重要。 但双编码器模型给出的原始相似度分数很难被解释为「标定过的一致性度量」,尤其在图像与文本嵌入之间那道 modality gap 之下。 ——换句话说,问题不是「相似度能不能排序」,而是「相似度能不能当阈值用」。

方法亮点。 作者提出 Congruency Score(CS)一个轻量的标定层(calibration layer),把图文相似度的证据映射到一个有界的分数上。 ——注意它的形态是「映射函数」而不是「新模型」底下的视觉语言骨干保持冻结,被研究的对象是「如何把相似度转成一个可用阈值解释的量」。

证据。 摘要给出的结果分三组(作者口径)。① 一个否定性结果在 DOCCI 与 Urban1k 上评测四个冻结的视觉语言骨干后,作者发现「投影后质心距离(post-projection centroid distance)的下降」并不一致地改善图文检索性能——即一个常被用来证明「gap 被弥合了」的指标,在检索上未必带来收益。 ② 一个权衡在 DOCCI 上的人类校准评测显示,直接的 post-hoc 标定保持了与人类判断的高关联性,而某些基于投影的配置可以降低「与阈值相关的斜率与截距畸变」,代价是检索性能与关联强度。 ③ 结论句这两条结果共同把「长文本图文一致性打分」确立为一个「标定分数估计问题」——在这个问题里,检索性能、与人类判断的关联性、以及阈值标定必须作为三个不同的目标分别评测。

边界。 摘要给的都是方向性结论,没有给出任何数值——「并不一致地改善」没有说明在几个骨干上是改善、几个上不是「与人类判断的高关联性」没有给出相关系数「降低斜率与截距畸变」没有给出畸变量「代价是检索性能与关联强度」同样没有幅度——而「权衡」这一类论断如果没有幅度,就无法判断它是一次工程取舍(例如牺牲 1% 换个可用的阈值)还是根本性的冲突「四个冻结的骨干」没有被点名因此本刊无法判断这四个模型是否代表了当前的骨干谱系数据集只有 DOCCI 与 Urban1k 两个,而人类校准只在 DOCCI 上做样本量与标注协议摘要未给CS 的「轻量标定层」具体形式(是否为单调映射、是否含可训练参数、训练目标是什么)摘要未展开——而这决定了它是「一个可复用的校准方法」还是「针对这两个数据集的一个拟合」「三个目标必须分别评测」是一个规范性主张,摘要没有给出把三者放在同一评测里会出现的具体反例这是一篇 3 图 2 表的短文,摘要密度有限,摘要未提代码是否公开。

我的判断。 这篇是本期的「一张反对票」,而它反对的东西很具体:用「弥合 modality gap」来论证模型更好。 它给出的反例结构是:质心距离下降 ≠ 检索变好 ≠ 与人类判断更一致 ≠ 阈值更好用——这四个量目前的评测习惯是把它们当成同一件事。 把这一条与本期第 3 篇(ModaLens)并读,会发现两篇在同一条线上都在问「我们用的那个分数,到底在测什么」——ModaLens 问的是「模型答对了是因为看了图还是看了报告」,这篇问的是「相似度高是因为真的匹配还是因为嵌入空间被投影塑形了」。 保留意见我认同这个区分,但这篇摘要的证据强度不足以支撑它的规范性结论——在没有数值的情况下,「检索性能、人类一致性、阈值标定是三个不同目标」更像是作者从两组实验里读出的解释,而不是被证明的命题。 如果要在引用时保守一点,我会只引用它最硬的那一半:「投影后质心距离的下降并不一致地改善图文检索性能」——这是一个清晰、可被他人复现检验的否定结果,而它对当前很多多模态对齐工作的宣传口径是一个直接的挑战。 给读者的实用建议如果你在做图文匹配的线上系统,请把「排序指标」和「阈值指标」分开做表格——这篇提示的是,优化排序的那套手段(包括投影与对齐)可能会让分数看起来更「收敛」,却让阈值更难设定。

今日阅读线索

一句话:这一批五篇的共同动作是「换掉对照项」——把输入条件换成冲突的、把发送内容换成按需的、把被问的图像换成另一张、把评测方式换成重建、把相似度换成校准分数;而五篇换完之后给出的答案指向同一件事:「看起来对」与「实际用上了」是两件可以独立成立的事。

三条线索值得带走:

其一,本期有三篇独立地论证了同一个结构:模型(或 agent)手里存在正确的信号,但它没有让这个信号决定输出。 视频模型篇(第 1 篇)给出的是最直接的机制证据——正确的运动仍在模型内部,可被一次低维编辑恢复,而且这个可恢复性随深度出现一条尖锐边界;医学审计篇(第 3 篇)给出的是行为层面的证据——一旦报告在手,图像引起的答案变化从 20.94% 掉到 4.26%;重建基准篇(第 4 篇)给出的是产出层面的证据——视觉相似度 88.6、时空事实只留 53.7%,而「多想一会儿」只改善前者三篇的量表不同(内部状态、行为敏感度、产出保真度),但描述的是同一个失败形态:冗余输入或表层相似度被当成了「理解」。

其二,「裁剪」和「校准」在这一期里都被重新定义成了一句成本会计,而不是一次性能优化。 第 2 篇的裁剪对象是传输的 token它的两个货币是「精度」与「攻击成功率」——而作者给出的账是:省下约 60% 的 token,换来的隐私改善是攻击成功率从 0.99 到 0.76–0.79;第 5 篇的校准对象是那个阈值的斜率与截距它的两个货币是「检索性能」与「与人类判断的关联强度」两篇都拒绝给出一个「更好」的单一结论,而是把结果写成一条需要自己选点的权衡曲线——本刊认为这种写法本身值得记录,因为它是过去几期反复出现的同一句话的又一次落地:指标的口径比指标本身更重要。

其三,这一批里最好用的方法学提示不是任何实验结果,而是两个审计设计。 一个是 ModaLens 的配对换图把图像换掉、把问题与报告固定,看输出变化多少次——它用一个几乎不需要训练的流程,测出了一个此前需要消融训练才能接近的问题。 另一个是 BVB 的双轴不许可偏科的评分结构感知相似度与可核验的事实保留率必须分别报告。 把这两个设计与昨晚日报 #025 的三条发布并读,会看到一个有趣的对照本期论文速递在讨论「如何验证模型真的用了它声称使用的信息」,而日报第 1 条(TypeSafe 的 0% 不是实测而是 schema 保证)与简讯④(一家公司把 checkpoint 和日志一起开源)恰好是同一个问题的两种回答方式——一种靠形式化保证,一种靠过程可追溯。 两种方式本刊都不反对;但本期论文速递的五篇,无一例外选择了后者。


本刊注:本期覆盖 arXiv published 字段为 2026-09-14 的公告批次(对应公告日 2026-09-15),与 #024 覆盖的 2026-09-11 批次不重叠。核验路径说明:cat:cs.CV / cat:cs.CL / cat:cs.AI 三路经 export.arxiv.org/api/query 按 submittedDate 倒序各取最新 40 条,三路全部成功返回(HTTP 200,本期未出现 #023 记录的 cs.CV 一路 429);cs.CV 一路 40 条的 published 全部为 2026-09-14。 五篇的 arXiv ID、发布日期、分类、作者与摘要全文均取自官方 API 直查;本刊未直读任何 PDF 正文,亦未访问 HF Papers 页面或项目页。 所有数字均引自摘要原文并归因于作者;摘要中未出现的数字(逐数据集精度、攻击成功率的部署门槛、重建配置的逐项总分、相关系数等)本刊一律不做补充,并已在各篇「边界」一节逐条标出。本期涉及的两处外部链接(第 3 篇的 github.com/criticaldata/MODALENS、第 1 篇与第 4 篇的篇幅与图表数)均取自摘要自述,本刊未独立核实。