本期仍取自 arXiv 当前最新的公告批次:公告日 2026-09-11(周五),对应 API 中 published 字段的 2026-09-10。核验路径需要如实说明:cat:cs.AI 与 cat:cs.CL 两路经 export.arxiv.org/api/query 按 submittedDate 倒序各取最新 60 条,返回条目的发布日期全部为 2026-09-10;而 cat:cs.CV 这一路的 API 查询本机持续返回 429(Rate exceeded,多次重试均未成功),因此改用官方列表页 arxiv.org/list/cs.CV/recent(前 50 条 + skip=50 的余下 39 条)取标题与 arXiv ID,再逐篇抓取 arxiv.org/abs/<id> 页面取摘要与元数据。 本轮已确认截至 9 月 14 日 07:20(北京时间)最新公告批次仍是 Fri, 11 Sep 2026,周末未产生新公告批次(与本刊 #017–#022 记录一致),因此本期与前两期同批但五篇完全不重复。下列五篇的 arXiv ID、发布日期、分类、作者与摘要全文均取自官方页面,本刊未直读任何 PDF 正文;所有数字均引自摘要原文并归因于作者,摘要中未出现的数字本刊不做补充。
五篇合起来是一条主线加一个反复出现的追问。主线「把评价的对象换掉」:物理实验选择篇主张评测不该只看最终答案,而要看「要不要再测一次、测哪一个」这个决策;OmniHallu 篇把幻觉检测从单模态单任务扩展成理解与生成两侧、图像/视频/音频三种模态的统一框架;多模态情感分析篇直接质疑整整一类平衡方法(梯度与损失层面的优化式平衡)是否真的有效;软提示篇把少样本适配的评价标准从「精度够不够」改成了「精度、代价、遗忘三者的权衡」;VLA 单步动作篇则指出多步采样的动作头本身就是机器人动作不连贯的原因。追问「换掉评价对象之后,我们看到了什么」:五篇的答案是——模型在需要「换一个动作」时会重复旧动作(最好模型也只有 5.9% 全对)、幻觉检测存在稳定的「模态相关梯度」、没有一种平衡策略能可靠优于最简单的拼接、只学 7,168 个参数就能匹配 LoRA 且不遗忘、把 10 步采样压成 1 步反而更稳。本期气质与日报 #023 一致:真正的进展发生在「你把什么当作证据」这一层。
1. New Evidence, Same Choice:把「该不该再测一次」单独拿出来考——六个开源模型在 95.1%–100% 的图像对上重复了同一个动作
论文:New Evidence, Same Choice: Testing Physical Experiment Selection in Vision Language Models(2026-09-10,cs.CV/cs.AI/cs.CL/cs.LG;Under Review at PhysWorldAI @ NeurIPS 2026)
资源:HF Papers
问题。 作者把题设写得很具体:模型先看到一次物理测量实验的图像(例:一个滑块滑了多远),然后必须回答关于新一次试验的问题(例:在固定推力下这个滑块会不会越过目标点)。初始实验可能已经提供足够信息,也可能不够——不够时模型需要再要一次测量(物体的质量、摩擦、恢复系数、弹簧刚度等)。作者要测的正是视觉语言模型能不能判断「何时可以直接回答」,以及在需要更多证据时「该做哪个实验」。他们的批评是:当前的物理推理基准通常只评最终答案,因此并没有直接测量这种决策能力。
方法亮点。 作者设计了一个可控评测:每道题给出一张测量图像,以及由「两种质量 × 另一种相关属性的两个取值」组合而成的四个可能物理世界;模型要么停下并作答,要么选择「能解决问题的最便宜的追加实验」。关键是他们构造了配对问题(matched problem pairs)——改变被观测的测量或改变问题本身,都会改变最优动作;由于所有可能世界与实验成本都是已知的,最优选择可以被显式确定,因此这不再是「参考答案比对」,而是与可计算的最优策略比对。
证据。 摘要给出的数字(作者口径):在六个开源模型、144 组物理参数上,直接作答的反应在 95.1% 到 100% 的图像对中重复了同一个动作——即使正确动作已经改变。简短推理能改善动作切换,但最好的模型也只在 5.9% 的图像对上把两个决策都做对。作者另称进一步分析揭示了测量解读、物理推理与回答格式三个层面的失败,并总结把「证据选择」与「最终答案」分开评估,能暴露传统答案准确率看不到的物理推理局限。
边界。 结果全部为作者自建评测上的作者口径,摘要未给出这六个模型的名字、规模与是否使用工具(「开源模型」是一个范围很大的集合);「重复同一动作」的 95.1%–100% 是最容易令人误读的数字——它统计的是输出稳定性而非正确率,作者自己也点明「即使正确动作改变」,但摘要没有给出各模型的基线正确率,因此无法判断这些模型是「完全不会」还是「会但被惯性压住」;「最优动作」的定义依赖作者构造的四个可能世界与实验成本,现实中往往不存在这样封闭的世界集合(这正是该设计可算最优的前提,也是它与真实科研决策的距离);配对问题的构造方式、题目数量与领域覆盖未列出;「最好的模型 5.9% 全对」中的「两个决策」是「是否作答 + 选哪个实验」,其评分细节未展开;没有做闭源模型的对照(摘要只提到六个开源模型);PhysWorldAI @ NeurIPS 2026 的「Under Review」状态不构成方法有效性的证据。
我的判断。 这篇的真正贡献是一个可复用的提问方式:把「获取证据」与「使用证据」拆成两个可分别打分的动作。它与本刊 #020/#021 记录的 World in World(把控制证据做成带标签的状态)、#022 的 CFD(把「看多少帧」变成查询级成本)属于同一族——都在问「系统在信息不足时,会做什么动作」,而这恰好是过去一年 agent 类系统最薄弱的一环:它们擅长在给定上下文里作答,不擅长判断上下文不够。保留意见:95.1%–100% 这个数字的力量来自它的极端性,但也正因如此需要更谨慎地读——如果模型输出被格式或先验锁定(例如倾向于给出一致的短答案),那么「重复同一动作」可能部分是评测形式的产物,而作者没有提供「随机猜动作」的对照基线。另外,本设计的最优策略是论域内可计算的,真实科研里「该做哪个实验」的代价常常跨天、跨设备、不可逆——这道题的难度上限由作者设定的世界集合决定。给读者的实用建议:如果你在做 agent 评测,这份工作提供了一个低成本的补测项:把「是否要求更多信息」当成一等输出,而不是当成失败。
2. OmniHallu:把幻觉检测做成跨模态、跨任务的统一框架——10,000 样本、六种跨模态任务、一个能省掉 66% 专家调用的可训练验证器
论文:OmniHallu: Unified Hallucination Detection for Cross-Modal Comprehension and Generation in Multimodal Large Language Models(2026-09-10,cs.CL/cs.CV;Findings of EMNLP 2026,12 页 4 图)
资源:HF Papers
问题。 作者的问题陈述是:多模态大模型(MLLM)在各类任务上进展显著,但会产生幻觉——生成内容与输入语义相矛盾或错误表征;而现有研究通常在单一模态或单一任务类型内处理幻觉检测,泛化性受限。
方法亮点。 作者提出 OmniHallu,一个横跨「理解」与「生成」两侧、覆盖图像/视频/音频三种模态的统一幻觉检测框架。配套贡献是 OmniHallu-Bench:一个 10,000 样本、带「声明级(claim-level)人工标注」的基准,覆盖六种跨模态任务——图像到文本(I2T)、视频到文本(V2T)、音频到文本(A2T)、文到图(T2I)、文到视频(T2V)、文到音频(T2A)。方法上是多智能体架构:把模型输出分解为原子声明(atomic claims)→ 由模态专用的专家(modality-specific experts)逐条验证 → 通过结构化推理聚合证据。工程上最实用的一点是进一步提出一个经偏好优化(preference-optimized)的可训练验证器,用来逼近多智能体系统的决策边界,在性能损失极小的前提下把专家调用次数减少 66%。
证据。 摘要为部分定量(作者口径):基准规模 10,000 样本、六种任务、声明级人工标注;可训练验证器减少 66% 专家调用且性能损失极小;实验结论是发现了一致的「模态相关性能梯度(modality-dependent performance gradient)」,并给出了跨模态幻觉模式的细粒度观察。摘要未给出任何具体的检测精度、各模态的具体得分、也未列出所评测的 MLLM 名单。
边界。 「模态相关梯度」被作者称为「一致的」,但摘要没有给出这条梯度的方向、幅度或统计口径——它可能是本期最值得知道的一条结论,却恰好只有形容词;「减少 66% 专家调用」是本篇唯一的具体数字,但「性能损失极小」没有量化(判断部署价值的关键正在这里);10,000 样本要在六种任务上覆盖理解与生成两侧、三种模态,平均每格不足 1,700 条,其中声称为人工标注的比例、标注者数量与一致性指标摘要均未说明;多智能体 + 模态专家的级联结构意味着误差可以在「分解 → 验证 → 聚合」三步中任意一环累积,摘要没有给出分步消融;可训练验证器逼近的是「多智能体决策边界」,也就是说它的上限是该多智能体系统的表现,而非人类标注上限;音频与视频的幻觉判定本身高度依赖主观标准(什么算「与输入矛盾」),摘要未讨论标注协议;「Foundings of EMNLP 2026」的接收不构成方法有效性的证据。
我的判断。 这篇的价值在把评价对象的边界推到了「跨模态 + 双向 + 多任务」:现有幻觉工作大多只做「图像→文本」(看模型说错了什么),而生成侧的幻觉(文→图/视频/音频)长期缺少统一的检测口径——本刊认为「生成侧有没有被骗」是 2026 年下半年多模态里最欠测的一格,这篇把它纳入了同一框架。更值得记的是那条工程结论:把多智能体的判定蒸馏进一个可训练验证器,用 66% 的专家调用换近乎等价的性能——这与本刊 #022 的 Logit Refiner(用 10% 参数修正基座规则)是同一个模式:先用昂贵但可靠的流程得到决策边界,再用廉价模型逼近它。保留意见:没有数字的「梯度」和没有量化的「极小损失」都还不能支撑判断;此外,benchmark 一旦成为目标,就会被优化——这也是本刊 #022 日报里 Epoch AI 的 Tier 4 给出的教训(题库本身需要被审计)。判断上:框架方向明确、工程点子实用,但证据强度目前是「有基准、缺数字」。
3. The Illusion of Balanced MSA:指出整类「模态平衡」方法收效被高估——没有任何策略能可靠优于最朴素的拼接
论文:The Illusion of Balanced Multimodal Sentiment Analysis: Beyond the Limits of Optimization-Based Methods(2026-09-10,cs.CL;Interspeech 2026)
资源:HF Papers
问题。 作者的判断很直接:多模态情感分析(MSA)长期受「模态不平衡」制约,而该领域一直依赖「基于优化的平衡方法」,这些方法承诺的比它们交付的更多。
方法亮点。 摘要给出三项贡献:① 一个统一的评测框架,在受控设定下测试基于梯度与基于损失的平衡策略;② 一个理论诊断,解释这些方法为什么失败——因为它们把「拟合速度」与「判别性贡献」混为一谈;③ 一份研究议程,指向「用留出性能估计判别性模态价值(held-out discriminative modality valuation)」。
证据。 摘要给出的结论(作者口径,评测数据集为 CMU-MOSI 与 CMU-MOSEI):存在三个不足——没有任何一种策略能可靠地优于最简单的 Late Concatenation(晚期拼接);性能对超参数敏感;即使做了比例校准(ratio calibration)也不能带来一致收益。作者把核心问题表述为一句判断:「损失不是效用,梯度不是重要性(loss is not utility, and gradients are not importance)」,并认为模态不平衡问题仍未解决,因而必须转向从留出性能来估计效用。
边界。 这篇是「否定性结论 + 理论诊断」型工作,最需要警惕的是范围:评测只覆盖两个英文情感分析数据集(CMU-MOSI / CMU-MOSEI),两者都源自同一类数据采集范式(访谈式视频),因此「没有策略优于晚期拼接」这一结论不宜外推到其他多模态任务(视频问答、文档理解、具身多模态都不在这两个数据集的分布里);被测试的策略集合未在摘要中列出(「基于梯度与基于损失」是两大类,具体实现数量与调参预算不明);「对超参数敏感」这一指责需要配平调参预算才能成立,否则可能只是「作者没有为对比方法调到最优」;理论诊断说这些方法「混同了拟合速度与判别性贡献」,但摘要没有给出形式化命题或可检验预测;作者提出的替代方向(held-out discriminative modality valuation)在摘要里只是一句议程,没有方法或结果;CMU-MOSI/MOSEI 长期存在数据规模小、划分不稳定、结论难复现的争议,摘要未讨论这一背景;Interspeech 2026 接收不构成结论有效性的证据。
我的判断。 这篇是本期「方法论侧」最重要的一篇,因为它打击的是一个持续多年、几乎默认正确的技术直觉:看到某个模态贡献低,就去损失或梯度层面把它抬起来。作者给出的替换原则只有一句,但很锋利:判断一个模态有多大用,应该看「把它拿掉之后,留出性能掉多少」,而不是看它对损失的瞬时贡献。 这与本刊 #022 记录的 OmniKVQuant(先指出被普遍使用的做法在机制上错了,再给最小修正)以及本期第 2 篇同属一类:先做诊断,再做方法。保留意见:否定性结论的说服力取决于对比是否公平——如果被否定的策略是在欠调参条件下评测的,那这篇的结论会被后续工作轻易推翻;而且它否定的只是「这一类优化技巧」,不等于「模态不平衡不存在」——作者自己也承认问题仍未解决。判断上:诊断的原则值得直接采纳,结论的普适性等更多数据集上的重复。 对多模态从业者的实用含义是那句可带走的提问:你报告某个模态「重要」,依据是梯度、损失,还是留出性能?
4. Your Model Already Knows:只训 7,168 个连续提示 token 就能匹配 LoRA,而且「不遗忘」——代价是更难优化
论文:Your Model Already Knows Don’t Teach It, Learn to Ask It: Soft Prompting for Few-Shot Adaptation of Vision-Language Models(2026-09-10,cs.CV/cs.AI/cs.LG/eess.IV/stat.ML;无会议标注)
资源:HF Papers
问题。 作者处理的是域外(out-of-domain)少样本目标检测:用视觉语言模型在航空、工业、医疗这类分布外的图像上,只给十张标注图。他们把既有路线归为两类——离散提示优化(discrete prompt optimization)与 LoRA 微调——然后重新审视第三种选择:软提示(soft prompting),即只优化少量连续提示 token,预训练骨干完全冻结。
方法亮点。 摘要给出两个经过对比的关键设计选择:第一,把提示 token 放在视觉 token 与文本 token 之间的「跨模态边界(cross-modal boundary)」上,优于其他位置(10.0 vs. 8.4 mAP);第二,用「空空间 token(empty space token)」初始化提示,优于语义初始化与随机初始化。在这两个选择之下,一到三个学到的 token(平均 7,168 个参数)就能匹配最佳 LoRA 配置。
证据。 摘要给出的数字(作者口径):在 Roboflow20-VL 的 10-shot 设定下匹配最佳 LoRA 配置(14.2 mAP),而训练的参数少 20,000 倍以上;软提示更难优化,在不同随机种子间方差更大;与 LoRA 不同,它不造成遗忘——匹配其精度的 LoRA 配置使 NaturalBench VQA 精度相对下降 35%,最大 rank 时下降 56%,而软提示保持预训练性能不变;学到的 token 行为像提示而不像权重——可迁移到更新的模型而无需重训(在 Qwen3.5-9B 上 +0.8 mAP),并且可以被「语言化」成可读提示,与提示搜索方法竞争(与 DetPO 相当、优于 GEPA)。方法还做了外推:在 RoboCasa 操作任务上,冻结的 π0.5 VLA 策略也能从软提示中受益,当 token 放在「梯度瓶颈」上时,在三个任务中的两个上追平 LoRA 基线。作者据此给出总结:现代 VLM 已经编码了专门领域所需的大部分东西,难点在于「学会怎么问」。
边界。 全部为作者自建/公开基准上的作者口径,本刊未复现;「匹配最佳 LoRA」是比较结论,但摘要只给了 14.2 mAP 这一个数值,LoRA 在其余数据集/域上的对比、以及各域(航空/工业/医疗)的分项结果均未列出;「20,000 倍更少参数」是训练参数之比,而推理成本、显存与吞吐未给出——软提示需要把 token 拼进序列,长序列开销是否可忽略,摘要没有算;方差更大是作者主动披露的缺点,但没有量化(是否稳定到可复现是工程上最关键的一问);「不遗忘」的对照是 NaturalBench VQA 一项指标,LoRA 的 35%/56% 下降是该配置下的观测值,不能直接读作「LoRA 都这么差」(rank 与学习率等条件未在摘要中完整给出);「+0.8 mAP」是同一模型家族内的迁移,跨架构是否成立未知;「可语言化成可读提示」是一项有趣的性质,但与提示搜索方法的对比细节未展开;RoboCasa 上「三个任务中的两个」是部分成功,样本量小;无会议标注,评审状态未知。
我的判断。 这篇是本期最实用的一篇,其价值可以一句话概括:它把「少样本适配」的评价指标从单点的精度,扩展成了「精度 × 参数代价 × 是否遗忘 × 可迁移性」四维,而且给出了一个反直觉的组合结果——最少参数的做法同时是唯一不遗忘的做法。机制上的解释也很清楚:学到的 token「行为像提示而不像权重」,因此它可以被搬到别的模型上、也可以被翻译成人话;这与本期第 2 篇(可训练验证器逼近决策边界)、本刊 #022 的 LoopVAE(复用同一核心)属于同一族思路:新增「接口」而不是新增「容量」。保留意见:「软提示 vs LoRA」过去被认为软提示明显更弱,这篇的结论高度依赖两个设计选择(放在跨模态边界、用空空间 token 初始化)——这意味着该结论更像「一个被调好的配置」,而不是「软提示本来就好」;方差问题也不应被轻描淡写,在 10-shot 场景下,高方差意味着某些种子下可能不匹配 LoRA。判断上:设计选择可复现、结论值得试,但「不遗忘」这一条是本篇最有价值、也最应该在更多任务上复核的部分。
5. IMLE-VLA:把多步扩散动作头换成单步生成——推理频率 3.67 倍、LIBERO 平均成功率 98.0%,真机 jerk 降低 2.2–3.0 倍
论文:IMLE-VLA: Fast Single-Step Action Generation for Vision-Language-Action Policies(2026-09-10,cs.RO/cs.CV;IROS 2026,8 页 5 图 5 表;Simon Fraser University/宾夕法尼亚大学/Amii 等)
资源:HF Papers
问题。 作者的起点是 VLA 主流架构的一个具体瓶颈:视觉语言动作策略借助预训练视觉语言骨干获得跨任务泛化能力,而主流设计会给骨干接一个专门用于连续动作的「动作头」,用扩散或流匹配训练——但这类动作头依赖迭代式多步采样(原文举例:π0.5 中的 10 次欧拉步)。作者指出这造成推理瓶颈,并在机器人上表现为「走走停停(stop-and-go)」的运动与更慢的任务完成。
方法亮点。 作者提出 IMLE-VLA,用一个单步条件生成器替换迭代动作头,通过条件隐式最大似然估计(conditional Implicit Maximum Likelihood Estimation, cIMLE)训练。摘要对目标的说明是:cIMLE 目标促进多模态动作覆盖,避免朴素回归头的模式坍缩(mode collapse),同时完全消除多步采样。
证据。 摘要给出的数字(作者口径):把 IMLE-VLA 应用于 π0.5 后,推理频率提升 3.67 倍(55 Hz vs 15 Hz),动作吞吐最高提升 11 倍;在 40 个任务的 LIBERO 基准上取得所有基线中最高的平均成功率(98.0%),同时在推理频率上领先;在 LIBERO-plus 的测试时扰动下,IMLE-VLA 保持了 π0.5 的鲁棒性,而其他基线显著退化;在 Franka Emika Panda 上的四项真机任务中运动更平滑(jerk 低 2.2 至 3.0 倍)、任务完成更快,在每一项任务上都超过 π0.5,并把每个 episode 的平均 VLA 推理时间减少 3.9 至 6.6 倍。
边界。 全部为作者口径,本刊未复现;「最高平均成功率 98.0%」需要与基线列表一起读,而摘要未列出基线是谁(LIBERO 上 98% 已接近饱和,这意味着该基准对「单步 vs 多步」的分辨力可能已经不足);数字中最有价值的是真机侧(jerk 降低 2.2–3.0 倍、每 episode 推理时间减少 3.9–6.6 倍),但对应的是 Franka 上的四项任务——任务数量少、平台单一;「最高 11 倍动作吞吐」与「3.67 倍推理频率」是不同口径的两个数字(前者是吞吐上限,后者是实际频率),摘要未说明二者的换算条件;LIBERO-plus 的结果是「保持鲁棒性」而非提升,摘要没有给出具体退化幅度对比;cIMLE 的多模态覆盖性质需要一个「动作是多模态的」前提,而真机任务里动作分布是否真的多模态未被单独验证;代码与项目页链接来自摘要原文,本刊未核验其可用性;IROS 2026 接收不构成方法有效性的证据。
我的判断。 这篇是本期的「系统瓶颈」侧代表,与 #022 的 Vidu S2(把「实时」当作卖点却未给延迟数字)形成有趣对照:IMLE-VLA 恰好给出了那类论文最缺的东西——速度和延迟的数字(频率 3.67×、吞吐 11×、每 episode 3.9–6.6×、真机 jerk 2.2–3.0×),而且它的因果链条很短:多步采样 → 推理频率低 → 机器人走走停停,因此改一处就能同时改速率与运动质量。这与本刊 #022 中 Logit Refiner 的诊断同型(「这是解码规则的局限,不是容量不足」)——本期两篇都在说同一件事:把「采样过程」本身当作变量。 保留意见:LIBERO 接近饱和使得 98.0% 的说服力有限,真正的证据其实是真机上的平滑度与时间,而那只是四项任务;此外单步生成把「多模态动作覆盖」的责任从采样式动作头转移到了 cIMLE 目标上,这个目标的稳定性(是否会在长时序任务中坍缩)摘要没有讨论。判断上:瓶颈诊断可信、加速数字具体,泛化性待更多平台验证。
今日阅读线索
用一句话概括本期:五篇不是在问「模型还能做什么」,而是在问「我们一直在看的那个指标,是否在看真正该看的东西」——而换掉评价对象之后,得到的结论往往是「原来看的那一格比想象的差」。
第一条线索:把「决策」和「答案」拆开评。 物理实验选择篇的全部贡献可以浓缩成一句:让「要不要更多证据」成为一个可被单独打分的输出;多模态情感分析篇打击的是用损失/梯度替换「效用」的习惯;软提示篇给出的是四维权衡(精度 × 参数 × 遗忘 × 迁移),而不是单点精度。三者指向同一条方法论:当某个指标长期处于「所有人都接近饱和」的状态时,正确的下一步不是换更大的模型,而是换一个更接近后果的评价对象。 这与日报 #023 中 Anthropic 报告「把软件工程师这个岗位作为观测对象」、Bengio「把训练信号作为观测对象」是同一种做法:先确定你在测量什么,再讨论结果好不好。
第二条线索:新增「接口」,而不是新增「容量」(本期第二次出现,但形态与 #022 不同)。 软提示只学 1–3 个连续 token(平均 7,168 参数);可训练验证器是一个用来逼近多智能体决策边界的轻量模块;IMLE-VLA 换掉的是动作头这个「接口」,骨干不动。三处修改都不增加骨干容量,而三处的收益分别来自「不遗忘」「省掉 66% 专家调用」「推理频率 3.67 倍」——恰好是部署侧最实际的三类代价。给读者的可复用提问:你手上有哪个模块是「用通用方法处理专门接口」的?(扩散头、外挂验证器、全参数微调)——把那一处换掉,通常比换骨干便宜,而且常常同时改善行为质量。
第三条线索(本期最弱的一环,与 #022 相同):跨模态的「可靠性梯度」被声称存在,但没有被量化。 OmniHallu 声称发现一致的「模态相关性能梯度」,这是本期最值得知道的一条结论,但摘要里只有形容词——方向、幅度、统计口径全部缺失;物理实验选择篇的 95.1%–100% 是最抓眼球也最容易被误读的一个数字(它度量的是输出稳定性,而不是能力)。这两处空白指向同一个研究习惯问题:当论文引入了一个新的「评价对象」时,它必须同时给出这个新对象的量纲与分布,否则读者只能记住耸动的数字。 如果只跟进一条线,我会选这条。
旁注(标题级线索,未读摘要):本期同批次里另有一批与「接口与评测」相关的标题可作延伸阅读:《Distance generalization in transformers: why bother with positional encoding?》(cs.CL)、《Why Does Post-Training Quantization Work?》(cs.LG/cs.CL)、《BodyCam-VQA: Enhanced Body-Worn Camera Video Captioning via Multimodal Reasoning and Probe Question Generation》(cs.CV/cs.CL,EMNLP 2026 Workshop NLP4PI)、《Beyond Benchmarks: Using VLMs to Reveal Systematic Classification Failures Under Real World Conditions》(cs.CV,SPIE Sensors + Imaging 2026)。仅记录线索,本刊本期未读其摘要,不做判断。
本刊注:本期五篇论文的 arXiv ID、发布日期、分类、作者、页数与会议标注,以及摘要全文,均经本机直接抓取 arxiv.org/abs/<id> 页面核验;批次信息来自 arxiv.org/list/cs.CV/recent、arxiv.org/list/cs.CL/recent 与 export.arxiv.org/api/query(cat:cs.AI 与 cat:cs.CL 两路成功,cat:cs.CV 一路持续返回 429,详见开篇说明);本刊未直读任何 PDF 正文。批次说明:截至发布时(2026-09-14 07:20 北京时间),最新公告批次为 Fri, 11 Sep 2026,API 中对应条目的 published 日期为 2026-09-10,周末未产生新批次——因此本期与 #021、#022 同批但选题不重复(五篇 ID:2609.11022/2609.11244/2609.11247/2609.11310/2609.10915)。所有性能与规模数字均为论文作者口径,本刊未复现;凡摘要中未出现的数字,本刊不做补充;摘要中未讨论的边界(推理时延、数据许可、评测协议、向真实场景迁移等),已在上文「边界」段落中逐条标注为「未说明/未讨论」。代码、项目页与 HF Papers 链接取自摘要原文或按 arXiv ID 构造,本刊未核验其可用性。