先说明本期与上一期的一处不同:arXiv 出现了新批次。#028 至 #030 连续三期覆盖的都是 9 月 17 日提交、18 日公告的那一批;本期覆盖的是下一批。

核对路径如实说明:cat:cs.CV、cat:cs.CL、cat:cs.AI 三路均经 export.arxiv.org/api/query 按 submittedDate 倒序取最新 80 条,三路全部成功返回(HTTP 200,本期未出现 #023 记录的 429):cs.CV 的 80 条 published 全部为 2026-09-18;cs.AI 的 80 条全部为 2026-09-18;cs.CL 为 49 条 2026-09-18 加 31 条 2026-09-17。 区间探测(submittedDate:[202609180000 TO 202609190000],三路均 HTTP 200)得到 cs.CV 84 条、cs.CL 49 条、cs.AI 98 条;把区间起点推到 9 月 19 日([202609190000 TO 202609240000])后,三路的 totalResults 全部为 0——也就是说,索引中没有任何一条条目带 9 月 19 日或之后的时间戳(本刊另用 [202609160000 TO 202609170000][202609170000 TO 202609180000] 两组区间做了对照,三路均正常返回 84–174 条,证明该探测方式本身有效,不是查询写错)。 arxiv.org 的列表页与 API 在这批上有一处措辞差异,本刊照录两侧原文:/list/cs.CV/recent/list/cs.CL/recent/list/cs.AI/recent 三个页面的最新日期页头均为「Mon, 21 Sep 2026」(分别标注 showing first 50 of 98、87、125 entries),而 cs.CV 该页头下的第一条正是本期第 1 篇的 arXiv:2609.22083;API 对这些条目返回的 published 则是 2026-09-18。 两者并不矛盾——列表页按公告日分组(周一 9/21),API 的 published 记录的是提交时间戳(周五 9/18)——但读者若只查一侧,会把批次的日期写错一天;本刊把两侧都记下来。 五篇的 arXiv ID、发布日期、分类、作者、comments 字段与摘要全文均取自官方 API;本刊未直读任何 PDF 正文,也未打开 HF Papers 页面、代码仓库或项目页(huggingface.co 本期本机仍不可达,curl 报 SSL connect error,退出码 35,与 #028 至 #030 的记录一致);所有数字均引自摘要原文并归因于作者,摘要中未出现的数字本刊一律不做补充,并在各篇「边界」中逐条标出。

五篇合起来问的,是同一个问题的五个位置:当模型必须靠「看到的东西」做决定时,它到底在看什么。 第 1 篇给出一族统一了界面定位、跨端导航与视觉工具调用的模型,摘要给出的单个数字是 OSWorld-Verified 上的 48.9;第 2 篇把「模型表现出了什么行为」变成一份可构造的规格,并给出因果估计以指出哪个概念在左右行为;第 3 篇在同一件事上给出最刺眼的一组对照——把答案列表里的「拒绝」选项从最后移到最前,六组模型中有三组的拒绝率直接从 78–100% 掉到 0–6%,而基于画面的判断准确率在所有提示变体下都没能超过多数类基线;第 4 篇让感知去听下游的话,用最多 2970 万参数(占 73 亿基座模型的 0.41%)把情境记忆接进感知查询,在 Bench2Drive 闭环上取得 82.47 的 Driving Score;第 5 篇把评测从「整体一致性」拆到「因素级」——7 个任务族、18 项细粒度任务、12,172 条逐案例检查项。

1. MintAct:把界面定位、跨端导航与视觉工具调用收进族模型,OSWorld-Verified 48.9

论文:MintAct: A Unified Visual Agent for Digital Environments(2026-09-18,cs.CV)

资源:HF Papers

作者:Mingfei Gao、Rui Tian、Haiming Gang、Bohan Zhai、Le Zhang、Yuanzheng Gong、Di Feng、Ege Özsoy、Kaixin Ma、Vishwesh Kirthivasan、Oğuzhan Fatih Kar、Roman Bachmann、Anders Boesen Lindbo Larsen、Afshin Dehghan(14 人)

问题。 作者的定位句是:「a family of vision-language models that unifies UI grounding, multi-step navigation across mobile, desktop, and web, and visual tool use, trained at 2B, 4B, and 8B scales.」 ——三件事被摆在同一族模型里:界面元素定位、跨手机/桌面/网页的多步导航、以及视觉工具调用。 它要解决的问题被写成一句对照: 「Through careful design of our environments, data, and training recipes, MintAct models match the performance of per-domain specialists across all of these capabilities.」 ——也就是说,目标是「一个模型顶掉若干个各自专精的小模型」,而不是在单项上刷到最高。

方法亮点。 两件事,环境与训练各一件。① 环境: 「we host hundreds of concurrent instances across heterogeneous per-domain backends, serving both trajectory data collection and online RL.」 ——环境不是一套仿真器,而是跨多个领域专属后端的并行实例群,同时服务于轨迹采集与在线强化学习两条用途。 ② 训练: 「an asynchronous framework keeps explicit control over the cross-domain training distribution and remains stable under noisy environment feedback and off-policy drift.」 ——异步框架显式控制跨域训练分布,并声称在环境反馈嘈杂与 off-policy 偏移下保持稳定。 本刊认为这两句才是这篇的核心: 视觉智能体的难点很少在单点识别,而在「把不同域的轨迹混在一起训」这件事上; 分布式比例怎么定、环境给错答案怎么办,是这类系统的实际失效点,而摘要明确把这两点列为设计对象。

证据。 摘要给出一个数字与一句范围:「MintAct achieves state-of-the-art performance (48.9 on OSWorld-Verified) across a wide range of benchmarks at comparable model sizes.」 ——OSWorld-Verified 上的 48.9 是摘要里唯一的数值;「a wide range of benchmarks」与「comparable model sizes」是范围限定,没有展开。

边界。 本篇的缺口集中在「一个数字要承担太多结论」上: 「48.9 on OSWorld-Verified」是唯一的量化结果,而摘要同时声称覆盖界面定位、跨端导航与视觉工具调用三类能力—— 本刊无法判断 48.9 是这三类的哪一类、也无法判断另外两类各自的表现。 「match the performance of per-domain specialists」是一句对等声明,但摘要没有给出任何被替代的专门模型名单或对比表; 2B/4B/8B 三个规模给出后,摘要未给出任何一个规模上的分项结果,因此读者无法判断规模与能力的对应关系; 「hundreds of concurrent instances」「heterogeneous per-domain backends」没有说明硬件、实例类型与各域数量; 「remains stable under noisy environment feedback and off-policy drift」是稳定性声明,摘要未给出任何稳定性度量(例如训练崩溃率、回报方差或与基线的对照); 摘要未说明数据来源、数据规模、是否含合成轨迹、是否公开权重,也未标注会议或提交场合。 「OSWorld-Verified」这一基线的版本与评测轮数本刊未核验。

我的判断。 这篇最值得记的是它的目标函数写法:不是「在某个基准上超过别人」,而是「用一族模型顶掉一批专精模型」。 这在多模态智能体这个方向上是一个可检验、也可被证伪的主张——只要把所有被替代的专精模型列出来、逐一比较,就能判断它成立与否。 本刊的保留意见是:摘要恰好没有给出这份名单,因此这句主张目前是缺席审判的判决书。 把它与 #030 第 1 篇(VA-Bench 把完整闭环当评测对象)并读,可以看到同一件事的两种做法: VA-Bench 的做法是先定义闭环再测模型,本篇的做法是先把工程(环境与训练分布)做好再报一个总分。 前者能告诉读者「失败发生在哪一步」,后者能告诉读者「一个模型能顶几个」,但两者在本期都还没把最关键的那张表交出来。 给读者的实用建议: 如果你关心的是 UI 或跨端自动化这一类任务,本篇的阅读顺序应当是先看它的环境设计(几百个并发实例+跨域后端),再看 48.9—— 因为在这类系统里,环境与训练分布的工程细节通常比模型结构更能解释最终的差距。

2. DiaVLo:把「一个 VLM 表现出了什么行为」做成可构造的规格,并给出因果估计

论文:DiaVLo: Diagnosing Behaviours of Vision-Language Models(2026-09-18,cs.CL/cs.AI;comment 字段标注「34 pages. To appear in EMNLP 2026 (findings)」)

资源:HF Papers

作者:Lorenzo Corti、Jie Yang(2 人)

问题。 作者把缺口写得很直接:「Vision-language models (VLMs) rely on storing and transferring appropriate information across their sub-components. Verifying that the VLMs exhibit desired behaviours, while avoiding harmful ones, is central to their reliable deployment. Yet, methods that identify VLM behaviours remain scarce.」 ——问题不在「模型答错了」,而在「我们缺少一套能说出模型到底在做什么」的方法。 「rely on storing and transferring appropriate information across their sub-components」这一句把关注点放在子模块之间的信息传递上,即内部而非仅输出。

方法亮点。 摘要给出两个部件与一个使用范围。① 规格构造: 「a diagnostic framework that leverages human curation and VLMs’ generation capabilities to construct specifications of desired and observed VLM behaviours, surfacing potential misalignments.」 ——关键在于两侧同时构造:一侧是「期望行为」,一侧是「观察到的行为」,缺口(misalignment)由两者的差产生,而这个规格不是人工逐条写死的,是人工筛选加上模型生成一起做出来的。 ② 因果定位: 「DiaVLo also provides causal estimates to identify the most influential concepts steering VLM behaviours.」 ——不只指出行为不一致,还给出「哪个概念在左右这个行为」的因果估计。 ③ 使用范围: 「We evaluate DiaVLo on several open-source VLMs under both classification and generation conditions.」 ——分类与生成两种条件都测。

证据。 摘要给出的是三条定性结论,没有数值。 「DiaVLo produces behaviour labels that correlate with model performance and provide context for measured performance.」 ——行为标签与模型性能相关,并且给性能数字提供上下文。 「DiaVLo surfaced behaviours that are clearly aligned and misaligned」 「alongside patterns in how VLMs perceive, organise, and prioritise concepts.」 ——第 ③ 条本刊认为最值得注意:它把结论落在了「感知、组织、排序概念」这三件事上,而不是落在某一类具体错误上。

边界。 本篇是本期五篇里唯一一篇摘要不含任何数字的,而这恰好是最需要数字的一类工作: 「behaviour labels that correlate with model performance」——相关到什么程度、用什么度量、在多少个模型上成立,摘要均未给出; 「several open-source VLMs」没有列名,读者无法判断覆盖的是哪一档模型; 「classification and generation conditions」各自的任务集、样本量与判分方式未说明; 「causal estimates」的方法(是干预、消融,还是基于表征的探针)摘要未交代,而这决定了「因果」二字的强度——本刊在此提醒读者,摘要用词是 causal,但未给方法,摘要在这一点上无法自证; 「human curation」的人力规模、标注者数量与一致性(κ 值一类)未给出; 摘要未说明数据与代码是否公开,也未说明可用于哪些 VLM 家族之外的模型。 另需说明:comment 字段写明这是 EMNLP 2026 findings 论文、共 34 页,但本刊未打开论文正文或附录。

我的判断。 这篇的贡献形态与小节标题里的「诊断」二字是一致的:它不主张某个模型更好,它主张一种能说清「模型在做什么」的程序。 本刊认为它值得记录的理由是它与本期第 3 篇形成了一个方向相反的对子: 第 3 篇通过改变提示的表面形式就推翻了模型的表面行为(拒绝率从 78–100% 掉到 0–6%),说明输出层的指标有多脆弱; 而本篇要做的正是绕过输出层,去构造「期望行为 vs 观察行为」的规格,并试图从内部找到决定行为的那个概念。 如果本篇的方法可靠,它恰好能回答第 3 篇留下的那个问题—— 模型是因为「看懂了这个场景不安全」才拒绝,还是因为「看到了答案列表里『拒绝』这个选项」才拒绝。 保留意见: 上面这个判断是本刊的推理,不是摘要的结论;摘要既没有给出任何数字,也没有说明因果估计的强度,因此读者现在能确认的只有「这套框架存在,并在若干开源 VLM 上被跑过」。 给读者的实用建议: 如果你要复用它,最该先读的是方法节里「规格怎么构造」与「因果估计怎么算」这两部分—— 因为这两步决定了整篇结论是「一份关于模型行为的可复用清单」,还是「一份关于某个提示模板的观察笔记」。

3. 机器人该不该求助:力传感器 0.99 而所有图像方法不超过 0.55,六个开源 VLM 却在看提示的表面

论文:When Should a Failing Robot Ask? Initiating Corrective Human-Robot Dialogue from Audited Sensor Evidence(2026-09-18,cs.RO/cs.AI/cs.HC;comment 字段标注「Accepted at the IROS 2026 Workshop on Human-Robot Dialogue」)

资源:HF Papers

作者:Eshika Pathak、Leela Krishna(2 人)

问题。 作者把「失败之后第一件事该做什么」写成一个三选一:「A robot that fails at a task faces the first decision in corrective dialogue: act on its own diagnosis, consult another onboard sensor, or interrupt a person.」 而这个选择的依据被明确写在两件事上: 「Choosing well requires knowing how much the robot’s sensors reveal about the cause and how reliable the robot’s own diagnosis is.」 ——先知道传感器能揭示多少,再知道自己有多可靠。

方法亮点。 三步。① 一个真值已知的模拟基准: 「We build a simulated benchmark in which every failure’s true cause is known, because we injected it, and measure what each sensor reveals, with explicit checks against data leakage.」 ——故障原因是作者注入的,因此每一条都有真值;同时显式做了数据泄漏检查。 ② 逐传感器的可诊断性: 「Some failures are diagnosable from camera images; others only from the robot’s force data (0.99 from force data, no image method above 0.55).」 ③ 把决策写成最优策略可解的形态,再测模型是否照做: 「We pose the choice as a three-action decision problem, act, consult your own sensors, or ask a human, whose optimal policy follows from measured accuracy.」

证据。 摘要给出的结果分两组,第一组是本篇最有冲击力的一段。① 行为跟着提示的表面走,不跟着证据走: 「Their behavior tracks the surface of the prompt, not the evidence: moving the refusal option from last to first in the answer list collapses refusal rates from 78-100% to 0-6% in three of the six swept model-and-family pairs.」 ② 只给画面时,准确率不高于多数类基线: 「Accuracy from frames stays at or below a majority-class baseline under every prompt variant, with or without worked examples, and stated confidence carries no information about correctness.」 ——注意后半句:模型自己声明的置信度与是否正确无关。 ③ 缺的是数据,不是能力: 「Handing the same models the force data as ten lines of text produces the first above-baseline diagnoses, in four of the six models: much of the failure reflects missing sensor data, not missing ability.」 ④ 不按成本行事: 「The models do not follow it, and their ask rates ignore a fourfold change in question cost.」 ⑤ 但问一次人就够了: 「One question to a human still lifts them from that baseline to roughly the answerer’s own reliability (0.70-0.81 when they ask).」 ⑥ 作者的结论句: 「The decision to ask should be tied to measured accuracy and stated costs, not to the model’s confidence.」

边界。 本篇的方法学是它最强的地方,也是它边界最需要看清的地方: 首先,这是模拟基准,真值来自作者注入,因此 0.99 与「no image method above 0.55」衡量的是「在该模拟器里,某类传感器信号对某类已注入故障的可判别性」,不等于真机上同样成立;摘要未给出模拟器名称、故障类别数量、样本量与泄漏检查的具体做法。 其次,模型一侧的关键数字都带分母: 「in three of the six swept model-and-family pairs」—— 六个配对里只有三组出现拒绝率崩塌,另外三组的名字、行为与原因摘要均未给出,而这恰恰是最该被追问的一半; 「in four of the six models」同理。 第三,摘要未给出「多数类基线」的具体数值,因此读者无法判断 baseline 是高是低; 「stated confidence carries no information about correctness」没有给任何相关性度量(例如是否做了校准曲线或相关系数)。 第四,六个开源 VLM 都没有列名,也没有给参数规模; 「one question to a human」那一组的 0.70–0.81 是「人类回答者的可靠度」还是「模型在获得一次提问后的表现」,摘要的措辞是前者(the answerer’s own reliability),但整句的表达容易读成后者——本刊照录原文,不替它做统一。 第五,这是 IROS 2026 workshop 论文,不是主会论文,篇幅与审稿强度本刊未核验(本刊未打开正文)。 最后,「question cost」被改变四倍而提问率不变,摘要未说明这个成本是人工设定还是从系统里测量的。

我的判断。 本期五篇里,这一篇的可核对性最高,破坏性也最大。 「把答案列表里的拒绝项从最后挪到最前,拒绝率从 78–100% 掉到 0–6%」是一句可以被任何人复现的实验描述—— 它不依赖任何新模型或新数据,只依赖一次格式变更; 而它一旦成立,就意味着所有以「拒绝率」为指标的视觉—语言系统评测都在测排序,而不是在测判断。 这与本刊在本期日报 #031 第 1 条里记录的机器人安全基准(RoboHarm)落在同一处: 那一条里,最有效的一道防线(Claude Fable 5.1 的 20 次拒绝)全部集中在一句特定措辞的指令上,另外四类任务合计只有 1 次拒绝; 这一条给出的机制解释可能正是同一个: 行为与措辞绑定,而不是与危害绑定。 第二条值得带走的是一条对本刊自己的工作也适用的方法学提醒: 「stated confidence carries no information about correctness」—— 如果一个系统给出的置信度与正确性无关,那么任何以「高置信度」为理由放行的自动化流程都缺少依据。 第三条是本篇最有建设性的一处: 把力传感器数据以「十行文本」的形式交给同一批模型,六个模型里有四个第一次超过基线。 「much of the failure reflects missing sensor data, not missing ability」这句话把问题从「模型不够好」挪到了「我们没给它看该看的东西」,而后者是一个工程问题,不是训练问题。 给读者的实用建议: 如果你在做任何「模型决定该不该拒绝/该不该升级给人」的评测,本篇给出的最小改动是—— 把选项顺序做一次置换,再跑一遍。 如果结果变化比你的改进幅度大,那么你测的是排序,不是判断。

4. PRIME:让感知去听下游的话,用 0.41% 的参数把情境记忆接进感知查询

论文:PRIME: Perception Feedback with Situational Memory Embeddings in VLA Models(2026-09-18,cs.CV/cs.RO)

资源:HF Papers

作者:Erik Deinzer、Naya Baslan、Luca Paparusso、Narunas Vaskevicius、Peter Knott、Luigi Palmieri(6 人)

问题。 作者的诊断是「感知对下游目标无知」:「Current Vision-Language-Action (VLA) models for autonomous driving operate primarily through feedforward inference across the perception–reasoning–planning hierarchy. While modern architectures maintain temporal recurrence within the perceptual module, early perception remains blind to downstream reasoning and navigation goals, processing visual inputs agnostically without prioritizing cues informed by prior decisions.」 ——要点有两个:这条流水线是前馈的;感知模块内部虽然有时间递归,但它看不到后面的推理与导航目标,因此「一视同仁」地处理输入,不会优先看与先前决策相关的线索。

方法亮点。 摘要给出一个部件与其成本。① 机制: 「a learned feedback mechanism that conditions the VLA perceptual queries on a novel Situational Memory.」 ——把感知侧的 query 用情境记忆来条件化,方向是从下游往回给感知加约束。 ② 情境记忆的构成与范围: 「By aggregating latent representations of past perception, reasoning, navigation goals, and predicted behaviors across an L-step window via cross-attention」 ——四类潜表示(过去的感知、推理、导航目标、预测行为)在一个 L 步窗口上经 cross-attention 聚合。 ③ 成本: 「adding only a maximum of 29.7M parameters (0.41% of the 7.3B-parameter base model)」 ——最多 2970 万参数,占 73 亿参数基座模型的 0.41%。 本刊认为「a maximum of」这个限定词值得留意:它暗示不同配置下附加参数量不同,而摘要未说明上限出现在什么条件下。

证据。 摘要给出两组闭环结果与一句范围声明:「Evaluated on the Bench2Drive closed-loop benchmark, PRIME achieves a state-of-the-art Driving Score of 82.47 (+4.73 over ORION) and a Success Rate of 60.00% (+5.38 percentage points), the highest reported Driving Score among published VLAs trained on Think2Drive demonstrations.」 ——Driving Score 82.47(比 ORION 高 4.73)、成功率 60.00%(提高 5.38 个百分点);最后一句是作者对比较范围的自我限定。

边界。 本篇的结构清晰,缺口也相对集中: 首先,所有结果只来自一个基准(Bench2Drive),且基座是 73 亿参数的 VLA,摘要未说明该基座是否开源、是否只有这一个基座被验证—— 因此「这个机制是否与基座绑定」无法判断。 其次,那条自我限定句必须完整读: 「the highest reported Driving Score among published VLAs trained on Think2Drive demonstrations」—— 它限定的是「在 Think2Drive 示范上训练过的已发表 VLA」这一子集,读者不应把它读成「所有 VLA 中最高」。 第三,「L-step window」中的 L 是多少、是否做了 L 的消融,摘要未给出; 「predicted behaviors」从何而来(是规划器输出还是单独预测头)也未说明。 第四,0.41% 这个比例衡量的是参数占用,而不是运行代价: 摘要没有给出推理延迟、帧率、显存或训练开销的变化,而「把下游信息回灌给感知」在实时驾驶场景里正是最容易被延迟惩罚的一类改动。 第五,摘要未给出任何安全或舒适性指标(碰撞率、急刹、越界),也未给出失败案例。 最后,「state-of-the-art」与 ORION 的比较细节(是否同基座、同训练数据、同评测轮数)摘要未交代。

我的判断。 这篇最有价值的一句不是 82.47,而是那个 0.41%。 在感知—推理—规划这条链上,「让前面知道后面想要什么」在直觉上是对的,但过去的做法通常要改架构或加大模型; 本篇给出的做法是用一个附加模块、在最大 2970 万参数的预算内把四类下游信息一起回灌,并且只在闭环基准上验证—— 如果这个代价是真的,那么它把一个架构问题变成了一个可插拔的模块问题,这比分数更重要。 保留意见: 我认为这一篇目前最需要的是延迟数据。 闭环驾驶评测是逐步执行的,任何把反馈回路加长的设计都会改变时序行为; 摘要给出了参数比例,却没有给出时间成本,而在这个领域里,时间成本往往直接改写结论。 把它与本期第 1 篇并读也很清楚: 第 1 篇的规模是 2B/4B/8B 的族模型,参数是它的核心变量; 本篇的附加代价被压到 0.41%,参数几乎不是变量,机制才是。 给读者的实用建议: 如果你在做具身或驾驶一类的前馈式流水线,本篇提供的最小改动是在感知与推理之间加一路「目标条件化」—— 先不要改主干,只加一个把导航目标与上一轮推理接进感知 query 的模块,再看闭环指标与延迟同时怎么变。 两个数一起看,才算读完了这篇。

5. OmniVBench:把参考到视频的评测从「整体一致性」拆到 7 个任务族与 12,172 条检查项

论文:OmniVBench: A Benchmark and Large-Scale Dataset for Omni Reference-to-Video Generation(2026-09-18,cs.CV)

资源:HF Papers

作者:Wenxue Li、Peiyan Guan、Haoyang Jiang、Junxian Cai、Hualuo Liu、Chunjie Zhang、Chong Guan、Kai Huang、Songlian Li、Taiyi Wu、Yongjian Yu、Xiaotong Zhao、Alan Zhao、Eric Liu、Xi Chen、Yu Liu、Lei Zhu(17 人)

问题。 摘要用两句把缺口讲清楚。① 评测覆盖不足: 「their test cases cover limited reference types and compositions, and their evaluation protocols largely assess holistic reference consistency, overlooking whether reference factors are properly preserved, disentangled, and routed.」 ——三个动词是这篇的骨架:保真(preserved)、解耦(disentangled)、路由(routed); 既有评测只看「整体一致性」,因此无法回答「参考里的某个因素有没有被正确地拆开并送到该去的地方」。 ② 训练数据稀缺: 「the high cost of constructing omni R2V training data makes suitable training resources scarce.」

方法亮点。 三件事,评测、数据、构造方法各一件。① 评测: 「OmniVBench expands R2V evaluation across broader reference types, fine-grained control tasks, and richer reference compositions, covering 7 task families and 18 fine-grained tasks spanning content, motion, style, structure, narrative, and multi-reference settings.」 ② 因素级判分: 「We introduce factor-grounded evaluation with 12,172 case-specific checklist items, assessing whether intended reference factors are faithfully preserved, correctly disentangled and bound to their targets, and properly realized according to the instruction.」 ——每个案例有自己的检查项,检查的正是「保真、解耦并绑定到目标、按指令实现」这三步。 ③ 数据: 「the Omni-R2V Dataset … comprises 340K processed training samples spanning diverse reference types and multi-reference compositions」来源为「a large-scale corpus of professional video footage」, 并配了「task-specific pipelines for reference-target pair construction」。 摘要把这批数据定位为 「industrial-grade training resources」——本刊提醒:「industrial-grade」是摘要原文的用词,属发布方描述,不是可核验的属性。

证据。 摘要给出的是结论而非分数:「Extensive evaluation of advanced open- and closed-source R2V models reveals clear performance gaps across task families and evaluation dimensions on OmniVBench, highlighting remaining limitations of current R2V models.」 ——能确认的是「存在明显差距」,未被给出的是差距有多大、在哪些模型之间、以及在哪个维度上最大。

边界。 本篇的缺口全部集中在「它没有报分」这一点上,而这是一篇基准论文最关键的留白: 首先,摘要未给出任何一个模型在 OmniVBench 上的分数,也没有列出被评测的开放与闭源模型名单—— 因此读者无法判断这个基准的区分度是「已有模型都不行」,还是「已有模型都差不多」; 对基准类工作而言,这两种结论的意义完全不同。 其次,12,172 条「case-specific checklist items」的产出方式(人工撰写、模型生成、还是混合)摘要未说明,而这直接决定这些检查项本身的可靠性。 第三,7 个任务族与 18 项细粒度任务之间如何对应、每族题目数量与配比摘要未给出。 第四,340K 样本的构建流程只说了「task-specific pipelines for reference-target pair construction」,未说明素材授权、隐私处理与是否可复现; 数据是否公开、以何种许可公开,摘要未提。 第五,评测协议的具体指标(是否含自动指标与人工评分的组合、各自权重)未给出。 最后,17 位作者的机构信息本刊未核验;摘要未标注会议或提交场合,也未提及与既有 R2V 基准(如摘要中提到的「existing benchmarks」)的定量对照。 另需说明:本刊本机无法访问 huggingface.co,因此未确认 Omni-R2V Dataset 是否已在该平台发布。

我的判断。 这一篇应当被当作一份「接口提案」来读,而不是一份排行榜。 它真正的主张是:参考到视频的评测不该只看整体一致性,而应把参考拆成可命名的因素,逐个检查它是否被保真、是否被解耦、是否被送对了地方。 把评测改成这个形状之后,「模型能生成一个长得像参考的视频」与「模型知道参考里的哪一部分该出现在画面里的哪个位置」就变成了两个可以分别打分的量。 本刊认为这个拆分是必要的,理由与本刊在 #030 第 1 篇记录过的 VA-Bench 同源: 当一个任务的能力由多个环节串成时,只报一个总分,等于放弃告诉读者失败发生在哪一环。 保留意见: 这一篇目前没有任何数字,所以它对本刊来说是一条方向明确的线索,而不是一个可引用的结论。 在作者把模型分数表放出来之前,读者能确认的只有三组规模(7 族/18 项任务、12,172 条检查项、340K 样本)与一个方法思路。 给读者的实用建议: 如果你在做视频生成或编辑类系统的内部评测,本篇最可即用的部分不是它的数据集,而是那三个动词。 把「保真/解耦/路由」作为三栏,把你现有的评测案例逐个过一遍,看看有多少案例其实只能填第一栏—— 这个自检不需要它的数据,也不需要它的代码。

今日阅读线索

一句话:本期五篇合起来,是「视觉条件」这件事被放在五个不同位置上的检查报告——模型侧的统一(第 1 篇)、行为侧的诊断(第 2 篇)、决策侧的替换实验(第 3 篇)、感知侧的回路(第 4 篇)、评测侧的拆分(第 5 篇)。

三条线索值得带走。

其一,第 3 篇与第 2 篇要为同一个现象负责,而它们各自只说了一半。 第 3 篇给出了一个几乎不需要复现成本的观测—— 把答案列表里的「拒绝」项从最后移到最前,六组模型中有三组的拒绝率从 78–100% 掉到 0–6%; 同时,基于画面的判断在每一种提示变体下都没有超过多数类基线,模型自己给出的置信度与正确性无关。 而第 2 篇要做的正是把「期望行为与实际行为」的差构造成规格,并指出哪个概念在左右行为。 两者的组合关系很清楚: 第 3 篇说明输出层的观测不可靠,第 2 篇提供了一条绕过输出层的路径。 但两者在本期都没有给出足够数字让这条路径被检验(第 3 篇缺另一半模型的明细,第 2 篇缺全部数字),因此读者现在能带走的是一条明确的分工,而不是一个结论。 本刊的保留意见: 第 3 篇的实验对象是模拟器中的注入故障与六个未列名的开源 VLM,第 2 篇的因果估计方法摘要未交代;两者都还不能支撑「视觉模型不懂安全」这类一般性论断。

其二,第 1、4、5 篇分别给出三组「规模」,而它们衡量的是三件不同的事。 第 1 篇是模型规模(2B/4B/8B)与一个总分(OSWorld-Verified 48.9); 第 4 篇是附加代价(最多 29.7M 参数,占 7.3B 基座的 0.41%)与两组闭环指标(Driving Score 82.47、成功率 60.00%); 第 5 篇是数据与评测的规模(7 族/18 项任务、12,172 条检查项、340K 训练样本)——而它没有分数。 本刊的判断是:这三篇的可引用程度与其「规模」成反比。 第 4 篇的边界最清楚(一个基准、一个基座、一句自我限定的最高分),因此它的数字最容易被正确引用; 第 1 篇只有一个数字要撑三类能力,因此它最容易被过度引用; 第 5 篇只给规模不给分,因此它目前只能被引用为方法。

其三,一条跨过本刊两期工作的线索:拒绝行为与危害本身可能是脱钩的,而这件事在两个领域里同时被观测到。 在本期日报 #031 第 1 条里,RoboHarm 的官方页写明: Anthropic 的 Claude Fable 5.1 在 100 次试验中拒绝 20 次,而这 20 次全部落在「用刀刺向唯一不是面包的东西」这一条指令上,另外四类任务合计只有 1 次拒绝; 而本期第 3 篇给出的机制解释是「行为跟着提示的表面走,不跟着证据走」。 一个是真机上的 300 次试验,一个是模拟器里的提示置换; 两者的样本、任务与测量方式完全不同,本刊不把它们当作互相印证,只把它们当作同一方向的两次独立观测记录下来。 读者的实用含义是一致的: 任何以「拒绝率」或「安全率」为指标的系统验收,都需要额外做一次形式置换的对照,否则无法区分「它判断出这件事有危害」与「它认出了这句话」。

最后说明本期未收录的几篇同批论文及其取舍理由,供读者自行查阅。 同一批(published 为 2026-09-18)中还有若干本刊读到摘要但未写成条目的工作,其中与 VLM 或视觉—语言相关的包括:2609.22085(SeeQ,为长程机器人操作学习分段的 Q 函数,cs.RO)、2609.21948(GALA,几何感知的潜在动作建模,面向跨本体 VLA 预训练,cs.RO/cs.CV)、2609.21908(CommitFlow,长程 VLA 执行的语义承诺校验与局部纠正,cs.RO)、2609.21879(把开源权重 VLM 在人脸识别中的解释质量作为评测轴,cs.CV)、2609.22043(面向 LLM Agent 的零参数记忆决策控制器,cs.CL)。 本刊本期选择第 1 至第 5 篇,是因为它们合起来覆盖了「统一能力/行为诊断/决策替换/感知回路/评测拆分」五个互不重复的位置;上述五篇本刊读到的是摘要,未读正文,因此不做推荐性描述,只列出编号与一句话方向,published 与分类均可由读者自行核对。


本刊注:本期覆盖 arXiv 最新可检索批次——按 API 的 published 字段为 2026-09-18,按 arxiv.org/list/ 的日期页头为「Mon, 21 Sep 2026」,两者为公告日与提交时间戳的差异,已在文首说明。 核验路径:五篇的 ID、日期、分类、作者、comment 字段与摘要全文取自 export.arxiv.org/api/query(HTTP 200,三路均未出现 429);索引状态由三路各取最新 80 条、两组区间探测([202609160000 TO 202609170000][202609170000 TO 202609180000][202609180000 TO 202609190000][202609190000 TO 202609240000])与三个列表页的日期页头共同核对。 本刊未直读任何一篇的 PDF 或正文,未打开 HF Papers 页面(huggingface.co 本机 curl 报 SSL connect error,退出码 35,与 #028 至 #030 记录一致)、未打开任何代码仓库或项目页。 所有数字均引自摘要原文并归因于作者;摘要中未出现的数字,本刊一律不做补充,已在各篇「边界」中逐条标出。 第 1 篇的 48.9、第 3 篇的 0.99/0.55/78–100%/0–6%/0.70–0.81、第 4 篇的 82.47/+4.73/60.00%/+5.38 个百分点/29.7M/0.41%/7.3B、第 5 篇的 7/18/12,172/340K 均为摘要原文数字;第 2 篇摘要不含数字,本篇因此不含其任何量化结论。*