本期覆盖 arXiv 当前可检索的最新公告批次:发布日期 2026-09-10,编号段约 2609.11477–2609.11929——经 export.arxiv.org/api/query 直查核验(cat:cs.CV、cat:cs.CL、cat:cs.AI 三路分别 sortBy=submittedDate 倒序),截至本期发布时,三条分类路径返回的最新条目日期均为 2026-09-10,未出现 09-11 及之后的新批次(arXiv 周末不公告,与 #017–#020 记录一致)。下列五篇的 arXiv ID、发布日期、分类与摘要全文均取自官方 Atom feed 原文,本刊未直读 PDF 正文;所有数字均引自摘要原文并归因于作者,摘要中未出现的数字本刊不做补充。
五篇合起来是本期的两条线索加一个追问。线索一「世界=程序,控制=接口」(Recursive Code World Models、World in World):两篇都在回答**「怎么把复杂世界的构建与控制,从模型权重里拿出来,变成显式、可检查的结构」——前者把 3D 世界写成递归的场景代码**,后者把相机控制与重访变成免训练的证据路由接口;都不靠增加容量,都靠重写中间表示或接口。线索二「统一的账本」(SenseNova-U1.5、OmniKVQuant):一篇主张原生统一(一个模型内理解、推理并生成),另一篇则指出统一之后存储与推理的账必须算清楚——两者恰好是同一个赌注的两面。最后追问「空间理解到底该测什么」(MindTopo):把评测从度量关系推进到拓扑关系。本期整体气质与日报 #021 的暗线一致——瓶颈在接口、成本与度量,而不在参数量。
1. Recursive Code World Models:把复杂 3D 世界写成递归的场景程序——一张参考图,全局–局部–全局地递归重建
论文:Recursive Code World Models: Building Complex Worlds through Recursive Scene Programs(2026-09-10,cs.CV)
资源:HF Papers
问题。 代码世界模型(code world models)把世界表示为可执行程序,但作者指出一个此前被跳过的问题:「这个表示本身并不能决定如何构造一个复杂世界」。也就是说,把世界写成代码这件事已经有人做了,但没有回答「复杂世界该怎么被逐步搭起来」——单一层级的代码生成在复杂场景里会遇到全局结构与局部细节互相牵制的矛盾。
方法亮点。 RCWM(Recursive Code World Models),一个从单张参考图像出发、在代码中重建复杂 3D 世界的框架。它把两样东西耦合起来:递归场景程序(Recursive Scene Program,RSP)这种表示,以及一个递归调用自身的构造求解器(construction solver)。RSP 把可执行世界表示为组合式的场景代码;而每一次求解器调用都遵循同一套完整流程:先确立整体(establish the whole)→ 递归重建未解决的部分 → 回访整体以精修它们的组合关系。作者称这种**「全局–局部–全局」的递归让细尺度结构拥有自己的感知与编辑回路,同时保留场景级几何与关系**。具体机制上:参考对齐视图在每一层级之间传播共享的相机投影;父级回访(parent revisitation)处理局部精修之后才浮现的边界、空间关系与共享误差。一个视觉–语言编码 agent(vision-language coding agent)直接对比参考图像与场景渲染结果,来指导精修、递归下探与返回。
证据。 摘要为定性陈述(作者口径):「在复杂场景上,RCWM 优于此前的基于代码的图像到场景重建方法」;消融研究支持递归构造带来的收益,并提示更深的调用可以改善更细尺度的重建。摘要未给出任何量化数字(无指标名、无数据集名、无对比表格),也未说明评测场景的数量与来源。
边界。 全程无数字是最大短板:「优于此前方法」在什么指标(渲染质量、几何精度、代码可执行性?)、什么场景集上成立,均未披露;递归深度与计算成本的取舍未讨论——既然消融说「更深的调用改善细尺度」,那么深度上界是什么、成本如何增长是这套方法的实用生死线,摘要回避了;「构造求解器」与「视觉–语言编码 agent」的组合意味着大量模型调用,其延迟与 token 成本未量化;RSP 的表达力边界未展开——代码能描述几何与空间关系,但对材质、光照、可变形物体的覆盖能力不明;依赖「参考对齐视图」意味着单一视角参考图的覆盖盲区(背面、遮挡区域)如何被填上未说明;代码的确定性 vs 渲染的观感之间如何权衡(大量论文的落点)也未讨论。
我的判断。 这篇是本期概念密度最高的一篇,也是它与上一期「Programmable World Model」形成同一条技术路线的正式延续——#020 那篇把世界状态的演化写成可执行程序,这一篇把世界本身的构造过程写成递归程序。两篇合读,可以看清这条路线的方法论内核:承认生成模型不可靠地隐式学到结构与物理,于是把结构显式建出来,让模型只负责「看」与「改」。RCWM 相对前者的推进在于承认「构造」本身是一个需要递归控制的问题——全局与局部互相牵制的场景不可能一次生成,必须分层、可回访、可回退,这个观察在软件工程与程序合成里是常识,但把它搬到 3D 世界重建上是新的。我最看重的设计是**「父级回访」:它显式处理「局部修改破坏全局一致性」这一失败模式,而绝大多数一次性生成方法对此无能为力。保留意见:无数字、无成本、无表达力边界,说明这篇目前仍是方法论提案**;「递归构造能否稳定收敛」以及「代码表征能否覆盖真实世界的材质与光照」,是它从流程框架变成可用工具的两道关。
2. World in World:用免训练推理期接口控制世界模型——把异构控制证据变成带相机与时间标签的「干净视觉状态」,再读出冻结视频模型的原生自注意力
论文:World in World: Explore the World with World Models(2026-09-10,cs.CV)
资源:HF Papers
问题。 自回归视频世界模型已支持交互式、长时程探索,但灵活控制仍然困难。作者把「从新视角探索一段源视频」拆成四项必须同时满足的要求:生成的开卷(rollout)要与录下的事件保持同步、要把观测到的内容放到被请求的视角里、要合理地补全新暴露的区域、并且在重访时要恢复此前生成过的外观。作者指出,已有方法通常靠任务专属模块或额外训练来处理这些要求——即每加一种控制就需要一次训练。
方法亮点。 World in World,一个免训练(training-free)的推理期接口:它把异构的控制证据(heterogeneous control evidence)转换成带相机标签与时间标签的干净视觉状态(camera- and time-labelled clean visual states),然后通过一个冻结的因果视频模型的原生自注意力(native self attention)去读取这些状态。证据包含四类:源视频观测、目标视角的场景投影、用于引导新暴露主体区域补全的几何渲染、以及从滚动缓存之外检索回来的已生成状态;每一种证据源都携带 token 级的支持度(token-level support)与自己的可用时间表(availability schedule)。为了让证据真正落到对的 token 上,作者设计了一个对应路由器(correspondence router):把持久点身份(persistent point identities)与几何结合,建立 token 对应关系,引导「有支持的查询」朝向匹配的源视频 token;随后用证据级注意力 CFG(Evidence-wise attention CFG,EWA),在同一次去噪前向过程中,用注意力响应分别调节每一条辅助通道的额外贡献。作者强调这套共享接口用同一个冻结骨干支持相机控制的重渲染、长时程重访与人体动作迁移三类任务。
证据。 摘要为定性陈述(作者口径):「我们在多样视角变化下的相机控制视频重渲染上评测 World in World,评估感知质量、时间一致性与相机跟随精度」。摘要未给出任何具体数值,也未说明所用视频模型、数据集规模或与基线的对比表。
边界。 同样无任何数字:「评估感知质量、时间一致性与相机跟随精度」只说明了评测维度,没有结果;「免训练」不等于「无成本」——四类证据源中包含几何渲染与跨缓存检索,这些模块的依赖(是否需要场景几何、是否需要相机轨迹、是否需要额外重建)与推理开销未说明;「原生自注意力」这一通路依赖具体视频模型的架构,摘要未说明对哪些模型适用、换模型是否仍成立,这意味着该接口的可移植性可能比表述更窄;证据的可用时间表如何设定(是否需要人工指定)、token 级支持度如何估计均未展开;四类证据的取舍在什么条件下会失败(例如源视频遮挡严重、目标视角远离原轨迹)未讨论;长时程重访的「一致性」如何度量、能维持多久未给证据;人体动作迁移仅被列为支持任务,未给任何结果。
我的判断。 这篇与第 1 篇是同一个思想的两种应用,也延续了 #020 中 Show-Harness 的路线:不动模型权重,只设计一层「模型天生会读」的中间表示,把控制问题变成路由问题。它最聪明的两点是:① 把「控制证据」统一成「带标签的干净状态」(不管证据来自源视频、投影还是渲染,先归一到同一形式再喂给注意力),② 用同一次前向的注意力响应来自适应调节各证据通道的权重(EWA)——后者本质上把 CFG 从「提示词强度」扩展成了「每类证据的强度」,这在概念上比逐任务加模块干净得多。「免训练」的价值主张也很明确:如果控制真的只需要接口,那么世界模型的能力升级可以自动继承,不必每换一个控制类型重训一遍。保留意见:这篇的证据强度目前是最弱的(无数字),而它依赖的三个外部件——几何渲染、跨缓存检索、以及「冻结骨干」对自注意力的可读性——恰好是最容易在真实场景里失效的部分;特别是当源视频没有可靠几何时,这套证据结构会退化成普通的条件生成。判断上我倾向于把它读作「接口设计的方向是对的,但证据还不足以证明它稳」。
3. SenseNova-U1.5:8B-MoT 原生统一多模态——无编码器、无 VAE,理解与生成同框,最高 4K 原生分辨率
论文:SenseNova-U1.5: Towards Native Unified Visual Intelligence(2026-09-10,cs.CV)
资源:HF Papers
问题。 「统一多模态」的路线分歧长期集中在架构选择上:多数系统仍由独立的视觉编码器 / VAE 加生成模块拼装,理解与生成各自持有表示;原生统一(native unified)主张在同一个模型内完成理解、推理与生成,但代价是视觉界面与训练数据的组织都要重做。这篇给出的是一次工程化的正面回答,并顺带提出一个更大的假设:多模态理解能力可以迁移到视觉规划与创作。
方法亮点。 SenseNova-U1.5,一个 8B-MoT 的原生统一多模态模型,其最鲜明的架构选择是 encoder-free 与 VAE-free——不带独立视觉编码器、也不带 VAE。作者做了三处关键工作:① 通过空间一致的 patch 重建(spatially coherent patch reconstruction)强化视觉界面;② 扩大训练规模,并配以精心构造的生成与编辑数据、改进的任务形式化(task formulation)、结构化提示增强(structural prompt enhancement)、以及最高 4K 的原生分辨率;③ 后训练阶段为视觉美学、双语文字渲染、信息图生成与图像编辑分别优化专家,再用**多专家 on-policy 蒸馏(multi-expert on-policy distillation)**把各专家能力合并回一个模型。
证据。 摘要为定性陈述(作者口径):「在大量评测中,SenseNova-U1.5 在图像保真度、文字渲染、复杂构图、多参考编辑与交错生成(interleaved generation)上大幅推进,同时改善指令遵循,并保持主体身份、几何与未修改区域」;作者还报告一个耐人寻味的泛化现象:「尽管其生成数据中结构化格式的暴露有限,SenseNova-U1.5 仍能有效泛化到长、复杂、结构化的视觉指令」,并据此认为多模态理解能迁移到视觉规划与创作。摘要未给出任何具体分数与基准名;作者承诺将开源训练代码,包括监督微调、强化学习与 on-policy 蒸馏。
边界。 无任何量化数字:所有「大幅推进」「改善」都缺基准与分差,「8B-MoT」也未解释 MoT 的具体含义与专家数;数据规模与 4K 原生分辨率的训练成本均未披露——这是判断该路线是否可复现的核心;「encoder-free / VAE-free」的代价未讨论:去掉编码器通常意味着模型必须自己学出视觉表示,那么理解侧的细粒度任务(OCR、小目标、密集文本)是否因此受损没有被回答;多专家 on-policy 蒸馏的合并是否带来能力回退(组合多个专家时常见的现象)未给证据;「理解可迁移到视觉规划」这一结论建立在单一模型的观感之上,缺对照实验(例如与同规模拼接式架构直接对比);开源承诺未给出仓库地址与许可证;4K 生成的实际延迟、显存需求与计价未提及。
我的判断。 这篇的看点不在成绩(没有数字),而在它把「原生统一」这条路线推进到了完整的工程栈:encoder-free + VAE-free + 4K 原生 + 多专家 on-policy 蒸馏 + 承诺开源训练代码——尤其最后一项,意味着这条路线很快会从「大厂内部结论」变成可被别人复现或证伪的公开方案,这比任何一次榜单成绩都更有信息量。作者那句「生成数据中结构化格式暴露有限,却能泛化到复杂结构化指令」如果经得起检验,则是一条真正的机制性主张:统一模型的理解侧确实在给生成侧提供归纳偏置——这是统一路线相对拼接路线的核心赌注,也是它的最强卖点。保留意见:摘要是典型的「无数字、全形容词」写法,且「首个/大幅推进」类表述在统一模型这个已经被反复宣称的赛道上尤其需要折扣。对读者的实用建议:等开源代码与权重,再验证两件事——理解侧有没有为了生成而退化,以及4K 原生分辨率在真实部署成本上是否可接受。这两点决定它是「路线验证」还是「又一次展示」。
4. OmniKVQuant:给 Omni-LLM 的 KV 缓存做 2-bit 量化——指出「时间键漂移」与「异构值几何」两个问题,免训练修复并给出融合 Triton 解码核
论文:OmniKVQuant: KV Cache Quantization for Omni-LLMs(2026-09-10,cs.CV)
问题。 当 Omni 模态大模型同时接收音频、视频与文本时,KV 缓存的显存开销随之增长。作者指出:KV 缓存量化在纯文本 LLM 里已是事实标准,但在 Omni-LLM 上尚未被探索。这篇文章要回答的是为什么不能直接照搬。
方法亮点。 作者先做诊断:分析一种代表性的基于旋转(rotation-based)的 KV 缓存量化方法 TurboQuant 在多模态缓存上的行为,识别出两个关键问题——「时间键漂移(temporal key drift)」与「异构值几何(heterogeneous value geometry)」。针对这两点,提出 OmniKVQuant,一个免训练(training-free)框架,包含两项修正:① 把键(key)的量化范围设置为输入流的每一个短窗口(short window)内——以对应时间键漂移;② 对值(value)按模态分别做旋转——以对应值几何的异构性。工程上,作者进一步给出一个融合的 Triton 解码核(fused Triton decode kernel),在注意力计算过程中即时解包 2-bit 缓存,从而「永远不会构建稠密的 FP16 缓存」。
证据。 摘要给出的量化声明(作者口径):「在 Qwen2.5-Omni 与 Qwen3-Omni 上,OmniKVQuant 支持 2-bit KV 缓存,同时在七个音视频基准上大幅保持性能(substantially preserving performance across seven audio-visual benchmarks)」。摘要未给出任何具体分数、内存节省比例或吞吐提升数字,也未列出具名基准。
边界。 无数字:「大幅保持性能」没有给出每 bit 数下的精度损失曲线,而量化类工作最有价值的信息恰是这条曲线(2-bit 掉了多少?3-bit 呢?);只测了两个模型家族(Qwen2.5-Omni / Qwen3-Omni),结论对其他 Omni 架构的可迁移性未知;「短窗口」的窗口长度如何选取、是否需按模态调参未说明——免训练框架若仍需人工调窗口,其便利性会打折;实际的显存节省与端到端吞吐提升未给出(融合核的收益通常与序列长度、batch 配置强相关);音视频基准的构成未列出,无法判断是否覆盖了长视频这类最吃缓存的场景;未讨论量化对生成任务的副作用(Omni 模型同时做音频/视频生成时,缓存的误差会如何传导);代码已给出但本刊未核验其可用性。
我的判断。 这篇的价值在它把「统一模型」这条路线里最容易被忽略的一笔账摆了出来:接受音频 + 视频 + 文本三种模态,意味着缓存必须同时承载三种时间尺度与三种分布——而这正是第 3 篇(SenseNova-U1.5)那类原生统一模型在部署端的第一道现实约束。两篇合读构成本期的「统一账本」:一篇负责把统一做到架构里,一篇负责让统一跑得起来。方法上我最认的一点是**「先诊断再修」的结构**:明确指出 TurboQuant 的两个失效机制(时间键漂移、异构值几何),这比直接报一个更好的量化精度更有信息量,也解释了为什么文本 LLM 的成熟组件不能无脑移植到多模态。保留意见:无精度曲线、无内存与延迟数字,说明这篇目前只能证明「方向可行」;而 Omni 类模型本身仍在快速迭代,针对具体架构的诊断结论可能随架构变化而失效——这既是这类工作的风险,也是它必须持续跟进的证据。
5. MindTopo:把空间推理的评测从「度量关系」推进到「拓扑关系」——11,030 个实例、五种拓扑性质、推理与规划两个认知层级,所有 MLLM 在规划上都弱于推理
论文:MindTopo: Can Foundation Models Reason in Topological Space?(2026-09-10,cs.AI/cs.CL/cs.CV)
问题。 作者指出现有评测的一个盲区:空间推理不只依赖距离、角度、形状这类度量属性,还依赖在连续形变下保持不变的拓扑关系,而认知科学把这类关系认定为空间理解的基础,但基础模型的评测大多集中在度量或视角相关的关系上。换句话说:模型能不能认出「一个物体在另一个里面」「两个物体是否连通」,这类最基础的空间直觉,几乎没被系统测过。
方法亮点。 MindTopo,一个基于认知科学与形式拓扑的拓扑直觉基准,覆盖五种性质:连通性(continuity)、分离(separation)、次序(order)、包含(enclosure)与纽结(knots)。设计上它有两个关键区分:① 每一种性质都在两个认知层级上评测——推理(reasoning)要求模型识别拓扑关系或推断其如何变化;规划(planning)则把一个基础模型实例化为闭环 agent,由其策略选择环境动作;② 规模与可控性——共 11,030 个实例,跨 13 类程序化生成的任务类型,难度可控。作者评测了 14 个 MLLM,并研究了用图像与视频生成来增强的 agent 配置,包括在规划设定中引入 3 个视频生成模型。
证据。 摘要给出的核心发现(作者口径):① 每一个 MLLM 在推理上的表现都优于规划;② 表现最好的模型仍远低于观察到的「人类水平」;③ 在 Qwen3-VL-2B-Instruct 上,监督微调与强化学习对推理的提升大于对规划的提升;④ 关于用生成模型当世界模拟器:生成的观测能保留局部线索并到达看似合理的终点,但经审计的开卷(audited rollouts)不能可靠地遵循环境动力学,也不能在状态转移中保持拓扑。
边界(本刊标注)。 摘要未给出任何具体分数或分差,「远低于人类水平」缺数值与人类评测的协议说明;拓扑性质以 2D/3D 程序化生成的合成场景为主(13 类程序化任务),因此结论描述的是在受控合成环境中的拓扑直觉,向真实场景迁移的证据为零;「推理优于规划」这一发现需要区分任务难度——如果规划任务本身更复杂,这个对比就不等价于「模型缺乏规划能力」,摘要未说明两者的难度是否被校准;微调/RL 的类型、数据量与超参未披露,「提升推理多于规划」的结论缺乏可复现细节;第 ④ 点最锋利但也最依赖审计方法:用生成模型当世界模拟器失败的具体判定标准(谁来审计、判什么)未展开;14 个模型的清单与规模分布未列出,无法判断结论是否只是「小模型不行」;评测是否包含抗污染设计(程序化生成降低了污染风险,但也降低了生态效度)未讨论。
我的判断。 这篇是本期的「度量」侧代表,其价值与 #020 里的 VANTAGE-Bench 属于同一类但更基础:VANTAGE 指出整类应用域被基准遗漏,MindTopo 则指出一整类空间认知能力被基准遗漏。它最值得记的一句判断是**「所有 MLLM 在推理上都优于在规划上」——把它与第 2 篇(World in World 用生成模型做控制)、以及 #020 的 Show-Harness、Programmable World Model 并读,会得到一个相当一致的图景:当前多模态系统在「看懂关系」上还有相当能力,但一旦要求它在世界里连续行动、并保持状态与关系不漂移,就系统性失效。第 ④ 点尤其与本期第 2 篇构成直接张力——把视频生成模型当作世界模拟器用(World in World 的做法),在这篇的审计下恰恰是不能可靠遵循动力学、也不能保持拓扑的那一类**;这不是否定前者,而是提示:用生成模型做控制器,必须外挂确定性的几何与状态约束(第 1 篇的递归代码、#020 的可执行程序状态,都是同一类补丁)。保留意见:合成场景 + 无数字 + 无人类评测协议,使它目前更像一份待验证的命题清单;但它提出的问题——拓扑关系是空间理解的地基,而我们的评测全在测地表——方向是对的,值得列入长期跟踪。
今日阅读线索
本期可以用一句话概括:当「把世界写成程序」「把控制变成接口」「把多模态统一进一个模型」这三件事都已经有人做到,剩下的全部问题都转移到了「成本、可移植性与度量」上。
「世界=程序」这条线(RCWM、World in World)现在的形态很清晰:不训练,改表示。RCWM 补上了「构造过程本身需要递归控制」这一环,World in World 补上了「控制证据需要统一成模型能读的干净状态」这一环;两篇都把确定性当作设计美德(递归求解器、几何渲染与点身份),而把生成模型限定在它真正擅长的位置(对比渲染、补全区域)。这条思路可复用的地方在于它的问题形式:读者手上的任何「强模型 + 难落地」组合,都可以先问——我是不是把本该显式管理的结构,交给模型去隐式学习了?
「统一的账本」这条线(SenseNova-U1.5、OmniKVQuant)则提示另一件事:架构上的统一与部署上的成本是一体两面。原生统一的收益是表示一致、理解可迁移到生成(一个仍需验证的机制性主张),代价是缓存、分辨率与后训练复杂度同时上升(4K 原生、多专家蒸馏、音频+视频+文本的异构 KV)。OmniKVQuant 用 2-bit 与逐模态旋转给出了一个「免训练的减法」,但缺精度曲线意味着这笔账目前只算了一半。
追问「该测什么」(MindTopo)是本期的第三个落点:它把评测从度量关系推进到拓扑关系,并给出了一个与另外两篇直接对话的发现——生成模型能到达看似合理的终点,却不能可靠保持环境动力学与拓扑。这恰好解释了为什么本期前两篇都要外挂确定性的几何与状态:如果度量与拓扑是地基,那么任何依赖「看起来对」的系统,都必须外挂一层「检查是否真的对」的机制。
如果只跟进一条线,我会推荐**「确定性外挂」这个模式**:本期五篇里,三篇(RCWM、World in World、OmniKVQuant)都在做同一件事——把某个原本交给模型隐式学习的环节,换成显式、可检查、免训练或最小训练的组件。这既是当下最可复用的工程范式,也是最容易在下一批论文里看到变体的位置。
本刊注:本期五篇论文的 arXiv ID、发布日期、分类与摘要全文,均经 export.arxiv.org/api/query(Atom feed)直查核验;本刊未直读任何 PDF 正文。批次说明:截至发布时,cat:cs.CV / cat:cs.CL / cat:cs.AI 三路按 submittedDate 倒序返回的最新条目日期均为 2026-09-10,未出现 09-11 及之后的新公告批次(arXiv 周末不公告)。所有性能与规模数字均为论文作者口径,本刊未复现;凡摘要中未出现的数字,本刊不做补充;摘要中未讨论的边界(计算成本、数据许可、向真实场景迁移等),已在上文「边界」段落中逐条标注为「未说明/未讨论」。代码与项目页链接取自摘要原文,本刊未核验其可用性。