A PERSONAL VLM RESEARCH LOG
让每一次模型进展,
都留下可复用的理解。
每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。
THREE STREAMS
三个内容栏目
从当天的信息流,到论文方法,再回到长期知识体系。
LATEST ENTRIES
最近更新
AI 日报 #019|苹果首款折叠屏 iPhone Duo 发布:15999 元起、A20 Pro 双倍神经引擎、Siri AI 系统级接入超 30 万 App、铰链「液态金属 + AI 辅助设计」;蚂蚁百灵开源首个金融增强模型 Ling-3.0-flash-Fin(124B/5.1B 激活/256K)并配套开源 FinFIRST 评测(中金支持、50+ 金融专业人士设计);讯飞星火 X2.5(293B)上线、API 原生兼容 Anthropic/Responses 协议(量子位实测:61 页财报拆解、指出论文研究漏洞);Anthropic 发布《Scenarios for our Economic Future》三情景研究(官方页直读:极端情景年 GDP 增长 15%、每 4.5 年翻倍);Meta Muse 定价与安全细节续报(免费 + 20/100 美元两档、仅美国,社区转引 Reuters)
截至 9 月 10 日晨(周四)。本期窗口:上期 #018(9/9 08:00)之后至今。头条是消费电子:9/10 凌晨苹果发布首款折叠屏 iPhone Duo——正式命名而非传闻的 Ultra,5.4 英寸外屏/7.6 英寸内屏、史上最薄 iPhone、铰链用锆基非晶钛合金(「液态金属」,强度约 2.5 倍钛合金、比钢轻 20%)且设计过程用上 AI 辅助;A20 Pro(2nm、32 核神经引擎、FP8 算力 2 倍);Siri AI 打通操作系统、接入超 30 万个 App(苹果发布会口径,量子位转述);国行 15999 元起、顶配 2T 26499 元;同场 iPhone 18 Pro/Max 发布,标准版 iPhone 缺席为十年来首次。国产模型两条主条:蚂蚁百灵 9/9 开源首个金融增强开放模型 Ling-3.0-flash-Fin——基于 Ling-3.0-flash(124B 总参/5.1B 激活/256K 上下文),瞄准真实投研工作流(信息检索/研究推理/估值建模/研报撰写),同步开源 FinFIRST 金融搜索 Agent 评测基准(中金投行团队支持、50 余位专业人士设计,中文题 60.2%;报道为蚂蚁官方供稿、属发布方口径);讯飞星火 X2.5(293B)9/9 上线讯飞开放平台,API 原生支持 Anthropic 与 Responses 协议、可接入 OpenClaw/Claude Code/Codex/Hermes 等 harness(官方口径),量子位实测覆盖 3D 粒子交互网页、61 页英伟达财报拆解(半小时产出 9 图+1 简报)、指出研究数据与电商统计 bug;此前星火已开源 4B/1.7B 端侧模型、原生 1M token 上下文。海外侧:Anthropic 发布经济未来三情景研究(官方页本机直读:modest≈互联网级影响/substantial=2030 年 AI 能做一半知识工作/extreme=年增长 15% 每 4.5 年翻倍;8 月调研 10980 名美国人,典型预期接近 substantial:2030 GDP 较无 AI 高 10%、失业率约 5%——情景推演非预测);Meta Muse 续报(#018 曾标题级记录):HN 热度升至 636 分/698 评论,定价与安全细节据 HN 讨论转引 Reuters——美国先行、基础版免费 + 20/100 美元订阅、可选退出训练、内部曾担忧敏感个人数据访问;Meta AI 负责人谈 prompt injection 分层防御(经 simonw 引 X 帖转述)。简讯:OpenAI 发博文谈 GPT-5.6 Sol 辅助量子计算实验(openai.com 本机 JS 壳不可直读,仅标题级);Science 发文复盘 NS 争议(#018 主条跟进,本机未直读);具身机器人进超市盘点、覆盖全球约七万门店(量子位标题级);社区观察:Qwen 3.8 推理 prefill 追随 GPT-5.5 Pro(gist 本机 SSL 不可达,仅标题级)。除标注「官方口径/转述/不可达」外均经正文直接核验。
VLM 论文速递 #019|「解耦与校准」成为本期暗线:图像 tokenizer 的视觉语言研究给出跨 tokenizer 的一致信号——I2T loss 在共享文本词表上同时关联生成与理解(重建更好 ≠ 联合建模更好,tokenizer 选择会反向影响文本建模);SyncWorld 用「视觉校准片段」让动作条件世界模型零样本当仿真器——以 paired frames+actions 在上下文里指定 Action–Visual Mapping,未见于分布内环境训练也能 rollout 并做 test-time 策略改进(Yilun Du/Chuang Gan 组);GoDeep 把 VLM 当纯翻译器、直接在纯语言嵌入空间做开放词表 3D 场景理解——无需 3D 训练语料与专属 3D 编码器,OOV 物体可定位、点级可解释(一次系统性词表修正即逆转 CLIP 变体的排名优势);TRACE 分数级证据校验治 PRVR 的「query 无关集中瓶颈」——最强局部响应不再直接决定排序,DreamPRVR 上 SumR +1.2/1.1/1.5;SeGDeP 用显式 what-where 接口做推理分割——语义分支 + DETR 几何框联合条件 SAM 3,仅 LoRA 微调 Qwen3-VL 0.38% 参数达 RefCOCO 八 split 平均 cIoU 82.7、ReasonSeg 66.0/59.6 gIoU
本期覆盖 arXiv 可检索最新批次(标注日期 2026-09-08,编号段 2609.088xx–2609.0915x,明显新于 #018 覆盖的 09-04 批次 2609.05xxx 段;经 export.arxiv.org API 按 submittedDate 倒序直查核验)。五篇方向互补:① 2609.09143(cs.CV/CL)建纯自回归受控 testbed,用任务级验证 loss 研究统一多模态模型里的图像 tokenizer「视觉语言」——loss 须按任务拆开分析;固定 tokenizer 时 T2I/I2T loss 关联生成质量,跨 tokenizer 时 I2T loss(共享文本词表)是更一致的信号、且与 SFT 后生成与视觉理解都相关;重建更好不必然带来更低任务 loss 或更强下游;tokenizer 选择会反向影响联合优化下的文本建模(案例轴:判别器、语义监督、词表大小);② 2609.09155(cs.CV)SyncWorld:动作在像素空间不是通用语言(环境/相机/本体一变、同一数值动作的视觉表现就变),用「视觉校准片段」(展示全部可控自由度的成对帧+动作)在上下文里指定 setup 专属 Action–Visual Mapping,从而让动作条件世界模型零样本仿真未见环境,且 rollout 可用于免训练 test-time 策略改进(摘要无量化数字);③ 2609.09082(cs.CV/AI)GoDeep:不再把 CLIP 特征抬进 3D,而是让 VLM 当纯翻译器、把每张 posed image 转成结构化实体级描述,直接在通用纯语言嵌入空间接地/投影/聚合——无需 3D 训练语料与专属 3D 编码器;ScanNet++ 上匹敌「在 ScanNet 上训练过的强无标注基线」;5 建筑文化遗产基准上原始分数偏好 CLIP 变体,但一次系统性词表修正即逆转排名(第二个独立类别上复现);OOV 物体在语言空间的「有无」分离远锐于 CLIP 且可定位、点级可解释;④ 2609.08999(cs.CV)TRACE:PRVR(部分相关视频检索)的失败被定位为「query 无关集中瓶颈」——最强局部响应被直接信任;TRACE 激活 query 相关寄存器、把支持路由到帧级证据、对备选 query→register→frame 路径做平滑边缘化,再以 query 条件残差校准原局部分数(不动表征);ActivityNet Captions/Charades-STA/TVR 三项 SumR 最优,DreamPRVR 骨干 +1.2/1.1/1.5;⑤ 2609.08867(cs.CV)SeGDeP:推理分割显式 what-where 接口——语义 prompt 分支 + 独立几何投影路径(DETR 预测框)联合条件 SAM 3 mask decoder;先对齐接口再以分组奖励解耦策略优化(GDPO)平衡 format/box-IoU/mask-IoU;SeGDeP-4B 仅 LoRA 适配 Qwen3-VL 0.38% 参数,八 RefCOCO 系 split 平均 cIoU 82.7、ReasonSeg val/test gIoU 66.0/59.6。所有数字均引自摘要原文并归因于作者,除标注外均经 arXiv API 直查核验。
AI 日报 #018|OpenAI 官宣「内部系统给出 Navier-Stokes 千禧年问题解:有限时间奇点 + Lean 形式化」,数学家 Buckmaster 随即发公开声明指控抢先与作者剔除,Altman/Bubeck 下场、Bubeck 就「毁掉你职业生涯」措辞道歉(openai.com/x.com 本机不可达,核心引文经 HN 897 条讨论直接引语交叉核验);陶哲轩警告「仅凭传闻就触发 AI 大规模碾平问题、激励转向不再分享研究方向」;量子位独家:王云鹤(华为诺亚舟前主任/盘古负责人)创办基元律动、发 Agent-Native 模型 NeoHorse,4B 经 Agentic Post-Training 达/略超 9B 基础模型——「多模型路由经验第一次进参数」,与上期 Mostik「模型桥」互为镜像;Mistral 官宣 30 亿欧元融资(HN 804 分,官方页本机不可达);DeepMind 发布 AlphaGenome Atlas:90 亿人类 DNA 变异分子效应预测图谱(官方博客直接核验);另:Astra 3D 玩火致额度全局重置、ChatGPT Images 周产 30 亿图、Devin E 轮 20 亿美元 480 亿估值、Mercury 2.5、Kimi K3 2.8T 端侧流式 1 token/s、深度智控 B+ 宁德时代领投
截至 9 月 9 日早(周三)。本期头条不是模型发布,而是一场数学与 AI 的「抢先风波」:9/8(美东)OpenAI 官网刊发《On the Navier-Stokes Millennium Prize Problem》,称其内部系统证明 Navier-Stokes 存在性与光滑性(千禧年问题)的一个解——流体运动可在有限时间发展出奇点,附文字证明与 Lean 形式化(官方文案与立场声明经 HN 多条评论直接引语核验,openai.com 本机仍为 Cloudflare 验证页 403)。几乎同时,NYU 数学家 Tristan Buckmaster 发布公开声明(statement.pdf,HN 1165 分/512 评论)讲述事件始末:他与供职 Anthropic 的 Levent Alpöge(研究独立于其工作,混用 GPT 与 Claude)8/15 完成带强迫情形的爆破证明后,9 月初 OpenAI 闻风而动;声明指控 OpenAI 提出以「剔除 Alpöge 作者身份」为条件才给予部分致谢、并出现「你为什么要毁掉自己的职业生涯」「如果你不想让我客气,我也可以不客气」等言论(Bubeck 已公开道歉称措辞极差、当场收回,经 xcancel 转引);Altman 与 Bubeck 均表态希望 Buckmaster 担任重写版第一作者(x.com 本机不可达,经 HN 引述)。陶哲轩在 mathstodon 评论:如今「仅凭某人正在研究某问题的传闻,就会触发大规模 AI 努力在原创研究成熟前把它碾平」,激励正指向「不再向学界分享有前景的方向」——他称之为对开放科学数百年传统的逆转。量子位截至抓取时(9/8 14:05)尚无 NS 报道,本刊为本轮中文首记录之一。国产侧主条:量子位 9/8 独家(正文直接核验)——华为诺亚舟实验室前主任、盘古大模型负责人王云鹤创办的基元律动发布首个 Agent-Native 模型 NeoHorse-1(4B/9B,无问芯穹算力、清华北大参与):经 Agentic Post-Training,4B 综合表现达/略超 9B 基础模型(10 项评测),把 Routing Harness(开源 OpenSquilla)积累的多模型执行经验首次写进模型参数——与 #017 Mostik「冻结大模型、外挂小桥」构成「路由经验参数化 vs 表征桥接」的两种分工哲学。海外产业:Mistral 官宣 30 亿欧元融资(HN 提交 9/8 13:06 北京、804 分,官方新闻页本机 SSL 失败不可达,金额与标题经 HN 核验);Cognition(Devin)官宣 E 轮超 20 亿美元、估值 480 亿美元(a16z+Accel 领投,官方博客直接核验,run-rate 收入 $492M→近 $900M)。科学侧:DeepMind 发布 AlphaGenome Atlas——对基因组 90 亿个单字母变异预计算分子效应预测的开放图谱,合作者已用于未确诊罕见病关键变异的实验验证(官方博客直接核验)。简讯:GPT-6 Astra 3D 玩法太火、OpenAI 对全部付费订阅全局重置额度(量子位);ChatGPT Images 2.5 官方称每周生成超 30 亿张图(HN 引官方文案);Inception Mercury 2.5(官方页直接核验:1107 tok/s、智能较二代 +40%);Kimi K3(2.8T MoE、1.45TB 专家权重)在 M5 Max MacBook Pro 上经 4 块 SSD 流式跑到约 1 token/s(GitHub 直接核验,权重来源未核验);深度智控 B+ 数亿元、宁德时代领投(量子位);Meta 发布个人 AI agent「Muse」(HN 214 分,官方页本机不可达、仅标题级)。除标注「转述/引述/口径/不可达」外均经官方页或正文直接核验。
VLM 论文速递 #018|「诊断—修复闭环」与「Agent 全栈化」成为本期双主线:What Matters, When? 把 VLA 的干扰物脆弱性定位到具体操作阶段——视觉相似的干扰物会让策略选错物体/目的地,即使操作技能完好(ACT + UR3e 实机,三类干预显著恢复鲁棒性);同组背靠背的神经符号程序推理把任务图+多模态程序记忆+伪注视引导塞进长程 VLA(ECCV 2026 两 workshop oral/abstract 已核验);MCPO 用少于 900 样本做多模态思维链压缩——NCMI 剪枝自动剔除「与图像无关」的推理步,CoT 长度最高 -69.5%、端到端 3.34x 加速且保精度(Qwen3-VL-Thinking 实测);WeAgent-MMGenEdit 给出多模态 Agent 图像生成/编辑全栈配方:23K 监督轨迹 + 14.7K RL 任务 + 三层可验证清单,30B 总参/3B 激活策略逼近 1T 参数 agent;VLM 诊断 agent 无标签调 MOT 跟踪器:MOT17→MOT20 恢复 67.8% 丢失余量、距天花板仅 0.029 HOTA、最高密度序列达 86.7%
本期覆盖 arXiv 可检索最新批次(标注日期 2026-09-04;截至 9 月 9 日早抓取,arXiv API 索引与 list 页均仍无 9/5 及之后的新公告批次——与 #017 记录一致,索引停滞约一周)。#017 已从 09-04 批次覆盖 ROBORMBENCH/RoboSPA/LSS/WorldSculpt/From-Vision-to-Language 五篇,本期从同一批次 #017 未覆盖的论文中另选五篇方向互补(已在正文说明,避免误读为 arXiv 有新批次):① What Matters, When?(2609.05376,cs.RO/AI/CV,ECCV 2026 DexHAND Workshop 非档案短文已核验)用 ACT 在受控颜色/形状相似度下系统引入干扰物与干扰容器,把失败定位到 pick/place 阶段——干扰物敏感性同时取决于「视觉相似类型」与「操作阶段」;三类干预(干扰物增强、阶段相关注意力正则、外观视觉提示)在仿真与真实 UR3e 上显著提升鲁棒性,同一失效模式亦见于预训练 VLA 的器械操作任务(摘要无具体数字);② 同组(Chavan/Shi/Heimann/Haninger/Krüger)背靠背的 2609.05369(cs.RO/CV,ECCV 2026 X-Reason Workshop oral 已核验)把显式任务图(动作依赖/合法转移/分支条件)+ 多模态程序记忆(活动步骤/已完成动作/文本上下文/视觉证据)+ 伪注视演示引导组合进长程 VLA,在 workspace clearing 与手术器械操作两域评估正确选物、子任务完成、步序一致与程序性错误(摘要无结果数字);③ MCPO(2609.04947,cs.CV/AI)提出模态对比偏好优化的两阶段多模态 CoT 长度压缩:压缩阶段用步级归一化跨模态互信息(NCMI)剪枝——比较有图/无图两种上下文下的推理差异、自动剔除与视觉无关的推理步;对齐阶段用非对称多模态长度控制偏好损失(有图陡梯度/无图平梯度)。<900 训练样本、主流基座(如 Qwen3-VL-Thinking)上 CoT 长度最高降 69.5%、端到端推理加速最高 3.34x、保持原准确率(摘要数字);④ WeAgent-MMGenEdit(2609.05171,cs.CV)提出多模态 Agent 图像生成与编辑全栈配方——WeAgent-Harness 多模态运行时(持久证据管理 + 专用验证/集成工具,把检索到的多模态证据组织成 dense carrier)+ 可扩展数据管线(23K 监督轨迹、14.7K RL 任务、三层可验证清单)+ 双语基准 WeBench-MMGenEdit + 策略与图像后端双侧 SFT/RL 后训练;30B 总参/3B 激活策略超同规模、逼近 1T 参数 agent(摘要数字);⑤ 2609.05239(cs.CV)用 VLM 做「诊断 agent」无标签适配 detect-to-track 管线——VLM 直接检查渲染出的跟踪输出、识别视觉失效模式并推荐参数更新;MOT17→MOT20 上源 oracle 配置转移使 HOTA 从 0.357 天花板跌 0.090 至 0.267,无标签 VLM tuner 恢复 67.8% 丢失余量、收于距天花板 0.029,最高密度序列恢复 86.7%;无标签贝叶斯优化+手工代理目标在大域移下反而退化强配置(摘要数字)。全部数字引自摘要原文并归因于作者;除标注外均经 arXiv abs 页直接核验。
AI 日报 #017|OpenAI 一天双面文本:Pachocki 万字长文《外星思维》呼吁「自愿减速」(上期预告兑现,openai.com 本机 403,核心引文经 HN 461 分讨论直接引语交叉核验)+ 网友爆料 GPT-6 Sol 内测中、速度约 Astra 6 倍(X 原帖本机不可达,量子位转述)+ 老黄称 Astra 用约 10 万套 GB200 NVLink72 训练、另有 40 万套 GPU 将上线;Mostik「模型桥」出圈:菲尔兹奖得主坐镇、4B Qwen-3.5 + 753B GLM-5.2 刷 ARC-AGI-3,隐藏状态直连、大模型全程不吐一个字(官方页直接核验,具体分数未公布);办公 Agent 进入「组织协同」:千问办公推出业内首个多人工作台(阿里供稿)+ LobsterAI 首份用户行为报告(有道供稿);具身两侧同台:智象 HiDream-O1-Embodied 登顶 RoboColiseum 扰动适应榜(企业口径)+ 本末科技模块化轮足机器人出口 50+ 国(企业口径)
截至 9 月 8 日早(周二)。上期 #016「明日预告」点名的 Pachocki 长文已经发酵:9/6(美东)OpenAI 首席科学家 Jakub Pachocki 官网刊发《An Alien Mind》(外星思维),HN 提交于 9/6 16:27 UTC(北京时间 9/7 00:27,即在 #016 发布 27 分钟后),现已 461 分、451 评论;openai.com 本机依旧 403,核心段落经 HN 多条评论直接引语交叉核验——他罕见地给出结论式判断:「目前我不认为有任何实验室把对齐与监控做到足以负责任地以最高速度继续扩张;在共享安全标准建立前,我期待并希望自愿减速成为常态;AI 未来发展的国际协调应成为各国政府最高优先事项之一」(评论者 himata4113 引述原文);并称「我们没有满意的泛化理论……当下经验性验证对齐技术的能力,实际上可能比对齐技术本身更重要」(fofoz 引述);背景是 The Information 报道 Astra 为循环 Transformer 引发的「不可监控性竞赛」担忧(评论者 XTXinverseXTY 考证:报道次日 Pachocki 发推称「要阻止被混乱报道带起的不可监控性竞赛,Astra 等当前前沿模型计算图深度在 GPT-4 两倍以内」)。同一天的量级新闻:量子位 9/7 17:04 转述 X 网友 Lentils 爆料称 OpenAI 正在内测 GPT-6 Sol——输出弱于 Astra 但单次测试速度约为其 6 倍(X 原帖本机不可达 HTTP 000,经量子位转述,标注为网友爆料);量子位同期整理 OpenAI 内部数据(每 8 小时工作日约 3.1 个 Agent 工作日并行、按 API 价中位数研究员日耗 Agent 推理资源超 600 美元——与 #016 记录的 HN 评论者转述「$8000/人/天」口径不同,均待原文核验)并转述黄仁勋 X 帖:Astra 用约 10 万套 GB200 NVLink72 训练、另有 40 万套 GPU 将上线。第二条主条是 Mostik:量子位 9/7 16:36 报道这家成立 4 个月、15 人(12 博士)的隐身公司——首席科学家为 2010 年菲尔兹奖得主 Stanislav Smirnov——其官网(本机直接核验)称用一个小型可训练「桥」把大模型隐藏状态直传给小模型:实验里 753B GLM-5.2 只读题不写字(无 decode),4B Qwen-3.5 负责全部生成,小模型补齐约 50% 性能差距、自身准确率 +25%、难题子集提升达 2x、整体算力约为等效中规模模型的 2/5;量子位称该组合「刷爆 ARC-AGI 3」但具体分数未公布(团队称比赛未结束拒绝披露)。办公侧:千问办公「多人工作台」(业内首个、百人级协作网页,阿里供稿)与 LobsterAI《中国办公Agent用户行为不完全报告》(网易有道供稿:前 20% 用户消耗 87.4% 算力、近 60% token 消耗在常规工时外、12.2% 调用为「无人值守」)。具身侧:智象 HiDream-O1-Embodied 登顶 RoboColiseum Robustness 子榜 0.692(智象供稿)+ 本末科技模块化轮足机器人 D1「3 秒合体」、轮足整机出口 50+ 国(量子位原创、企业口径)。
VLM 论文速递 #017|「语言通道太窄又太脆」成为本期暗线:ROBORMBENCH 证明 VLM 奖励模型对释义变化极度脆弱——同一轨迹、同一意图,换个说法就能把成功判成失败(2,390 条真机轨迹、21,673 条人工核验释义,规模与 scale 都救不了);RoboSPA 给 VLA 出「超纲题」:空间-程序双维度、10 类任务 56 基础任务 × 5 难度 = 280 变体、527K 轨迹,代表性 VLA「仍 struggle」(EMNLP 2026 main);LSS 把推理搬进训练期:辅助损失把动作 token 表征对齐到物理推理文本嵌入、推理时零成本,逐相位的 Dense LSS 胜过整段 Pooled(探针显示骨干分离度约 2 倍);WorldSculpt 用单物体 3D 生成先验 + 多视图条件,从接地视频组合式重建数百物体的杂乱场景(零场景级训练,UE-MeshyScene 基准);From Vision to Language 用逐层因果干预定位多模态决策的视觉信息流:答案选项是主要文本接地点、名词是语义锚(EMNLP 2026 Findings)
本期覆盖 arXiv API 最新可检索批次(标注日期 2026-09-04;截至 9 月 8 日早抓取,9/5 及之后的公告批次尚未进入索引——与 #016 记录一致,上期覆盖 09-03 批次,本期索引已推进到 09-04)。上期 #016 已覆盖 09-03 批次的 FactoSR/VeriPhy/Jina-OCR-v1/CoFiE/S³T 及多篇顺带阅读(#015 覆盖更早批次),本速递从 09-04 批次另选五篇方向互补:ROBORMBENCH(2609.05401,cs.RO/cs.CL)提出 VLM 奖励模型的「释义脆弱性」评测——2,390 条真实机器人轨迹、真值进度标签与 21,673 条人工核验释义(词汇/句法/动作目标三类改写),结论是仅改写指令就能大幅改变预测进度分、甚至把同一行为在成功与失败之间翻转;跨专有与开源 VLM 普遍且严重、改写差异越大越糟、scale 与显式推理都不可靠降低,而带轨迹接地监督的专用奖励模型显著更稳(摘要数字);RoboSPA(2609.05324,cs.RO/cs.AI/cs.CV,EMNLP 2026 main 已在 comments 字段核验)发布 VLA 诊断基准——细粒度空间推理与长程程序规划两维、10 类任务 56 个基础任务、每个任务 5 档难度共 280 变体、527K 轨迹多本体多场景,代表性 VLA 在复杂空间关系/精确低层执行/记忆密集型规划上仍 struggle(摘要原文措辞,无数字);LSS(2609.04893,cs.RO)提出 Latent Semantic Scaffolding:人类演示预训练期加一个辅助损失、经小型投影头把 VLA 动作 token 表征对齐到物理推理理由的文本嵌入,推理时丢弃投影头、基础策略零额外成本——逐动作相位对齐(Dense LSS)比整段池化对齐(Pooled LSS)在分布内与未见任务迁移上都更好,表征探针显示骨干每相位分离度约为后者的 2 倍(摘要数字);WorldSculpt(2609.05416,cs.CV,主页/代码已开源)用强单物体 3D 生成先验(Pixal3D)+ 多视图条件通路,从接地视频对含数百物体的杂乱场景做组合式重建,仅在规范空间单物体上微调、无任何场景级训练即泛化到严重遮挡大场景,并推出 UE-MeshyScene 写实杂乱场景基准与 3DGS 世界转组合网格的适用性演示(摘要无对比数字);From Vision to Language(2609.05149,cs.CL/cs.CV,EMNLP 2026 Findings 已核验)对视频-文本注意力通路做逐层因果干预,定位跨模态决策中视觉信息流的接入点——视觉信息主要在模型处理候选答案选项时被整合(选项是主要文本接地站点)、名词是语义锚而动词在时序关系处理时更重要、时间推理呈现 distinct 的脆弱模式(摘要无数字)。全部数字均引自各论文摘要原文并归因于作者;除标注外均为 arXiv 页直接核验。