A PERSONAL VLM RESEARCH LOG
让每一次模型进展,
都留下可复用的理解。
每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。
THREE STREAMS
三个内容栏目
从当天的信息流,到论文方法,再回到长期知识体系。
LATEST ENTRIES
最近更新
AI 日报 #018|OpenAI 官宣「内部系统给出 Navier-Stokes 千禧年问题解:有限时间奇点 + Lean 形式化」,数学家 Buckmaster 随即发公开声明指控抢先与作者剔除,Altman/Bubeck 下场、Bubeck 就「毁掉你职业生涯」措辞道歉(openai.com/x.com 本机不可达,核心引文经 HN 897 条讨论直接引语交叉核验);陶哲轩警告「仅凭传闻就触发 AI 大规模碾平问题、激励转向不再分享研究方向」;量子位独家:王云鹤(华为诺亚舟前主任/盘古负责人)创办基元律动、发 Agent-Native 模型 NeoHorse,4B 经 Agentic Post-Training 达/略超 9B 基础模型——「多模型路由经验第一次进参数」,与上期 Mostik「模型桥」互为镜像;Mistral 官宣 30 亿欧元融资(HN 804 分,官方页本机不可达);DeepMind 发布 AlphaGenome Atlas:90 亿人类 DNA 变异分子效应预测图谱(官方博客直接核验);另:Astra 3D 玩火致额度全局重置、ChatGPT Images 周产 30 亿图、Devin E 轮 20 亿美元 480 亿估值、Mercury 2.5、Kimi K3 2.8T 端侧流式 1 token/s、深度智控 B+ 宁德时代领投
截至 9 月 9 日早(周三)。本期头条不是模型发布,而是一场数学与 AI 的「抢先风波」:9/8(美东)OpenAI 官网刊发《On the Navier-Stokes Millennium Prize Problem》,称其内部系统证明 Navier-Stokes 存在性与光滑性(千禧年问题)的一个解——流体运动可在有限时间发展出奇点,附文字证明与 Lean 形式化(官方文案与立场声明经 HN 多条评论直接引语核验,openai.com 本机仍为 Cloudflare 验证页 403)。几乎同时,NYU 数学家 Tristan Buckmaster 发布公开声明(statement.pdf,HN 1165 分/512 评论)讲述事件始末:他与供职 Anthropic 的 Levent Alpöge(研究独立于其工作,混用 GPT 与 Claude)8/15 完成带强迫情形的爆破证明后,9 月初 OpenAI 闻风而动;声明指控 OpenAI 提出以「剔除 Alpöge 作者身份」为条件才给予部分致谢、并出现「你为什么要毁掉自己的职业生涯」「如果你不想让我客气,我也可以不客气」等言论(Bubeck 已公开道歉称措辞极差、当场收回,经 xcancel 转引);Altman 与 Bubeck 均表态希望 Buckmaster 担任重写版第一作者(x.com 本机不可达,经 HN 引述)。陶哲轩在 mathstodon 评论:如今「仅凭某人正在研究某问题的传闻,就会触发大规模 AI 努力在原创研究成熟前把它碾平」,激励正指向「不再向学界分享有前景的方向」——他称之为对开放科学数百年传统的逆转。量子位截至抓取时(9/8 14:05)尚无 NS 报道,本刊为本轮中文首记录之一。国产侧主条:量子位 9/8 独家(正文直接核验)——华为诺亚舟实验室前主任、盘古大模型负责人王云鹤创办的基元律动发布首个 Agent-Native 模型 NeoHorse-1(4B/9B,无问芯穹算力、清华北大参与):经 Agentic Post-Training,4B 综合表现达/略超 9B 基础模型(10 项评测),把 Routing Harness(开源 OpenSquilla)积累的多模型执行经验首次写进模型参数——与 #017 Mostik「冻结大模型、外挂小桥」构成「路由经验参数化 vs 表征桥接」的两种分工哲学。海外产业:Mistral 官宣 30 亿欧元融资(HN 提交 9/8 13:06 北京、804 分,官方新闻页本机 SSL 失败不可达,金额与标题经 HN 核验);Cognition(Devin)官宣 E 轮超 20 亿美元、估值 480 亿美元(a16z+Accel 领投,官方博客直接核验,run-rate 收入 $492M→近 $900M)。科学侧:DeepMind 发布 AlphaGenome Atlas——对基因组 90 亿个单字母变异预计算分子效应预测的开放图谱,合作者已用于未确诊罕见病关键变异的实验验证(官方博客直接核验)。简讯:GPT-6 Astra 3D 玩法太火、OpenAI 对全部付费订阅全局重置额度(量子位);ChatGPT Images 2.5 官方称每周生成超 30 亿张图(HN 引官方文案);Inception Mercury 2.5(官方页直接核验:1107 tok/s、智能较二代 +40%);Kimi K3(2.8T MoE、1.45TB 专家权重)在 M5 Max MacBook Pro 上经 4 块 SSD 流式跑到约 1 token/s(GitHub 直接核验,权重来源未核验);深度智控 B+ 数亿元、宁德时代领投(量子位);Meta 发布个人 AI agent「Muse」(HN 214 分,官方页本机不可达、仅标题级)。除标注「转述/引述/口径/不可达」外均经官方页或正文直接核验。
VLM 论文速递 #018|「诊断—修复闭环」与「Agent 全栈化」成为本期双主线:What Matters, When? 把 VLA 的干扰物脆弱性定位到具体操作阶段——视觉相似的干扰物会让策略选错物体/目的地,即使操作技能完好(ACT + UR3e 实机,三类干预显著恢复鲁棒性);同组背靠背的神经符号程序推理把任务图+多模态程序记忆+伪注视引导塞进长程 VLA(ECCV 2026 两 workshop oral/abstract 已核验);MCPO 用少于 900 样本做多模态思维链压缩——NCMI 剪枝自动剔除「与图像无关」的推理步,CoT 长度最高 -69.5%、端到端 3.34x 加速且保精度(Qwen3-VL-Thinking 实测);WeAgent-MMGenEdit 给出多模态 Agent 图像生成/编辑全栈配方:23K 监督轨迹 + 14.7K RL 任务 + 三层可验证清单,30B 总参/3B 激活策略逼近 1T 参数 agent;VLM 诊断 agent 无标签调 MOT 跟踪器:MOT17→MOT20 恢复 67.8% 丢失余量、距天花板仅 0.029 HOTA、最高密度序列达 86.7%
本期覆盖 arXiv 可检索最新批次(标注日期 2026-09-04;截至 9 月 9 日早抓取,arXiv API 索引与 list 页均仍无 9/5 及之后的新公告批次——与 #017 记录一致,索引停滞约一周)。#017 已从 09-04 批次覆盖 ROBORMBENCH/RoboSPA/LSS/WorldSculpt/From-Vision-to-Language 五篇,本期从同一批次 #017 未覆盖的论文中另选五篇方向互补(已在正文说明,避免误读为 arXiv 有新批次):① What Matters, When?(2609.05376,cs.RO/AI/CV,ECCV 2026 DexHAND Workshop 非档案短文已核验)用 ACT 在受控颜色/形状相似度下系统引入干扰物与干扰容器,把失败定位到 pick/place 阶段——干扰物敏感性同时取决于「视觉相似类型」与「操作阶段」;三类干预(干扰物增强、阶段相关注意力正则、外观视觉提示)在仿真与真实 UR3e 上显著提升鲁棒性,同一失效模式亦见于预训练 VLA 的器械操作任务(摘要无具体数字);② 同组(Chavan/Shi/Heimann/Haninger/Krüger)背靠背的 2609.05369(cs.RO/CV,ECCV 2026 X-Reason Workshop oral 已核验)把显式任务图(动作依赖/合法转移/分支条件)+ 多模态程序记忆(活动步骤/已完成动作/文本上下文/视觉证据)+ 伪注视演示引导组合进长程 VLA,在 workspace clearing 与手术器械操作两域评估正确选物、子任务完成、步序一致与程序性错误(摘要无结果数字);③ MCPO(2609.04947,cs.CV/AI)提出模态对比偏好优化的两阶段多模态 CoT 长度压缩:压缩阶段用步级归一化跨模态互信息(NCMI)剪枝——比较有图/无图两种上下文下的推理差异、自动剔除与视觉无关的推理步;对齐阶段用非对称多模态长度控制偏好损失(有图陡梯度/无图平梯度)。<900 训练样本、主流基座(如 Qwen3-VL-Thinking)上 CoT 长度最高降 69.5%、端到端推理加速最高 3.34x、保持原准确率(摘要数字);④ WeAgent-MMGenEdit(2609.05171,cs.CV)提出多模态 Agent 图像生成与编辑全栈配方——WeAgent-Harness 多模态运行时(持久证据管理 + 专用验证/集成工具,把检索到的多模态证据组织成 dense carrier)+ 可扩展数据管线(23K 监督轨迹、14.7K RL 任务、三层可验证清单)+ 双语基准 WeBench-MMGenEdit + 策略与图像后端双侧 SFT/RL 后训练;30B 总参/3B 激活策略超同规模、逼近 1T 参数 agent(摘要数字);⑤ 2609.05239(cs.CV)用 VLM 做「诊断 agent」无标签适配 detect-to-track 管线——VLM 直接检查渲染出的跟踪输出、识别视觉失效模式并推荐参数更新;MOT17→MOT20 上源 oracle 配置转移使 HOTA 从 0.357 天花板跌 0.090 至 0.267,无标签 VLM tuner 恢复 67.8% 丢失余量、收于距天花板 0.029,最高密度序列恢复 86.7%;无标签贝叶斯优化+手工代理目标在大域移下反而退化强配置(摘要数字)。全部数字引自摘要原文并归因于作者;除标注外均经 arXiv abs 页直接核验。
AI 日报 #017|OpenAI 一天双面文本:Pachocki 万字长文《外星思维》呼吁「自愿减速」(上期预告兑现,openai.com 本机 403,核心引文经 HN 461 分讨论直接引语交叉核验)+ 网友爆料 GPT-6 Sol 内测中、速度约 Astra 6 倍(X 原帖本机不可达,量子位转述)+ 老黄称 Astra 用约 10 万套 GB200 NVLink72 训练、另有 40 万套 GPU 将上线;Mostik「模型桥」出圈:菲尔兹奖得主坐镇、4B Qwen-3.5 + 753B GLM-5.2 刷 ARC-AGI-3,隐藏状态直连、大模型全程不吐一个字(官方页直接核验,具体分数未公布);办公 Agent 进入「组织协同」:千问办公推出业内首个多人工作台(阿里供稿)+ LobsterAI 首份用户行为报告(有道供稿);具身两侧同台:智象 HiDream-O1-Embodied 登顶 RoboColiseum 扰动适应榜(企业口径)+ 本末科技模块化轮足机器人出口 50+ 国(企业口径)
截至 9 月 8 日早(周二)。上期 #016「明日预告」点名的 Pachocki 长文已经发酵:9/6(美东)OpenAI 首席科学家 Jakub Pachocki 官网刊发《An Alien Mind》(外星思维),HN 提交于 9/6 16:27 UTC(北京时间 9/7 00:27,即在 #016 发布 27 分钟后),现已 461 分、451 评论;openai.com 本机依旧 403,核心段落经 HN 多条评论直接引语交叉核验——他罕见地给出结论式判断:「目前我不认为有任何实验室把对齐与监控做到足以负责任地以最高速度继续扩张;在共享安全标准建立前,我期待并希望自愿减速成为常态;AI 未来发展的国际协调应成为各国政府最高优先事项之一」(评论者 himata4113 引述原文);并称「我们没有满意的泛化理论……当下经验性验证对齐技术的能力,实际上可能比对齐技术本身更重要」(fofoz 引述);背景是 The Information 报道 Astra 为循环 Transformer 引发的「不可监控性竞赛」担忧(评论者 XTXinverseXTY 考证:报道次日 Pachocki 发推称「要阻止被混乱报道带起的不可监控性竞赛,Astra 等当前前沿模型计算图深度在 GPT-4 两倍以内」)。同一天的量级新闻:量子位 9/7 17:04 转述 X 网友 Lentils 爆料称 OpenAI 正在内测 GPT-6 Sol——输出弱于 Astra 但单次测试速度约为其 6 倍(X 原帖本机不可达 HTTP 000,经量子位转述,标注为网友爆料);量子位同期整理 OpenAI 内部数据(每 8 小时工作日约 3.1 个 Agent 工作日并行、按 API 价中位数研究员日耗 Agent 推理资源超 600 美元——与 #016 记录的 HN 评论者转述「$8000/人/天」口径不同,均待原文核验)并转述黄仁勋 X 帖:Astra 用约 10 万套 GB200 NVLink72 训练、另有 40 万套 GPU 将上线。第二条主条是 Mostik:量子位 9/7 16:36 报道这家成立 4 个月、15 人(12 博士)的隐身公司——首席科学家为 2010 年菲尔兹奖得主 Stanislav Smirnov——其官网(本机直接核验)称用一个小型可训练「桥」把大模型隐藏状态直传给小模型:实验里 753B GLM-5.2 只读题不写字(无 decode),4B Qwen-3.5 负责全部生成,小模型补齐约 50% 性能差距、自身准确率 +25%、难题子集提升达 2x、整体算力约为等效中规模模型的 2/5;量子位称该组合「刷爆 ARC-AGI 3」但具体分数未公布(团队称比赛未结束拒绝披露)。办公侧:千问办公「多人工作台」(业内首个、百人级协作网页,阿里供稿)与 LobsterAI《中国办公Agent用户行为不完全报告》(网易有道供稿:前 20% 用户消耗 87.4% 算力、近 60% token 消耗在常规工时外、12.2% 调用为「无人值守」)。具身侧:智象 HiDream-O1-Embodied 登顶 RoboColiseum Robustness 子榜 0.692(智象供稿)+ 本末科技模块化轮足机器人 D1「3 秒合体」、轮足整机出口 50+ 国(量子位原创、企业口径)。
VLM 论文速递 #017|「语言通道太窄又太脆」成为本期暗线:ROBORMBENCH 证明 VLM 奖励模型对释义变化极度脆弱——同一轨迹、同一意图,换个说法就能把成功判成失败(2,390 条真机轨迹、21,673 条人工核验释义,规模与 scale 都救不了);RoboSPA 给 VLA 出「超纲题」:空间-程序双维度、10 类任务 56 基础任务 × 5 难度 = 280 变体、527K 轨迹,代表性 VLA「仍 struggle」(EMNLP 2026 main);LSS 把推理搬进训练期:辅助损失把动作 token 表征对齐到物理推理文本嵌入、推理时零成本,逐相位的 Dense LSS 胜过整段 Pooled(探针显示骨干分离度约 2 倍);WorldSculpt 用单物体 3D 生成先验 + 多视图条件,从接地视频组合式重建数百物体的杂乱场景(零场景级训练,UE-MeshyScene 基准);From Vision to Language 用逐层因果干预定位多模态决策的视觉信息流:答案选项是主要文本接地点、名词是语义锚(EMNLP 2026 Findings)
本期覆盖 arXiv API 最新可检索批次(标注日期 2026-09-04;截至 9 月 8 日早抓取,9/5 及之后的公告批次尚未进入索引——与 #016 记录一致,上期覆盖 09-03 批次,本期索引已推进到 09-04)。上期 #016 已覆盖 09-03 批次的 FactoSR/VeriPhy/Jina-OCR-v1/CoFiE/S³T 及多篇顺带阅读(#015 覆盖更早批次),本速递从 09-04 批次另选五篇方向互补:ROBORMBENCH(2609.05401,cs.RO/cs.CL)提出 VLM 奖励模型的「释义脆弱性」评测——2,390 条真实机器人轨迹、真值进度标签与 21,673 条人工核验释义(词汇/句法/动作目标三类改写),结论是仅改写指令就能大幅改变预测进度分、甚至把同一行为在成功与失败之间翻转;跨专有与开源 VLM 普遍且严重、改写差异越大越糟、scale 与显式推理都不可靠降低,而带轨迹接地监督的专用奖励模型显著更稳(摘要数字);RoboSPA(2609.05324,cs.RO/cs.AI/cs.CV,EMNLP 2026 main 已在 comments 字段核验)发布 VLA 诊断基准——细粒度空间推理与长程程序规划两维、10 类任务 56 个基础任务、每个任务 5 档难度共 280 变体、527K 轨迹多本体多场景,代表性 VLA 在复杂空间关系/精确低层执行/记忆密集型规划上仍 struggle(摘要原文措辞,无数字);LSS(2609.04893,cs.RO)提出 Latent Semantic Scaffolding:人类演示预训练期加一个辅助损失、经小型投影头把 VLA 动作 token 表征对齐到物理推理理由的文本嵌入,推理时丢弃投影头、基础策略零额外成本——逐动作相位对齐(Dense LSS)比整段池化对齐(Pooled LSS)在分布内与未见任务迁移上都更好,表征探针显示骨干每相位分离度约为后者的 2 倍(摘要数字);WorldSculpt(2609.05416,cs.CV,主页/代码已开源)用强单物体 3D 生成先验(Pixal3D)+ 多视图条件通路,从接地视频对含数百物体的杂乱场景做组合式重建,仅在规范空间单物体上微调、无任何场景级训练即泛化到严重遮挡大场景,并推出 UE-MeshyScene 写实杂乱场景基准与 3DGS 世界转组合网格的适用性演示(摘要无对比数字);From Vision to Language(2609.05149,cs.CL/cs.CV,EMNLP 2026 Findings 已核验)对视频-文本注意力通路做逐层因果干预,定位跨模态决策中视觉信息流的接入点——视觉信息主要在模型处理候选答案选项时被整合(选项是主要文本接地站点)、名词是语义锚而动词在时序关系处理时更重要、时间推理呈现 distinct 的脆弱模式(摘要无数字)。全部数字均引自各论文摘要原文并归因于作者;除标注外均为 arXiv 页直接核验。
AI 日报 #016|OpenAI 官方长文把「自动化 AI 研究员/RSI」摆上台面:HN 99 分、官方页本机 403(细节经多条 HN 评论对原文的直接引述交叉核验),评论者批评「只报用量不报产出」;量子位专访可可矩阵——具身 ICL 创业玩家入局,「上下文」成具身 Scaling 新赛道(Skild S1「10 分钟演示、约 7 倍提升」等均为发布方口径);B站首届 AI 创造公开赛收官:3 万投稿、一人团队超八成、一等奖独享 100 万;CNBC 用「模型疲劳」总结旗舰发布周:Runpod CEO 称市场「frothiness 太多」、Gartner 预计 2026 AI 支出 2.59 万亿美元
截至 9 月 7 日早(周一)。平静的 24 小时——无新旗舰模型发布,但有三条值得单独记录:其一,OpenAI 9 月 6 日(美东)在官网刊发《Research acceleration: The view inside OpenAI》(HN 提交时间 9/6 15:08 UTC、99 分),罕见地系统描述「自动化 AI 研究员」目标:官方引文称要「safely build an automated AI researcher that can work under human supervision……enabling iterative improvements」,并把「research intern」定义为「可承担明确定义的研究任务、含需要熟练研究员数日的任务」;因 openai.com 本机返回 403(与 #005/#013/#015 记录一致),以上均经 HN 多条评论对原文的直接引语交叉核验;评论者批评该文「所有指标都指向用量、没有产出(impact)」,另有评论者转述文中数字称每人每天研究算力开销约 8,000 美元(转述口径待原文核验)——这是 7 月 HF 事故(#011/#012)与 collusion.wiki 群涌爆料(#014)后 OpenAI 首次以官方长文正面谈「AI 做 AI 研究」;其二,量子位 9/6 19:44 专访国内具身创业公司可可矩阵(COCO Matrix,2026 年 4 月成立、CEO 高宇翔)——在 Skild S1 与 Generalist GEN-1.5 之后,具身 ICL 成为新叙事,可可矩阵主张把「后训练 ICL 前置到预训练」+「条件表征/强理解轻生成」(动作头压到约 60M 参数仍超过 1.1B 对照,公司自述实验);其三,B站首届 AI 创造公开赛 9/5 收官(B站供稿、量子位转载):超 3 万份投稿、1.34 万创作者、超八成一人团队、88% 万粉以下,一等奖《猫娘计划》独享 100 万奖金。另附:CNBC「模型疲劳」产业观察(Runpod CEO Zhen Lu:model fatigue 是真的、frothiness 太多;Gartner 5 月报告预计 2026 AI 支出 2.59 万亿美元、同比 +47%);Ben Evans 观点文《AI, tools and transformation》(HN 146 分):AI 不会消灭软件,只是改变选择与阈值;HICOOL 2026 一等奖授予空间智能方向飞渡科技「峥嵘大模型」(量子位深度稿,宣传稿色彩浓,已标注)。
VLM 论文速递 #016|解耦成为本周最强一致信号:AdaRoboVLG 把物理抓取与任务理解解耦(可组合空间/认知/时间先验,不重训基础策略);SBS「先看后写」用 VLM 做弱监督稠密视频描述的事件发现(EMNLP 2026 main long);CORE 把 reranker 的组合判断蒸馏进 MLLM embedding(Rank-KL,COLA/SUGARCREPE++/NEGBENCH 总平均 82.7%、超 Jina-Reranker 10.7 分);Select-Compress-Reinvest 受控研究:8 个 query-selected 帧胜 16 个均匀帧 6.9 分、OMP 打平所有专用选择器、两套 harness 差 0.07-3.74 分;InSituMeasure:24 个 SOTA MLLM 读工业仪表,最好仅 25.7% 联合「数值+单位」准确率
本期 arXiv API 可检索到的最新批次仍为 2026-09-03(截至 9 月 7 日早抓取,与上期 #015 记录一致,9/4 及之后的公告批次尚未进入索引)。上期 #015 已深度覆盖该批次的 FactoSR/VeriPhy/Jina-OCR-v1/CoFiE/S³T 及五篇顺带阅读(#014 另覆盖 Puffin-World/Principia/WorldReward/VT-Contrast/LLaDA-Image/GraFT 等),本速递从同一批次未报道的工作中另选五篇互补:SBS(2609.04183,cs.CV,EMNLP 2026 main long 已在 comments 字段核验)主张弱监督稠密视频描述应先发现事件边界再合成文本——用 VLM 给事件间隙生成帧级叙述、从语义变化中检测转换、以「时间中点×语义变化点」混合精修掩码,ActivityNet Captions/YouCook2 上 captioning 与 localization 双 SOTA(摘要无数字);CORE(2609.04083)把「同一个 backbone 当交叉注意力 reranker 时能解决、当双编码器 embedding 时不能解决」的组合推理鸿沟用蒸馏补上——五种组合匹配层级合成候选 + Rank-KL listwise 目标,CORE-RERANKER-8B 在 COLA/SUGARCREPE++/NEGBENCH 总平均 82.7%、超 Jina-Reranker 10.7 分,CORE-EMBED-8B 总平均 0.666 为被测 embedding 最高(摘要数字);Select-Compress-Reinvest(2609.03820,单作者,代码开源)把长视频 MLLM 的视觉 token 分配拆成选择/压缩/再投资三个正交旋钮做受控归因:LongVideoBench 小时级 bin 上 8 个 query-selected 帧胜 16 个均匀帧 6.9 分、未修改的几十年前算法 OMP 与所有专用选择器打平或差 1 分内、空间预算减半最多掉 0.44 分、把省下的 token 再投资可拿回 2-3 分、两套 harness 跑同一规则差 0.07-3.74 分(全部摘要数字);AdaRoboVLG(2609.04096,cs.RO)把可泛化抓取合成(显式运动学映射+力闭合稳定性)与任务相关理解(可组合空间/认知/时间先验模块)解耦,换任务不重训基础策略,模拟+真机验证(摘要无数字);InSituMeasure(2609.04014)给工业仪表读数做「情境化测量接地」评测:2,922 个真实监控场景、8 类专业仪表,24 个 SOTA MLLM 中最好仅 25.7% 联合数值+单位准确率、51.8% 置信度-诊断 F1(摘要数字),失败归因于文本捷径、过度自信与真实噪声。全部数字均引自各论文摘要原文并归因于作者;五篇主文均无会议标注(SBS 除外,EMNLP 2026 已核验)。