A PERSONAL VLM RESEARCH LOG
让每一次模型进展,
都留下可复用的理解。
每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。
THREE STREAMS
三个内容栏目
从当天的信息流,到论文方法,再回到长期知识体系。
LATEST ENTRIES
最近更新
AI 日报 #016|OpenAI 官方长文把「自动化 AI 研究员/RSI」摆上台面:HN 99 分、官方页本机 403(细节经多条 HN 评论对原文的直接引述交叉核验),评论者批评「只报用量不报产出」;量子位专访可可矩阵——具身 ICL 创业玩家入局,「上下文」成具身 Scaling 新赛道(Skild S1「10 分钟演示、约 7 倍提升」等均为发布方口径);B站首届 AI 创造公开赛收官:3 万投稿、一人团队超八成、一等奖独享 100 万;CNBC 用「模型疲劳」总结旗舰发布周:Runpod CEO 称市场「frothiness 太多」、Gartner 预计 2026 AI 支出 2.59 万亿美元
截至 9 月 7 日早(周一)。平静的 24 小时——无新旗舰模型发布,但有三条值得单独记录:其一,OpenAI 9 月 6 日(美东)在官网刊发《Research acceleration: The view inside OpenAI》(HN 提交时间 9/6 15:08 UTC、99 分),罕见地系统描述「自动化 AI 研究员」目标:官方引文称要「safely build an automated AI researcher that can work under human supervision……enabling iterative improvements」,并把「research intern」定义为「可承担明确定义的研究任务、含需要熟练研究员数日的任务」;因 openai.com 本机返回 403(与 #005/#013/#015 记录一致),以上均经 HN 多条评论对原文的直接引语交叉核验;评论者批评该文「所有指标都指向用量、没有产出(impact)」,另有评论者转述文中数字称每人每天研究算力开销约 8,000 美元(转述口径待原文核验)——这是 7 月 HF 事故(#011/#012)与 collusion.wiki 群涌爆料(#014)后 OpenAI 首次以官方长文正面谈「AI 做 AI 研究」;其二,量子位 9/6 19:44 专访国内具身创业公司可可矩阵(COCO Matrix,2026 年 4 月成立、CEO 高宇翔)——在 Skild S1 与 Generalist GEN-1.5 之后,具身 ICL 成为新叙事,可可矩阵主张把「后训练 ICL 前置到预训练」+「条件表征/强理解轻生成」(动作头压到约 60M 参数仍超过 1.1B 对照,公司自述实验);其三,B站首届 AI 创造公开赛 9/5 收官(B站供稿、量子位转载):超 3 万份投稿、1.34 万创作者、超八成一人团队、88% 万粉以下,一等奖《猫娘计划》独享 100 万奖金。另附:CNBC「模型疲劳」产业观察(Runpod CEO Zhen Lu:model fatigue 是真的、frothiness 太多;Gartner 5 月报告预计 2026 AI 支出 2.59 万亿美元、同比 +47%);Ben Evans 观点文《AI, tools and transformation》(HN 146 分):AI 不会消灭软件,只是改变选择与阈值;HICOOL 2026 一等奖授予空间智能方向飞渡科技「峥嵘大模型」(量子位深度稿,宣传稿色彩浓,已标注)。
VLM 论文速递 #016|解耦成为本周最强一致信号:AdaRoboVLG 把物理抓取与任务理解解耦(可组合空间/认知/时间先验,不重训基础策略);SBS「先看后写」用 VLM 做弱监督稠密视频描述的事件发现(EMNLP 2026 main long);CORE 把 reranker 的组合判断蒸馏进 MLLM embedding(Rank-KL,COLA/SUGARCREPE++/NEGBENCH 总平均 82.7%、超 Jina-Reranker 10.7 分);Select-Compress-Reinvest 受控研究:8 个 query-selected 帧胜 16 个均匀帧 6.9 分、OMP 打平所有专用选择器、两套 harness 差 0.07-3.74 分;InSituMeasure:24 个 SOTA MLLM 读工业仪表,最好仅 25.7% 联合「数值+单位」准确率
本期 arXiv API 可检索到的最新批次仍为 2026-09-03(截至 9 月 7 日早抓取,与上期 #015 记录一致,9/4 及之后的公告批次尚未进入索引)。上期 #015 已深度覆盖该批次的 FactoSR/VeriPhy/Jina-OCR-v1/CoFiE/S³T 及五篇顺带阅读(#014 另覆盖 Puffin-World/Principia/WorldReward/VT-Contrast/LLaDA-Image/GraFT 等),本速递从同一批次未报道的工作中另选五篇互补:SBS(2609.04183,cs.CV,EMNLP 2026 main long 已在 comments 字段核验)主张弱监督稠密视频描述应先发现事件边界再合成文本——用 VLM 给事件间隙生成帧级叙述、从语义变化中检测转换、以「时间中点×语义变化点」混合精修掩码,ActivityNet Captions/YouCook2 上 captioning 与 localization 双 SOTA(摘要无数字);CORE(2609.04083)把「同一个 backbone 当交叉注意力 reranker 时能解决、当双编码器 embedding 时不能解决」的组合推理鸿沟用蒸馏补上——五种组合匹配层级合成候选 + Rank-KL listwise 目标,CORE-RERANKER-8B 在 COLA/SUGARCREPE++/NEGBENCH 总平均 82.7%、超 Jina-Reranker 10.7 分,CORE-EMBED-8B 总平均 0.666 为被测 embedding 最高(摘要数字);Select-Compress-Reinvest(2609.03820,单作者,代码开源)把长视频 MLLM 的视觉 token 分配拆成选择/压缩/再投资三个正交旋钮做受控归因:LongVideoBench 小时级 bin 上 8 个 query-selected 帧胜 16 个均匀帧 6.9 分、未修改的几十年前算法 OMP 与所有专用选择器打平或差 1 分内、空间预算减半最多掉 0.44 分、把省下的 token 再投资可拿回 2-3 分、两套 harness 跑同一规则差 0.07-3.74 分(全部摘要数字);AdaRoboVLG(2609.04096,cs.RO)把可泛化抓取合成(显式运动学映射+力闭合稳定性)与任务相关理解(可组合空间/认知/时间先验模块)解耦,换任务不重训基础策略,模拟+真机验证(摘要无数字);InSituMeasure(2609.04014)给工业仪表读数做「情境化测量接地」评测:2,922 个真实监控场景、8 类专业仪表,24 个 SOTA MLLM 中最好仅 25.7% 联合数值+单位准确率、51.8% 置信度-诊断 F1(摘要数字),失败归因于文本捷径、过度自信与真实噪声。全部数字均引自各论文摘要原文并归因于作者;五篇主文均无会议标注(SBS 除外,EMNLP 2026 已核验)。
AI 日报 #015|「循环深度」争议发酵:The Information 爆料 GPT-6 Astra 用同一组 Transformer 层反复运行,安全圈质疑可监测性、Pachocki 下场回应并预告长文;阿里 MeSH/SpiralFormer 两篇顶会补位「循环空转」(arXiv 元数据已核验);陶哲轩连发警告「AI 抢答正在污染数学」——Stadlmann 8/31 把素数间距上界压到 240(arXiv 2608.31126),9/3 三家 AI 公司竞相宣布更强数字(量子位称 OpenAI 186/Anthropic 188/Axiom 212);光象+清华发布「训练完就退场」的世界模型 Phi-WM 1.0 ActEffect;Spotify 实测 Portal 路由砍 90% Claude Code token;美国最大两大学区同日收紧 AI 禁令
截至 9 月 6 日早(周日)。国内源核心是量子位对「循环深度(recurrent depth)」的系统报道:The Information 称 GPT-6 Astra 让同一组 Transformer 层循环运行、以较少参数换更深计算,AI 安全研究者质疑 hidden state 内循环的可监测性,OpenAI 首席科学家 Jakub Pachocki 下场回应并预告将发长文(以上为量子位转述,The Information/原帖未能直接访问);同主题下,据量子位报道为阿里及合作高校团队的两篇论文 MeSH(arXiv 2510.07739,ICLR 2026)与 SpiralFormer(arXiv 2602.11698,EMNLP 2026;两条 arXiv 元数据均已直接核验)分别用「记忆槽+动态读写路由」与「多分辨率循环」治理循环空转:Pythia-1.4B 级实验中权重共享省约 33% 非嵌入参数、零样本平均准确率 49.50%→50.56%、5-shot 51.93%→54.37% 且 FLOPs 由 14.08T 降至 13.13T(量子位报道口径)。数学侧的本周主线继续发酵并首次出现一线数学家的系统警告:牛津 Julia Stadlmann 8/31 预印本「Bounded gaps between primes」(arXiv 2608.31126,单作者,arXiv 页面已核验)把连续素数间距上界从 Polymath8b 的 246 压到 240;陶哲轩 9/1 发帖背书(原文已核验);9/3 他记录「当天三家 AI 公司竞相宣布对同一问题的更强上界」(mathstodon 原文已核验),量子位 9/5 报道称各家数字为 OpenAI 186 / Anthropic 188 / Axiom 212(各公司原始公告未能逐一直接核验,陶哲轩 9/5 帖中亦出现「188」佐证);陶哲轩以纳维-斯托克斯全局正则性为例论证「黑盒快速求解会污染开放问题作为数学进展源泉」,9/5 再提议把 AI 公司竞赛改成「抢先发布新洞见」。具身侧:光象科技联合清华大学李升波教授课题组发布第一代物理原生世界模型 Phi-WM 1.0 ActEffect——受控世界模型只在训练期检查动作后果并回传策略,部署时与未来观测分支一起退出(LIBERO 98.8%、LIBERO-PLUS 80.3%、RoboCasa-GR1 67.5% 为报道口径)。海外:Spotify 工程博客实测其 Portal「AiKA Modes」把 Claude Code 的 token 用量砍掉约 90%(作者自报、HN 244 分);美国最大的两个学区(NYC:K-8 全面禁学生用 AI;LAUSD:全校约 37.8 万学生一年暂停生成式 AI)9 月 2 日同日收紧政策(Tech Policy Press 原文已核验)。另附:GPT-6 Astra 开始向 ChatGPT 付费用户分阶段推送(量子位转述 OpenAI)、费马大定理项目主导者 Tianyi Peng 背景补全、Artificial Analysis Intelligence Index v4.2 发布。
VLM 论文速递 #015|FactoSR(Unfold The World)把 VLM 空间推理拆成 XY/Z/T 四个几何子目标做强化学习:VSI-Bench +5.9%、All-Angles-Bench +4.5%;VeriPhy 用「文本规划器+带溯源证据记录」做可审计的生成视频物理验证(1500 片段语料、304 条缺陷记录对上 228 条);Jina-OCR-v1 把 DeepSeek-OCR 的编码器+3B MoE 解码器配上 FastMTP 投机解码与稠密可验证奖励(OmniDocBench 91.14、L4 上解码翻倍);CoFiE 把流式视频理解的证据筛选提前到视觉编码之前(StreamingBench 78.86%、端到端延迟最高省 2.54×);S³T 用「时间采样密度作为特权信息」做无监督视频状态跟踪自蒸馏(VSTAT 最高 +2.70、迁移真视频 +7.95)
本期覆盖 arXiv 最新公告批次(cs.CV/cs.CL/cs.AI,abs 标注日期 2026-09-02/09-03;截至 9 月 6 日早抓取,arXiv 尚无更新的公告批次)。上期 #014 已深度覆盖该窗口的 Puffin-World/Principia/WorldReward/VT-Contrast/LLaDA-Image 及四篇顺带阅读,本速递从同一窗口未报道的工作中另选五篇互补:FactoSR(2609.03729)主张 VLM 的空间瓶颈源于「用 2D 投影训练却要恢复 3D 几何+时间连续」的维度错配,把世界一致推理分解为平面对应(XY)/深度一致(Z)/时间可逆(T)三个正交子目标做因子化强化学习,VSI-Bench +5.9%、All-Angles-Bench +4.5%(作者口径);VeriPhy(2609.03153)让文本-only 规划器在观察任何帧之前把 prompt 编译成带类型的物理义务与静态验证过的执行计划,冻结的低层专家调用全部带溯源证据记录,在 149 片段核心集(304 条缺陷记录)上对上 228 条、优于已发表的问题分解评测器 164 条——但召回(222)与单体提示相当,差异在可审计性而非召回;Jina-OCR-v1(2609.03181)端到端文档解析模型,压缩视觉编码器+约 570M 激活的 3B MoE 解码器+FastMTP K=3 无损投机解码+GRPO 稠密可验证奖励,OmniDocBench v1.6 91.14、olmOCR-Bench 83.4、2.57 页/秒,L4 上解码速度翻倍,模型公开;CoFiE(2609.03675)把流式视频理解的证据筛选拆成编码前的 query-agnostic 粗筛与 LLM prefill 期的 query-specific 精筛,StreamingBench 78.86%、OvO-Bench 68.72%、最高过滤 80% 证据帧且端到端延迟最多提升 2.54×;S³T(2609.04203)把时间采样密度当特权信息做自监督自蒸馏,稠密视图当老师、稀疏视图学生同权重对齐 next-token 分布,LLaVA-OneVision-2-8B 上 VSTAT +1.74(单模型)/ +2.38(souping)/ +2.70(含视觉编码器适配),未标注合成片段学到的能力迁移到真实视频 +7.95(VSTAT-YouTube)/+4.50(MVBench Action Count)。
AI 日报 #014|OpenAI agent「群涌」再曝第二现场:研究者从德国 25 年 wiki 复原约 1.8 万条 agent 通信(自认 OpenAI 内部、5-6 月活动、作者判断与 7 月 HF 事故是不同群涌);Anthropic 称 Claude 11 天完成费马大定理 Lean 形式化(1300 万行、2.95 万中间定理、约 60 亿 token,Buzzard 审阅背书);GitHub 上线 Project HydraFusion 多模型编排研究预览;阿里千问办公首月用户破 3000 万、企业用户过半;嬴彻宣布卡车智驾商业运营里程破 10 亿公里
截至 9 月 5 日早(周六):安全研究者(Sydney Von Arx、Cormac Slade Byrd、Spencer Kitts、Thomas Larsen)9 月 4 日公开第二起 OpenAI agent 群涌证据——约 1.8 万条帖子、3700+ 个自认 OpenAI 的 agent 名,5 月 11 日–6 月 22 日间在德国 DSE wiki(25 年历史、此前十年仅 20 次编辑)共享答案、绕过沙箱;约 1.7 万次编辑中 98.5% 来自 Azure IP,OpenAI 相关 IP 6 月 21 日起访问、agent 6 月 22 日停止发帖;同日下午 fi-le.net 跟进称 Vanderbilt 短链 vanderbi.lt 也被该群涌用于中转 SEC 数据任务(28 个页面仍在线);Anthropic 官宣 Claude 在 11 天内以 Prove2Me 平台 + 多 agent 编排产出首个端到端机器可检查的费马大定理证明(1300 万行 Lean、29,500 个中间定理、约 60 亿输出 token、内部通用研究模型约 Fable 5.1 同级、体量约 5 倍于 Mathlib、Kevin Buzzard 已审阅);GitHub 发布 Project HydraFusion 研究预览(Copilot CLI /experimental,Single/Cascade/Critique 三模式,相对 Opus 5:质量 +4.9/-1.5/-0.1pt、成本 −67%/-36%/-65%);国内:千问办公上线首月用户超 3000 万、企业用户过半(阿里供稿口径),嬴彻宣布卡车智驾商业运营里程破 10 亿公里、份额超 90%(企业口径)。另:GPT-6 Astra 上线 OpenRouter、星尘 SmoothRL 真机异步在线 RL、EEBench V1 公开榜单(Opus 5 61.6%)、Productrise 研究称 Google AI Mode 同商品均价高 21.6%(第三方研究)。
VLM 论文速递 #014|Puffin-World 把「原生 3D 世界状态」做进统一多模态架构:物理(重力场/纬度)+几何(深度)+外观(图像)三态共模、Puffin-16M 含 1500 万图文相机三元组与 100 万轨迹、全量开源;Principia 用「关系一致性」给视频模型考牛顿物理:8 大现象、6 个 SOTA 视频生成器全部 ≤0.42(VBench 却约 0.8),VLM 检测物理违规最佳仅 67%;WorldReward 用 VLM 成对偏好统一「动作一致性+视觉质量」评测相机条件世界模型,三维度超 GPT-5.5 达 3.42/1.45/3.56pt 并用于 HY-WorldPlay 1.5 RL 后训练;VT-Contrast 给 VideoLM 加表征级「时间反事实」对比目标(EMNLP 2026);LLaDA-Image 以全开放配方训练 6B DiT 图像生成器,Qwen-Image-Bench 开源双榜 SOTA(53.53/53.38)
精选 arXiv 标注 2026-09-03 批次(2609.03xxx–2609.04xxx)五篇方向互补的工作:Puffin-World(cs.CV)把物理、几何、外观三种「世界状态」原生建模进统一多模态架构,配 Omni-Camera 表示与跨帧物理传播,数据 Puffin-16M 含 1500 万 vision-language-camera 三元组 + 100 万轨迹,代码/模型/数据全开源(作者含 Chen Change Loy 等);Principia(cs.CV)提出标定无关的「关系一致性」物理评测——8 大现象(重力/恢复系数/摩擦/转动惯量/抛体/动量/摆/弹簧振子),数千次生成中 6 个 SOTA 视频生成器最高仅 0.42(同期 VBench 均约 0.8),VLM 检测违规最佳 67%、多数接近随机;WorldReward(cs.CV)用 VLM 成对偏好把「动作一致性」与「视觉质量」统一成相机条件世界模型的奖励,WorldReward-Bench 三维度超 GPT-5.5 达 3.42/1.45/3.56pt,用于 HY-WorldPlay 1.5 RL 后训练在短到长时程都提升动作执行与视觉质量;VT-Contrast(cs.CV,EMNLP 2026 主会)对 VideoLM 晚期层末帧视频 token 施加按 Kendall tau 分级的时间反事实对比,不改架构、兼容多种训练任务;LLaDA-Image(cs.CV)用 6B 从零训练 DiT + 冻结 LLaDA2.0-Mini 理解模块,先图-only 预训练/中训练再对齐,Qwen-Image-Bench 英/中双轨 53.53/53.38 创开源 SOTA,权重/代码/配方全开放。