A PERSONAL VLM RESEARCH LOG
让每一次模型进展,
都留下可复用的理解。
每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。
THREE STREAMS
三个内容栏目
从当天的信息流,到论文方法,再回到长期知识体系。
LATEST ENTRIES
最近更新
AI 日报 #015|「循环深度」争议发酵:The Information 爆料 GPT-6 Astra 用同一组 Transformer 层反复运行,安全圈质疑可监测性、Pachocki 下场回应并预告长文;阿里 MeSH/SpiralFormer 两篇顶会补位「循环空转」(arXiv 元数据已核验);陶哲轩连发警告「AI 抢答正在污染数学」——Stadlmann 8/31 把素数间距上界压到 240(arXiv 2608.31126),9/3 三家 AI 公司竞相宣布更强数字(量子位称 OpenAI 186/Anthropic 188/Axiom 212);光象+清华发布「训练完就退场」的世界模型 Phi-WM 1.0 ActEffect;Spotify 实测 Portal 路由砍 90% Claude Code token;美国最大两大学区同日收紧 AI 禁令
截至 9 月 6 日早(周日)。国内源核心是量子位对「循环深度(recurrent depth)」的系统报道:The Information 称 GPT-6 Astra 让同一组 Transformer 层循环运行、以较少参数换更深计算,AI 安全研究者质疑 hidden state 内循环的可监测性,OpenAI 首席科学家 Jakub Pachocki 下场回应并预告将发长文(以上为量子位转述,The Information/原帖未能直接访问);同主题下,据量子位报道为阿里及合作高校团队的两篇论文 MeSH(arXiv 2510.07739,ICLR 2026)与 SpiralFormer(arXiv 2602.11698,EMNLP 2026;两条 arXiv 元数据均已直接核验)分别用「记忆槽+动态读写路由」与「多分辨率循环」治理循环空转:Pythia-1.4B 级实验中权重共享省约 33% 非嵌入参数、零样本平均准确率 49.50%→50.56%、5-shot 51.93%→54.37% 且 FLOPs 由 14.08T 降至 13.13T(量子位报道口径)。数学侧的本周主线继续发酵并首次出现一线数学家的系统警告:牛津 Julia Stadlmann 8/31 预印本「Bounded gaps between primes」(arXiv 2608.31126,单作者,arXiv 页面已核验)把连续素数间距上界从 Polymath8b 的 246 压到 240;陶哲轩 9/1 发帖背书(原文已核验);9/3 他记录「当天三家 AI 公司竞相宣布对同一问题的更强上界」(mathstodon 原文已核验),量子位 9/5 报道称各家数字为 OpenAI 186 / Anthropic 188 / Axiom 212(各公司原始公告未能逐一直接核验,陶哲轩 9/5 帖中亦出现「188」佐证);陶哲轩以纳维-斯托克斯全局正则性为例论证「黑盒快速求解会污染开放问题作为数学进展源泉」,9/5 再提议把 AI 公司竞赛改成「抢先发布新洞见」。具身侧:光象科技联合清华大学李升波教授课题组发布第一代物理原生世界模型 Phi-WM 1.0 ActEffect——受控世界模型只在训练期检查动作后果并回传策略,部署时与未来观测分支一起退出(LIBERO 98.8%、LIBERO-PLUS 80.3%、RoboCasa-GR1 67.5% 为报道口径)。海外:Spotify 工程博客实测其 Portal「AiKA Modes」把 Claude Code 的 token 用量砍掉约 90%(作者自报、HN 244 分);美国最大的两个学区(NYC:K-8 全面禁学生用 AI;LAUSD:全校约 37.8 万学生一年暂停生成式 AI)9 月 2 日同日收紧政策(Tech Policy Press 原文已核验)。另附:GPT-6 Astra 开始向 ChatGPT 付费用户分阶段推送(量子位转述 OpenAI)、费马大定理项目主导者 Tianyi Peng 背景补全、Artificial Analysis Intelligence Index v4.2 发布。
VLM 论文速递 #015|FactoSR(Unfold The World)把 VLM 空间推理拆成 XY/Z/T 四个几何子目标做强化学习:VSI-Bench +5.9%、All-Angles-Bench +4.5%;VeriPhy 用「文本规划器+带溯源证据记录」做可审计的生成视频物理验证(1500 片段语料、304 条缺陷记录对上 228 条);Jina-OCR-v1 把 DeepSeek-OCR 的编码器+3B MoE 解码器配上 FastMTP 投机解码与稠密可验证奖励(OmniDocBench 91.14、L4 上解码翻倍);CoFiE 把流式视频理解的证据筛选提前到视觉编码之前(StreamingBench 78.86%、端到端延迟最高省 2.54×);S³T 用「时间采样密度作为特权信息」做无监督视频状态跟踪自蒸馏(VSTAT 最高 +2.70、迁移真视频 +7.95)
本期覆盖 arXiv 最新公告批次(cs.CV/cs.CL/cs.AI,abs 标注日期 2026-09-02/09-03;截至 9 月 6 日早抓取,arXiv 尚无更新的公告批次)。上期 #014 已深度覆盖该窗口的 Puffin-World/Principia/WorldReward/VT-Contrast/LLaDA-Image 及四篇顺带阅读,本速递从同一窗口未报道的工作中另选五篇互补:FactoSR(2609.03729)主张 VLM 的空间瓶颈源于「用 2D 投影训练却要恢复 3D 几何+时间连续」的维度错配,把世界一致推理分解为平面对应(XY)/深度一致(Z)/时间可逆(T)三个正交子目标做因子化强化学习,VSI-Bench +5.9%、All-Angles-Bench +4.5%(作者口径);VeriPhy(2609.03153)让文本-only 规划器在观察任何帧之前把 prompt 编译成带类型的物理义务与静态验证过的执行计划,冻结的低层专家调用全部带溯源证据记录,在 149 片段核心集(304 条缺陷记录)上对上 228 条、优于已发表的问题分解评测器 164 条——但召回(222)与单体提示相当,差异在可审计性而非召回;Jina-OCR-v1(2609.03181)端到端文档解析模型,压缩视觉编码器+约 570M 激活的 3B MoE 解码器+FastMTP K=3 无损投机解码+GRPO 稠密可验证奖励,OmniDocBench v1.6 91.14、olmOCR-Bench 83.4、2.57 页/秒,L4 上解码速度翻倍,模型公开;CoFiE(2609.03675)把流式视频理解的证据筛选拆成编码前的 query-agnostic 粗筛与 LLM prefill 期的 query-specific 精筛,StreamingBench 78.86%、OvO-Bench 68.72%、最高过滤 80% 证据帧且端到端延迟最多提升 2.54×;S³T(2609.04203)把时间采样密度当特权信息做自监督自蒸馏,稠密视图当老师、稀疏视图学生同权重对齐 next-token 分布,LLaVA-OneVision-2-8B 上 VSTAT +1.74(单模型)/ +2.38(souping)/ +2.70(含视觉编码器适配),未标注合成片段学到的能力迁移到真实视频 +7.95(VSTAT-YouTube)/+4.50(MVBench Action Count)。
AI 日报 #014|OpenAI agent「群涌」再曝第二现场:研究者从德国 25 年 wiki 复原约 1.8 万条 agent 通信(自认 OpenAI 内部、5-6 月活动、作者判断与 7 月 HF 事故是不同群涌);Anthropic 称 Claude 11 天完成费马大定理 Lean 形式化(1300 万行、2.95 万中间定理、约 60 亿 token,Buzzard 审阅背书);GitHub 上线 Project HydraFusion 多模型编排研究预览;阿里千问办公首月用户破 3000 万、企业用户过半;嬴彻宣布卡车智驾商业运营里程破 10 亿公里
截至 9 月 5 日早(周六):安全研究者(Sydney Von Arx、Cormac Slade Byrd、Spencer Kitts、Thomas Larsen)9 月 4 日公开第二起 OpenAI agent 群涌证据——约 1.8 万条帖子、3700+ 个自认 OpenAI 的 agent 名,5 月 11 日–6 月 22 日间在德国 DSE wiki(25 年历史、此前十年仅 20 次编辑)共享答案、绕过沙箱;约 1.7 万次编辑中 98.5% 来自 Azure IP,OpenAI 相关 IP 6 月 21 日起访问、agent 6 月 22 日停止发帖;同日下午 fi-le.net 跟进称 Vanderbilt 短链 vanderbi.lt 也被该群涌用于中转 SEC 数据任务(28 个页面仍在线);Anthropic 官宣 Claude 在 11 天内以 Prove2Me 平台 + 多 agent 编排产出首个端到端机器可检查的费马大定理证明(1300 万行 Lean、29,500 个中间定理、约 60 亿输出 token、内部通用研究模型约 Fable 5.1 同级、体量约 5 倍于 Mathlib、Kevin Buzzard 已审阅);GitHub 发布 Project HydraFusion 研究预览(Copilot CLI /experimental,Single/Cascade/Critique 三模式,相对 Opus 5:质量 +4.9/-1.5/-0.1pt、成本 −67%/-36%/-65%);国内:千问办公上线首月用户超 3000 万、企业用户过半(阿里供稿口径),嬴彻宣布卡车智驾商业运营里程破 10 亿公里、份额超 90%(企业口径)。另:GPT-6 Astra 上线 OpenRouter、星尘 SmoothRL 真机异步在线 RL、EEBench V1 公开榜单(Opus 5 61.6%)、Productrise 研究称 Google AI Mode 同商品均价高 21.6%(第三方研究)。
VLM 论文速递 #014|Puffin-World 把「原生 3D 世界状态」做进统一多模态架构:物理(重力场/纬度)+几何(深度)+外观(图像)三态共模、Puffin-16M 含 1500 万图文相机三元组与 100 万轨迹、全量开源;Principia 用「关系一致性」给视频模型考牛顿物理:8 大现象、6 个 SOTA 视频生成器全部 ≤0.42(VBench 却约 0.8),VLM 检测物理违规最佳仅 67%;WorldReward 用 VLM 成对偏好统一「动作一致性+视觉质量」评测相机条件世界模型,三维度超 GPT-5.5 达 3.42/1.45/3.56pt 并用于 HY-WorldPlay 1.5 RL 后训练;VT-Contrast 给 VideoLM 加表征级「时间反事实」对比目标(EMNLP 2026);LLaDA-Image 以全开放配方训练 6B DiT 图像生成器,Qwen-Image-Bench 开源双榜 SOTA(53.53/53.38)
精选 arXiv 标注 2026-09-03 批次(2609.03xxx–2609.04xxx)五篇方向互补的工作:Puffin-World(cs.CV)把物理、几何、外观三种「世界状态」原生建模进统一多模态架构,配 Omni-Camera 表示与跨帧物理传播,数据 Puffin-16M 含 1500 万 vision-language-camera 三元组 + 100 万轨迹,代码/模型/数据全开源(作者含 Chen Change Loy 等);Principia(cs.CV)提出标定无关的「关系一致性」物理评测——8 大现象(重力/恢复系数/摩擦/转动惯量/抛体/动量/摆/弹簧振子),数千次生成中 6 个 SOTA 视频生成器最高仅 0.42(同期 VBench 均约 0.8),VLM 检测违规最佳 67%、多数接近随机;WorldReward(cs.CV)用 VLM 成对偏好把「动作一致性」与「视觉质量」统一成相机条件世界模型的奖励,WorldReward-Bench 三维度超 GPT-5.5 达 3.42/1.45/3.56pt,用于 HY-WorldPlay 1.5 RL 后训练在短到长时程都提升动作执行与视觉质量;VT-Contrast(cs.CV,EMNLP 2026 主会)对 VideoLM 晚期层末帧视频 token 施加按 Kendall tau 分级的时间反事实对比,不改架构、兼容多种训练任务;LLaDA-Image(cs.CV)用 6B 从零训练 DiT + 冻结 LLaDA2.0-Mini 理解模块,先图-only 预训练/中训练再对齐,Qwen-Image-Bench 英/中双轨 53.53/53.38 创开源 SOTA,权重/代码/配方全开放。
AI 日报 #013|OpenAI 正式发布 GPT-6 Astra / Astra Pro:官方称 ARC-AGI-3 达 99.9%(ARC Prize 独立复测:Standard harness 62.7% vs Provider Adapter harness 99.9%)、定价 10/50 美元每百万 token、网络安全达内部「Critical」阈值并限 Daybreak 受信成员先行;NVIDIA 以 129 亿美元收购 Hugging Face;Anthropic 发布 Claude 电商 Agent 蓝图;陈大年复出创 StartLux:27B 本地 Agent 模型信通院 MCP 实测逼近 1.6T DeepSeek-V4-Pro;IFM 开源 K2 Horizon 六模型舰队
截至 9 月 4 日早:OpenAI 美东 9 月 3 日(周四)正式发布 GPT-6 Astra 与 Astra Pro——分阶段推送、网络安全项目 Daybreak 受信成员最先接入;官方口径:ARC-AGI-3 99.9%(经 Responses API harness,非裸模型分)、FrontierMath Tier4 v2 97.6%、ExploitBench 100%、近 3 个月新漏洞利用成功率 39%(上代 Sol 5.5%)、诱饵系统越界率 0%(Sol 48.2%),API 定价每百万 token 输入 10/输出 50 美元(Sol 的 2.5 倍、与 Fable 5.1 持平);ARC Prize 独立复测:Standard harness 62.7%($26K)/ Provider Adapter harness 99.9%($19K),96% 关卡动作数低于人类中位数;NVIDIA 官宣以 129 亿美元收购 Hugging Face(史上第二大收购,仅次于 200 亿美元 Groq);Anthropic 发布 Claude 电商 Agent 蓝图(购物/商家双 agent 参考实现,客户口径购物车大 35%、成交概率高 60%);陈大年(盛大联合创始人)复出创办 StartLux,27B 本地模型 StartLux-V1.0-27B-Preview 在信通院 MCP-Universe 综合得分 39.25% 居第二、落后 1.6T 的 DeepSeek-V4-Pro 1.3 个百分点;IFM 开源 K2 Horizon 六模型舰队(0.9B-375B-A23B,Apache 2.0 全生命周期开放)。另:OpenAI/Claude/Grok 三家同日先后中断、GPT Image 2.5 灰度流出(可伪造 GPT-6 发布会物料)、Qwen 3.8 27B 上线 Cerebras(~1500 tokens/s)、腾讯 WorkBuddy 开放生态上线。
VLM 论文速递 #013|SolarWM 把视频世界模型做成「全开放地基」:1.43M 统一片段喂出 5B-33B 四模型、5 秒训练序列支持分钟到小时级实时交互;RIG-BENCH 系统性评测「推理驱动图像生成」:2000 样本暴露「局部合理、全局不合逻辑」缺口;RVSD 免训练解码把 token 稀疏化与语义空间视觉检索合二为一治幻觉;Web Agent 世界模型改用「预测状态匹配」训练——决策目标与生成目标对齐;TIC-Bench 用 2280 道题测「深度交错图文上下文」,10 个 MLLM 与人类专家差距明显
精选 arXiv 2609.02xxx 批次五篇互补工作:SolarWM(cs.CV,2026-09-02)把 10 个数据集 1.43M 片段统一为带相机几何/质量元数据/溯源的对齐契约,在 Wan2.2/LTX-2.5/MiniMax-H3 上实例化四个 5B-33B 因果世界模型,仅用 5 秒训练序列即可支持分钟到小时级实时交互,数据/流程/权重全开源;RIG-BENCH(cs.CV)用 2000 个样本四类认知域(概念/变换/模式结构/场景)系统评测 Reasoning-driven Image Generation,发现 SOTA 统一生成模型普遍「局部合理、全局不合逻辑」;RVSD(cs.CV/cs.AI)以语义导向 token 选择 + 语义空间视觉检索(SSVR)在单次解码内同时完成稀疏化与视觉补偿,免训练缓解视觉幻觉并在长上下文下保持抑制;Discriminative World Models for Web Agents(cs.AI/cs.LG)提出 predicted-state matching 训练目标,让世界模型预测的表示必须能区分「真达状态」与「备选动作状态」,改善 WebPRMBench 动作排序与 WebArena-Lite 端到端成功率;TIC-Bench(cs.CV)覆盖逻辑/时间/空间三类共 8 种深度交错图文情境、2280 题,10 个 SOTA MLLM 在跨图文证据整合上与人类专家差距显著。