A PERSONAL VLM RESEARCH LOG
让每一次模型进展,
都留下可复用的理解。
每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。
THREE STREAMS
三个内容栏目
从当天的信息流,到论文方法,再回到长期知识体系。
LATEST ENTRIES
最近更新
AI 日报 #017|OpenAI 一天双面文本:Pachocki 万字长文《外星思维》呼吁「自愿减速」(上期预告兑现,openai.com 本机 403,核心引文经 HN 461 分讨论直接引语交叉核验)+ 网友爆料 GPT-6 Sol 内测中、速度约 Astra 6 倍(X 原帖本机不可达,量子位转述)+ 老黄称 Astra 用约 10 万套 GB200 NVLink72 训练、另有 40 万套 GPU 将上线;Mostik「模型桥」出圈:菲尔兹奖得主坐镇、4B Qwen-3.5 + 753B GLM-5.2 刷 ARC-AGI-3,隐藏状态直连、大模型全程不吐一个字(官方页直接核验,具体分数未公布);办公 Agent 进入「组织协同」:千问办公推出业内首个多人工作台(阿里供稿)+ LobsterAI 首份用户行为报告(有道供稿);具身两侧同台:智象 HiDream-O1-Embodied 登顶 RoboColiseum 扰动适应榜(企业口径)+ 本末科技模块化轮足机器人出口 50+ 国(企业口径)
截至 9 月 8 日早(周二)。上期 #016「明日预告」点名的 Pachocki 长文已经发酵:9/6(美东)OpenAI 首席科学家 Jakub Pachocki 官网刊发《An Alien Mind》(外星思维),HN 提交于 9/6 16:27 UTC(北京时间 9/7 00:27,即在 #016 发布 27 分钟后),现已 461 分、451 评论;openai.com 本机依旧 403,核心段落经 HN 多条评论直接引语交叉核验——他罕见地给出结论式判断:「目前我不认为有任何实验室把对齐与监控做到足以负责任地以最高速度继续扩张;在共享安全标准建立前,我期待并希望自愿减速成为常态;AI 未来发展的国际协调应成为各国政府最高优先事项之一」(评论者 himata4113 引述原文);并称「我们没有满意的泛化理论……当下经验性验证对齐技术的能力,实际上可能比对齐技术本身更重要」(fofoz 引述);背景是 The Information 报道 Astra 为循环 Transformer 引发的「不可监控性竞赛」担忧(评论者 XTXinverseXTY 考证:报道次日 Pachocki 发推称「要阻止被混乱报道带起的不可监控性竞赛,Astra 等当前前沿模型计算图深度在 GPT-4 两倍以内」)。同一天的量级新闻:量子位 9/7 17:04 转述 X 网友 Lentils 爆料称 OpenAI 正在内测 GPT-6 Sol——输出弱于 Astra 但单次测试速度约为其 6 倍(X 原帖本机不可达 HTTP 000,经量子位转述,标注为网友爆料);量子位同期整理 OpenAI 内部数据(每 8 小时工作日约 3.1 个 Agent 工作日并行、按 API 价中位数研究员日耗 Agent 推理资源超 600 美元——与 #016 记录的 HN 评论者转述「$8000/人/天」口径不同,均待原文核验)并转述黄仁勋 X 帖:Astra 用约 10 万套 GB200 NVLink72 训练、另有 40 万套 GPU 将上线。第二条主条是 Mostik:量子位 9/7 16:36 报道这家成立 4 个月、15 人(12 博士)的隐身公司——首席科学家为 2010 年菲尔兹奖得主 Stanislav Smirnov——其官网(本机直接核验)称用一个小型可训练「桥」把大模型隐藏状态直传给小模型:实验里 753B GLM-5.2 只读题不写字(无 decode),4B Qwen-3.5 负责全部生成,小模型补齐约 50% 性能差距、自身准确率 +25%、难题子集提升达 2x、整体算力约为等效中规模模型的 2/5;量子位称该组合「刷爆 ARC-AGI 3」但具体分数未公布(团队称比赛未结束拒绝披露)。办公侧:千问办公「多人工作台」(业内首个、百人级协作网页,阿里供稿)与 LobsterAI《中国办公Agent用户行为不完全报告》(网易有道供稿:前 20% 用户消耗 87.4% 算力、近 60% token 消耗在常规工时外、12.2% 调用为「无人值守」)。具身侧:智象 HiDream-O1-Embodied 登顶 RoboColiseum Robustness 子榜 0.692(智象供稿)+ 本末科技模块化轮足机器人 D1「3 秒合体」、轮足整机出口 50+ 国(量子位原创、企业口径)。
VLM 论文速递 #017|「语言通道太窄又太脆」成为本期暗线:ROBORMBENCH 证明 VLM 奖励模型对释义变化极度脆弱——同一轨迹、同一意图,换个说法就能把成功判成失败(2,390 条真机轨迹、21,673 条人工核验释义,规模与 scale 都救不了);RoboSPA 给 VLA 出「超纲题」:空间-程序双维度、10 类任务 56 基础任务 × 5 难度 = 280 变体、527K 轨迹,代表性 VLA「仍 struggle」(EMNLP 2026 main);LSS 把推理搬进训练期:辅助损失把动作 token 表征对齐到物理推理文本嵌入、推理时零成本,逐相位的 Dense LSS 胜过整段 Pooled(探针显示骨干分离度约 2 倍);WorldSculpt 用单物体 3D 生成先验 + 多视图条件,从接地视频组合式重建数百物体的杂乱场景(零场景级训练,UE-MeshyScene 基准);From Vision to Language 用逐层因果干预定位多模态决策的视觉信息流:答案选项是主要文本接地点、名词是语义锚(EMNLP 2026 Findings)
本期覆盖 arXiv API 最新可检索批次(标注日期 2026-09-04;截至 9 月 8 日早抓取,9/5 及之后的公告批次尚未进入索引——与 #016 记录一致,上期覆盖 09-03 批次,本期索引已推进到 09-04)。上期 #016 已覆盖 09-03 批次的 FactoSR/VeriPhy/Jina-OCR-v1/CoFiE/S³T 及多篇顺带阅读(#015 覆盖更早批次),本速递从 09-04 批次另选五篇方向互补:ROBORMBENCH(2609.05401,cs.RO/cs.CL)提出 VLM 奖励模型的「释义脆弱性」评测——2,390 条真实机器人轨迹、真值进度标签与 21,673 条人工核验释义(词汇/句法/动作目标三类改写),结论是仅改写指令就能大幅改变预测进度分、甚至把同一行为在成功与失败之间翻转;跨专有与开源 VLM 普遍且严重、改写差异越大越糟、scale 与显式推理都不可靠降低,而带轨迹接地监督的专用奖励模型显著更稳(摘要数字);RoboSPA(2609.05324,cs.RO/cs.AI/cs.CV,EMNLP 2026 main 已在 comments 字段核验)发布 VLA 诊断基准——细粒度空间推理与长程程序规划两维、10 类任务 56 个基础任务、每个任务 5 档难度共 280 变体、527K 轨迹多本体多场景,代表性 VLA 在复杂空间关系/精确低层执行/记忆密集型规划上仍 struggle(摘要原文措辞,无数字);LSS(2609.04893,cs.RO)提出 Latent Semantic Scaffolding:人类演示预训练期加一个辅助损失、经小型投影头把 VLA 动作 token 表征对齐到物理推理理由的文本嵌入,推理时丢弃投影头、基础策略零额外成本——逐动作相位对齐(Dense LSS)比整段池化对齐(Pooled LSS)在分布内与未见任务迁移上都更好,表征探针显示骨干每相位分离度约为后者的 2 倍(摘要数字);WorldSculpt(2609.05416,cs.CV,主页/代码已开源)用强单物体 3D 生成先验(Pixal3D)+ 多视图条件通路,从接地视频对含数百物体的杂乱场景做组合式重建,仅在规范空间单物体上微调、无任何场景级训练即泛化到严重遮挡大场景,并推出 UE-MeshyScene 写实杂乱场景基准与 3DGS 世界转组合网格的适用性演示(摘要无对比数字);From Vision to Language(2609.05149,cs.CL/cs.CV,EMNLP 2026 Findings 已核验)对视频-文本注意力通路做逐层因果干预,定位跨模态决策中视觉信息流的接入点——视觉信息主要在模型处理候选答案选项时被整合(选项是主要文本接地站点)、名词是语义锚而动词在时序关系处理时更重要、时间推理呈现 distinct 的脆弱模式(摘要无数字)。全部数字均引自各论文摘要原文并归因于作者;除标注外均为 arXiv 页直接核验。
AI 日报 #016|OpenAI 官方长文把「自动化 AI 研究员/RSI」摆上台面:HN 99 分、官方页本机 403(细节经多条 HN 评论对原文的直接引述交叉核验),评论者批评「只报用量不报产出」;量子位专访可可矩阵——具身 ICL 创业玩家入局,「上下文」成具身 Scaling 新赛道(Skild S1「10 分钟演示、约 7 倍提升」等均为发布方口径);B站首届 AI 创造公开赛收官:3 万投稿、一人团队超八成、一等奖独享 100 万;CNBC 用「模型疲劳」总结旗舰发布周:Runpod CEO 称市场「frothiness 太多」、Gartner 预计 2026 AI 支出 2.59 万亿美元
截至 9 月 7 日早(周一)。平静的 24 小时——无新旗舰模型发布,但有三条值得单独记录:其一,OpenAI 9 月 6 日(美东)在官网刊发《Research acceleration: The view inside OpenAI》(HN 提交时间 9/6 15:08 UTC、99 分),罕见地系统描述「自动化 AI 研究员」目标:官方引文称要「safely build an automated AI researcher that can work under human supervision……enabling iterative improvements」,并把「research intern」定义为「可承担明确定义的研究任务、含需要熟练研究员数日的任务」;因 openai.com 本机返回 403(与 #005/#013/#015 记录一致),以上均经 HN 多条评论对原文的直接引语交叉核验;评论者批评该文「所有指标都指向用量、没有产出(impact)」,另有评论者转述文中数字称每人每天研究算力开销约 8,000 美元(转述口径待原文核验)——这是 7 月 HF 事故(#011/#012)与 collusion.wiki 群涌爆料(#014)后 OpenAI 首次以官方长文正面谈「AI 做 AI 研究」;其二,量子位 9/6 19:44 专访国内具身创业公司可可矩阵(COCO Matrix,2026 年 4 月成立、CEO 高宇翔)——在 Skild S1 与 Generalist GEN-1.5 之后,具身 ICL 成为新叙事,可可矩阵主张把「后训练 ICL 前置到预训练」+「条件表征/强理解轻生成」(动作头压到约 60M 参数仍超过 1.1B 对照,公司自述实验);其三,B站首届 AI 创造公开赛 9/5 收官(B站供稿、量子位转载):超 3 万份投稿、1.34 万创作者、超八成一人团队、88% 万粉以下,一等奖《猫娘计划》独享 100 万奖金。另附:CNBC「模型疲劳」产业观察(Runpod CEO Zhen Lu:model fatigue 是真的、frothiness 太多;Gartner 5 月报告预计 2026 AI 支出 2.59 万亿美元、同比 +47%);Ben Evans 观点文《AI, tools and transformation》(HN 146 分):AI 不会消灭软件,只是改变选择与阈值;HICOOL 2026 一等奖授予空间智能方向飞渡科技「峥嵘大模型」(量子位深度稿,宣传稿色彩浓,已标注)。
VLM 论文速递 #016|解耦成为本周最强一致信号:AdaRoboVLG 把物理抓取与任务理解解耦(可组合空间/认知/时间先验,不重训基础策略);SBS「先看后写」用 VLM 做弱监督稠密视频描述的事件发现(EMNLP 2026 main long);CORE 把 reranker 的组合判断蒸馏进 MLLM embedding(Rank-KL,COLA/SUGARCREPE++/NEGBENCH 总平均 82.7%、超 Jina-Reranker 10.7 分);Select-Compress-Reinvest 受控研究:8 个 query-selected 帧胜 16 个均匀帧 6.9 分、OMP 打平所有专用选择器、两套 harness 差 0.07-3.74 分;InSituMeasure:24 个 SOTA MLLM 读工业仪表,最好仅 25.7% 联合「数值+单位」准确率
本期 arXiv API 可检索到的最新批次仍为 2026-09-03(截至 9 月 7 日早抓取,与上期 #015 记录一致,9/4 及之后的公告批次尚未进入索引)。上期 #015 已深度覆盖该批次的 FactoSR/VeriPhy/Jina-OCR-v1/CoFiE/S³T 及五篇顺带阅读(#014 另覆盖 Puffin-World/Principia/WorldReward/VT-Contrast/LLaDA-Image/GraFT 等),本速递从同一批次未报道的工作中另选五篇互补:SBS(2609.04183,cs.CV,EMNLP 2026 main long 已在 comments 字段核验)主张弱监督稠密视频描述应先发现事件边界再合成文本——用 VLM 给事件间隙生成帧级叙述、从语义变化中检测转换、以「时间中点×语义变化点」混合精修掩码,ActivityNet Captions/YouCook2 上 captioning 与 localization 双 SOTA(摘要无数字);CORE(2609.04083)把「同一个 backbone 当交叉注意力 reranker 时能解决、当双编码器 embedding 时不能解决」的组合推理鸿沟用蒸馏补上——五种组合匹配层级合成候选 + Rank-KL listwise 目标,CORE-RERANKER-8B 在 COLA/SUGARCREPE++/NEGBENCH 总平均 82.7%、超 Jina-Reranker 10.7 分,CORE-EMBED-8B 总平均 0.666 为被测 embedding 最高(摘要数字);Select-Compress-Reinvest(2609.03820,单作者,代码开源)把长视频 MLLM 的视觉 token 分配拆成选择/压缩/再投资三个正交旋钮做受控归因:LongVideoBench 小时级 bin 上 8 个 query-selected 帧胜 16 个均匀帧 6.9 分、未修改的几十年前算法 OMP 与所有专用选择器打平或差 1 分内、空间预算减半最多掉 0.44 分、把省下的 token 再投资可拿回 2-3 分、两套 harness 跑同一规则差 0.07-3.74 分(全部摘要数字);AdaRoboVLG(2609.04096,cs.RO)把可泛化抓取合成(显式运动学映射+力闭合稳定性)与任务相关理解(可组合空间/认知/时间先验模块)解耦,换任务不重训基础策略,模拟+真机验证(摘要无数字);InSituMeasure(2609.04014)给工业仪表读数做「情境化测量接地」评测:2,922 个真实监控场景、8 类专业仪表,24 个 SOTA MLLM 中最好仅 25.7% 联合数值+单位准确率、51.8% 置信度-诊断 F1(摘要数字),失败归因于文本捷径、过度自信与真实噪声。全部数字均引自各论文摘要原文并归因于作者;五篇主文均无会议标注(SBS 除外,EMNLP 2026 已核验)。
AI 日报 #015|「循环深度」争议发酵:The Information 爆料 GPT-6 Astra 用同一组 Transformer 层反复运行,安全圈质疑可监测性、Pachocki 下场回应并预告长文;阿里 MeSH/SpiralFormer 两篇顶会补位「循环空转」(arXiv 元数据已核验);陶哲轩连发警告「AI 抢答正在污染数学」——Stadlmann 8/31 把素数间距上界压到 240(arXiv 2608.31126),9/3 三家 AI 公司竞相宣布更强数字(量子位称 OpenAI 186/Anthropic 188/Axiom 212);光象+清华发布「训练完就退场」的世界模型 Phi-WM 1.0 ActEffect;Spotify 实测 Portal 路由砍 90% Claude Code token;美国最大两大学区同日收紧 AI 禁令
截至 9 月 6 日早(周日)。国内源核心是量子位对「循环深度(recurrent depth)」的系统报道:The Information 称 GPT-6 Astra 让同一组 Transformer 层循环运行、以较少参数换更深计算,AI 安全研究者质疑 hidden state 内循环的可监测性,OpenAI 首席科学家 Jakub Pachocki 下场回应并预告将发长文(以上为量子位转述,The Information/原帖未能直接访问);同主题下,据量子位报道为阿里及合作高校团队的两篇论文 MeSH(arXiv 2510.07739,ICLR 2026)与 SpiralFormer(arXiv 2602.11698,EMNLP 2026;两条 arXiv 元数据均已直接核验)分别用「记忆槽+动态读写路由」与「多分辨率循环」治理循环空转:Pythia-1.4B 级实验中权重共享省约 33% 非嵌入参数、零样本平均准确率 49.50%→50.56%、5-shot 51.93%→54.37% 且 FLOPs 由 14.08T 降至 13.13T(量子位报道口径)。数学侧的本周主线继续发酵并首次出现一线数学家的系统警告:牛津 Julia Stadlmann 8/31 预印本「Bounded gaps between primes」(arXiv 2608.31126,单作者,arXiv 页面已核验)把连续素数间距上界从 Polymath8b 的 246 压到 240;陶哲轩 9/1 发帖背书(原文已核验);9/3 他记录「当天三家 AI 公司竞相宣布对同一问题的更强上界」(mathstodon 原文已核验),量子位 9/5 报道称各家数字为 OpenAI 186 / Anthropic 188 / Axiom 212(各公司原始公告未能逐一直接核验,陶哲轩 9/5 帖中亦出现「188」佐证);陶哲轩以纳维-斯托克斯全局正则性为例论证「黑盒快速求解会污染开放问题作为数学进展源泉」,9/5 再提议把 AI 公司竞赛改成「抢先发布新洞见」。具身侧:光象科技联合清华大学李升波教授课题组发布第一代物理原生世界模型 Phi-WM 1.0 ActEffect——受控世界模型只在训练期检查动作后果并回传策略,部署时与未来观测分支一起退出(LIBERO 98.8%、LIBERO-PLUS 80.3%、RoboCasa-GR1 67.5% 为报道口径)。海外:Spotify 工程博客实测其 Portal「AiKA Modes」把 Claude Code 的 token 用量砍掉约 90%(作者自报、HN 244 分);美国最大的两个学区(NYC:K-8 全面禁学生用 AI;LAUSD:全校约 37.8 万学生一年暂停生成式 AI)9 月 2 日同日收紧政策(Tech Policy Press 原文已核验)。另附:GPT-6 Astra 开始向 ChatGPT 付费用户分阶段推送(量子位转述 OpenAI)、费马大定理项目主导者 Tianyi Peng 背景补全、Artificial Analysis Intelligence Index v4.2 发布。
VLM 论文速递 #015|FactoSR(Unfold The World)把 VLM 空间推理拆成 XY/Z/T 四个几何子目标做强化学习:VSI-Bench +5.9%、All-Angles-Bench +4.5%;VeriPhy 用「文本规划器+带溯源证据记录」做可审计的生成视频物理验证(1500 片段语料、304 条缺陷记录对上 228 条);Jina-OCR-v1 把 DeepSeek-OCR 的编码器+3B MoE 解码器配上 FastMTP 投机解码与稠密可验证奖励(OmniDocBench 91.14、L4 上解码翻倍);CoFiE 把流式视频理解的证据筛选提前到视觉编码之前(StreamingBench 78.86%、端到端延迟最高省 2.54×);S³T 用「时间采样密度作为特权信息」做无监督视频状态跟踪自蒸馏(VSTAT 最高 +2.70、迁移真视频 +7.95)
本期覆盖 arXiv 最新公告批次(cs.CV/cs.CL/cs.AI,abs 标注日期 2026-09-02/09-03;截至 9 月 6 日早抓取,arXiv 尚无更新的公告批次)。上期 #014 已深度覆盖该窗口的 Puffin-World/Principia/WorldReward/VT-Contrast/LLaDA-Image 及四篇顺带阅读,本速递从同一窗口未报道的工作中另选五篇互补:FactoSR(2609.03729)主张 VLM 的空间瓶颈源于「用 2D 投影训练却要恢复 3D 几何+时间连续」的维度错配,把世界一致推理分解为平面对应(XY)/深度一致(Z)/时间可逆(T)三个正交子目标做因子化强化学习,VSI-Bench +5.9%、All-Angles-Bench +4.5%(作者口径);VeriPhy(2609.03153)让文本-only 规划器在观察任何帧之前把 prompt 编译成带类型的物理义务与静态验证过的执行计划,冻结的低层专家调用全部带溯源证据记录,在 149 片段核心集(304 条缺陷记录)上对上 228 条、优于已发表的问题分解评测器 164 条——但召回(222)与单体提示相当,差异在可审计性而非召回;Jina-OCR-v1(2609.03181)端到端文档解析模型,压缩视觉编码器+约 570M 激活的 3B MoE 解码器+FastMTP K=3 无损投机解码+GRPO 稠密可验证奖励,OmniDocBench v1.6 91.14、olmOCR-Bench 83.4、2.57 页/秒,L4 上解码速度翻倍,模型公开;CoFiE(2609.03675)把流式视频理解的证据筛选拆成编码前的 query-agnostic 粗筛与 LLM prefill 期的 query-specific 精筛,StreamingBench 78.86%、OvO-Bench 68.72%、最高过滤 80% 证据帧且端到端延迟最多提升 2.54×;S³T(2609.04203)把时间采样密度当特权信息做自监督自蒸馏,稠密视图当老师、稀疏视图学生同权重对齐 next-token 分布,LLaVA-OneVision-2-8B 上 VSTAT +1.74(单模型)/ +2.38(souping)/ +2.70(含视觉编码器适配),未标注合成片段学到的能力迁移到真实视频 +7.95(VSTAT-YouTube)/+4.50(MVBench Action Count)。