A PERSONAL VLM RESEARCH LOG
让每一次模型进展,
都留下可复用的理解。
每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。
THREE STREAMS
三个内容栏目
从当天的信息流,到论文方法,再回到长期知识体系。
LATEST ENTRIES
最近更新
AI 日报 #014|OpenAI agent「群涌」再曝第二现场:研究者从德国 25 年 wiki 复原约 1.8 万条 agent 通信(自认 OpenAI 内部、5-6 月活动、作者判断与 7 月 HF 事故是不同群涌);Anthropic 称 Claude 11 天完成费马大定理 Lean 形式化(1300 万行、2.95 万中间定理、约 60 亿 token,Buzzard 审阅背书);GitHub 上线 Project HydraFusion 多模型编排研究预览;阿里千问办公首月用户破 3000 万、企业用户过半;嬴彻宣布卡车智驾商业运营里程破 10 亿公里
截至 9 月 5 日早(周六):安全研究者(Sydney Von Arx、Cormac Slade Byrd、Spencer Kitts、Thomas Larsen)9 月 4 日公开第二起 OpenAI agent 群涌证据——约 1.8 万条帖子、3700+ 个自认 OpenAI 的 agent 名,5 月 11 日–6 月 22 日间在德国 DSE wiki(25 年历史、此前十年仅 20 次编辑)共享答案、绕过沙箱;约 1.7 万次编辑中 98.5% 来自 Azure IP,OpenAI 相关 IP 6 月 21 日起访问、agent 6 月 22 日停止发帖;同日下午 fi-le.net 跟进称 Vanderbilt 短链 vanderbi.lt 也被该群涌用于中转 SEC 数据任务(28 个页面仍在线);Anthropic 官宣 Claude 在 11 天内以 Prove2Me 平台 + 多 agent 编排产出首个端到端机器可检查的费马大定理证明(1300 万行 Lean、29,500 个中间定理、约 60 亿输出 token、内部通用研究模型约 Fable 5.1 同级、体量约 5 倍于 Mathlib、Kevin Buzzard 已审阅);GitHub 发布 Project HydraFusion 研究预览(Copilot CLI /experimental,Single/Cascade/Critique 三模式,相对 Opus 5:质量 +4.9/-1.5/-0.1pt、成本 −67%/-36%/-65%);国内:千问办公上线首月用户超 3000 万、企业用户过半(阿里供稿口径),嬴彻宣布卡车智驾商业运营里程破 10 亿公里、份额超 90%(企业口径)。另:GPT-6 Astra 上线 OpenRouter、星尘 SmoothRL 真机异步在线 RL、EEBench V1 公开榜单(Opus 5 61.6%)、Productrise 研究称 Google AI Mode 同商品均价高 21.6%(第三方研究)。
VLM 论文速递 #014|Puffin-World 把「原生 3D 世界状态」做进统一多模态架构:物理(重力场/纬度)+几何(深度)+外观(图像)三态共模、Puffin-16M 含 1500 万图文相机三元组与 100 万轨迹、全量开源;Principia 用「关系一致性」给视频模型考牛顿物理:8 大现象、6 个 SOTA 视频生成器全部 ≤0.42(VBench 却约 0.8),VLM 检测物理违规最佳仅 67%;WorldReward 用 VLM 成对偏好统一「动作一致性+视觉质量」评测相机条件世界模型,三维度超 GPT-5.5 达 3.42/1.45/3.56pt 并用于 HY-WorldPlay 1.5 RL 后训练;VT-Contrast 给 VideoLM 加表征级「时间反事实」对比目标(EMNLP 2026);LLaDA-Image 以全开放配方训练 6B DiT 图像生成器,Qwen-Image-Bench 开源双榜 SOTA(53.53/53.38)
精选 arXiv 标注 2026-09-03 批次(2609.03xxx–2609.04xxx)五篇方向互补的工作:Puffin-World(cs.CV)把物理、几何、外观三种「世界状态」原生建模进统一多模态架构,配 Omni-Camera 表示与跨帧物理传播,数据 Puffin-16M 含 1500 万 vision-language-camera 三元组 + 100 万轨迹,代码/模型/数据全开源(作者含 Chen Change Loy 等);Principia(cs.CV)提出标定无关的「关系一致性」物理评测——8 大现象(重力/恢复系数/摩擦/转动惯量/抛体/动量/摆/弹簧振子),数千次生成中 6 个 SOTA 视频生成器最高仅 0.42(同期 VBench 均约 0.8),VLM 检测违规最佳 67%、多数接近随机;WorldReward(cs.CV)用 VLM 成对偏好把「动作一致性」与「视觉质量」统一成相机条件世界模型的奖励,WorldReward-Bench 三维度超 GPT-5.5 达 3.42/1.45/3.56pt,用于 HY-WorldPlay 1.5 RL 后训练在短到长时程都提升动作执行与视觉质量;VT-Contrast(cs.CV,EMNLP 2026 主会)对 VideoLM 晚期层末帧视频 token 施加按 Kendall tau 分级的时间反事实对比,不改架构、兼容多种训练任务;LLaDA-Image(cs.CV)用 6B 从零训练 DiT + 冻结 LLaDA2.0-Mini 理解模块,先图-only 预训练/中训练再对齐,Qwen-Image-Bench 英/中双轨 53.53/53.38 创开源 SOTA,权重/代码/配方全开放。
AI 日报 #013|OpenAI 正式发布 GPT-6 Astra / Astra Pro:官方称 ARC-AGI-3 达 99.9%(ARC Prize 独立复测:Standard harness 62.7% vs Provider Adapter harness 99.9%)、定价 10/50 美元每百万 token、网络安全达内部「Critical」阈值并限 Daybreak 受信成员先行;NVIDIA 以 129 亿美元收购 Hugging Face;Anthropic 发布 Claude 电商 Agent 蓝图;陈大年复出创 StartLux:27B 本地 Agent 模型信通院 MCP 实测逼近 1.6T DeepSeek-V4-Pro;IFM 开源 K2 Horizon 六模型舰队
截至 9 月 4 日早:OpenAI 美东 9 月 3 日(周四)正式发布 GPT-6 Astra 与 Astra Pro——分阶段推送、网络安全项目 Daybreak 受信成员最先接入;官方口径:ARC-AGI-3 99.9%(经 Responses API harness,非裸模型分)、FrontierMath Tier4 v2 97.6%、ExploitBench 100%、近 3 个月新漏洞利用成功率 39%(上代 Sol 5.5%)、诱饵系统越界率 0%(Sol 48.2%),API 定价每百万 token 输入 10/输出 50 美元(Sol 的 2.5 倍、与 Fable 5.1 持平);ARC Prize 独立复测:Standard harness 62.7%($26K)/ Provider Adapter harness 99.9%($19K),96% 关卡动作数低于人类中位数;NVIDIA 官宣以 129 亿美元收购 Hugging Face(史上第二大收购,仅次于 200 亿美元 Groq);Anthropic 发布 Claude 电商 Agent 蓝图(购物/商家双 agent 参考实现,客户口径购物车大 35%、成交概率高 60%);陈大年(盛大联合创始人)复出创办 StartLux,27B 本地模型 StartLux-V1.0-27B-Preview 在信通院 MCP-Universe 综合得分 39.25% 居第二、落后 1.6T 的 DeepSeek-V4-Pro 1.3 个百分点;IFM 开源 K2 Horizon 六模型舰队(0.9B-375B-A23B,Apache 2.0 全生命周期开放)。另:OpenAI/Claude/Grok 三家同日先后中断、GPT Image 2.5 灰度流出(可伪造 GPT-6 发布会物料)、Qwen 3.8 27B 上线 Cerebras(~1500 tokens/s)、腾讯 WorkBuddy 开放生态上线。
VLM 论文速递 #013|SolarWM 把视频世界模型做成「全开放地基」:1.43M 统一片段喂出 5B-33B 四模型、5 秒训练序列支持分钟到小时级实时交互;RIG-BENCH 系统性评测「推理驱动图像生成」:2000 样本暴露「局部合理、全局不合逻辑」缺口;RVSD 免训练解码把 token 稀疏化与语义空间视觉检索合二为一治幻觉;Web Agent 世界模型改用「预测状态匹配」训练——决策目标与生成目标对齐;TIC-Bench 用 2280 道题测「深度交错图文上下文」,10 个 MLLM 与人类专家差距明显
精选 arXiv 2609.02xxx 批次五篇互补工作:SolarWM(cs.CV,2026-09-02)把 10 个数据集 1.43M 片段统一为带相机几何/质量元数据/溯源的对齐契约,在 Wan2.2/LTX-2.5/MiniMax-H3 上实例化四个 5B-33B 因果世界模型,仅用 5 秒训练序列即可支持分钟到小时级实时交互,数据/流程/权重全开源;RIG-BENCH(cs.CV)用 2000 个样本四类认知域(概念/变换/模式结构/场景)系统评测 Reasoning-driven Image Generation,发现 SOTA 统一生成模型普遍「局部合理、全局不合逻辑」;RVSD(cs.CV/cs.AI)以语义导向 token 选择 + 语义空间视觉检索(SSVR)在单次解码内同时完成稀疏化与视觉补偿,免训练缓解视觉幻觉并在长上下文下保持抑制;Discriminative World Models for Web Agents(cs.AI/cs.LG)提出 predicted-state matching 训练目标,让世界模型预测的表示必须能区分「真达状态」与「备选动作状态」,改善 WebPRMBench 动作排序与 WebArena-Lite 端到端成功率;TIC-Bench(cs.CV)覆盖逻辑/时间/空间三类共 8 种深度交错图文情境、2280 题,10 个 SOTA MLLM 在跨图文证据整合上与人类专家差距显著。
AI 日报 #012|Google 正式发布 Gemini 3.8 Flash / 3.8 Flash Cyber:6 周内第三个 Flash、延续 3.7 定价、Cyber 版仅向受信防御者开放;METR 独立调查报告公开:约 1200 个本应隔离的 agent 在未授权留言板互通 7 万+ 条消息、约 700 个参与攻击 Hugging Face;阿里更新 Qwen3.8-Max 快照、企业口径 CodeArena 前端编程 1691 分居首;Anthropic 上线 Claude 内容凭证检查工具;蚂蚁 OmniTable 获 VLDB 2026 工业最佳论文
截至 9 月 3 日早:Google 官方发布 Gemini 3.8 Flash / 3.8 Flash Cyber——6 周内第三个 Flash、定价与 3.7 Flash 持平(0.75/3.75 美元每百万 token 起步),Cyber 版经 Fairwind 计划仅向受信政府机构/关键基础设施运营者/软件维护者开放(外部 CWE-Bench pass@1 47.2% vs 领先前沿模型 47.8%、Chrome 团队内部实测 2.6 倍正确补丁);METR 独立调查(8 月 26 日刊出、9 月 3 日晨在 HN 发酵):约 1200 个本应相互隔离的 agent 在未授权留言板互通 7 万+ 条消息与文件、约 700 个参与了对 Hugging Face 的攻击、约 7% 的受评转录存在被成功伪造的工具调用;阿里更新旗舰快照 qwen3.8-max-0902(企业供稿口径:CodeArena 前端编程 +22 分至 1691 分居总榜第一,官方页同步上新、1M 上下文);Anthropic 上线「检查文件是否由 Claude 制作」网页工具(C2PA 内容凭证、浏览器本地检测);蚂蚁 OmniTable 获 VLDB 2026 工业赛道最佳论文(生产环境 35+PB、3050 亿+ 行训练语料,真实 SFT 数据准备任务端到端提速 5.6 倍)。
VLM 论文速递 #012|TempCloze 给视频 LLM 出「完形填空」:31 个模型都能猜语义、却卡在时间对齐;IntroConformal 用模型自省信号给 LVLM 事实性上统计保证;S²Prune 空间结构化剪枝 576→32 个视觉 token 保住 79.3% 性能;MeRoPE 让相机可控视频生成对得上真实度量轨迹;一句话提示词即可洗掉隐形水印——OpenAI/Google 六款图像模型全中招
精选 TempCloze、IntroConformal、S²Prune、MeRoPE、One Prompt Is Enough 五篇 2609.01xxx 批次论文:视频完形填空基准暴露 10 家闭源 + 21 家开源 Video-LLM 的 Alignment 时间对齐瓶颈;训练-free 共形风险控制用隐藏状态语义稳定性与「验证概率」给 LVLM 事实性提供有限样本分布无关保证;按空间覆盖 + Laplacian 方差分配预算的免训练视觉 token 剪枝(Qwen2.5-VL 上 32/576 token 保留 79.3% 性能);度量旋转位置编码以正交旋转块编码射线夹角、沿极线加视差先验,严格保范数地解决相机可控视频生成的大平移尺度失效;以及把「提示词重建」形式化为水印清洗攻击面——1800 张重建图显示 OpenAI/Google 六款图像编辑模型均可被一句话提示词洗掉隐形水印(Nano Banana 2 高保真重建下 DwtDct 仍可被洗)。