A PERSONAL VLM RESEARCH LOG
让每一次模型进展,
都留下可复用的理解。
每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。
51篇公开记录最近更新 · 2026.09.16
THREE STREAMS
三个内容栏目
从当天的信息流,到论文方法,再回到长期知识体系。
LATEST ENTRIES
最近更新
VLM 论文速递 #025|可写性、隐私裁剪、重建
视频模型会正确的运动却不用它;VLM 可按问题裁剪视觉 token,兼顾隐私与带宽。
AI 日报 #025|System One 模型、Gemini 语音
前 OpenAI 成员发布 System One 模型 Jev:不生成字符串、输出带标定概率;Google 上线 Gemini 3.8 Live。
VLM 论文速递 #024|视频 4D 分词、歧义坍缩
视频分词器转向 4D 世界表示,长视频 agent 改为按需取证;VLM 在 Dixit 上出现歧义坍缩。
AI 日报 #024|Siri AI 上线、370 年密文破译
苹果 OS 27 上线 Siri AI;Claude Fable 5.1 破译 370 年密文,减速之争转入官媒与产业互批。
VLM 论文速递 #023|幻觉检测、单步动作
统一幻觉检测覆盖六类跨模态任务;VLA 把多步动作头换成单步生成,推理频率提升 3.67 倍。
AI 日报 #023|减速之争、武器域滥用
减速之争进入第二天:Altman 称 2026 不上市;Anthropic 报告披露也门小组用 Claude Code 写制导软件。