A PERSONAL VLM RESEARCH LOG

让每一次模型进展,
都留下可复用的理解。

每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。

15篇公开记录最近更新 · 2026.08.29

THREE STREAMS

三个内容栏目

从当天的信息流,到论文方法,再回到长期知识体系。

LATEST ENTRIES

最近更新

全部动态
  1. AI 日报

    AI 日报 #007|智谱认领「牛来」:GLM-5.3 系列开源、62T tokens 全跑国产卡;英伟达 Q2 营收 962 亿美元;美法院裁定 Anthropic 黑名单违法

    截至 8 月 29 日:智谱官宣匿名模型「牛来」即 GLM-5.3-Flash,320B/18B 激活、AA 指数 57 分、匿名测试期 62T tokens 全部由国产芯片承载并开源;英伟达官方财报 Q2 FY27 营收 962 亿美元(+106%)、下季指引不含中国数据中心收入;加州北区法院裁定五角大楼将 Anthropic 列入黑名单违法;云知声中报显示 Agent 业务 4.78 亿元、Token 收入 Q2 环比 +500%;开源引擎 Luanti 因一封未指明资产的 AI 生成 DMCA 通知被 Google Play 下架。

    • AI 新闻
    • 大模型
    • 开源生态
  2. VLM 论文速递

    VLM 论文速递 #007|跨具身视频世界模型、VLM 里的「视觉检索头」、重访记忆评测、视觉文字纠错、10% token 的快速推理

    精选 CLAP、Retrieval Heads Meet Vision、R2M-Bench、ReViCo、PACE 五篇论文:以互联网级异构视频训练的跨具身视频世界模型(零样本物理模拟)、定位 VLM 中因果负责图文对齐的约 2% 注意力头、区分「重访记忆」与「时序稳定」的相对一致性评测、暴露 VLM 视觉文字理解与人类差距的纠错基准,以及把 VLM 推理提速 3.1 倍的统一「压缩-抽取」框架。

    • VLM
    • 世界模型
    • 可解释性
  3. AI 日报

    AI 日报 #006|Nvidia 拟 129 亿美元收购 Hugging Face、Google 连发 Omni 1.1 Flash 与 3.5 Transcribe、Anthropic 预览物理设备 Agent 标准

    截至 8 月 28 日:The Information 等媒体披露 Nvidia 已同意以约 129 亿美元收购 Hugging Face(官方未官宣);Google 官方连发 Gemini Omni 1.1 Flash(可控视频生成)与 Gemini 3.5 Transcribe(智能转录);Anthropic 开放 Model Hardware Standard 研究预览;MiniMax 披露 ARR 超 8 亿美元、B 端占比升至 80%、7 月 token 消耗达 1 月 20 倍;基元律动融资数千万美元推"中国版 OpenRouter"。

    • AI 新闻
    • 大模型
    • 多模态
  4. VLM 论文速递

    VLM 论文速递 #006|原生视觉推理测试台、人类视频即任务说明、VLA 流式时序、600 万参考视频编辑数据、代码作为世界大脑

    精选 VBVR-Pro、Zero-WAM、StreamPI、RefVideo-6M、Code World Model 五篇论文:可验证奖励的视觉推理闭环测试台、以人类视频为上下文说明的具身世界动作模型、零新增参数的 VLA 流式时序框架、600 万参考的视频编辑数据集,以及"代码+视频渲染"的世界模型新范式。

    • VLM
    • 世界模型
    • 具身智能
  5. AI 日报

    AI 日报 #005|「牛来」真身开源:GLM 首个原生多模态 + Qwen3.8-Flash-Next 落地 + OpenAI 披露 HF 评估事件

    截至 8 月 27 日:智谱 GLM-5.3 Flash(320B/18B 激活,5 系列首个原生多模态)发布即开源,62T token 训练跑在国产卡;Qwen3.8-Flash-Next 正式发布并公开技术报告;OpenAI 发布《The Hugging Face incident and the road ahead》回应模型评估安全事件;Skild AI 发布具身模型 S1 主打上下文学习。

    • AI 新闻
    • 大模型
    • 多模态
  6. VLM 论文速递

    VLM 论文速递 #005|1000 万小时开放视频数据、世界模型是否真的听指令、以及 VLM 的战术推理短板

    精选 LAION-BVD、WorldEcho/WorldSync、PhysMLLMs、DoublesEval、TurboT2VA 五篇论文:开放视频数据基础设施、世界模型动作遵循诊断、视频分割空间先验、多智能体战术推理评估与音视频生成加速。

    • VLM
    • 数据集
    • 世界模型