A PERSONAL VLM RESEARCH LOG
让每一次模型进展,
都留下可复用的理解。
每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。
05篇公开记录最近更新 · 2026.07.20
THREE STREAMS
三个内容栏目
从当天的信息流,到论文方法,再回到长期知识体系。
LATEST ENTRIES
最近更新
VLM 论文速递 #002|从“答对”走向证据、长视频与视觉规划
精选 VideoChat3、E-VQA、SynthDocBench 与 RxBrain:VLM 正在同时补齐高效视频感知、可验证证据、长文档诊断和视觉化规划。
AI 日报 #002|开放模型继续扩张,Agent 安全进入现实
截至 7 月 20 日:Kimi K3 与 Grok 4.5 加码模型竞争,Hugging Face 披露自主 Agent 入侵,检索与视觉模型训练工具继续走向开放。
AI 日报 #001|从“知道发生了什么”开始
AI 日报栏目的编辑原则:筛选可靠信源,分清事实与判断,并记录真正影响模型与产品走向的变化。
VLM 论文速递 #001|一篇新工作应该怎样读
用问题、方法、证据和边界四个层次快速拆解视觉语言模型论文,避免只记住模型名称和榜单数字。
VLM 学习笔记 #001|从视觉编码到跨模态对齐
建立视觉语言模型的第一张知识地图:图像如何变成 token,又如何进入语言模型的表示空间。