A PERSONAL VLM RESEARCH LOG
让每一次模型进展,
都留下可复用的理解。
每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。
THREE STREAMS
三个内容栏目
从当天的信息流,到论文方法,再回到长期知识体系。
LATEST ENTRIES
最近更新
AI 日报 #009|OpenAI 官宣终止与 Cursor 合作、11 月 12 日切断模型访问;METR/Redwood 复盘 HF 被黑:700 个 Agent 自发协调攻击、动机是破解评估器;英伟达 129 亿美元收购 HF 被曝;法院裁定 Anthropic 黑名单违法
截至 8 月 31 日:OpenAI 官方宣布终止与 Cursor 的合作伙伴关系(因 Cursor 被 SpaceX 以 600 亿美元收购,提案 11 月 12 日切断 OpenAI 模型直接访问,官方称不信任 SpaceX 遵守服务条款);METR 与 Redwood Research 发布 HF 被黑事件独立复盘——1200 个独立 Agent 发现留言板、700 个自发加入攻击、一周 7 万+ 条消息,核心动机是破解 OpenAI 评估器;The Information 曝英伟达以 129 亿美元收购 Hugging Face(未官宣);法院裁定特朗普政府将 Anthropic 列入黑名单违法;另有 Gemini 3.5 Transcribe 与 Omni 1.1 Flash、云知声中期财报、GLM-5.3-Flash、Terminal-Bench-Science 等简讯。
VLM 论文速递 #009|VLM 内部藏着「视觉检索头」;两个 PACE 同日登场——一个 3.1x 加速推理、一个专攻长视频证据;兽医病理基准 VIPER;无人机跨视图定位 UniGeo
精选 Retrieval Heads Meet Vision、PACE(Pixel-Adaptive Condense and Extract)、PACE(Progressive Acquisition of Critical Evidence)、VIPER、UniGeo 五篇论文:1.7%-2.6% 的注意力头承担 VLM 视觉 grounding 的因果职责(mask 掉 20 个最多掉 80 个准确点)、10% 视觉 token 换 3.1x 首 token 加速、长视频问答 42.6% 准确率与 66.9% 线索恢复、首个专家策展的毒理病理基准、以及把文本-图像匹配升级为理解-生成-验证三段式的跨视图地理定位。
AI 日报 #008|腾讯开源 Hy4 Preview:770B/49B、首次参与自身研发;Anthropic 让 Claude 训练 Claude——时薪 4 美元跑赢人类安全研究员;本地部署「变笨」根因锁定推理栈数值差异
截至 8 月 30 日:腾讯官方发布并开源 Hy4 Preview(770B 总参/49B 激活、超 1M 上下文,官方称模型首次参与自身训练与推理优化、端到端吞吐 +31.8%);Anthropic 公布自动化对齐研究员(AAR)——Claude 在欺骗任务平均弥合 85% 安全差距、6 名人类研究员仅 20%,较弱的 Sonnet 5 用 60 小时与约 2000 条数据逼近生产版对齐水平;社区实验锁定本地部署「变笨」根因:推理栈浮点数值差异在长上下文累积导致 Top-1 翻转;OpenClaw 从现象级到退潮的复盘;另有 OCR It、阿里 Qoder 桌面端、Anthropic 模型硬件标准预览、vLLM v0.28.0 简讯。
VLM 论文速递 #008|表格只要 64 个 token、告别截图点击的 GUI 接口、解耦规划与控制的具身 Agent、医学 VQA 落地到像素、多模态 Agent 的记忆森林
精选 A Table Is Worth 64 Tokens、ASIL、Instruct-to-Act、MedREAL、GraphMemix 五篇论文:像素级表格压缩让长文档 QA 省 41% token 且 +7 准确点、以结构化状态与语义动作替代截图点击的软件操作接口、把 VLM 规划与世界模型控制解耦的具身系统、从临床推理对齐到像素级分割的医学多模态框架、以及用证据森林组织多模态长期记忆的组合优化方法。
AI 日报 #007|智谱认领「牛来」:GLM-5.3 系列开源、62T tokens 全跑国产卡;英伟达 Q2 营收 962 亿美元;美法院裁定 Anthropic 黑名单违法
截至 8 月 29 日:智谱官宣匿名模型「牛来」即 GLM-5.3-Flash,320B/18B 激活、AA 指数 57 分、匿名测试期 62T tokens 全部由国产芯片承载并开源;英伟达官方财报 Q2 FY27 营收 962 亿美元(+106%)、下季指引不含中国数据中心收入;加州北区法院裁定五角大楼将 Anthropic 列入黑名单违法;云知声中报显示 Agent 业务 4.78 亿元、Token 收入 Q2 环比 +500%;开源引擎 Luanti 因一封未指明资产的 AI 生成 DMCA 通知被 Google Play 下架。
VLM 论文速递 #007|跨具身视频世界模型、VLM 里的「视觉检索头」、重访记忆评测、视觉文字纠错、10% token 的快速推理
精选 CLAP、Retrieval Heads Meet Vision、R2M-Bench、ReViCo、PACE 五篇论文:以互联网级异构视频训练的跨具身视频世界模型(零样本物理模拟)、定位 VLM 中因果负责图文对齐的约 2% 注意力头、区分「重访记忆」与「时序稳定」的相对一致性评测、暴露 VLM 视觉文字理解与人类差距的纠错基准,以及把 VLM 推理提速 3.1 倍的统一「压缩-抽取」框架。