A PERSONAL VLM RESEARCH LOG
让每一次模型进展,
都留下可复用的理解。
每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。
THREE STREAMS
三个内容栏目
从当天的信息流,到论文方法,再回到长期知识体系。
LATEST ENTRIES
最近更新
AI 日报 #008|腾讯开源 Hy4 Preview:770B/49B、首次参与自身研发;Anthropic 让 Claude 训练 Claude——时薪 4 美元跑赢人类安全研究员;本地部署「变笨」根因锁定推理栈数值差异
截至 8 月 30 日:腾讯官方发布并开源 Hy4 Preview(770B 总参/49B 激活、超 1M 上下文,官方称模型首次参与自身训练与推理优化、端到端吞吐 +31.8%);Anthropic 公布自动化对齐研究员(AAR)——Claude 在欺骗任务平均弥合 85% 安全差距、6 名人类研究员仅 20%,较弱的 Sonnet 5 用 60 小时与约 2000 条数据逼近生产版对齐水平;社区实验锁定本地部署「变笨」根因:推理栈浮点数值差异在长上下文累积导致 Top-1 翻转;OpenClaw 从现象级到退潮的复盘;另有 OCR It、阿里 Qoder 桌面端、Anthropic 模型硬件标准预览、vLLM v0.28.0 简讯。
VLM 论文速递 #008|表格只要 64 个 token、告别截图点击的 GUI 接口、解耦规划与控制的具身 Agent、医学 VQA 落地到像素、多模态 Agent 的记忆森林
精选 A Table Is Worth 64 Tokens、ASIL、Instruct-to-Act、MedREAL、GraphMemix 五篇论文:像素级表格压缩让长文档 QA 省 41% token 且 +7 准确点、以结构化状态与语义动作替代截图点击的软件操作接口、把 VLM 规划与世界模型控制解耦的具身系统、从临床推理对齐到像素级分割的医学多模态框架、以及用证据森林组织多模态长期记忆的组合优化方法。
AI 日报 #007|智谱认领「牛来」:GLM-5.3 系列开源、62T tokens 全跑国产卡;英伟达 Q2 营收 962 亿美元;美法院裁定 Anthropic 黑名单违法
截至 8 月 29 日:智谱官宣匿名模型「牛来」即 GLM-5.3-Flash,320B/18B 激活、AA 指数 57 分、匿名测试期 62T tokens 全部由国产芯片承载并开源;英伟达官方财报 Q2 FY27 营收 962 亿美元(+106%)、下季指引不含中国数据中心收入;加州北区法院裁定五角大楼将 Anthropic 列入黑名单违法;云知声中报显示 Agent 业务 4.78 亿元、Token 收入 Q2 环比 +500%;开源引擎 Luanti 因一封未指明资产的 AI 生成 DMCA 通知被 Google Play 下架。
VLM 论文速递 #007|跨具身视频世界模型、VLM 里的「视觉检索头」、重访记忆评测、视觉文字纠错、10% token 的快速推理
精选 CLAP、Retrieval Heads Meet Vision、R2M-Bench、ReViCo、PACE 五篇论文:以互联网级异构视频训练的跨具身视频世界模型(零样本物理模拟)、定位 VLM 中因果负责图文对齐的约 2% 注意力头、区分「重访记忆」与「时序稳定」的相对一致性评测、暴露 VLM 视觉文字理解与人类差距的纠错基准,以及把 VLM 推理提速 3.1 倍的统一「压缩-抽取」框架。
AI 日报 #006|Nvidia 拟 129 亿美元收购 Hugging Face、Google 连发 Omni 1.1 Flash 与 3.5 Transcribe、Anthropic 预览物理设备 Agent 标准
截至 8 月 28 日:The Information 等媒体披露 Nvidia 已同意以约 129 亿美元收购 Hugging Face(官方未官宣);Google 官方连发 Gemini Omni 1.1 Flash(可控视频生成)与 Gemini 3.5 Transcribe(智能转录);Anthropic 开放 Model Hardware Standard 研究预览;MiniMax 披露 ARR 超 8 亿美元、B 端占比升至 80%、7 月 token 消耗达 1 月 20 倍;基元律动融资数千万美元推"中国版 OpenRouter"。
VLM 论文速递 #006|原生视觉推理测试台、人类视频即任务说明、VLA 流式时序、600 万参考视频编辑数据、代码作为世界大脑
精选 VBVR-Pro、Zero-WAM、StreamPI、RefVideo-6M、Code World Model 五篇论文:可验证奖励的视觉推理闭环测试台、以人类视频为上下文说明的具身世界动作模型、零新增参数的 VLA 流式时序框架、600 万参考的视频编辑数据集,以及"代码+视频渲染"的世界模型新范式。