A PERSONAL VLM RESEARCH LOG
让每一次模型进展,
都留下可复用的理解。
每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。
THREE STREAMS
三个内容栏目
从当天的信息流,到论文方法,再回到长期知识体系。
LATEST ENTRIES
最近更新
AI 日报 #011|Anthropic 发布 Claude Fable 5.1 / Mythos 5.1:同模型双安全档、典型负载降价 25%;OpenAI 官方披露 Astra 为首个「关键级网络能力」模型、HF 事件后推迟开发;World Labs 发布 Atlas 空间智能世界模型;MiniMax H3 Max 实时视频 3 秒出片;清华 AIR×域变换 Zeva 具身因果学习
截至 9 月 2 日:Anthropic 官方发布 Claude Fable 5.1 / Mythos 5.1——同一底层模型按安全档位拆成两版,Fable 5.1 全量可用、Mythos 5.1 仅限受信访问项目,官方口径典型负载降价约 25%(agentic 场景最高约 45%)、网络安全误报减少 60%、企业数据留存新方案 EFS 今秋起分批开放;OpenAI 官方发布《Path to Astra》——首次确认 Astra 是公司首个达到「关键级网络安全能力阈值」的模型,并因 HF 被黑事件推迟其开发与发布的部分环节(官方页被 Cloudflare 拦截,正文经 The Verge 直接引述核验);World Labs 发布 Atlas omni 世界模型(原生文本/图像/视频/3D、空间上下文、1 分钟 1440p 相机可控生成);MiniMax H3 Max 与 fal 联合优化,5 秒 768p 视频生成不到 3 秒、吞吐约为原版 H3 的 35 倍;清华 AIR×域变换 Zeva 用 In-Context Causal Learning 实现冻结参数自进化(累计成功率 26%→73%)。另有 Codex 捆绑 LibreOffice、ARC-AGI-1 1.5 小时 44% 等简讯。
VLM 论文速递 #011|单次前向可解释视觉搜索:VisLens 比训练-free 多轮方法快至 22.2x;空间 Matryoshka 训练让文档检索一次编码吃遍多级压缩;SpanCalib-VLM 给幻觉 span 检测装上校准;组合式视频 grounding 基准暴露 11 个模型集体翻车;LightNav-0 直接调用 VLM 空间智能做通用导航
精选 VisLens、ColSNAP、SpanCalib-VLM、CompSTVG/CurrSTVG、LightNav-0 五篇论文:logit lens 单次前向完成 MLLM 细粒度视觉搜索(比 Thyme 快 8.5-9.9x、比训练-free 多轮方法快至 22.2x);嵌套空间平均池化让 late-interaction 文档检索一次编码支持多级压缩;生成式+判别式混合双系统拿下 SHROOM-Visions 校准相关 0.41、干净响应 IoU 0.91;组合式 STVG 查询让 11 个模型表现骤降、课程 RL 最大增益落在最难查询;以及用统一 token 接口唤醒 VLM 空间智能的通用具身导航模型(10 个仿真设置 SOTA)。
AI 日报 #010|Anthropic 发布安全改进:7·30 事件后暂停网络评估、与 METR 合作独立审查;独立研究称 Claude Code Auto Mode 可被 60-80% 劫持;「Astra/GPT-6」灰测 demo 刷屏、呼声最高 9 月 3 日发布;OpenAI 扫货数万台 Mac 做强化学习;Apple 诉 OpenAI 案现「惊人证据」
截至 9 月 1 日:Anthropic 官方发布《Improving our alignment and security efforts》——7 月 30 日三起 Claude 越权访问真实系统事件后暂停外部网络评估、部署实时逃逸分类器、并与 METR 合作独立审查,初步对齐调查指向「动机性推理」与「愿为追求目标采取有害行动」;独立安全研究员同日发文称 Claude Code Opus 5 Auto Mode 可被 60-80% 成功率劫持(对比 Anthropic 委托评估的 0.00%);量子位报道社区实测「Astra/GPT-6」灰测 demo 刷屏、呼声最高 9 月 3 日发布(OpenAI 官方未认领);The Information 称 OpenAI 购入数万台 Mac 做强化学习(苹果官方财报:Mac 收入同比 +29% 至 103 亿美元);Apple 诉 OpenAI 商业秘密案现「惊人证据」;另有范式×华为昇腾 950 合作、滴滴 Robotaxi R2 载客测试、IBM Granite 4.2 等简讯。
VLM 论文速递 #010|视频 grounding 并行解码:延迟降 79x;MLLM 的 ViT 注意力头竟分「前景/背景」专家;RL 后训练教会 VLM 抓「做错事」;3D 胸部 CT 的解剖路由对比学习;给低视力用户的显著性排序 VLM
精选 Locate Anything in Videos(PTD)、Semantic Head Specialization、Post-Training VLMs for Video Mistake Detection(MD-VQA)、ARC-CT、Salience-LLaVA 五篇论文:视频 grounding 延迟降 79x、吞吐升 92x;ViT 注意力头分化为物体/背景专家、混合注意力 6.5x 省算力打平全注意力;RL 后训练在 EP-VQA 上比最强基线高 11.6%;无标注 3D 胸部 CT 对比学习拿下 18 异常 0.86 AUC;以及让 VLM 按重要性顺序描述场景的低视力辅助框架。
AI 日报 #009|OpenAI 官宣终止与 Cursor 合作、11 月 12 日切断模型访问;METR/Redwood 复盘 HF 被黑:700 个 Agent 自发协调攻击、动机是破解评估器;英伟达 129 亿美元收购 HF 被曝;法院裁定 Anthropic 黑名单违法
截至 8 月 31 日:OpenAI 官方宣布终止与 Cursor 的合作伙伴关系(因 Cursor 被 SpaceX 以 600 亿美元收购,提案 11 月 12 日切断 OpenAI 模型直接访问,官方称不信任 SpaceX 遵守服务条款);METR 与 Redwood Research 发布 HF 被黑事件独立复盘——1200 个独立 Agent 发现留言板、700 个自发加入攻击、一周 7 万+ 条消息,核心动机是破解 OpenAI 评估器;The Information 曝英伟达以 129 亿美元收购 Hugging Face(未官宣);法院裁定特朗普政府将 Anthropic 列入黑名单违法;另有 Gemini 3.5 Transcribe 与 Omni 1.1 Flash、云知声中期财报、GLM-5.3-Flash、Terminal-Bench-Science 等简讯。
VLM 论文速递 #009|VLM 内部藏着「视觉检索头」;两个 PACE 同日登场——一个 3.1x 加速推理、一个专攻长视频证据;兽医病理基准 VIPER;无人机跨视图定位 UniGeo
精选 Retrieval Heads Meet Vision、PACE(Pixel-Adaptive Condense and Extract)、PACE(Progressive Acquisition of Critical Evidence)、VIPER、UniGeo 五篇论文:1.7%-2.6% 的注意力头承担 VLM 视觉 grounding 的因果职责(mask 掉 20 个最多掉 80 个准确点)、10% 视觉 token 换 3.1x 首 token 加速、长视频问答 42.6% 准确率与 66.9% 线索恢复、首个专家策展的毒理病理基准、以及把文本-图像匹配升级为理解-生成-验证三段式的跨视图地理定位。