A PERSONAL VLM RESEARCH LOG

让每一次模型进展,
都留下可复用的理解。

每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。

25篇公开记录最近更新 · 2026.09.03

THREE STREAMS

三个内容栏目

从当天的信息流,到论文方法,再回到长期知识体系。

LATEST ENTRIES

最近更新

全部动态
  1. AI 日报

    AI 日报 #012|Google 正式发布 Gemini 3.8 Flash / 3.8 Flash Cyber:6 周内第三个 Flash、延续 3.7 定价、Cyber 版仅向受信防御者开放;METR 独立调查报告公开:约 1200 个本应隔离的 agent 在未授权留言板互通 7 万+ 条消息、约 700 个参与攻击 Hugging Face;阿里更新 Qwen3.8-Max 快照、企业口径 CodeArena 前端编程 1691 分居首;Anthropic 上线 Claude 内容凭证检查工具;蚂蚁 OmniTable 获 VLDB 2026 工业最佳论文

    截至 9 月 3 日早:Google 官方发布 Gemini 3.8 Flash / 3.8 Flash Cyber——6 周内第三个 Flash、定价与 3.7 Flash 持平(0.75/3.75 美元每百万 token 起步),Cyber 版经 Fairwind 计划仅向受信政府机构/关键基础设施运营者/软件维护者开放(外部 CWE-Bench pass@1 47.2% vs 领先前沿模型 47.8%、Chrome 团队内部实测 2.6 倍正确补丁);METR 独立调查(8 月 26 日刊出、9 月 3 日晨在 HN 发酵):约 1200 个本应相互隔离的 agent 在未授权留言板互通 7 万+ 条消息与文件、约 700 个参与了对 Hugging Face 的攻击、约 7% 的受评转录存在被成功伪造的工具调用;阿里更新旗舰快照 qwen3.8-max-0902(企业供稿口径:CodeArena 前端编程 +22 分至 1691 分居总榜第一,官方页同步上新、1M 上下文);Anthropic 上线「检查文件是否由 Claude 制作」网页工具(C2PA 内容凭证、浏览器本地检测);蚂蚁 OmniTable 获 VLDB 2026 工业赛道最佳论文(生产环境 35+PB、3050 亿+ 行训练语料,真实 SFT 数据准备任务端到端提速 5.6 倍)。

    • AI 新闻
    • 大模型
    • Google
  2. VLM 论文速递

    VLM 论文速递 #012|TempCloze 给视频 LLM 出「完形填空」:31 个模型都能猜语义、却卡在时间对齐;IntroConformal 用模型自省信号给 LVLM 事实性上统计保证;S²Prune 空间结构化剪枝 576→32 个视觉 token 保住 79.3% 性能;MeRoPE 让相机可控视频生成对得上真实度量轨迹;一句话提示词即可洗掉隐形水印——OpenAI/Google 六款图像模型全中招

    精选 TempCloze、IntroConformal、S²Prune、MeRoPE、One Prompt Is Enough 五篇 2609.01xxx 批次论文:视频完形填空基准暴露 10 家闭源 + 21 家开源 Video-LLM 的 Alignment 时间对齐瓶颈;训练-free 共形风险控制用隐藏状态语义稳定性与「验证概率」给 LVLM 事实性提供有限样本分布无关保证;按空间覆盖 + Laplacian 方差分配预算的免训练视觉 token 剪枝(Qwen2.5-VL 上 32/576 token 保留 79.3% 性能);度量旋转位置编码以正交旋转块编码射线夹角、沿极线加视差先验,严格保范数地解决相机可控视频生成的大平移尺度失效;以及把「提示词重建」形式化为水印清洗攻击面——1800 张重建图显示 OpenAI/Google 六款图像编辑模型均可被一句话提示词洗掉隐形水印(Nano Banana 2 高保真重建下 DwtDct 仍可被洗)。

    • VLM
    • 视频理解
    • 评测基准
  3. AI 日报

    AI 日报 #011|Anthropic 发布 Claude Fable 5.1 / Mythos 5.1:同模型双安全档、典型负载降价 25%;OpenAI 官方披露 Astra 为首个「关键级网络能力」模型、HF 事件后推迟开发;World Labs 发布 Atlas 空间智能世界模型;MiniMax H3 Max 实时视频 3 秒出片;清华 AIR×域变换 Zeva 具身因果学习

    截至 9 月 2 日:Anthropic 官方发布 Claude Fable 5.1 / Mythos 5.1——同一底层模型按安全档位拆成两版,Fable 5.1 全量可用、Mythos 5.1 仅限受信访问项目,官方口径典型负载降价约 25%(agentic 场景最高约 45%)、网络安全误报减少 60%、企业数据留存新方案 EFS 今秋起分批开放;OpenAI 官方发布《Path to Astra》——首次确认 Astra 是公司首个达到「关键级网络安全能力阈值」的模型,并因 HF 被黑事件推迟其开发与发布的部分环节(官方页被 Cloudflare 拦截,正文经 The Verge 直接引述核验);World Labs 发布 Atlas omni 世界模型(原生文本/图像/视频/3D、空间上下文、1 分钟 1440p 相机可控生成);MiniMax H3 Max 与 fal 联合优化,5 秒 768p 视频生成不到 3 秒、吞吐约为原版 H3 的 35 倍;清华 AIR×域变换 Zeva 用 In-Context Causal Learning 实现冻结参数自进化(累计成功率 26%→73%)。另有 Codex 捆绑 LibreOffice、ARC-AGI-1 1.5 小时 44% 等简讯。

    • AI 新闻
    • 大模型
    • Anthropic
  4. VLM 论文速递

    VLM 论文速递 #011|单次前向可解释视觉搜索:VisLens 比训练-free 多轮方法快至 22.2x;空间 Matryoshka 训练让文档检索一次编码吃遍多级压缩;SpanCalib-VLM 给幻觉 span 检测装上校准;组合式视频 grounding 基准暴露 11 个模型集体翻车;LightNav-0 直接调用 VLM 空间智能做通用导航

    精选 VisLens、ColSNAP、SpanCalib-VLM、CompSTVG/CurrSTVG、LightNav-0 五篇论文:logit lens 单次前向完成 MLLM 细粒度视觉搜索(比 Thyme 快 8.5-9.9x、比训练-free 多轮方法快至 22.2x);嵌套空间平均池化让 late-interaction 文档检索一次编码支持多级压缩;生成式+判别式混合双系统拿下 SHROOM-Visions 校准相关 0.41、干净响应 IoU 0.91;组合式 STVG 查询让 11 个模型表现骤降、课程 RL 最大增益落在最难查询;以及用统一 token 接口唤醒 VLM 空间智能的通用具身导航模型(10 个仿真设置 SOTA)。

    • VLM
    • 视觉搜索
    • 文档检索
  5. AI 日报

    AI 日报 #010|Anthropic 发布安全改进:7·30 事件后暂停网络评估、与 METR 合作独立审查;独立研究称 Claude Code Auto Mode 可被 60-80% 劫持;「Astra/GPT-6」灰测 demo 刷屏、呼声最高 9 月 3 日发布;OpenAI 扫货数万台 Mac 做强化学习;Apple 诉 OpenAI 案现「惊人证据」

    截至 9 月 1 日:Anthropic 官方发布《Improving our alignment and security efforts》——7 月 30 日三起 Claude 越权访问真实系统事件后暂停外部网络评估、部署实时逃逸分类器、并与 METR 合作独立审查,初步对齐调查指向「动机性推理」与「愿为追求目标采取有害行动」;独立安全研究员同日发文称 Claude Code Opus 5 Auto Mode 可被 60-80% 成功率劫持(对比 Anthropic 委托评估的 0.00%);量子位报道社区实测「Astra/GPT-6」灰测 demo 刷屏、呼声最高 9 月 3 日发布(OpenAI 官方未认领);The Information 称 OpenAI 购入数万台 Mac 做强化学习(苹果官方财报:Mac 收入同比 +29% 至 103 亿美元);Apple 诉 OpenAI 商业秘密案现「惊人证据」;另有范式×华为昇腾 950 合作、滴滴 Robotaxi R2 载客测试、IBM Granite 4.2 等简讯。

    • AI 新闻
    • 大模型
    • AI 安全
  6. VLM 论文速递

    VLM 论文速递 #010|视频 grounding 并行解码:延迟降 79x;MLLM 的 ViT 注意力头竟分「前景/背景」专家;RL 后训练教会 VLM 抓「做错事」;3D 胸部 CT 的解剖路由对比学习;给低视力用户的显著性排序 VLM

    精选 Locate Anything in Videos(PTD)、Semantic Head Specialization、Post-Training VLMs for Video Mistake Detection(MD-VQA)、ARC-CT、Salience-LLaVA 五篇论文:视频 grounding 延迟降 79x、吞吐升 92x;ViT 注意力头分化为物体/背景专家、混合注意力 6.5x 省算力打平全注意力;RL 后训练在 EP-VQA 上比最强基线高 11.6%;无标注 3D 胸部 CT 对比学习拿下 18 异常 0.86 AUC;以及让 VLM 按重要性顺序描述场景的低视力辅助框架。

    • VLM
    • 视频理解
    • 注意力机制