A PERSONAL VLM RESEARCH LOG

让每一次模型进展,
都留下可复用的理解。

每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。

09篇公开记录最近更新 · 2026.08.26

THREE STREAMS

三个内容栏目

从当天的信息流,到论文方法,再回到长期知识体系。

LATEST ENTRIES

最近更新

全部动态
  1. AI 日报

    AI 日报 #004|开源推理模型再提速、OpenAI 自研芯片传闻、国产多模态密集上新

    截至 8 月 26 日:Qwen3.8-Flash-Next 预告今日发布(125B/6B 激活),SemiAnalysis 报道 OpenAI 自研芯片 Jalapeño 性能超 Blackwell,阿里 Wan3.0 与商汤 SenseNova U1.5 Lite 正式上线。

    • AI 新闻
    • 大模型
    • 算力
  2. VLM 论文速递

    VLM 论文速递 #004|从预测像素到预测几何、从看视频到懂意图、以及提示词的权威问题

    精选 GeoWAM、JoyAI-Echo-1.5、IntentQA、DG-Mem、TOWN-VLA 五篇论文:世界模型的状态空间、长程音视频生成、视频意图推理、Agent 记忆与提示词注入风险。

    • VLM
    • 世界模型
    • 视频生成
  3. AI 日报

    AI 日报 #003|垂直行业的自有前沿模型、价格下调与 Agent 治理进入议题

    截至 8 月 25 日:Thomson Reuters 发布自有前沿模型,OpenAI 下调 GPT-5.6 系列定价,Hot Chips 讨论 CUDA 走向 RISC-V,Agent 引发的服务洪峰被系统化描述。

    • AI 新闻
    • 大模型
    • Agent 安全
  4. VLM 论文速递

    VLM 论文速递 #003|更少的 token、更难的时序与关系推理、以及可验证的安全

    精选 E2S-Pruner、TimeCatch、EviSafe 等五篇 8 月 24 日论文:VLM 的挑战正在从“看清”转向“连续、可靠、负得起责任”。

    • VLM
    • 视觉推理
    • 模型效率
  5. VLM 论文速递

    VLM 论文速递 #002|从“答对”走向证据、长视频与视觉规划

    精选 VideoChat3、E-VQA、SynthDocBench 与 RxBrain:VLM 正在同时补齐高效视频感知、可验证证据、长文档诊断和视觉化规划。

    • VLM
    • 视频理解
    • 视觉推理
  6. AI 日报

    AI 日报 #002|开放模型继续扩张,Agent 安全进入现实

    截至 7 月 20 日:Kimi K3 与 Grok 4.5 加码模型竞争,Hugging Face 披露自主 Agent 入侵,检索与视觉模型训练工具继续走向开放。

    • AI 新闻
    • 大模型
    • Agent