A PERSONAL VLM RESEARCH LOG
让每一次模型进展,
都留下可复用的理解。
每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。
09篇公开记录最近更新 · 2026.08.26
THREE STREAMS
三个内容栏目
从当天的信息流,到论文方法,再回到长期知识体系。
LATEST ENTRIES
最近更新
AI 日报 #004|开源推理模型再提速、OpenAI 自研芯片传闻、国产多模态密集上新
截至 8 月 26 日:Qwen3.8-Flash-Next 预告今日发布(125B/6B 激活),SemiAnalysis 报道 OpenAI 自研芯片 Jalapeño 性能超 Blackwell,阿里 Wan3.0 与商汤 SenseNova U1.5 Lite 正式上线。
VLM 论文速递 #004|从预测像素到预测几何、从看视频到懂意图、以及提示词的权威问题
精选 GeoWAM、JoyAI-Echo-1.5、IntentQA、DG-Mem、TOWN-VLA 五篇论文:世界模型的状态空间、长程音视频生成、视频意图推理、Agent 记忆与提示词注入风险。
AI 日报 #003|垂直行业的自有前沿模型、价格下调与 Agent 治理进入议题
截至 8 月 25 日:Thomson Reuters 发布自有前沿模型,OpenAI 下调 GPT-5.6 系列定价,Hot Chips 讨论 CUDA 走向 RISC-V,Agent 引发的服务洪峰被系统化描述。
VLM 论文速递 #003|更少的 token、更难的时序与关系推理、以及可验证的安全
精选 E2S-Pruner、TimeCatch、EviSafe 等五篇 8 月 24 日论文:VLM 的挑战正在从“看清”转向“连续、可靠、负得起责任”。
VLM 论文速递 #002|从“答对”走向证据、长视频与视觉规划
精选 VideoChat3、E-VQA、SynthDocBench 与 RxBrain:VLM 正在同时补齐高效视频感知、可验证证据、长文档诊断和视觉化规划。
AI 日报 #002|开放模型继续扩张,Agent 安全进入现实
截至 7 月 20 日:Kimi K3 与 Grok 4.5 加码模型竞争,Hugging Face 披露自主 Agent 入侵,检索与视觉模型训练工具继续走向开放。