A PERSONAL VLM RESEARCH LOG
让每一次模型进展,
都留下可复用的理解。
每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。
THREE STREAMS
三个内容栏目
从当天的信息流,到论文方法,再回到长期知识体系。
LATEST ENTRIES
最近更新
AI 日报 #005|「牛来」真身开源:GLM 首个原生多模态 + Qwen3.8-Flash-Next 落地 + OpenAI 披露 HF 评估事件
截至 8 月 27 日:智谱 GLM-5.3 Flash(320B/18B 激活,5 系列首个原生多模态)发布即开源,62T token 训练跑在国产卡;Qwen3.8-Flash-Next 正式发布并公开技术报告;OpenAI 发布《The Hugging Face incident and the road ahead》回应模型评估安全事件;Skild AI 发布具身模型 S1 主打上下文学习。
VLM 论文速递 #005|1000 万小时开放视频数据、世界模型是否真的听指令、以及 VLM 的战术推理短板
精选 LAION-BVD、WorldEcho/WorldSync、PhysMLLMs、DoublesEval、TurboT2VA 五篇论文:开放视频数据基础设施、世界模型动作遵循诊断、视频分割空间先验、多智能体战术推理评估与音视频生成加速。
AI 日报 #004|开源推理模型再提速、OpenAI 自研芯片传闻、国产多模态密集上新
截至 8 月 26 日:Qwen3.8-Flash-Next 预告今日发布(125B/6B 激活),SemiAnalysis 报道 OpenAI 自研芯片 Jalapeño 性能超 Blackwell,阿里 Wan3.0 与商汤 SenseNova U1.5 Lite 正式上线。
VLM 论文速递 #004|从预测像素到预测几何、从看视频到懂意图、以及提示词的权威问题
精选 GeoWAM、JoyAI-Echo-1.5、IntentQA、DG-Mem、TOWN-VLA 五篇论文:世界模型的状态空间、长程音视频生成、视频意图推理、Agent 记忆与提示词注入风险。
AI 日报 #003|垂直行业的自有前沿模型、价格下调与 Agent 治理进入议题
截至 8 月 25 日:Thomson Reuters 发布自有前沿模型,OpenAI 下调 GPT-5.6 系列定价,Hot Chips 讨论 CUDA 走向 RISC-V,Agent 引发的服务洪峰被系统化描述。
VLM 论文速递 #003|更少的 token、更难的时序与关系推理、以及可验证的安全
精选 E2S-Pruner、TimeCatch、EviSafe 等五篇 8 月 24 日论文:VLM 的挑战正在从“看清”转向“连续、可靠、负得起责任”。