A PERSONAL VLM RESEARCH LOG
让每一次模型进展,
都留下可复用的理解。
每日筛选 AI 动态,拆解最新 VLM 论文,也记录从概念到代码实验的学习过程。 这里不追求信息最多,只追求理解更深。
THREE STREAMS
三个内容栏目
从当天的信息流,到论文方法,再回到长期知识体系。
LATEST ENTRIES
最近更新
AI 日报 #006|Nvidia 拟 129 亿美元收购 Hugging Face、Google 连发 Omni 1.1 Flash 与 3.5 Transcribe、Anthropic 预览物理设备 Agent 标准
截至 8 月 28 日:The Information 等媒体披露 Nvidia 已同意以约 129 亿美元收购 Hugging Face(官方未官宣);Google 官方连发 Gemini Omni 1.1 Flash(可控视频生成)与 Gemini 3.5 Transcribe(智能转录);Anthropic 开放 Model Hardware Standard 研究预览;MiniMax 披露 ARR 超 8 亿美元、B 端占比升至 80%、7 月 token 消耗达 1 月 20 倍;基元律动融资数千万美元推"中国版 OpenRouter"。
VLM 论文速递 #006|原生视觉推理测试台、人类视频即任务说明、VLA 流式时序、600 万参考视频编辑数据、代码作为世界大脑
精选 VBVR-Pro、Zero-WAM、StreamPI、RefVideo-6M、Code World Model 五篇论文:可验证奖励的视觉推理闭环测试台、以人类视频为上下文说明的具身世界动作模型、零新增参数的 VLA 流式时序框架、600 万参考的视频编辑数据集,以及"代码+视频渲染"的世界模型新范式。
AI 日报 #005|「牛来」真身开源:GLM 首个原生多模态 + Qwen3.8-Flash-Next 落地 + OpenAI 披露 HF 评估事件
截至 8 月 27 日:智谱 GLM-5.3 Flash(320B/18B 激活,5 系列首个原生多模态)发布即开源,62T token 训练跑在国产卡;Qwen3.8-Flash-Next 正式发布并公开技术报告;OpenAI 发布《The Hugging Face incident and the road ahead》回应模型评估安全事件;Skild AI 发布具身模型 S1 主打上下文学习。
VLM 论文速递 #005|1000 万小时开放视频数据、世界模型是否真的听指令、以及 VLM 的战术推理短板
精选 LAION-BVD、WorldEcho/WorldSync、PhysMLLMs、DoublesEval、TurboT2VA 五篇论文:开放视频数据基础设施、世界模型动作遵循诊断、视频分割空间先验、多智能体战术推理评估与音视频生成加速。
AI 日报 #004|开源推理模型再提速、OpenAI 自研芯片传闻、国产多模态密集上新
截至 8 月 26 日:Qwen3.8-Flash-Next 预告今日发布(125B/6B 激活),SemiAnalysis 报道 OpenAI 自研芯片 Jalapeño 性能超 Blackwell,阿里 Wan3.0 与商汤 SenseNova U1.5 Lite 正式上线。
VLM 论文速递 #004|从预测像素到预测几何、从看视频到懂意图、以及提示词的权威问题
精选 GeoWAM、JoyAI-Echo-1.5、IntentQA、DG-Mem、TOWN-VLA 五篇论文:世界模型的状态空间、长程音视频生成、视频意图推理、Agent 记忆与提示词注入风险。