今天是周三。过去 24 小时没有全新的通用超大规模模型发布,但推理层的竞赛与风险同时升温:开源侧 Qwen 预告了一款新的闪速推理模型,OpenAI 被报道正在用自研芯片逼近 NVIDIA 的地盘,而国产视频与图像生成模型在上周密集落地后,本周开始进入正式版与商业定价阶段。下面四条值得单独记录,另有几条简讯。

1. Qwen3.8-Flash-Next:125B 总参 / 6B 激活的开源推理模型,预告今日发布

事实。 8 月 25 日晚间,Qwen 团队在 ModelScope 上线了 Qwen3.8-Flash-Next 模型页,并在 Hacker News 上预告次日(8 月 26 日)正式发布。据发布方页面信息,该模型为 125B 总参数、6B 激活参数的 MoE 架构(“125B a6B”),定位延续 Flash 系列的快速推理路线。截至本文写作时,模型权重尚未在 Hugging Face 上出现,属于“页面先于权重”的发布前状态。

为什么重要。 这延续了 Qwen 今年以来“大参数、小激活 + 高频迭代”的打法:以远低于稠密模型的计算成本提供接近前沿的能力,把推理成本曲线作为开源模型的核心竞争力。对应用侧来说,这类模型是“能不能用得起”的关键变量——6B 激活意味着单卡甚至消费级硬件就有机会承载,本地与私有化部署的门槛被进一步拉低。

待观察。 参数规模是发布方口径,实际能力需要等权重放出后以独立基准核验;“Flash”系列的定位通常牺牲部分长上下文或复杂推理换取速度,具体取舍要等官方技术报告与社区实测。另外,上一条 GPT-5.6 降价(见上期)与开源侧提速叠加,说明价格与推理效率的竞争正在成为主线

来源:ModelScope 模型页 · Hacker News 讨论

2. OpenAI 自研芯片 Jalapeño:第三方报道称性能优于 NVIDIA Blackwell

事实。 SemiAnalysis 于 8 月 25 日发布报道《OpenAI Jalapeño: Better than Nvidia Blackwell》(Hacker News 高热度,286 分),基于同日 Bloomberg 的相关报道,称 OpenAI 自研芯片(代号 Jalapeño)在性能上优于 NVIDIA Blackwell。具体架构与跑分细节在订阅墙内,无法从公开渠道独立核验。

为什么重要。 这对应的是 OpenAI 从“买算力”走向“造算力”的长期叙事。如果自研芯片真能达到与 Blackwell 相当或更高的性能,那么 OpenAI 在训练与推理两端对 NVIDIA 的依赖都会被削弱——这既是供应链议价筹码,也是成本结构重构的起点。对算力产业而言,“大模型厂商自研芯片”这条路的成败,将直接改写 GPU 市场的竞争格局。

待观察。 目前全部信息都来自第三方报道,没有 OpenAI 官方确认,也没有可验证的跑分数据。历史上自研芯片“纸面优秀、落地困难”的例子不少(软件栈、产能、良率都是坎),在官方发布或独立基准出现之前,这条新闻应读作“信号”而非“事实”

来源:SemiAnalysis · Hacker News 讨论

3. 阿里 Wan3.0 视频生成大模型正式上线:单次 30 秒,支持文档输入

事实。 8 月 24 日,阿里巴巴视频生成大模型 Wan3.0 正式上线(来源为阿里提供、量子位获授权转载的官方稿)。官方口径:单次可生成 30 秒视频;首次支持 doc、xls、ppt、pdf、md 等文档格式输入;在角色、道具、声音、空间关系、风格等维度强调细粒度一致性保持。即日起可在阿里云百炼、千问 AI 平台、万相官网及千问 APP 体验;API 限时优惠(8 月 24 日至 9 月 23 日,标准版 7 折),480P/720P/1080P 折后价分别为 0.21/0.42/0.84 元/秒。

为什么重要。 这是视频生成从“炫技 Demo”转向“可计价的生产工具”的一个明确信号:公开定价、按秒计费、接入企业流程(官方稿提到已参与短剧、影视、广告的规模化出片)。“支持文档输入”尤其值得注意——它把视频生成从“给一段文字”扩展到“给一份商业材料”,指向 PPT 转视频、报告转短片这类真实办公场景,而不是只服务创作者。

待观察。 上述参数与体验均为官方口径与官方稿引用,公测口碑(“稳定、真实、有质感”)也来自官方稿中的用户反馈,缺乏独立第三方复测。30 秒单次生成 + 文档输入的稳定性能否在真实生产里复现,是下一步值得跟踪的点;价格战方面,这个价位也会对同赛道竞品形成压力。

来源:量子位(阿里官方稿转载)

4. 商汤 SenseNova U1.5 Lite 正式开源:8B 图像生成,主打编辑与排版

事实。 8 月 25 日,商汤科技正式开源 SenseNova U1.5 Lite(8B 参数图像生成模型),距其 Preview 版发布仅三周。量子位实测报道称其亮点包括:3-4k 字符超长复杂指令遵循Native 4K 高分辨率直出、原生图像编辑(框选 + 标注指定修改区域,同时保持画面其余部分不变)、中英文文字与复杂排版,以及多图参考。报道称其在复杂排版与精准编辑等核心场景上可比肩闭源的 GPT-Image-2

为什么重要。 这是“国产开源生图模型快速迭代”的一个样本:三周时间从 Preview 到正式版,8B 的轻量参数 + 4K 直出 + 强编辑能力,直接指向可私有化部署的生产级图像工作流。当开源模型在排版、编辑这类“具体干活”的能力上逼近闭源头部,“闭源更强”的假设正在被逐点拆掉——这和本期第 1 条 Qwen 的叙事是同一条主线。

待观察。 “比肩 GPT-Image-2”来自媒体实测口径,不是标准化基准的横向对比,且测评任务选择有主观性。8B 模型在复杂长指令下的稳定性、以及在真实商业设计流程中的完成度,还需要更多独立评测与社区复现来确认。

来源:量子位:开源国产8B模型,比肩闭源Image 2了!

简讯

  • OpenAI 数据中心负责人离职。据华尔街日报 8 月 26 日报道(Hacker News 35 分),OpenAI 数据中心负责人已离职。细节在付费墙内,仅能据标题确认人事变动这一事实。在自研芯片报道(见第 2 条)同期出现,基础设施团队的动向值得后续跟踪。来源:WSJ(付费墙)
  • 英伟达 AI 服务器被报道将涨价约 15%。量子位 8 月 23 日报道:内存成本飙升,AI 服务器价格预计上涨约 15%,1GW 数据中心成本激增约 50 亿美元(媒体报道口径,非 NVIDIA 官方公告)。若落实,将直接抬高推理与训练的单位成本——与第 1 条“开源压成本”形成对冲。来源:量子位
  • 生数科技在 WRC 2026 提出通用世界模型五级发展路线。8 月 25 日量子位报道,生数科技发布最新研究成果,提出从模拟世界到交互世界的通用世界模型分级路线。与上期“世界模型进入产业议程”的判断方向一致。来源:量子位
  • “HN 里有多少是 AI?”——约一半。lcamtuf 的博客分析显示,截至 2026 年 6 月,Hacker News 每日 top stories 中约 50% 与 AI 相关或由 AI 生成(Hacker News 245 分)。这本身是对“AI 浓度”的一个量化观察。来源:How much of HN is AI?

今日判断

把今天几条串起来,主线很清楚:推理层的“成本”与“自主”正在同时成为竞争焦点。开源侧用“小激活 MoE + 高频迭代”(Qwen3.8-Flash-Next)继续下压推理成本;OpenAI 的自研芯片传闻指向摆脱单一供应商的算力自主;英伟达服务器涨价传闻则是反方向的成本压力。而应用侧,国产视频(Wan3.0)与图像(SenseNova U1.5 Lite)生成模型在同周进入“正式版 + 公开定价”阶段,说明模型能力之外,可计价、可部署、可进生产流程正在成为新的竞争维度

对做 Agent 与多模态应用的人,本周的实操提示是:盯住推理成本曲线(开源 MoE 的落地成本可能比想象中更快下降),同时把“模型、运行时、提示词”三层边界分开审计——上期讨论的推理引擎攻击面与本期 VLA 提示词注入(见论文速递)都指向同一件事:部署层的安全边界需要重新画。

注:本期的模型参数、价格与能力描述均标注了发布方或原始来源;Jalapeño 芯片、服务器涨价等未经官方确认的信息,均明确标注为第三方媒体口径,不作事实断言。