今天是周一,官方渠道在过去 24 小时内没有密集发布新模型。因此本期采用 7 月 16 日至 20 日 的信息窗口,优先保留已经有官方页面、产品入口或安全公告可核验的变化。

先说结论:这一轮信息里最值得记住的并不是又多了几个模型名字,而是三条更长期的趋势——开放权重的承诺继续向超大规模推进,Agent 的竞争指标从单次回答转向完整任务成本,而自主 Agent 攻击已经从安全演练进入真实生产事件。

1. Kimi K3 发布 2.8T 模型,完整权重仍待放出

事实。 月之暗面在 7 月 16 日发布 Kimi K3。官方披露它采用 MoE 架构,总参数 2.8T,每次激活 896 个专家中的 16 个;模型原生支持视觉输入和 100 万 token 上下文,并使用 Kimi Delta Attention、Attention Residuals 与 Stable LatentMoE。K3 已进入 Kimi、Kimi Work、Kimi Code 和 API,完整权重计划最迟在 7 月 27 日发布。

为什么重要。 这说明开放模型的竞争不再只发生在“小而强”,也开始正面探索超大稀疏模型。与此同时,2.8T 并不等于普通开发者可以轻松自托管:官方建议使用至少 64 张加速卡组成的超节点,工程门槛仍然很高。

待观察。 当前性能数字主要来自厂商评测,技术报告与完整权重尚未同时发布。真正需要验证的是第三方推理框架能否稳定承载 KDA、1M 上下文和高稀疏 MoE,而不只是模型能否下载。

来源:Kimi K3 官方技术博客

2. Grok 4.5 主打编码、Agent 与更低调用成本

事实。 SpaceXAI 在 7 月 16 日发布 Grok 4.5,定位于编码、Agent 和知识工作。官方称模型使用数万张 NVIDIA GB300 训练,在线服务速度约为 80 tokens/s;API 定价为每百万输入 token 2 美元、输出 token 6 美元,目前已进入 Grok Build、Cursor 和官方 API。

为什么重要。 前沿模型正在同时竞争三件事:任务完成率、输出 token 数和延迟。对长时间运行的编码 Agent 来说,少走几轮错误路径通常比压低单个 token 的价格更有价值。

待观察。 Grok 4.5 在不同工程榜单上的表现并不完全一致,例如官方页面列出的 DeepSWE 1.1 成绩低于部分竞品,却在 SWE Marathon 上更强。这再次说明,不能用单个榜单概括“编码能力”。

来源:Grok 4.5 官方发布

3. Hugging Face 披露一次由自主 Agent 驱动的入侵

事实。 Hugging Face 在 7 月 16 日披露,一份恶意数据集利用数据处理管线中的远程代码加载与模板注入漏洞进入生产环境,随后完成提权、凭证收集和横向移动。官方判断攻击由自主 Agent 框架端到端执行,累计留下超过 17,000 条事件记录。部分内部数据集和服务凭证遭到未授权访问;截至公告发布时,没有证据表明公开模型、数据集、Spaces 或软件供应链被篡改,完整影响评估仍在继续。

Hugging Face 随后修复入口、重建受影响节点并轮换凭证,同时建议用户主动轮换访问令牌并检查近期活动。

为什么重要。 “Agent 攻击者”不再只是威胁模型中的假设场景。更耐心、更便宜的自动化探索,会让数据处理器、MCP 工具、模型加载器和临时沙箱都成为新的攻击面。

这次事件还有一个值得讨论的细节:Hugging Face 此次提交给商业 API 的真实攻击载荷被安全护栏拦截,最终改用本地部署的 GLM 5.2 分析日志。安全策略不仅要阻止攻击,也要为经过授权的取证保留可控通道。

来源:Hugging Face 安全事件公告

4. OpenAI 提议用“每美元有用智能”衡量 AI 投入

事实。 OpenAI 在 7 月 17 日提出一套面向企业的 AI 价值记分卡,核心不是席位数、活跃用户或单 token 价格,而是四个问题:完成了多少真正有用的工作、每个成功任务的完整成本、结果是否可靠,以及投入扩大后单位资金能否产生更多价值。

为什么重要。 这套框架把模型评测从“回答一次多少钱”推向“交付一个可用结果多少钱”。完整成本还应包括重试、人工复核、返工和错误升级。对于博客未来的模型评测,这也是更值得采用的口径:同时记录成功率、总 token、耗时和人工干预,而不是只抄排行榜。

需要保留的判断。 这是 OpenAI 提出的商业衡量框架,不是已经形成行业共识的中立标准;文章中的 GPT-5.6 横向比较也属于厂商公布结果。

来源:A scorecard for the AI age

5. Nemotron 3 Embed 把 Agent 检索成本拉进模型竞争

事实。 NVIDIA 与 Hugging Face 在 7 月 16 日发布 Nemotron 3 Embed,包括 8B BF16、1B BF16 和 1B NVFP4 三个开放模型。三者都支持 32K 上下文、多语言和代码检索,并开放权重、数据及微调/蒸馏配方。官方报告 8B 模型在 7 月 15 日的 RTEB 榜单得分为 78.5;Blackwell 上的 NVFP4 版本最高可达到 BF16 的两倍吞吐,同时保留 99% 以上检索精度。

为什么重要。 Agent 的成本不只发生在生成阶段。检索器如果更早找到正确证据,就能减少重复搜索、无效上下文和后续推理 token。RAG 与长期记忆系统的“第一跳”正在成为新的效率战场。

待观察。 榜单会动态变化,而且吞吐结论依赖 Blackwell 硬件。更有价值的验证应放在真实知识库、代码库和长期记忆数据上。

来源:Nemotron 3 Embed 发布说明

6. Diffusers 模型可以直接进入 NeMo AutoModel 分布式微调

事实。 NVIDIA 与 Hugging Face 在 7 月 17 日宣布打通 Diffusers 与 NeMo AutoModel。Hub 上的 Diffusers 格式模型可以直接进行分布式训练,不需要转换 checkpoint 或重写模型;首批配方覆盖 Wan 2.1/2.2、FLUX.1/2、HunyuanVideo 1.5 和 Qwen-Image,并支持 FSDP2、张量并行、上下文并行、专家并行及流水线并行。

为什么重要。 过去开放图像、视频模型从单卡 LoRA 走向多机完整微调时,常常需要另一套权重格式和训练代码。现在模型格式、训练框架与回传 Hub 的路径开始连成一条线,视觉生成模型的规模化实验门槛会明显下降。

边界。 当前集成只支持 flow-matching 模型,Kubernetes 编排和 Python 化配方仍在后续计划中。

来源:NVIDIA × Hugging Face 联合技术文章

今日判断

今天的信息可以归纳成一个变化:模型行业正在从“谁的单次回答更聪明”,转向“谁能以可控成本持续完成任务”。超大开放模型、检索器、分布式微调工具和 Agent 安全事件,看似分散,实际上都在回答同一件事——当模型开始长时间工作并调用真实系统时,能力、成本、开放性与安全必须放在一起衡量。

注:文中的性能、成本和吞吐数字均注明了发布方。除公开榜单外,它们不等同于独立第三方复测结果。