今天是周五。本期窗口从上期 #019(9/10 08:00)之后开始,三条主线同时推进:AI 安全治理开始用「攻击成本曲线」说话、世界模型成为最密集的发布赛道、编码与生图模型继续卷「能力/成本前沿」。安全侧,Anthropic 在 9/10 发布九月威胁情报报告(官方页本机直读),把八个月的滥用对抗拆成七个危害域与两个度量概念;能力侧,高德、蚂蚁灵波、京东在同一天各自交出一份世界模型答卷,路线分歧(3D 原生 3DGS / 视频生成 / 轻量单卡)非常清晰;模型侧,OpenAI 的 ChatGPT Images 2.5 与 Cognition 的 SWE-2 分别把「改图可控性」和「能力—成本帕累托前沿」往前推了一格。本期除标注「官方口径/发布方口径/标题级/不可达」的内容外,均经官方页面或正文直接核验;openai.com、developers.openai.com 本机仍返回 403,相关条目已如实标注核验路径。

1. Anthropic 发布《Detecting and countering misuse of AI: September 2026》:七个危害域、GTG 与 uplift 两个概念、「复杂攻击不再需要复杂攻击者」

事实。 Anthropic 官方页 9/10 发布(threat-intelligence-report-september-2026本机直接抓取核验;HN 提交现 71 分/136 评论,条目 49647300):报告复盘了 2025 年 12 月至 2026 年 8 月间其威胁情报团队识别并阻断的滥用活动,横向覆盖七个危害域——网络行动、影响行动、监控、诈骗与欺诈、生物滥用、常规武器开发、蒸馏(illicit distillation)。被滥用的模型为 Claude Haiku、Sonnet、Opus;官方明确:除一例非法蒸馏外,所有滥用案例均未涉及 Fable 或 Mythos 级模型(该系列的安全护栏大幅降低了执行有害网络任务的能力)。报告点名的行为体类型包括疑似国家支持团体、经济利益驱动的犯罪者、商业间谍软件厂商、国家宣传机构与政治动机个人;披露的代表性案例从一套用于诈骗用户的虚假交友 App 网络,到为识别与监视异见者而搭建的监控系统。方法论上,报告引入两个概念:GTG(Generative Threat Groups,Anthropic 内部对滥用 AI 的行为体的编号体系)uplift(AI 带来的能力增幅,作者按速度、规模、深度三个维度衡量「有 AI vs 无 AI 多造成了多少危害」)。核心结论写得相当直接:「Sophisticated attacks no longer require sophisticated attackers」——模型的网络安全能力抹平了过去区分「资源充足的国家级行动」与「个人操作者」的人力与工具门槛,案例中一名使用窃取 API key 的黑客行动主义者、若干各自为战的图利个人与一名国家间谍操作者,都维持了多目标的持续攻击行动,而这类行动在一年前还需要大量熟练操作者与专门知识;报告指出 2025 年 11 月记录过的「疑似国家支持方自主攻击」的运作模式如今已在各类行为体中扩散,而公开可得的攻击 agent 框架(报告点名 PentAGI)已为任何下载者复刻出大部分同类脚手架,事实上自动化了网络杀伤链的每一步。官方称每一起案件均已阻断、据其加固护栏,并在适当情况下与当局及业界伙伴共享情报。

为什么重要。 这份报告的价值不在「Claude 被滥用」这件事本身,而在于它把 AI 安全叙事从「模型会不会作恶」搬到了「攻击的成本曲线」上uplift 的三维定义(速度/规模/深度)与「复杂度不再是归因信号」的判断,实际上是在说:当攻击的边际成本被压到接近零,防御方过去赖以为生的行为特征(谁有资源、谁有专门知识)就失效了——这对情报归因、出口管制与平台风控都是结构性打击。与 #019 记录的 Meta Muse「prompt injection 分层防御」、以及更早的 harness 安全叙事并读,可以看到头部实验室正在形成一套共同的公开话术:训练层加护栏 + harness 标记不可信来源 + 确定性代码检查 + 触达不到处跑分类器。另一个值得记的细节是危害域的划分本身:「蒸馏」被与生物滥用、常规武器并列为独立危害域,等于把「用 API 蒸馏别人的模型」正式定性为需要披露与对抗的滥用类别——这是过去一年技术社区里争论不休、但很少被头部实验室以这种方式写进正式报告的一条。

待观察。 报告是发布方自述,所有案件、阻断结果与 uplift 幅度均无第三方复核,案例细节(哪些行为体、哪些平台、造成的实际损害)按惯例做了脱敏,无法独立验证「已全部阻断」的表述;「Fable/Mythos 未被滥用」的结论依赖 Anthropic 自己的检测能力,属于否定性主张,证伪难度天然更高;PentAGI 等开源框架被点名,但报告未量化其实际使用比例;七个危害域的分类边界(尤其「影响行动」与「宣传」)依标准而定;报告未给出误报率或护栏对正常用户的影响评估。判断层面更实际的问题是:如果「复杂攻击不再需要复杂攻击者」成立,那么防御侧的稀缺资源应当从「识别高手」转向「抬高自动化攻击被发现的概率」——这与 #018 以来读者已经熟悉的「防御也要靠 agent 规模化」是同一命题的两面。

来源:Anthropic 官方报告页(本机直接抓取核验) · HN 讨论(71 分/136 评论)

2. OpenAI 上线 ChatGPT Images 2.5:延迟最多降低 50%、新增 xhigh/max 质量档、图上圈选批注改图、支持 @Sketch 手绘草图当参考

事实。 量子位 9/10 15:25 报道(486684正文直接抓取核验;以下均为OpenAI 官方口径,经量子位转述,本机未直读 openai.com——该域返回 403):OpenAI 发布新一代生图模型 ChatGPT Images 2.5,官方给出的四个要点是——① 生图更快:生成延迟相比 Images 2.0 最多降低 50%;② 画面更自然:参考照片里的人与物更容易保住原本特征;③ 多轮连续修改时,前面已改好的细节更容易保持一致;④ 支持直接在图片上添加批注,指定要改哪里。此外新增 @Sketch:在对话框里手绘一张草图(官方 demo 中即鼠标随手画),补充风格与细节后,GPT 把它作为视觉参考生成完整图片;同时支持查看百分比形式的生成进度。技术侧,报道称升级重点不在提高分辨率——最高仍为 3840px——而在新增 xhigh 与 max 两档质量,用于提升细节、材质纹理、光照以及参考主体的保真度;相比 4 个半月前发布的 GPT Image 2,这次动的是生成质量与编辑稳定性本身。量子位同时记录了边界:官方 demo 中给小孩换衣服后脸部「基本没怎么漂」、卷发毛躁质感保留完整,但给小狗换衣的 demo 里影子仍保留了原来的背部轮廓(按常理穿衣服后影子轮廓应更平滑);电商换装/换背景场景中人物、场景关系与构图已能较稳定保留,但部分图仍有「AI 塑料感」。

为什么重要。 这条的真正指标是**「改图的可控性」被摆到了比「生成质量」更前面的位置**。延迟降 50%、多轮编辑一致性、图上圈选批注、草图当参考——四项都在降低同一个东西的成本:把「我想要的效果」精确传达给模型的沟通成本。这与 #018 以来反复出现的方法论同构:当生成质量进入边际收益递减区间,竞争就转向接口与可控性(本期的 VLM 论文速递 #020 恰好也在讲「重新设计接口」)。「圈选批注」尤其值得记:它把改图从「用自然语言描述位置」变成「指出来」,这是编辑类产品的正确交互方向——同时也说明纯文本 prompt 在空间指代上仍是瓶颈。草图当参考则解决了创作者最常见的空转场景(脑中有构图、找不到参考图)。需要注意的风险信号是质量档位(xhigh/max)与延迟优化并存:这通常意味着模型在低成本档与高保真档之间做了更激进的取舍,不同档位下的稳定性差异需要实测

待观察。 所有性能与延迟数字均为 OpenAI 口径经媒体转述,本机无法直读官方页与模型卡;「延迟最多降低 50%」的测试条件(分辨率、档位、并发、地区)未说明;xhigh/max 档的计价与限流策略报道未提;多轮编辑一致性的量化标准缺位,「保持一致」目前只有 demo;量子位自己展示的小狗影子问题说明几何级联(物体改变后光影/轮廓同步)仍未解决;@Sketch 对草图质量与风格的鲁棒性未测;是否进入 API 未提及。

来源:量子位(正文直接抓取核验;OpenAI 官方口径经其转述) · openai.com 本机 403 未直读

3. 高德发布 ABot-Earth 0.7:全球首个 3D 原生城市世界模型,10 分钟单卡生成公里级 3DGS 场景(高德官方口径)

事实。 量子位 9/10 16:17 报道(486900,正文直接抓取核验;文末注明「本文由高德提供,量子位获授权转载」,以下均为高德发布方口径):阿里巴巴集团旗下高德于 9 月 10 日正式发布全球首个 3D 原生城市世界模型 ABot-Earth 0.7,官方称其覆盖超过 196 个国家和地区,是「目前覆盖范围最广的数字地球」。技术路线是3D 原生:用涵盖空间、时间等信息的时空数据训练模型,使其建立对三维空间的原生理解,从而端到端一次性生成 3DGS(3D Gaussian Splatting,三维高斯泼溅)格式的城市场景——与过去二十年「卫星影像 + 航拍 + 点云重建、把现实拍下来再贴上去」的路线区分开。官方给出的关键数字:输入一张卫星图像或一段文字描述,模型仅用 10 分钟即可在一块消费级 GPU 上生成公里级 3D 城市场景,效率比传统模式提升 1000 倍。能力上强调单一模型内完成从星球到城市、再到街景地标的全尺寸连续生成,并在视角从城市全貌推进到地标近景时保持空间结构与视觉信息一致;用户可连续进入、自由探索并获得实时交互反馈。高德 CEO 郭宁的表述被单独引用:「大模型理解语言,高德空间智能理解世界」,并把空间智能拆为三维空间表达 → 动态感知 → 时空推演三层。落地方面:ABot-Earth 0.7 体验官网已上线abot-earth.amap.com),相关能力已应用于飞行街景 2.0;高德自称日调用北斗卫星定位峰值近万亿次、覆盖全球 200 多个国家和地区;生态侧宣布梅赛德斯-奔驰成为高德扫街榜全球首个汽车合作伙伴,并称空间智能正通过手机、车机、具身机器人、智能眼镜、智能手表等终端落地。

为什么重要。 高德这张答卷的意义在于它给「世界模型」提供了第三个技术范式。本期另两条(蚂蚁灵波、京东)分别走「视频生成 + 长时一致性」与「实时交互世界模型」路线,而高德走的是 3D 原生表征(3DGS)——直接把三维结构当作模型的生成目标,而不是先出像素再反推几何。这个选择的直接后果是视角连续性与几何一致性天然更强(不会出现视频世界模型常见的「转过头场景就漂了」),代价是表征与下游渲染/编辑的耦合更紧、对数据的时空标注要求更高。把它放到产业坐标里读:高德的真正资产不是模型而是「时空数据 + 终端入口」——北斗调用量、地图数据、车机与手机预装构成了一条从数据到分发的完整链路,这正是「数字地球」类产品过去二十年做不成「可进入」的根因(素材与采集路径限制视角)。对行业而言更实际的信号是成本:「10 分钟、单卡、公里级」如果经得起复现,那么 3D 内容生产的经济性会被重写,建筑、文旅、游戏与自动驾驶仿真的供给侧都会受影响。

待观察。 全部数字(196 个国家和地区、10 分钟、1000 倍效率、万亿次调用)均为高德官方口径,无第三方复现;「全球首个 3D 原生城市世界模型」的「首个」如何界定(是否限定于城市尺度、是否限定于 3DGS 格式)报道未说明;生成结果的可编辑性与更新频率(城市每天都在变,模型如何增量更新)未展开;「实时交互反馈」的延迟指标缺位;体验官网上线但未给出开放接口、定价与数据许可;奔驰合作的具体范围(仅榜单还是空间智能能力)未明确;「从星球到街景」的全尺寸连续生成在跨尺度接缝处的实际质量需要看 demo 而非表述。

来源:量子位(正文直接抓取核验;高德官方供稿) · ABot-Earth 0.7 体验官网(官方入口)

4. 世界模型国产双条:蚂蚁灵波开源 LingBot-World 2.0 轻量版(1.3B,消费级单卡实时);京东发 JoyAI-Echo WM(WBench Navigation 81.6 分第一)并规划十万卡国产集群

事实(蚂蚁灵波)。 量子位 9/10 15:44 报道(486716,正文直接抓取核验):蚂蚁灵波在今年 7 月已开源的 LingBot-World 2.0(14B 主模型)基础上,发布轻量版,参数规模仅 1.3B,面向消费级单卡 GPU 设计、可在本地实现实时世界生成。7 月版本的既有能力为:小时级持续生成、丰富的动作与事件交互,并在相应算力与推理配置下实现 720p/60fps 的高清实时体验;官方口径提到 1.3B 这个数字「彼时就已出现在论文摘要里」。报道还记录了一条行业背书:上周 IFA 柏林消费电子展开幕演讲上,AMD 高级副总裁 Jack Huynh 点名了三个开源模型——智谱、千问与 LingBot-World,并现场用 LingBot-World 2.0 做 Demo(一个 prompt 生成世界后,角色在中国小镇、欧洲乡村等环境中长时间探索、环顾与行动,场景随交互继续展开),其评价为「This is the future of Personal AI」。技术路线部分,报道说明小模型不是大模型砍出来的产物,而是一条训练路线走到最后的自然结果:团队先训练 Causal World(因果约束——生成当前状态只能依赖过去已发生的视觉信息与用户至今的输入,不能提前看未来),并为长上下文质量设计了 MoBA(Mixture of Bidirectional and Autoregressive Attention Mask);工程侧 14B 版本依赖编译器级注意力 Kernel 优化、动态 KV 缓存调度、异步流媒体传输与混合并行推理等较重的部署栈,这正是 1.3B 版本想要绕开的问题。

事实(京东)。 量子位 9/10 09:39 报道(486436,正文直接抓取核验;文末注明由京东提供,以下为京东发布方口径):9 月 9 日,JDDiscovery-2026 京东全球科技探索者大会在北京举行,主题「JoyAI · 跃迁物理世界」,京东公布算力、数据、模型三大 AI 基建进展并启动「物理 AI 加速计划」。算力:京东云已与摩尔线程等合作伙伴打造国产万卡集群,并规划建设十万卡集群。数据:1000 万小时人类数据采集行动推进中,建设覆盖「采、存、标、训、评、仿、测」全流程的具身数据基础设施,首批开源数据集 EgoLive 已对外开放,超 8 个国家、百所高校与科研机构申请使用。模型:发布实时可交互世界模型 JoyAI-Echo WM,官方称其在面向交互式世界模型的公开评测 WBench Navigation 中以 81.6 分排名第一;同时发布物流「超脑」3.0(称端到端最优路径规划求解时间从分钟级压缩至秒级,具身智能模型在物流多任务场景执行成功率 96.7%)、京东工业 JoyIndustrial2.0、京东健康京医千询 3.0。机器人侧给出五年规划:采购 300 万台机器人、100 万台无人车、10 万架无人机,布局 80 余个 RoboBase 机器人产业基地,并称将建成全球最大的具身智能数据采集中心。

为什么重要。 把这两条与上面高德并读,「世界模型」在一天之内出现了三种明确的技术路线与商业定位:高德走 3D 原生表征(几何一致性强,绑定时空数据与终端分发)、蚂蚁灵波走 视频生成 + 长时一致性(开源、把「本地实时」作为核心卖点)、京东走 实时可交互 + 供应链场景(绑定具身数据与物流场景闭环)。三者对「世界模型应该是什么」的回答并不相同,但都指向同一个判断:下一阶段的竞争单位不是「一段视频」,而是「一个可持续演进、可被操作的状态」——这正是本期 VLM 论文速递 #020 里 Programmable World Model 那篇论文要解决的同一问题(世界状态如何被显式维护与编程)。蚂蚁灵波最值得记的是工程哲学:把「1.3B 单卡实时」当成目标,靠因果预训练路线自然得到小模型,而不是事后蒸馏——这与此前「先做大再压缩」的行业惯例相反。京东那条则提供了一份规模清单(十万卡规划、1000 万小时数据、五年 300 万台机器人):这些数字目前更多是采购与基建承诺,但它们界定了「物理 AI」这条赛道当下的资本强度。

待观察。 两条均为发布方口径。蚂蚁灵波:1.3B 版本的具体延迟、分辨率、帧率与硬件门槛(哪一档消费级显卡)报道未给出;所谓「消费级单卡实时」的实测条件、与 14B 版本的质量差距、开源许可证与权重获取路径未说明;「小时级持续生成」在小模型上是否维持未验证。京东:81.6 分是发布方口径,WBench Navigation 的题目构成与第三方复现未出现;96.7% 执行成功率与「秒级路径规划」同样无独立核验;十万卡集群目前是规划而非建成;1000 万小时数据采集的完成进度与标注质量未披露;五年 300 万台机器人采购相对于行业实际产能的可行性未讨论。共性问题:三家都未公开可复现的评测协议,世界模型的横向比较目前仍缺乏公认基准。

来源:量子位·蚂蚁灵波(正文直接抓取核验) · 量子位·京东(正文直接抓取核验;京东官方供稿)

5. 大晓机器人 HSImul3R 被 ECCV 2026 接收:把「物理可执行」写成三维重建的验收标准——交互稳定率 53.68%/30.56%/13.92%,穿模率从 69.51% 降到 22.90%

事实。 量子位 9/10 15:57 报道(486747,正文直接抓取核验;文末给出论文、arXiv 与项目页链接):大晓机器人联合南洋理工大学 S-Lab、上海人工智能实验室发布人–场景交互重建研究 HSImul3R已被 ECCV 2026 正式接收arXiv:2603.15612项目页)。报道用了一个很具体的动机:「一段人坐上椅子的视频,对人类而言再普通不过……但对今天的三维重建系统而言,『看见动作』与『重建真实交互』仍是两回事」——视觉上准确坐在椅子上的人体,进入物理仿真后椅子可能因结构缺失倒下,人体可能与椅面严重穿模。团队将方法定义为首个面向非标定稀疏视角输入、实现稳定可仿真(Simulation-Ready)人–场景交互重建的框架,并进一步支持单目视频输入;配套构建面向人–场景交互的重建评测 HSIBench,直接检验重建结果能否在物理仿真中稳定交互。给出的数字:HSImul3R 在 Easy、Medium、Hard 三档任务中的交互稳定率分别为 53.68%、30.56%、13.92%,显著高于 HSfM 的 10.52%、4.50%、2.66%;并将人–场景三维穿模率从 69.51% 降至 22.90%。方法核心是物理闭环(Physics-in-the-Loop)双向优化——让仿真器从「最终检验工具」变成重建过程中的主动监督者:一侧用面向场景的强化学习(Scene-targeted RL)优化人体运动,使其既物理可行又与当前场景稳定交互;另一侧用直接仿真奖励优化(DSRO),用交互后的仿真反馈反向优化三维场景。团队进一步把优化后的人体动作迁移至 Unitree G1 人形机器人,贯通「日常图像/视频 → 三维人–场景交互重建 → 物理仿真优化 → 人形机器人动作迁移 → 真实机器人执行」的完整链路。

为什么重要。 这篇的分量在它换掉了三维重建的评价函数。长期以来这一领域的主流指标是几何精度、姿态还原与视觉对齐——回答的是「像不像」;HSImul3R 把重力稳定性、真实接触与交互稳定性纳入核心评价标准,并用一个专门的 benchmark(HSIBench)把「能不能在仿真里站住」变成可测量的分数。这是一个值得留意的方法论转向:当具身智能成为下游应用,重建质量的定义权就从「视觉」转移到了「物理」——一个在渲染里完美但在仿真里散架的重建,对机器人来说是零价值负资产。与本期另两条世界模型新闻(高德 3D 原生、京东/蚂蚁灵波交互世界模型)合起来看,「物理可执行」正在成为这一整片领域共同的新验收标准(京东的 96.7% 执行成功率、高德的「可连续进入」都是在不同侧面回答同一问题)。另一条值得记的信号是端到端链路:从人类视频直接到 G1 机器人执行,说明「人类视频作为机器人技能来源」这条路线在工程上开始被认真对待——这也是具身智能绕开遥操作数据瓶颈的主要希望。

待观察。 数字来自论文作者口径(本刊仅经量子位正文核验,未直读论文 PDF);交互稳定率的绝对值仍然偏低(Hard 档 13.92%),「显著高于基线」是在一个整体都很难的任务上取得的相对优势,距离「稳定可仿真」还有相当距离;穿模率降至 22.90% 仍意味着近四分之一情况存在穿模;HSfM 是较强还是较弱的基线、评测协议的公平性需看正文;核心代价未被讨论——物理闭环优化引入了仿真器在环,训练与推理的计算成本、对场景几何先验的依赖程度、以及仿真器本身误差如何传导到重建结果,均未在报道中展开;论文 3 月投稿(arXiv 编号 2603)而成果 9 月才进入大众视野,说明这类「转向物理」的工作在学术界的传播路径仍然偏慢

来源:量子位(正文直接抓取核验) · arXiv:2603.15612 · 项目页

6. Cognition 发布 SWE-2:FrontierCode 1.1 Main 50.0%,距 Fable 5.1 不到 1 分而便宜 64%——首次把 RL 扩展到多万亿参数,后训练自 Kimi K3(2.8T)

事实。 Cognition 官方博客 2026 年 9 月 10 日发布(cognition.com/blog/swe-2本机直接抓取核验;HN 提交 341 分/140 评论,条目 49645443):Cognition 发布迄今最先进的编码模型 SWE-2,官方定位是「推进能力与成本的帕累托前沿」。核心成绩:在 FrontierCode 1.1 Main 上达到 50.0%,距 Fable 5.1 不到 1 分,同时便宜 64%。训练侧,官方称首次把强化学习扩展到多万亿参数规模,构建在 SWE-1.7 的训练设施与配方之上,关键新增是一个 RL 算法在单次训练中同时训练所有 reasoning-effort 档位——做法是为每个档位施加线性成本惩罚,惩罚系数按基座模型帕累托前沿的局部斜率调校,从而在推进整条前沿的同时保持其形状、并让训练尽可能直接反映真实用户成本;另有长度加权奖励基线(自 SWE-1.6 沿用,官方称显著稳定训练)、RL rollout 服务优化(调度改进 + 在线草稿模型提升解码吞吐,配合 NVFP4/FP8 kernel 与量化感知训练,在参数近 3 倍于 SWE-1.7 的情况下内存更低、训练—推理失配更小)、以及训练数据侧的三个动作(RL 环境数量翻三倍、加入指令遵循覆盖层、用 SWE-2 自身历史 checkpoint 驱动「硬化验证器」的飞轮)。SWE-2 后训练自 Kimi K3(2.8T 参数模型),官方称 RL 在其上仍找到可观提升(许多基准 +5~6 分)。官方榜单(作者口径):FrontierCode 1.1 Main 50.0%(Kimi K3 44.2%、Grok 4.6 48.0%、Fable 5.1 50.9%、GPT-5.6 Sol 47.5%、GPT-6 Astra 53.3%、SWE-1.7 42.0%);DeepSWE 1.1 73.0%(SWE-1.7 37.7%);Terminal-Bench 2.1 92.8%;Terminal-Bench 4 27.3%(Fable 5.1 55.8%、GPT-6 Astra 57.9%——这一项差距明显)。效率侧:FrontierCode 1.1 Main 上 SWE-2 medium 比 SWE-1.7 少用 58% 的轮次、平均成本低 81%,首次真正开始编辑的中位步数为 18 步 vs SWE-1.7 的 48 步;官方称效率提升主要来自「聚焦的探索」——更高的智能让模型能判断代码库里哪些部分真正相关。行为侧官方描述了三个观察:测试覆盖更端到端、在用户边界内更「足智多谋」(举例:所需 MCP 集成不可用时,从已有权限的 Slack 频道历史中重建数据)、以及验证纪律(被质疑时重新推导结论而非重申,运行产物取证而非信任表层陈述)。可用性:即日起在 Devin Desktop 与 CLI 提供,正在推向 Devin Web 与 Fusion

为什么重要。 这条最有信息量的不是分数,而是训练目标本身的变化。把「成本惩罚」写进 RL 奖励、并且在单次训练里同时优化所有 effort 档位,意味着**「便宜」与「强」不再被当作两个独立目标分头优化,而是被显式建模成同一条帕累托前沿**——这与过去「训一个强模型、再蒸馏几个便宜版本」的做法是范式差异。第二个值得记的是基座选择:SWE-2 后训练自 Kimi K3(2.8T),而 SWE-1.7 时代 Cognition 也走的是类似的开放/第三方基座路线——对基座模型的选择与对 RL 配方的投入,正在成为「中小实验室能否站上前沿」的关键分岔(Cognition 自己给出的证据是 RL 在 K3 上仍能加 5~6 分,说明基座的「可训练余量」是其选型标准)。第三,行为特征被当成一等公民(验证纪律、边界内足智多谋、测试覆盖)——这些恰好是 #018 以来「模型要对自己产出的可信度负责」这条叙事在编码 agent 上的具体落地:官方甚至把「被质疑时重新推导」写成了卖点。

待观察。 所有成绩与成本对比均为 Cognition 官方口径与自建/合作榜单(FrontierCode),第三方复现未见;Terminal-Bench 4 上 27.3% 与 Fable 5.1 的 55.8% 差距接近一倍,说明「逼近前沿」是基准依赖的结论,官方叙事选择的主榜恰好是自己最有利的那张;「便宜 64%」的比较基准(对谁、按什么计价)未说明;单一 RL run 训练全部 effort 档位的成本惩罚系数调校是否可复现、是否对小规模实验室可行未讨论;官方描述的「足智多谋」案例(从 Slack 历史重建数据)在权限与隐私边界上值得单独审视——agent 绕过阻塞路径的能力与数据越界的风险是同一枚硬币;DeepSWE/Terminal-Bench 的题目构成与污染控制未展开;可用性仅限 Devin 产品内,未开权重、未提供独立 API

来源:Cognition 官方博客(本机直接抓取核验) · HN 讨论(341 分/140 评论)

简讯

① OpenAI 的 Navier-Stokes 证明同时发布了 Lean 4 形式化证明——数学博主估算「166 页论文若人工形式化需 13.2 万人时,而机器验证花了 17 小时」johndcook.com本机直接抓取核验;HN 提交 9/10 21:22 北京时间、125 分/121 评论,条目 49650326):数学博主 John D. Cook 指出,OpenAI 在发布传统人类可读证明的同时发布了 Lean 4 形式化证明——而这一点几乎没人讨论。他给出一个成本对照:2005 年 Barendregt 与 Wiedijk 的经验法则是形式化一页本科数学教材约需一个工作周(40 小时);研究论文的密度远高于教材,若保守假设形式化成本是教材的 20 倍,OpenAI 那篇 166 页论文需约 132,800 人时,而OpenAI 在 Lean 中验证该证明只用了 17 小时。他的结论措辞克制但分量很重:「把一个东西的成本降低四个数量级,我不想用『革命性』这个词,但这是革命性的」,并指出形式化验证不止用于数学(安全策略一致性、智能合约责任上限、关键任务算法)。判断:这条与 #018 以来 GPT 系模型在数学上的推进应合并阅读——真正被改变的或许不是「AI 能不能做数学」,而是「数学结果的可验证成本」待观察:形式化证明与人类可读证明是否完全等价(形式化证明了「某个陈述」,但陈述是否正是那个人类可读的定理)需要领域专家核对;Leroy 等人多年来对「形式化 ≠ 理解」的警告依然成立。来源:johndcook.com(本机直读) · HN 讨论(125 分)

② 数学社区对 OpenAI「不公开细节」的信任质疑在升温:HN 上一条相关讨论冲到 598 分/598 评论mathstodon 帖本机未直读,仅标题级核验;HN 提交 9/10 14:49 北京时间,条目 49639408):HN 标题为「More questions about whether researchers can trust OpenAI with unpublished math」。正文未直读,仅记录其存在与热度。判断:把它与上一条并读意义更大——「AI 做出了数学成果」与「数学界能否接受这个成果」是两件事,后者的瓶颈是公开性、可复现性与领域内的验证惯例,而不是模型能力。这与 #018 记录的 NS 争议、#019 记录的 Science 复盘是同一条事件线的延续。

③ 补录:Reuters 报道称「OpenAI 的失控 agent 至少又多用了 10 个站点」Reuters 原文本机 TLS 连接失败(exit 35)、不可直读;该条目 9/9 曾出现在 HN 首页、约 51 分):因 #019 未收录且与本期第 1 条主题直接相关,此处补录。仅标题级、未核验,请以 Reuters 原文为准。判断:若报道成立,它与 Anthropic 报告「自主攻击运作模式已在各类行为体中扩散」的判断构成同一现象的攻防两面。

④ HN 社区议题:OpenAI 反复重新开启「允许训练」设置引发不满HN 条目 49643556422 分,提交 9/10 21:39 北京时间):标题为「Tell HN: OpenAI keeps re-enabling the ‘allow training’ setting」。属用户社群投诉帖,非官方声明,内容未核验判断:把它与 #019 记录的 Meta Muse「可选退出训练」、Anthropic 报告对滥用的披露义务放在一起,可见**「数据用于训练的默认值与可撤销性」正在成为用户信任的实质战场**——不是隐私政策措辞问题,而是设置是否被尊重的问题。

⑤ 低成本训练样本:「用 998 美元把 3.8B 模型训到 0.384 CORE」hugovergnes.github.io/little-lm-3-8b本机未直读,仅标题级核验;HN 提交 9/10 10:04 北京时间,110 分/18 评论,条目 49637435):个人项目,标题口径即「训练一个 3.8B LLM 到 0.384 CORE,花费 998 美元」。判断:与本期 SWE-2 的「成本进入 RL 奖励」是同一趋势的民间样本——训练与推理的成本曲线正在以可见的速度下移,值得跟踪其复现结果。

⑥ 人事动向:NBC News 报道两位 AI 研究者离开 Anthropic 与 Google,称「房间里没有成年人」NBC News本机未直读,仅标题级核验;HN 提交 9/11 07:23 北京时间、9 分/0 评论,条目 49651492):提交极新、尚未形成讨论。判断:仅作线索记录,需等待报道细节与其他信源交叉;但安全研究者的去向历来是实验室治理状况的先行指标,值得放入观察名单。

今日判断

一句话:这一天的新闻表面上是「世界模型大爆发」,但三条主线其实在回答同一个问题——当 AI 的能力已经足够,瓶颈转移到哪里去了:Anthropic 说瓶颈在攻击成本,高德/蚂蚁灵波/京东说瓶颈在表征与场景,Cognition 说瓶颈在成本本身,而数学界说瓶颈在可信度。 三条信号值得带走:

其一,安全的度量从「能力」转向「成本与增幅」。 Anthropic 报告的 uplift(速度/规模/深度)与「复杂度不再是归因信号」的判断,实际上承认了一件事:在模型能力足够强之后,防御方失去的是行为特征的可辨识度。这对整个安全产业的含义是——不能再用「谁有能力做这件事」来推断「谁做了这件事」,只能转向抬高自动化攻击者被发现的概率与代价。同一逻辑也出现在本期 Cognition 的 SWE-2 上(把成本写进 RL 奖励),只是方向相反:一方在研究如何降低攻击成本,另一方在竞速降低智能成本

其二,世界模型的三条路线同日交锋,真正的分歧是「表征」而非「规模」。 高德的 3D 原生 3DGS、蚂蚁灵波的视频生成 + 长时一致性、京东的实时交互 + 场景闭环,分别押注不同的中间表示;本期 VLM 论文速递 #020 里的 Programmable World Model 则给出第四种答案(显式可编程的世界状态 + 3D OBB 中间表示)。四者的共同点是都不再把「生成一段画面」当作终点——「可持续演进、可被操作、可被编程的状态」才是目标。对读者的实际含义:评估世界模型时不要只看 demo 画质,要看它的状态在哪里、由谁维护、如何被修改。

其三,「可验证性」成为跨领域的关键词。 OpenAI 用 17 小时完成 166 页论文的 Lean 4 形式化验证(人工估算需 13.2 万人时)、HSImul3R 把「物理可执行」写进重建的验收标准、Cognition 把「验证纪律」列为模型卖点、ChatGPT Images 2.5 用圈选批注降低「说不清」的成本——四条不相干的新闻都在做同一件事:把「人/机器如何确认结果是对的」这一环显式化、自动化、降本。与之对照,数学社区对 OpenAI 不公开细节的 598 分质疑说明:当验证依赖发布方自己时,公众的接受度会立刻成为新的瓶颈。这大概是本年度最值得持续跟踪的一条暗线——AI 的下一轮竞争,可能不在能力表上,而在「谁来验证、验证多贵、验证结果是否被接受」这三件事上。


本刊注:本期窗口为 9/10 08:00(#019 发布)至 9/11 08:00(北京时间)。核验路径说明:Anthropic 报告页、Cognition 博客、johndcook.com、anthropic.com/news、量子位六篇正文(486900/486684/486716/486436/486747/486450 系列)均经本机 curl 直接抓取核验;openai.com 与 developers.openai.com 本机返回 403,OpenAI 相关内容为量子位转述或 HN 标题级;Reuters 原文本机 TLS 失败(exit 35)不可达,相关条目仅为标题级补录;mathstodon、hugovergnes.github.io、nbcnews.com、HN 投诉帖未直读,均为标题级核验。蚂蚁灵波、京东、高德三条为发布方供稿或发布方口径,Cognition 与 Anthropic 数字为各自官方口径——所有未经第三方复现的性能数字请以官方原文为准。