今天是周日。过去 24 小时没有新的旗舰模型发布,但两条「上周主线」都在继续加码:一是模型架构侧的「循环深度(recurrent depth)」争议正式出圈——The Information 爆料称 GPT-6 Astra 让同一组 Transformer 层反复运行(以少参数换深计算),AI 安全圈随即质疑这类在 hidden state 里进行的循环难以监测,OpenAI 首席科学家 Jakub Pachocki 被迫下场回应(据量子位转述);同一主题下,阿里团队的 MeSH 与 SpiralFormer 两篇论文(arXiv 元数据已核验)给出了治理「循环空转」的具体方案。二是「AI for Math」的答案之争从实验室蔓延到公共舆论——牛津数学家 Julia Stadlmann 8/31 把素数间距上界压到 240 的预印本刚被陶哲轩背书,9/3 就有三家 AI 公司竞相宣布更强的数字(量子位称 OpenAI 186、Anthropic 188、Axiom 212),陶哲轩随即以「污染」为题连发警告,认为黑盒快速求解正在损害数学本身的发展。产业侧:光象科技与清华团队发布「训练完就退场」的世界模型 ActEffect;Spotify 实测用自家 Portal 把 Claude Code 的 token 砍掉约 90%;美国最大两大学区同日宣布收紧学生 AI 政策。下面五条主条 + 四条简讯。除标注「量子位报道口径/企业口径/作者自报/转述」的内容外均经原文直接核验;OpenAI 官网(openai.com)与 The Information 原文本次无法从本机直接访问,已如实标注。HN 分数为 9 月 6 日早抓取值。

1. 「循环深度」争议出圈:The Information 称 Astra 用同一组层反复运行,安全圈质疑可监测性、Pachocki 下场回应;阿里 MeSH/SpiralFormer 补位「循环空转」(arXiv 元数据已核验)

事实。 量子位 9 月 5 日 23:07 刊发系统报道(正文直接抓取核验)。背景:The Information 最早爆料 GPT-6 Astra 采用了「循环深度(recurrent depth)」——让同一组 Transformer 层反复运行多轮,在不按同等规模增加参数的前提下把计算做深(该爆料为量子位转述,The Information 原文与 OpenAI 官方架构说明本次均未能直接访问)。由此引发的争议集中在可监测性:循环发生在 hidden state 内部,中间过程未必写成人类可读的思维链,模型行为更难监测;AI 安全研究者就此批评 OpenAI,首席科学家 Jakub Pachocki 下场回应,并透露正在写一篇长文完整解释此事(量子位转述,原帖未能直接核验)。报道同时给出产业参照:Anthropic 的 Claude Mythos 早前已把循环架构带火一轮——在 GraphWalks BFS 的 256K 至 1M 上下文测试中,Mythos Preview 拿到 80.0%,GPT-5.4 为 21.4%、自家 Opus 4.6 为 38.7%(量子位转述官方成绩;Mythos 是否真用循环架构官方未明说)。真正的新信息是阿里侧的两篇论文(据量子位报道为阿里及合作高校团队;arXiv 元数据已直接核验,MeSH 一作序列含 Chengting Yu 等 11 人):MeSHarXiv 2510.07739,2025 年 10 月 9 日首版、2026 年 4 月 20 日修订,据量子位称已被 ICLR 2026 接收)先给循环模型做「体检」:用 hidden state 变化幅度、CKA 表示相似度、奇异值谱三项指标证明「第一个 core loop 承担绝大部分更新,后面的循环趋于空转」——诊断出「计算无分化」与「信息过载」两个病因,解法是给循环之间加一个可动态存取的 Memory Buffer(记忆槽)+ Write/Read 双路由器,让每轮循环按可学习权重存取信息、逐步形成分工;SpiralFormerarXiv 2602.11698,2026 年 2 月 12 日首版,据量子位称已被 EMNLP 2026 接收)则把每轮循环的序列长度变成可调——先压缩到原长 1/8、再 1/4、1/2、最后回到完整序列,从粗到细循环(写回结果做右移防止泄漏未来信息)。实验数字(量子位报道口径):MeSH 在 Pythia-1.4B 级实验里,循环结构的权重共享减少约 33% 非嵌入参数,加入 MeSH 后零样本下游平均准确率从普通 Transformer 的 49.50% 提到 50.56%(+1.06pt),新增路由器参数仅约非嵌入参数的 0.005%、额外计算开销约 0.014%;SpiralFormer 在参数量与普通 Transformer 基本持平下,计算量从 14.08T FLOPs 降到 13.13T,5-shot 下游平均准确率从 51.93% 提高到 54.37%;两项 probing 显示早期低分辨率循环注意力分布更广(global),后期高分辨率循环转向局部(local),循环比例在 30%-40% 附近最优(U 形曲线)。

为什么重要。 这是「下一代高效大模型往哪走」的一次公开化:如果 Astra 确系循环架构,那么「把计算做深、而不是把参数做大」就从学术路线变成了旗舰产品的现实选项——报道里那句「8 层参数跑 3 遍 ≈ 24 层深度的计算」正是其诱惑所在。但这条路线有两个此前被忽视的代价,本周同时暴露:其一是可监测性——循环在 hidden state 里进行,安全研究者担心思维链式的人类可读中间过程消失(注意这与 #014 里 agent 群涌事件同属「黑盒化」焦虑的延续);其二是**「循环空转」**——阿里论文用三项指标证明朴素循环的后几轮增量趋近于零,「多算几轮」不等于「多算出东西」。MeSH 与 SpiralFormer 的价值在于把「循环内部发生了什么」第一次拆成可诊断、可修复的工程问题(信息管理 + 计算粒度),这比争论「Astra 到底用没用」更接近路线本身的地基。把这条与 #014 的 GitHub HydraFusion(跨模型编排)、今天 Spotify 的 token 路由(见主条 4)并置,信号很清楚:行业竞争单位正在从「模型参数」上移到「计算怎么被组织」——包括层内循环、模型间路由、token 级委派三层

待观察。 The Information 爆料与 Pachocki 回应均为量子位转述,OpenAI 官方架构说明未发布、官网本次不可达;「Mythos 用循环架构」仍是外界推断;MeSH/SpiralFormer 的实验全部在 Pythia-1.4B 级别,未见更大规模验证;「ICLR/EMNLP 2026 接收」为量子位口径,arXiv 页 comments 字段未标注;阿里团队与具体高校的对应关系报道未点名;循环架构在长上下文、推理任务上的表现与监控方案均未见公开实验。若 Pachocki 的长文近期发布,值得单独跟踪。

来源:量子位(正文直接抓取核验;The Information 与 Pachocki 言论为转述) · arXiv: MeSH(元数据直接核验) · arXiv: SpiralFormer(元数据直接核验)

2. 陶哲轩警告「AI 抢答正在污染数学」,素数间距上界竞速成导火索:Stadlmann 240(arXiv 已核验)→ 9/3 三家 AI 公司竞相宣布更强数字(OpenAI 186/Anthropic 188/Axiom 212,量子位转述)

事实。 这是一条时间线完整、且大部分可原文核验的故事:① 8/31:牛津大学数学家 Julia Stadlmann 发布单作者预印本《Bounded gaps between primes》(arXiv 2608.31126,math.NT,8 月 31 日提交,arXiv 页面已直接核验),把自 2014 年 Polymath8b 起保持的「连续素数间距上界 246」首次压到 240;② 9/1:陶哲轩发帖背书(mathstodon 原文已核验),称其是「PolyMath8b 精神的可贵延续……由一位数学家(借助传统数值计算、未用现代 AI 工具)完成」;③ 9/3:陶哲轩记录「今天出现了不体面的一幕(unedifying spectacle):至少三家 AI 公司竞相宣布对同一问题自己的改进,数字都比 Stadlmann 的 240 更强;我很庆幸 Stadlmann 赶在问题被污染之前完成了她的分析」(mathstodon 原文已核验)。各家公司具体数字据量子位 9/5 报道为:OpenAI(GPT-6 Astra,称用 Lean 形式化把上界从 246 推到 186)、Anthropic 188、Axiom 212——OpenAI/Anthropic/Axiom 的原始公告本次未能逐一直接核验(openai.com 不可达),但陶哲轩 9/5 的长帖中明确以「把 Zhang 的 7000 万上界改进到 246、188 或 6」举例,可佐证「188」这一量级的数字确实出自本轮 AI 公司公告;④ 9/3 至 9/5:陶哲轩连发数帖把个案上升为方法论警告(全部 mathstodon 原文已核验):以纳维-斯托克斯方程全局正则性为例,指出一个由自主 AI harness 在巨量算力下内部完成「拟设-失败-调整」迭代、公司却把过程屏蔽在公众视野之外的求解,会「在技术上解决最著名的开放问题之一,却几乎没有为数学增加任何价值」;「AI 在制造答案与制造洞见之间已出现负相关」;「过早用纯 AI 方式(尤其缺乏过程透明)解决问题,会把该问题作为数学进展源泉的机制污染到净负」;并引 Fields 奖得主 Hugo Duminil-Copin 的「对开放问题的自动化挖矿会摧毁数学生态系统」论述,提出有必要把某些问题划为自动求解器的禁区;9/5 他再发一条「新竞赛提议」:AI 公司与其抢先宣布解决未解问题,不如抢先宣布一个新的数学洞见(9/5 23:30,mathstodon 原文已核验)。量子位 9/5 12:24 以《陶哲轩吐槽 GPT-6 孪生素数新突破》为题报道此事(正文直接抓取核验)。

为什么重要。 把这条和 #014 的头条(Anthropic 用 11 天形式化费马大定理)放在一起,上周的「AI for Math」图景突然完整了:一边是「答案的生产」在加速——费马大定理 1300 万行 Lean、素数间距上界一周内被三家 AI 公司连番下探;另一边是「洞见的生产」在被质疑——陶哲轩警告的正是 #014 里那种「60 亿 token 换一个正确但可能无人能读懂的证明」的极端情形:如果公司把「通往答案的迭代过程」私有化,数学共同体将失去失败路径上的全部副产品(新方法、新概念、新联系),而历史上这些副产品(Leray-Hopf 弱解、Prodi-Serrin 正则性、Beale-Kato-Majda 判据……)恰恰是学科发展的主要来源。这不是反 AI 立场——陶哲轩明确说 AI 辅助数学「没有理由必然做这个交换」,并举了 Erdos 问题 126 的合作式案例;他反对的是「把开放问题当基准刷、把过程锁进黑盒」的竞赛模式。对产业界,这条信号同样直接:「AI 证明」的声誉风险正在从「正确性」转移到「透明度与可复现性」——Anthropic 开源了 FLT 仓库、陶哲轩的批评对象则是「只宣布结果不公开过程」的做法,两者在「可验证性」上正好一正一反。这也呼应主条 1 的可监测性争议:黑盒化(hidden state 循环、私有 harness)正在成为 2026 年下半年 AI 行业最大的公共信任赤字来源

待观察。 OpenAI 186 / Anthropic 188 / Axiom 212 三组数字目前仅量子位单方转述(Axiom 是否为正式公司名、其公告形态均未核验);各公司是否发布可检查的 Lean 证明文件、是否公开过程日志未见报道;「上界」竞赛是否还会继续(陶哲轩 9/5 的「Sep 5-, 2026: ???」);Stadlmann 240 的分析是否已被 AI 公司结果超越或独立复现;陶哲轩「划禁区」的提议目前无任何执行机制。

来源:陶哲轩 9/1 帖(Stadlmann 240,原文核验) · 陶哲轩 9/3 帖(三家 AI 公司竞速,原文核验) · 陶哲轩 9/3 纳维-斯托克斯长帖 1/6(原文核验) · 陶哲轩 9/5 澄清帖(原文核验) · 陶哲轩 9/5「新竞赛」提议(原文核验) · arXiv: Stadlmann《Bounded gaps between primes》(元数据核验) · 量子位(正文直接抓取核验;各公司数字为转述)

3. 光象科技 × 清华李升波组发布 Phi-WM 1.0 ActEffect:受控世界模型只在训练期检查动作后果,部署时「退场」,机器人反而更能干(LIBERO 98.8% 等为报道口径)

事实。 量子位 9 月 5 日 12:18 刊发(正文直接抓取核验;技术成绩为光象科技与清华团队口径,产业表述为企业口径):光象科技联合清华大学李升波教授课题组发布第一代物理原生世界模型 Phi-WM 1.0 ActEffect,核心主张一反「世界模型随机器人上岗」的主流叙事——它只在训练场里工作:拿到当前视觉状态与一份动作提案,预测这段动作执行后场景会如何变化,把「后果好坏」变成策略优化的反馈;训练完成后,受控世界模型与未来观测分支一起从部署链路退出,机器人执行时只剩 MIP 动作头做粗提案+精修,不再展开未来、不再搜索候选动作。方法细节(报道口径):① VLA 策略同时交出三版完整提案——前馈分支的「第一反应」、MIP 动作头的粗提案、以及在其上精修出的最终执行动作;② 受控世界模型对三版提案分别预测后果(只看当前画面与动作、不读任务语言——同一物理动作的后果与指令措辞无关),并把未来状态放进冻结的 DINOv3 视觉特征空间,只需抓住物体位置/姿态/结构变化,不必生成逼真未来帧;③ 把三次预测与训练数据里真实执行后的观测逐一比较,用排序损失(精提案须比粗提案更接近真实未来、粗提案须胜过前馈提案)+ 梯度截断(差答案不能靠变得更差来衬托好答案)把信号写回策略权重。成绩(报道口径):LIBERO 平均成功率 98.8%(对比 DiT4DiT 98.6%)、加入七类分布偏移的 LIBERO-PLUS 80.3%(对比 Fast-WAM 51.5%)、29 维动作空间 + 双臂/灵巧手/腰部自由度的 RoboCasa-GR1 平均成功率 67.5%(比第二名 ABot-M0 高 9.2pt);消融显示去掉后果反馈 98.8%→97.0%、把 DINOv3 换成 VLM 表征 97.3%、去掉排序损失 98.1%。产业侧(企业口径):光象科技 2025 年 4 月成立、由清华车辆与运载学院与人工智能学院联合孵化,CEO 张涛(清华博士、前阿里高德技术总监),联合创始人李升波(清华教授);在 2026 ATC 展会上其 Phi-Bot X1 进入蔚来汽车焊接上下料场景,连续运行 3 天、累计作业 21.5 小时、零失误零中断。

为什么重要。 这是具身智能「世界模型应该放在哪」路线之争的一个清晰新样本。上周 #014 简讯里的 SmoothRL 主张「把在线 RL 搬进真机执行」;今天 ActEffect 给出相反的位置安排:把「多想一会儿」全部留给训练,把最轻的链路留给执行。它戳中的是工业部署最现实的两笔账——时延与算力:单台机器人多跑一层世界模型只是一行开销,复制到几十个工位、几百台设备就是实打实的显卡、功耗与维护成本;而把世界模型当作「训练期的后果裁判」,等于从现有演示数据里再榨出一层监督,却不给产线增加任何在线负担。方法上值得注意的两点:其一,受控世界模型刻意不看语言指令——把「任务语义」与「物理后果」解耦,让后果预测只学动作与状态变化的对应关系,这比把一切塞进同一上下文更符合因果直觉;其二,用排序信号而非生成误差做世界模型的监督目标(且配梯度截断防钻空子),避开「预测像素」的高成本与低信号问题——这与 #014 里 WorldReward「VLM 成对偏好当奖励」是同一方法论家族(不预测、只比较)。把它和嬴彻的「货运物理 AI」(#014 主条 5)放在一起,国内「世界模型进工厂」的两条路线正在收敛到同一个判断:世界模型的第一价值不是生成画面,而是为决策提供可用的监督或推演信号

待观察。 全部技术数字为报道/团队口径,未见论文或开源代码链接(光象与清华是否计划发布技术报告未说明);LIBERO/PLUS/GR1 均为仿真基准,真机验证目前只有 Phi-Bot X1 的产线连续运行(21.5 小时零失误为企业口径,且为整套工业系统而非 ActEffect 单点验证);「部署时拿掉世界模型后性能不掉」的关键对比(带/不带部署期世界模型的真机对照)未给出;DINOv3 特征空间与排序损失的组合是否有更优配置未消融完整。

来源:量子位(正文直接抓取核验;技术成绩为团队口径、产业表述为企业口径)

4. Spotify 实测:用自家 Portal「AiKA Modes」给 Claude Code 做模型路由,token 用量砍约 90%——「把 I/O 活派给便宜模型,把思考留给旗舰」

事实。 Spotify 工程博客 9 月 5 日发布(原文直接抓取核验;HN 244 分,9/6 早抓取值;全部数字为作者自报):作者(Spotify 工程师)把 Claude Code 的 token 消耗拆解后发现「大部分消耗不是思考而是 I/O——读五个文件回答一个问题、照着旁边二十个测试文件生成一个新测试、会后更新文档」,于是基于 Spotify 的 Portal(内部 AI 平台)的 AiKA Modes(声明式 agent、运行在类似 Lambda 的临时运行时上)搭了一个叫 shunt 的 Claude Code 插件做强制路由:① bulk-reader 模式(worker 为 Gemini 2.5 Flash)负责大批量读文件并输出结构化要点——Claude Code 的 PreToolUse 钩子拦截超过默认 350 行的 Read/cat/head/tail 调用,把活转给 worker,文件内容不进 Claude 的上下文;② code-writer 模式负责照既有模式生成测试/配置样板,输出直接落盘、Claude 根本看不到生成的代码;③ 委派只做单次调用、不存服务端,跟进询问重新发送即可。实测:在 Java monorepo 上四个场景测量,bulk-read 场景平均省约 90% 的 token。作者明确列出不能委派的部分:编辑(worker 摘要的可靠行号缺失)、推理/调试(worker 在测试中漏掉一个微妙的线程安全 bug,Claude 拿到上下文后几秒就发现了),以及延迟代价(每次委派 10-30 秒、Portal 单次调用上限 30 秒,小文件场景反而划不来)。配套的产业背景陈述(作者转述行业数据):到 2028 年 AI 编程成本预计超过开发者平均工资;四分之一工程负责人每月每开发者烧 200-500 美元 token、部分超过 2000 美元。

为什么重要。 这是「模型路由」从厂商 demo 变成一线工程实践的又一实例——而且和 #014 的 GitHub HydraFusion 走的是同一条逻辑的两端:GitHub 在 Copilot 里做自动化的跨模型编排(质量门决定是否升级),Spotify 在 Claude Code 外面做强制化的任务委派(钩子拦截 + 便宜 worker)。两者的共同假设是:前沿模型的钱应该只花在真正的推理上,I/O 型劳动(读文件、写样板)用便宜模型效果相当。shunt 的工程细节值得注意:用 PreToolUse 钩子做强制而非建议路由(第一版写在 CLAUDE.md 里靠模型自觉,失败后才改成钩子拦截),以及「delegation 的语料不进主模型上下文」这一条——它把 token 经济学从「少生成」推进到「少看见」。这条经验与主条 1 的循环深度其实是同一枚硬币的两面:一个在架构内减少参数、一个在系统外减少 token,方向都是「让昂贵的计算只花在必要处」

待观察。 全篇为单作者自报:~90% 是 bulk-read 场景的均值,不是全工作流总体节省;测试只覆盖 Java monorepo 四种场景;worker 模型(Gemini 2.5 Flash)会随供应商变动,路由收益对模型价差敏感;「不能委派编辑/推理」意味着真实收益上限取决于工作负载里 I/O 的占比;Portal/AiKA 目前是 Spotify 内部平台,通用性待验证。

来源:Spotify 工程博客(原文直接抓取核验;作者自报) · HN 讨论(244 分)

5. 美国最大两大学区同日收紧 AI 政策:NYC 全 K-8 禁学生用 AI,LAUSD 全校一年暂停生成式 AI——「先禁后放再禁」的钟摆

事实。 Tech Policy Press 9 月 5 日刊发(原文直接抓取核验;HN 41 分):9 月 2 日(周三),纽约市(全美最大学区)宣布 2026-27 学年禁止在全部 K-8 年级课堂上使用面向学生的 AI,高中仅允许使用一小批经批准的工具;同日晚些时候,洛杉矶联合学区(LAUSD,全美第二大)宣布对其约 37.8 万名学生在学校设备上使用生成式 AI 实施为期一年的暂停(moratorium)——这一决定连学区内部官员都感到意外(此前该学区暑期只出台了屏幕时间限制,没有专门针对 AI 的规则)。背景:NYC 曾在 2023 年 1 月(ChatGPT 发布后不久)第一个封禁 ChatGPT、LAUSD 更早在 2022 年 12 月跟进,但 2023 年年中两区又转向「拥抱」;NYC 今年 3 月曾提出「红绿灯」式分级政策草案(几乎把学生使用全部归入需教师裁量的黄灯),因强烈反弹被撤回,学监 Kamar Samuels 承认草案「missed the mark」,暑期并暂停了软件采购。推动力量:两地的家长/教师/学生联盟(NYC 的 AI Moratorium (AIM) Coalition、洛杉矶的 Schools Beyond Screens)已为此游说两年;NYC 教师 Kyle DeAngelis(UFT 成员)称对政策「总体满意」但希望把高中也纳入更严监管、并建立长期民主化决策流程。

为什么重要。 这是「K-12 是 AI 社会采纳的风向标市场」的又一次验证:2022-23 年学区最先恐慌性封禁、2023 年年中又最先拥抱,如今在全美最大与第二大学区同时出现组织化的退潮——而且这次不是行政命令式的短期封禁,而是「两年草根运动 + 一年缓冲期制定长期政策」的结构性收紧。对 AI 产业,K-12 的警示信号在于:面向青少年的默认可用(chatbot as free therapy)、隐私与心智健康风险,正在把「AI 进课堂」从效率叙事改写成保护叙事;教师群体的组织化(UFT 内的 rank-and-file 党团)意味着企业 lobbing 的对象不再只是学区官僚。对国内读者的参照意义:中美在「未成年人用 AI」上正走向相反的政策方向(国内以「AI 进课堂/教材」推动为主),两边的效果都还缺少长期证据——值得互相参照而不是互相背书。

待观察。 NYC 政策留了口子(部分学校 AI 试点、教职工使用限制较少、工具评估指标缺失);LAUSD 的一年期限到 2027 年夏,长期政策未定;两区 2023 年「先禁后放」的历史说明这次收紧同样可能被新一轮压力翻转;对学区「允许清单」具体含哪些工具报道未列;草根运动能否扩散到其他州未可知。

来源:Tech Policy Press(原文直接抓取核验) · HN 讨论(41 分)

简讯

  • GPT-6 Astra 开始向 ChatGPT 付费用户分阶段推送(量子位 9/5 09:17 报道的「One More Thing」,为量子位转述 OpenAI 最新信息;openai.com 本次不可达未能直接核验):GPT-6 Pro 面向 Pro、Business 与 Enterprise 计划推出,Pro 用户可在 Chat、Work 和 Codex 中使用 Astra,Sam Altman 亲自宣传,强调 Astra 重点强化长链路 Agent 任务、软件工程、计算机操作、浏览器使用与科学/专业工作——这是 #014 简讯「OpenRouter 先行上线」之后的分发落地节点。来源:量子位(转述)

  • 费马大定理项目「谁做的」补全:主导者为清华姚班校友 Tianyi Peng(量子位 9/5 09:17 人物向报道,正文直接抓取核验;Anthropic 官方博客已于 #014 核验):Tianyi Peng 2017 年清华姚班本科毕业、2023 年获 MIT 博士,现任哥伦比亚大学助理教授兼 Anthropic 研究员,是 Prove2Me 平台作者——#014 主条 2 里「人类只给高层指令、靠 Prove2Me + Claude Code harness 救回失败协作」的细节有了具体的人;报道补充:早期多 agent 协作失败留下的代码只占成品非模板代码约 7%,换上 Prove2Me(把证明拆成 DAG、陈述与证明分离、自然语言检索)后项目才跑通。来源:量子位(正文直接抓取核验) · Anthropic 官方博客

  • Artificial Analysis 发布 Intelligence Index v4.2(官方页 9 月 4 日,原文直接抓取核验;HN 147 分):新增自研 AA-Briefcase(私有 held-out 测试集上的 agentic 知识工作评测)与 Surge 的 GDP.pdf(100 份 PDF、10 个领域、跨 4592 页文档推理,按 1275 条专家原子标准打分),移除已饱和的 GPQA Diamond;Index 权重中私有 held-out 测试集占比升至 40%(v4.1 的两倍)以反刷榜。结果:Claude Fable 5.1 居首,GPT-6 Astra 第二(较 GPT-5.6 Sol 高 4pt),Meta 第三;GDP.pdf 上 OpenAI 领先(Astra 33.2% / Sol 28.2% / Fable 5.1 26.2%);AA-Briefcase 上 Fable 5.1 与 Opus 5 领先、Astra 较 Sol 高约 85 Elo;成本-任务帕累托前沿由 Anthropic/OpenAI/Meta/Z.AI 四家共享。来源:Artificial Analysis(原文直接抓取核验) · HN

  • 随笔:《AI 处理事故,工程师正在与系统「失联」》(Sylvain Kalache,Rootly AI Labs 负责人、前 LinkedIn SRE;原文直接抓取核验;HN 340+ 分):作者承认 AI SRE 处理常规事故的魔力,但引用 1983 年 Lisanne Bainbridge 的《自动化的反讽》指出:自动化越是成功,人类越少练习常规事故处理,越可能在「自动化解决不了的高危非常规事故」上身手生疏;主张软件行业引入民航式的「事故模拟器」定期训练(类比 FAA 要求机长每六个月复训发动机失效等罕见场景)。观点文,非新闻事实。来源:原文(直接抓取核验) · HN

今日判断

没有新模型发布的周日,反而把上周埋下的两条主线照得更清楚:

其一,「AI 的答案生产」与「人类理解的生产」正在脱钩,而最先发出系统性警告的是一线数学家。 把本周的费马大定理 11 天形式化(#014)、素数间距上界的三家竞速、陶哲轩的「污染」长文放在一起看,这不是「AI 能不能做数学」的问题——陶哲轩自己都在认真推演「ML 模拟 + 区间算术 + 形式化 + LLM 拟设」解决纳维-斯托克斯的可行性;他警告的是竞赛结构:当「先宣布结果」成为激励、当通往答案的迭代被锁进公司黑盒,开放问题作为「下一代方法/概念/人才孵化器」的功能就会被消耗掉。对读者最实用的判据是陶哲轩 9/5 那句「新竞赛提议」——接下来观察各实验室的回应:谁开始发布「过程日志/失败轨迹」级别的东西,谁就在回应这个批评。Anthropic(开源 FLT 仓库)目前是正面样本,OpenAI 的回应(Pachocki 长文)值得盯。

其二,「贵的计算只花在必要处」正在成为跨层共识。 循环深度(层内把计算做深、省参数)、HydraFusion(#014,模型间编排)、Spotify shunt(系统外 token 路由)、ActEffect(世界模型训练期上岗、部署期退场)——四件事发生在架构、编排、系统、具身四个层面,指向同一个判断:单模型「更大更强」的边际收益在下降,2026 下半年的工程红利在「计算组织方式」。与之配套的代价是黑盒化:hidden state 循环难监测、私有 harness 不透明——这也正是主条 2 陶哲轩批评与 #014 agent 群涌事件的共同底色。可监测性与可验证性,正在从安全议题变成商业信誉议题。

其三,社会采纳出现钟摆回摆的信号,且这次有组织、有缓冲。 美国两大学区的收紧不是 2023 年式的应激封禁,而是两年草根运动后的结构性政策(一年缓冲期 + 长期政策议程);它提醒我们「AI 进课堂/进社会」的叙事正在从效率单边主义走向保护与效率的拉锯。国内语境下,这条新闻的价值更多是参照系而非行动指南——但「未成年人保护」作为政策变量,在哪个市场都不会缺席太久。

明日预告:Pachocki 的循环架构长文、OpenAI 对陶哲轩批评与 collusion.wiki 报告(#014)的回应、Astra 向普通用户的推送进度、以及「谁先发布下一个数学洞见」——都值得盯。