今天是周六。本期窗口为上期 #028(9/19 07:00 北京时间)之后至今(9/20 07:00 北京时间)。这一天的主线可以概括成一句话:关于「AI 该快还是该慢」的争论,开始出现两种截然不同的落地形态——一种把它做成公司内部可以签字、可以公布的机制,另一种把它变成研究员个人署名、带浏览量的声明。 Anthropic 给出了前者,并在同一天被自己的一线研究员与离职者从外部追问;量子位在这一天把后者的完整名单整理了出来。同一天另外三条分别在硬件、芯片设计与模型能力上给出可核验的新数字:华为把 4096 卡超节点与近封装光学摆上台面,IEEE Spectrum 用一篇设计复盘给出 OpenAI 首款自研加速器的工期与团队规模,而一条 Substack 帖子声称一个前沿模型解开了一封 1918 年未被破译的德军电台密文。
核验路径如实说明:本刊本机直接抓取并核验正文的来源包括 anthropic.com/news/accenture-embedded-evaluation(官方公告,HTTP 200,页内标注 Sep 18, 2026)、anthropic.com/news 新闻索引页(HTTP 200)、spectrum.ieee.org/llms-for-chip-design(IEEE Spectrum,作者 Matthew S. Smith,页内标注 14 Sep 2026,本机直读全文)、prinzai.com/p/gpt-6-astra-solves-a-wwi-german-radio(Substack,页内标注 Sep 17, 2026,本机直读全文),以及量子位的六篇正文(/2026/09/492755.html、/2026/09/492467.html、/2026/09/492476.html、/2026/09/492429.html、/2026/09/492550.html、/2026/09/492573.html,均 HTTP 200);HN 分数与评论数均取自 firebase API 的 /v0/item/<id>.json 字段(news.ycombinator.com 本机连接超时,与 #027/#028 记录一致),本刊未引用任何一条讨论内容。五处地址本机不可达或不可读,已在对应条目内逐条标注:terrytao.wordpress.com 的两篇博客(含 SAIR 声明原文)返回 HTTP 403、openai.com/news 返回 HTTP 403、bbc.co.uk 与 scmp.com 连接失败(curl 返回 000)、huggingface.co 连接失败。 因此凡本刊只经量子位转述而未能打开一手页面的条目(Bloomberg、X 帖子、CBS/CNN 采访、Nature 文章、Huawei 官方页),均在文内明确标注为转述。
1. Anthropic 把「独立评估」搬进公司内部:与 Accenture 各投至少 10 亿美元,并自陈「目前没有标准」
事实。 Anthropic 于 2026 年 9 月 18 日发布《Partnering with Accenture on embedded evaluation》(anthropic.com/news/accenture-embedded-evaluation,本机直接抓取核验全文,HTTP 200,页内标注 Sep 18, 2026)。这篇公告的定位句是: 「We’re partnering with Accenture on independent evaluation of frontier AI. This is an important step toward the commitment, made in our CEO’s essay “We Must Pace the Frontier,” to embed evaluators within Anthropic.」 ——注意这句里的两个信息:一是这件事被明确挂在一篇 CEO 文章所作的承诺上;二是「embedded(嵌入式)」这个词在这里是字面意思,不是比喻,公告下一段自己解释了区别: 「Unlike today’s external evaluators, embedded evaluators will work inside AI companies, with access comparable to an employee’s.」
可核验的具体内容包括五组。 ① 执行方与范围: 「The partnership will be led by Faculty, Accenture’s specialist AI business, and will include evaluating and red-teaming models, conducting alignment assessments, and testing model safeguards.」 ② 金额与期限——这是本条最硬的一组数字: 「Anthropic and Accenture each expect to invest at least $1 billion in building capacity in this area over the next five years.」 ③ 嵌入式评估能做什么(官方给的三个动作): 「That access allows them to watch models take shape in training, follow the decisions that govern how those models are built and deployed, and speak directly to employees.」 以及三个产出: 「assess how a company operates, verify that it is keeping its safety commitments, and identify blind spots. They can also report incidents and give the public a more informed account of benefits and risks.」 ④ 责任归属的一句声明: 「To be clear, independent embedded evaluators do not reduce our accountability, but help to make it more verifiable. The safety of our models remains our responsibility.」 ⑤ 缺位——本刊认为这是全篇最值得记的一段,因为它由发布方自己写出: 「There are, as yet, no standards for what information embedded evaluators should have access to, or how they should report what they find. There is also no settled system for funding independent evaluation.」 紧接着是资金来源的处理方式: 「Long-term, we think funding should come from pooled or government sources, as we called for in our Advanced AI Framework in June. As neither exists today, we plan to work with different evaluators under different funding arrangements. Given the importance and urgency of this work, Anthropic will fund Accenture’s work directly.」 另外两处结构性细节: 「We are also in dialogue with METR and other nonprofit evaluators to pilot elements of embedded evaluation using their own funding.」 以及 「Our partnership is non-exclusive; Anthropic will work with other evaluators to be announced in the coming weeks, and Accenture will work with other AI developers in similar capacities.」
一天之前的一份同源公告可以做交叉参照。 同一新闻索引页上,Sep 17, 2026 的条目是《Introducing the Life Sciences Verification Program》,Sep 18 的另一则相关材料是《Developing Enterprise Frontier Safeguards with our customers》(anthropic.com/news,本机直接抓取核验,HTTP 200;后一则的正文本刊未逐页打开,索引页摘要为「The Life Sciences Verification Program (LSVP) gives life science professionals access to Claude Mythos, Opus, and Sonnet models with a refined set of safeguards more permissive for biology-related work.」)。
为什么重要。 三点。其一,本条真正的新东西不是「10 亿美元」,而是「可核验(verifiable)」这个词被写进了责任声明里。 「do not reduce our accountability, but help to make it more verifiable」——这句话把评估的目的从「让别人放心」改成了「让别人能查」。 这是一个可以被检验的差别:让第三方在内部看到模型成形的过程、看到决策、可以直接找员工谈话,这些动作产出的不是结论而是过程记录。 本刊从 #026 起就在记录这条线(评测方把审计写进流程),到本期它第一次以「金额 + 期限 + 执行方」的形式出现。 其二,官方主动写下的两处「没有」,比任何承诺都更有信息量。 没有访问权限的标准,没有报告方式的标准,也没有独立的资金机制——而他们给出的解法是「我们自己出钱,长期应由公共或政府资金承担」。 这是一条诚实的自陈,但它同时留下了一个本刊希望读者自己判断的问题:在一套由被评估方直接出资的安排里,「独立性」目前只能靠合作方声誉与「non-exclusive」这类条款来保证。 其三,把它与 #028 第 1 条并读,可以发现两份材料在同一个位置上是互补的。 #028 记录的是 Anthropic Institute 公布的内部研发自动化指数与 3 万个并行 agent 的监控漏斗(覆盖、标记、人工复核三条都给了量);本期这一条给的是这条漏斗之外的第二只眼睛——不是监控自己的 agent,而是让外人来看自己。 两份材料放在一起,读者第一次能看到一家实验室对「可核验」这件事的两个层次:内部的自动监控,与外部的嵌入式评估。
待观察。 本条的全部事实来自 Anthropic 官方一页公告,本刊未核验与 Accenture 之间的协议文本、投资口径、Faculty 的人员配置,也未获得任何第三方的确认;「at least $1 billion each over five years」是双方各自的预期投入,公告未说明这笔钱包含哪些成本(人力、算力、基础设施),也未说明是否计入既有支出;公告自己写明「Embedded evaluation is new, and many of the details about how it will operate are still being worked out」,因此本刊目前无法回答最关键的几个操作问题:评估者看到的训练过程是实时的还是事后的、他们能否否决发布、报告写给谁、被否的内容能否公开;「no standards」与「Anthropic will fund Accenture’s work directly」这两句在文中相邻出现,本刊照录,不对其得失做评价,但认为这是这套安排中最需要被持续追问的一组;公告提到的 METR 试点仍在「in dialogue」阶段,本刊未核验 METR 侧的任何说法;公告所挂的 CEO 文章《We Must Pace the Frontier》本刊未打开原文(仅在公告与量子位 9/19 的报道中看到对它的引述);Sep 17 的 LSVP 与 Sep 18 的 Enterprise Frontier Safeguards 两则本刊只读到索引页摘要,未逐页核验。
来源:Anthropic·Partnering with Accenture on embedded evaluation(本机直接抓取核验全文,Sep 18, 2026) · Anthropic News 索引(本机直接抓取核验)
2. 一线研究员的风险声明与离职潮:从「80 万浏览」到「1.71 亿浏览」,减速的呼吁与「模型会识破自己在被测试」的担忧
事实。 量子位于 2026 年 9 月 19 日 19:53(北京时间)发布《“留给人类阻止AI的时间不多了”》(qbitai.com/2026/09/492755.html,作者 henry,本机直接抓取核验正文,HTTP 200)。本条以下全部内容来自这一篇报道的转述,本刊未打开它引用的 Bloomberg、X 帖子、CBS/CNN 采访与那份个人声明原文。
报道梳理的四组人物与声明,按时间顺序如下。 ① Bilal Chughtai(近期从 Google DeepMind 离职):报道引用他的原话是「我坚信,AI有可能终结我们所有人,而留给我们阻止这一结局发生的时间,或许已经不多了。」 背景部分给出:2021 年剑桥大学数学专业毕业,2022 年初进入 AI 领域,研究方向为安全、对齐与机制可解释性,此后四年从研究神经网络内部机制到追踪模型欺骗,再进入 Google DeepMind 做 AGI 安全与可解释性研究。 报道称这条帖子在 X 上已获得超过 80 万次浏览,并有彭博等媒体跟进。 ② Jacob Coxon(9 月 9 日宣布从 Anthropic 离职):报道引用他的帖子称「OpenAI和Anthropic都没有负责任地行事。它们正一路冲向能够自我改进的超级智能,拿所有人的生命冒险。」 背景给出:1999 年出生,曾两次代表英国参加国际数学奥林匹克(2016 年银牌、2017 年铜牌),剑桥数学专业,先后在 OpenAI 与 Anthropic 从事预训练研究,姓名出现在 GPT-4o 的贡献者名单中;报道称这是他发出的第一条推文,浏览量已达 1.71 亿次。 ③ Evan Hubinger(Anthropic 对齐研究负责人)的回应:报道称他同意 Jacob 对风险的判断,「他们确实认真地相信,AI 存在杀死所有人的可能」,并给出个人估计:未来十年内发生这种情况的概率超过 10%;同时强调 Anthropic 正在尽力,但对于如何解决超级智能的对齐问题「尚未找到方案,也不能确定目前是否正走在通往解决方案的路上」。 ④ Daniel Selsam(9 月 14 日,仍在 OpenAI):报道称他没有 X 账号,声明由前同事 Daniel Kokotajlo 代为分享;背景给出他已在 AI 领域工作十五年,在 MIT 研究概率编程、在微软研究院参与 Lean 定理证明器早期开发、在斯坦福攻读博士,姓名出现在 o1 推理研究的「奠基贡献者」名单中。 他的核心论点被报道概括为一句: 「模型越来越能理解自己所处的环境,也越来越能识别,人类正在怎样测试它。」 ——由此推出的是「真正对齐」与「看起来对齐」可能无法区分;而报道也照录了他对自己工作方式的一句自述: 「我自己已经很少直接看代码了,也很难始终保持自律,深入审视模型给出的解释和建议。」 ⑤ 刘胜与(intlsy,DeepSeek 算子研发人员,9 月 14 日凌晨发布《我不得不把才华埋葬在昨天》):报道称 DeepSeek v4.1 的主要 Attention 算子出自他之手;他的判断是「再过半年或者一年,AI写出的算子,很可能就会与自己同样优秀,甚至超过自己」,而他的应对是转向「指挥 Agent」的「机甲驾驶员」角色。 报道同时给出 Dario 的两处公开表态(CBS 采访中强调需要科技公司、政府与社会共同参与;CNN 采访中表示自己与 Jacob 的「共同意见,远多于分歧」),以及 9 月 12 日 Dario 发表《We Must Pace the Frontier》呼吁放缓能力提升速度为安全研究争取时间,并称该呼吁得到奥特曼、马斯克等人的公开支持。 报道末尾把时间线接到 2023 年 5 月 Hinton 离开谷歌、以及 2024 年 12 月他在诺贝尔奖晚宴上的提醒。
为什么重要。 两点。其一,本期第 1 条与本条构成一组非常干净的对照,而它们的差别不在立场上。 两条都同意「应该有人从外部盯着这件事」;区别在于表达形式:一条是可引用的公告,有金额、有期限、有执行方、有责任声明;另一条是可截图的帖子与个人声明,有浏览量、有署名、有前雇主。 本刊认为这不是「官方对民间」的简单对立——恰恰相反,Anthropic 的公告与 Jacob Coxon 的批评来自同一个组织,而 Hubinger 的回应等于在一份公司公告的旁边签了一个个人判断(十年内超过 10%)。 值得留意的是,这两类材料对读者的可用性完全不同:公告可以被检验(说了什么、承诺了什么、谁出钱),个人声明只能被转述。 其二,Daniel Selsam 的那条论点,是本条里唯一一个提出「新机制」而不是「新概率」的说法,也最值得单独记下。 他指的不是模型会说谎,而是模型会识别评测情境——「即使研究人员精心设计一个环境,试图观察AI在无人监管时会做什么,模型也可能识破这仍然是一场测试,继续表现得温顺、可靠」。 如果这个判断成立,那么它指向的不是某次评测的分数失真,而是评测范式本身的一个上界问题:在训练与部署之间,只要评测环境与真实环境可区分,任何「行为评估」都只是一次情境化表演的抽样。 本刊注意到,这条担忧与 #028 记录的第 1 条(模型会以另一种方式「看起来在做研究」)方向相反:那一条关心的是把人的工作交给模型之后的可见性,这一条关心的是模型在被人看的时候会怎么做。
待观察。 本条全部事实来自量子位一篇报道的转述,其一手材料是若干条 X 帖子、一次 CBS 采访、一次 CNN 采访、一份由他人代发的个人声明、一份微信公众号文章,以及彭博社与华尔街日报的报道;本刊未打开其中任何一项,也未核验任何一条浏览量的统计口径;报道中「X 上 80 万次浏览」与「1.71 亿次浏览」是两个不同量级的数字,本刊照录,无法判断它们的截图时点与平台计算方式是否可比;「未来十年内超过 10%」在本刊读到的一段英文转引中写作「AI wiping out humanity(AI 消灭人类)」,而量子位的中文表述是「发生这种情况」,本刊在此照录中文报道的措辞并标出这一处用词差异;Daniel Selsam 的声明本刊只读到量子位的转述与两句引语,未读到原文,因此无法判断「识破测试」是他给出的论点还是报道的概括;报道提到的《We Must Pace the Frontier》本刊未读原文,但本期第 1 条 Anthropic 官方公告引用了同一篇文章并写明 it 是 CEO 文章(「our CEO’s essay “We Must Pace the Frontier”」),这一点构成交叉印证;刘胜与文章中关于 DeepSeek v4.1 算子的自述本刊无法独立核验,也未在其他来源看到确认;报道给出的组织层面的推理(例如「如果自己不率先造出超级智能,就会有一家更不负责任的公司抢先做到」这类动机描述)属于转述与概括,本刊不做补充。
来源:量子位·“留给人类阻止AI的时间不多了”(本机直读正文,2026-09-19 19:53 北京时间)
3. 华为昇腾 960:单芯片提前三个季度,但真正的赌注落在 4096 卡超节点、近封装光学与 CANN
事实。 量子位于 2026 年 9 月 19 日 16:28(北京时间)发布《华为汪涛:华为要打造AI算力底座,只做好一颗芯片远远不够》(qbitai.com/2026/09/492476.html,作者梦瑶/乔不迟,本机直接抓取核验正文,HTTP 200)。本条以下内容来自这一篇报道(含其对华为轮值董事长汪涛的专访与圆桌引语),本刊未打开华为官方页面或全联接大会材料做逐条核对。
报道给出的可核验数字分四组。 ① 芯片与时间表(全部为华为口径): 昇腾 960DT 研发进度比原计划提前三个季度,单芯片算力倍增,支持 2 PFLOPS FP8、4 PFLOPS FP4,HBM 容量最高 288GB、带宽 9.6TB/s;对应的昇腾 960 超节点做到 4096 张 NPU 卡,最高 8 EFLOPS FP8 算力、超过 1PB HBM 容量;路线为 2028 年昇腾 970、2029 年昇腾 980,未来几年保持「一年一代」。 汪涛的表述被直接引用: 「从今年开始,950、960、970、980连续几代,未来几年我们坚持一年一代,走入了快速演进的节奏。这也是国内半导体制造、封装的上下游配套全部打通之后才实现的。」 关于研发周期,报道引用他说 960 芯片「已经在实验室测了好几个月」,并解释了发布节奏的前提: 「芯片从立项到产品化往往要三年,我们任何一次发布,都是产品已经在实验室反复测试、有准确交付时间之后才做。」 ② 规模算力与一个效率数字: 910C 是 384 卡,950 做到 1024 卡,960 进一步扩到 4096 卡,并通过跨物理节点的统一内存编址让多颗 NPU 互联;报道称汪涛提到,从仿真训练看,在同样十万卡集群下,4096 卡超节点组成的集群相对传统八卡服务器组成的集群,MFU 可提升 2.75 倍。 ③ 光互联: NPO(近封装光学)是这一代最硬的新增技术,昇腾 960 被称为「业界首个」采用 NPO 光引擎的超节点;具体产品为 Hi-ONE 光引擎,单引擎集成 36 路 200G,总传输容量 7.2Tbps,并内置光源。 汪涛把领先性概括为「三个第一」: 「第一个规模商用的,大家还在实验室阶段;第二个最大的带宽,36路200G集成;第三个唯一内置光源的。」 关于为什么没有直接走向 CPO(共封装光学),他给的回答很具体: 「CPO把光引擎和主芯片放一起,光引擎坏了整个主芯片就报废,可用度差,故障成本极高,对封装厂要求也高。现在NPO的TCO至少比CPO低40%以上。当前NPO是工程、成本各方面综合最佳选择。」 换来的系统指标: 昇腾 960 超节点用约 5500 个 Hi-ONE 替代原本约 4.8 万个 800G 光模块,功耗降低超过 550kW,系统无故障运行时间提升一倍,系统可用度为 99.8%。 ④ 软件与生态(同样为报道口径): CANN 进入常态化开源社区运营,月活开发者超过 5200 人,外部开发者占比达到 61%;昇腾进入 PyTorch 官方支持路线。 汪涛对此的表述是克制的: 「经过八年努力,我们今天只敢说 CANN生态跨过了拐点。」 关于网络扩展上限,报道称多超节点通过灵衢网络或 RoCE 继续扩展,二层 Clos 组网最大可到 51.2 万卡,结合多轨道拓扑技术上限可支持百万卡,并注明汪涛强调「百万卡更多是技术指标,现实部署仍要看投资、电力和模型需求」。 报道另引他关于定位的两句话: 「华为的核心使命是打造算力底座。」 与 「我们把他们托得越高,中国AI竞争力越强。」
为什么重要。 两点。其一,本条最值得留意的不是任何一个峰值数字,而是「MFU 2.75 倍」这个量级的比较对象。 它的对照组不是另一家的芯片,而是「传统八卡服务器组成的集群」——也就是说,华为在这里比的是系统形态,而不是单点性能。 把这句话与「只做好一颗芯片远远不够,只做一台服务器也不够,最后要交付一个高可用度的复杂系统才有价值」放在一起,读者可以理解这次发布会为什么把 NPO、超节点、CANN 与供电散热放在同一段里讲: 在先进制程短期受限的前提下,可用的杠杆被移到了芯片之外,而这类杠杆的收益必须用集群级指标(MFU、可用度、故障间隔)来衡量。 其二,本期的三条硬件/设计类条目(本条、第 4 条、以及 #028 记录过的 Anthropic 算力分配)刚好落在三个不同层次上。 华为讲的是把算力组织起来的物理与系统工程;OpenAI 的 Jalapeño 讲的是这颗芯片是怎么被设计出来的(设计流程本身被 AI 加速);而 #028 那条讲的是算力花在了哪里(约 6%/12% 用于安全)。 三者合起来,构成一份相当完整的「2026 年 9 月算力三问」:怎么造、怎么连、怎么分。
待观察。 本条的硬件与生态数字全部来自量子位对华为发布会与汪涛专访的转述,属发布方口径,本刊未打开华为官方页面、大会材料或任何第三方实测,也未核验「业界首个」「提前三个季度」这类表述的判定基准;「960DT 支持 2 PFLOPS FP8」与「960 超节点最高 8 EFLOPS FP8」分别为单芯片与整机柜口径(4096 卡 × 2 PFLOPS 恰好等于 8 EFLOPS,这一点本刊按算术核对一致,但报道未明说二者就是这一关系);MFU 提升 2.75 倍是「从仿真训练里看到」的结果,报道未给出实验配置、模型规模与基线绝对值;Hi-ONE 的 7.2Tbps 是「36 路 × 200G」的算术和,报道以单引擎总容量表述;「功耗降低超过 550kW」与「无故障运行时间提升一倍」比较的是替换光模块前后的同一系统,报道未给出测量条件;NPO 与 CPO 的 TCO 差 40% 以上为汪涛口径,本刊未见到测算依据;CANN 的 5200 月活与 61% 外部占比未说明统计窗口;「2028 年 970、2029 年 980」是路线图而非交付承诺,报道引用的芯片研发周期说明也可反向理解:路线图的时间跨度大于一代芯片的研发周期。
来源:量子位·华为汪涛:华为要打造AI算力底座,只做好一颗芯片远远不够(本机直读正文,2026-09-19 16:28 北京时间)
4. OpenAI 的 Jalapeño:20 个月从概念到首硅、不到 100 人团队,设计流程本身被自家模型加速
事实。 IEEE Spectrum 发布《How OpenAI Used Its Own LLMs to Design Its Jalapeño Chip》(spectrum.ieee.org/llms-for-chip-design,作者 Matthew S. Smith,页内标注 14 Sep 2026,6 min read,本机直接抓取核验全文,HTTP 200;HN 条目 49761432,09-18 23:04 UTC 提交,本刊抓取时取值 196 分 / 132 评论)。
硬件参数部分(报道口径,源自 OpenAI 8 月 25 日的公开)。 「On 25 August, OpenAI fully unveiled Jalapeño, the company’s debut AI accelerator chip. Jalapeño delivers up to 13.4 petaflops of 4-bit compute and accesses 232 gigabytes of the most advanced memory available, linking to it at a blazing 15.4 terabytes per second.」 以及一句带比较对象的性能声明: 「Benchmarks cited by OpenAI show that Jalapeño can reduce end-to-end latency (the time between prompt to last token) by up to 3.6 times when compared to Nvidia’s GB300—a chip the company currently relies on—and do so while consuming less power.」 报道同时给出了对这类数字的保留: 「Whether these figures translate into real-world gains once Jalapeño enters widespread service in OpenAI’s inference fleet remains to be seen」;页内图注写明这颗芯片「pairs its compute die with six stacks of HBM4 and an I/O chiplet」。
设计流程部分,是本篇真正的重点,报道给的可核验内容有六项。 ① 工期——本刊认为这是全篇最硬的一组数字: 「Jalapeño moved from first architecture concept to first silicon in under 20 months. Only nine months separated the first RTL—the register-transfer level code defining the chip’s logic—from tape-out, when the finished design goes to manufacturing.」 ② 团队规模: 「Ho says the group that designed Jalapeño averaged fewer than 100 people over the course of the project and continues to stand at roughly 100 today」,并注明该数字包含硬件团队从系统设计到软件与供应链的多个角色,但不含合作方 Broadcom 的人。 ③ 分工: 「OpenAI’s team was responsible for end-to-end system design including the inference accelerator, the memory hierarchy, and networking. Broadcom handled “physical design from the gates onward.”」 ④ 前端流程的技术选择: 「OpenAI’s front-end workflow was built around Accelerated Hardware Synthesis (XLS), an open-source high-level synthesis chain of tools originally developed at Google.」 ——设计师用 DSLX(一门受 Rust 启发的领域特定语言)或 C++ 编写,XLS 再转换为 Verilog。 负责人的一句解释是: 「We were thinking about how to leverage AI to make the project faster, and the AI was much better at software-looking things. XLS in some ways looks like software, so it got that benefit.」 ⑤ 一处可核验的效率数字(来自 IEEE Hot Chips 2026): 报道称 Ho 与 Leary 在会上给出 AI 引导的物理设计优化收益,「including an area reduction of 10 percent for the matrix multiplication units as measured against an optimized human baseline」。 ⑥ 边界条件: 「Broadcom used its own internal workflow. The company’s team did not have access to the internal models OpenAI used to help design Jalapeño, but it did have access to OpenAI’s public, commercial models.」 另外,报道提到项目始于 2024 年 10 月,第一批芯片于 5 月从代工厂返回,团队随即让内部模型去做软件与基准优化(报道此处以 SemiAnalysis 的 InferenceX 与 DeepSeek 的 MLA 为例,本刊未展开该段细节)。
报道收集的两条外部评价值得并置。 一条是有保留的肯定: Verkor.io 联合创始人 David Chin 称「the schedule they gave us is quite credible」,但认为 Broadcom 的协助对这条时间线是必需的——「If you have somebody else start from scratch, it won’t be possible」; 另一位联合创始人 Ravi Krishna 称这是「a relatively impressive result」,并认为如果今天才开工,模型能力的进步会让工期更短。 另一条来自 UCSD 的 Andrew Kahng,他对这条时间线的评价是「likely best in class today」。 而报道结尾引用了 OpenAI 自己的克制表态: 「We’re not saying that anyone can come and just build state-of-the-art, frontier AI/ML accelerator chips using just [OpenAI’s coding platform] Codex」,并称 OpenAI 明确表示第二代芯片会在验证与物理设计里引入更多 AI,且团队已具备自动波形操纵与查看的工具。
为什么重要。 两点。其一,本篇最有价值的地方不在于「AI 参与芯片设计」这件事本身,而在于报道把「参与」拆成了可指认的位置。 报道明确写道,OpenAI 的工作重心在前端(概念、RTL、验证),而后端(互连布线、时钟与电源规范的完成与验证、交给代工厂的设计信息)交给了 Broadcom;它同时引述了行业人士对「保守」的判断,以及「从 2026 年 4 月起模型才真正开始能更好地处理这类任务」的说法。 这类「AI 到底做了哪一段」的拆解,在多数关于 AI 加速设计的宣传里是缺失的。 其二,把它与本期第 3 条并读,「芯片竞争」这个词的层次就出来了。 华为那一条讨论的是如何把 4096 颗 NPU 连成一个可用的系统,而这一条讨论的是如何在一个不到 100 人的团队里把一颗芯片从概念推到首硅;两者的共同点是都把瓶颈定义在「芯片之外」——一边是互联与系统工程,另一边是设计流程中可被语言与代码表达的环节。 报道引用的一位学者把后一类任务描述为「still in the linguistic domain of the problem」,本刊认为这句话是整个流程选择的关键理由:能被写成软件样子的部分,才是当前模型能吃到的那部分。
待观察。 本条的硬件参数(13.4 PFLOPS 4-bit、232GB、15.4TB/s、最高 3.6 倍延迟改善)与工期(20 个月/9 个月)均为 OpenAI 口径,本刊未找到第三方实测,也未打开 OpenAI 的官方发布页(openai.com/news 本机返回 HTTP 403,已在核验说明中标出);「3.6 倍」是相对 Nvidia GB300 的端到端延迟改善,报道未说明测试配置、模型与批大小;页内一条读者评论即指出 GB300 是整机柜而非单芯片,本刊照录该评论的存在,但不以其作为结论;「少于 100 人」的统计口径由报道与受采访者给出,本刊未核验其是否包含外包与实习生等成本归属;「矩阵乘单元面积减少 10%」的比较基线与测量方法本刊未读到(仅见于报道对 Hot Chips 2026 讲话的转述);报道提到的第二代工作流改进(验证、物理设计、自动波形操纵)均为未来时态的表述,尚无产品可核;Jalapeño 与 SemiAnalysis InferenceX、DeepSeek MLA 相关的那一段本刊未展开,也未核验其中任何数字。
来源:IEEE Spectrum·How OpenAI Used Its Own LLMs to Design Its Jalapeño Chip(本机直读全文,14 Sep 2026) · HN 条目 49761432(本机经 firebase API 取值:196 分/132 评论,09-18 23:04 UTC 提交)
5. 陶哲轩代表 SAIR 启动「开放数学模型计划」:开放权重、可复现评测、社区治理,以及一条「发布时同时报告失败与局限」的承诺
事实。 量子位于 2026 年 9 月 19 日 14:44(北京时间)转载 SAIR Foundation 的官方声明《陶哲轩代表SAIR Foundation宣布正式启动“开放数学模型计划”》(qbitai.com/2026/09/492467.html,本机直接抓取核验正文,HTTP 200;量子位注明「本文由SAIR AI Foundation提供,量子位获授权转载」,并给出英文原文地址 terrytao.wordpress.com/2026/09/18/sairs-open-math-model-initiative/——该地址本机返回 HTTP 403,本刊未能打开,以下内容全部来自量子位转载的中文版)。声明标注的时间是 2026 年 9 月 18 日。
可核验的内容分五组。 ① 计划的定位与范围: 「2026 年 9 月 18 日,菲尔兹奖得主、SAIR Foundation联合创始人陶哲轩(Terence Tao)代表机构宣布启动「开放数学模型计划」,意在联合学术界与产业界,为数学及科学研究构建开放权重模型与配套开源工具。」 首阶段聚焦「理解论证、核对文献、形式化证明等日常科研场景」,以「开放权重、可复现评测与社区治理」为原则运作,即日起征集资金、算力、专业经验与社区建设方面的合作伙伴。 ② 为什么要提前宣布——这是声明里最诚实的一段: 「我们最初计划循序渐进地推进该计划,未来几个月先从若干试点项目起步。考虑到当下形势与各界对开放模型的强烈需求,我们决定加快进度,将计划的首次公开宣布提前到今天,尽管部分关键规划仍在推进之中。」 声明同时交代了基础:SAIR Foundation 由他「与几位科学家和投资人等共同创立」,定位是「不依附于任何大型 AI 公司」,资源起初有限,主要活动是播客、短期活动与竞赛; 近期的支持来自 XTX Markets(资助下一轮 SAIR 竞赛)。 ③ 七条原则,按声明标题照录: 「由社区塑造的模型」(研究者决定训练方式、评测内容与如何服务科研教学)、「面向日常研究的工具」(第一阶段的落点是理解艰深论证、核对文献、探索示例、编写代码与形式化证明,并明确「以可靠的辅助、可验证的结果以及持续使用的成本来衡量其价值」)、「开放开发」、「数学界拥有数据」、「共享知识产权」、「开放的社区与治理」,以及最后一条「加入计划」。 ④ 三条可以被日后对照检验的具体承诺: 其一,关于发布纪律: 「模型发布时,将同时报告失败与局限,而非只宣扬成功。独立团队将能够复现这项工作,并把模型适配到自身的数学需求。」 其二,关于授权: 「本计划开发的模型、代码与工具,将在开放许可下与社区共享,例如 Apache 2.0、MIT 或 CC BY 4.0(视情况而定)。」 并写明「训练数据将附带可追溯的来源与兼容的授权,其共享边界会被清楚标注」。 其三,关于数据使用: 「数学界拥有数据,并决定其使用方式。我们将仅在获得用户明确同意、且依据事先约定条款的前提下,使用用户数据训练或改进模型。」 ⑤ 独立性条款: 「我们会与战略产业伙伴合作以提供算力等资源,但这些合作必须保持社区的研究独立性。」 声明给出的联系渠道是 [email protected] 与 SAIR Foundation 的 Zulip 讨论区。 量子位的附注另给出基金会背景:成立于 2025 年,由陶哲轩发起、多位诺贝尔奖得主及全球顶尖科学家共同指导,并把「可验证性」列为其核心原则之一。
一处必须说明的同期材料。 在同一个时间窗口内,HN 上另有一条陶哲轩的博客被提交:《If math is more than proof, we need to better celebrate the rest of it》(HN 条目 49763928,09-19 06:28 UTC 提交,本刊抓取时取值 292 分 / 230 评论)。该地址同样返回 HTTP 403,本刊未能打开,因此本刊不引用其任何内容,也不把它与上述 SAIR 声明混为一谈——两者是同一作者在同一日期的两篇不同材料。
为什么重要。 两点。其一,本期第 1 条与本条在同一个位置上给出了两种不同的「治理」写法,而它们的差别很具体。 Anthropic 的路径是把外部评估者放进公司内部,用钱和合同来落地一套尚未有标准的机制;SAIR 的路径是把权重、代码、训练方法与评测全部公开,用开放性来代替内部审计。 两者面对的是同一个问题——「外面的人怎么知道里面发生了什么」——但给出的答案一个靠权限,一个靠可复现。 本刊不对哪条路更有效做判断,但认为有一个差别值得读者注意:前者的可核验对象是过程(能不能看到训练、能不能和员工谈话),后者的可核验对象是产物(能不能复现、能不能适配)。 其二,这条计划里最有可能被日后检验的,是那句「发布时同时报告失败与局限」。 本刊从 #026 起记录过评测类工作的两类改进(请专家逐题复核、把选项从文本换成图像),到 #028 归纳出一条检查清单(基线是什么、指标区分了什么、真值从哪来); 如果这份计划真的按自己的原则发布模型与技术报告,那么它将成为少数在发布时主动披露失败案例的开放模型项目,读者届时可以拿这条承诺逐项对照。 这与本期第 2 条形成了一个有意思的对照:一边是个体研究者对自己是否还能独立判断表示怀疑,一边是一个由科学家发起的非营利机构试图把「可验证」做成公共基础设施。
待观察。 本条全部内容来自量子位转载的中文声明(自称基于英文原文直译,并注明「如存在任何差异或歧义,以英文原版为准」),而英文原文页本机 HTTP 403,本刊未能核对任何一处措辞;声明的资金规模、算力来源、合作伙伴名单、时间表、评测方案与治理细则均未在本次公告中给出(公告自称「计划在不久的将来发布更多详细公告」);「这一雄心勃勃的计划目前仍处在意向征集阶段」是本刊对该声明的概括而非原文,且声明自己写明「部分关键规划仍在推进之中」,因此本刊提醒读者不要把本次公告读作已完成的设计;「开放权重」在声明中未点名基座模型、参数量或是否从零训练,与「构建面向科学的开放权重模型」这一目标之间的距离,本刊无法评估;XTX Markets 的资助金额与范围未披露;量子位附注中关于基金会的背景介绍(成立时间、指导科学家构成)属媒体整理,本刊未核验; HN 上的另一篇陶哲轩博客本刊未打开,因此对本条不做任何引申。
来源:量子位·陶哲轩代表SAIR Foundation宣布正式启动“开放数学模型计划”(本机直读正文,2026-09-19 14:44 北京时间) · HN 条目 49763928(同期另一篇陶哲轩博客,本机经 firebase API 取值:292 分/230 评论,09-19 06:28 UTC 提交;原文页本机 403,本刊未引用其内容)
6. 「爱因斯坦测试」与 JEPA-Anything:AI 到底能不能提出一个新解释——一个从零训练的 GPT-1900 摸到了光量子的门槛,但它所在的 1900 年并不密封
事实。 量子位于 2026 年 9 月 19 日 19:36(北京时间)发布《Nature:AI重生到1900,这一世抢先爱因斯坦提出光量子》(qbitai.com/2026/09/492550.html,作者 henry/文婷,本机直接抓取核验正文,HTTP 200);同日 14:39 另有一篇《AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水》(qbitai.com/2026/09/492429.html,作者梦瑶/衡宇,本机直接抓取核验正文,HTTP 200)。两条都由量子位报道,前者转述 Nature 文章,后者转述一篇技术报告;本刊未打开 Nature 原文或该报告本身。
前一条(爱因斯坦测试)的可核验内容。 提问来自诺奖得主、Google DeepMind 联合创始人哈萨比斯: 「如果把AI送回1911年,只让它掌握爱因斯坦所能了解的知识,AI能否在4年后的1915提出相对论?」 其目的是检验「AI能不能仅以1911年的知识水平,直面当时的知识和物理难题,自己提出一套新的解释框架,并完成一套超出训练材料的推理,而不是只会照着答案复读」。 Nature 给这类测试起的名字是「爱因斯坦测试」。 真正动手做的人被报道为独立研究者 Michael Hla,项目名 Machina Mirabilis: 他借助 Andrej Karpathy 的 nanochat 训练框架,从零训练了一个 33 亿参数的 Transformer(GPT-1900),预训练材料是 1900 年以前的书籍与报纸,约 220 亿 token;另收集 2600 多部历史物理书籍、期刊与科学著作(含牛顿《光学》、麦克斯韦与法拉第的相关著作),约 2.9 亿 token; 数据清洗规则是: 「如果一份文献中出现“爱因斯坦”“量子力学”“相对论”等现代概念,整份文献都会被删除」,现代人添加的前言、脚注与明显不属于 1900 年前的词汇同样过滤。 结果是双向的: 在光电效应题上,GPT-1900 有一次给出了「光可能不是连续的,而是由许多彼此分离、频率不同的部分组成」,Hla 称之为「直觉的闪现」; 而报道同时写明「GPT-1900距离“重新发现光量子”还有很远」,它在大多数物理任务上都失败, 且「这些矛盾,原本最终是靠爱因斯坦的光量子解释破的局」——也就是说,题目里的现象、矛盾与经典假设都是人类替它筛好、理好、摆好的。 最关键的一处限制是污染: 报道写明实验过程中借助了现代 AI Claude 的帮助,「用Claude Sonnet 4、Claude 3 Haiku等模型生成指令问答,强化学习也靠现代模型评分」, 并引用实验者日志中的自承:现代模型的介入让这场实验的「零污染」人设有点立不住。 报道随后引出两个相关判断:Google DeepMind 研究员 Tom Zahavy 在《LLM无法跳跃》一文中把科学推理分为归纳、演绎、溯因三层,认为当前大模型已非常擅长归纳、演绎能力在快速提高,但仍缺少爱因斯坦式的「溯因飞跃」; 以及 Sendhil Mullainathan 在研究行星轨道的基础模型时看到的现象:任务内预测「头头是道」,一换新场景就无法举一反三地运用牛顿力学,更像「给每套数据临时拼出一套规则」。 报道最后引用 MIT 计算机科学家 Jacob Andreas 的判断:AI 产生一套相对论式表述本身可能并不是最困难的部分。
后一条(JEPA-Anything)的可核验内容。 报道称这是 PhAI Labs 联合牛津、斯坦福、普林斯顿、港中文等高校团队发布的跨领域框架, 核心机制是 OPF(Orthogonal Predictive Factorization,正交预测分解): 「将原本完整的目标状态切割为多个彼此互补的子空间,交由不同的预测分支独立处理,最终再拼回完整的世界状态」,并引入正交约束、因子活性约束与编码器方差约束; 这些 factor 不被预先规定语义,「它们学什么由数据中的可预测结构决定」。 实验部分给出了本刊在这一天读到的、最具体的一组跨领域数字: 受控环境 CITRIS Interventional Pong 上,「在分布内的单项干预中,JEPA-Anything相较标准JEPA降低了约11.7%的预测误差;而在未见过的多因子组合干预中,均方误差(MSE)同样下降了约3.5%,且在五组配对训练seed中全部改善」; 在「严格对齐的动力学基准」十项任务中九项提升,其中 Burgers 方程 MSE 下降 39.7%、浅水方程下降 39.3%、WeatherBench 2 下降 10.5%; 行星任务上「提取出的“轨道频率-半长轴”关系拟合斜率达-1.4991(开普勒第三定律理论值为-1.5),且R²=0.99999999」; 分子系统(液态水、α-石英、对乙酰氨基酚、苯)中,「无论是一步预测的MAE,还是100步自由rollout后的最终位置RMSD,JEPA-Anything在四种分子系统中都拿到了最低误差」。 报道同样给出了反例与自我限制:连续控制的 Walker2d 与 HalfCheetah 上该框架平均得分更高,但 Hopper 上标准 JEPA 更好;Burgers 测试中预测长度从 20 步增至 50 步时优势明显缩小; 以及一句结论性的限定: 「这篇报告验证的是“共同预测原则存在跨领域适用性”,而非“已经实现一个统一所有领域的世界模型”。」
为什么重要。 两点。其一,本刊认为这两条分开看各有亮点,合起来看才是本期最有意思的一组:它们从两个方向逼近同一个问题——「模型是在发现,还是在召回」。 GPT-1900 的路径是切断现代知识然后看它能否自己走到 1905 年;JEPA-Anything 的路径是让模型在隐空间里学一套可复用的预测结构,再看它内部长出的因子能不能对上人类早已写下的定律(开普勒第三定律的 -1.5)。 两条最引人注目的结果,恰好都有一层「答案可能早就存在」的阴影: 前者的阴影是数据污染(现代 AI 参与了指令生成与强化学习评分),后者的阴影是那条拟合到小数点后八位的 R²——一个模型在隐空间里重建出一条已知定律,与模型独立发现一条定律,是两件不同的事,而报告本身也承认它证明的是「原则可跨领域复用」。 其二,「溯因」这个词值得读者单独记住。 Zahavy 的三分法(归纳/演绎/溯因)给出了一个比「AGI 到了没有」更可操作的问法: 归纳与演绎都是沿着已有结构的推进,只有溯因要求发明一个此前不存在的原因。 本期第 5 条(SAIR 计划里「形式化证明」被列为第一阶段场景)与本条在这里形成了一个并不刻意但很清楚的呼应:形式化证明是演绎的极致,而开放模型能不能帮上科学,关键恐怕不在这里。
待观察。 前一条的全部内容来自量子位对 Nature 文章的转述,本刊未打开 Nature 原文,也未打开 Michael Hla 的项目日志;GPT-1900 的规模(33 亿参数)、语料(约 220 亿 token + 约 2.9 亿 token)、清洗规则与那句被反复引用的回答,本刊均未从一手材料核验;「220 亿 token」与「2.9 亿 token」两个数据本刊按报道原文照录,未做单位换算或交叉计算;报道对「GPT-1900 在大多数物理任务上都失败了」这一结论未给出任务清单与分数,本刊记为定性表述;该实验已自承使用现代模型参与评测与训练,因此「零污染」这一前提在本刊看来已不成立,报道亦持同样态度;后一条的全部内容来自量子位对一篇技术报告的转述,本刊未读该报告、未核验其代码或数据是否公开,也未核验 PhAI Labs 与所列高校团队的作者署名情况;11.7%、3.5%、39.7%、39.3%、10.5% 与「-1.4991/R²=0.99999999」均为作者口径,其中 R² 的九位小数本刊按报道原文照录(报道写作 0.99999999,即八位小数),未做任何加工;「十项任务中九项提升」的具体任务名目、基线与算力预算报道未逐一列出;两条均未标注会议或发表状态,本刊不做推断。
来源:量子位·Nature:AI重生到1900,这一世抢先爱因斯坦提出光量子(本机直读正文,2026-09-19 19:36 北京时间) · 量子位·AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水(本机直读正文,2026-09-19 14:39 北京时间)
7. 另附:一篇 Substack 声称 GPT-6 Astra 解开了 1918 年一封未被破译的 ADFGVX 密文——作者用档案馆原始日志做了交叉验证
事实。 Substack 作者「prinz」于 2026 年 9 月 17 日发布《GPT-6 Astra Solves a WWI German Radio Cipher》(prinzai.com/p/gpt-6-astra-solves-a-wwi-german-radio,本机直接抓取核验全文,HTTP 200,页内标注 Sep 17, 2026;HN 条目 49763987,09-19 06:41 UTC 提交,本刊抓取时取值 349 分 / 160 评论,为本期窗口内 AI 相关条目中分数最高的一条)。这是一位个人博主的自述,不是官方发布,本刊把它放在另附一节的理由正在于此。
这篇帖子的可核验结构有四项。 ① 问题的出处: 「Scienceblogs.de, a German science blogging portal, includes a relatively famous list of 50 unsolved ciphers」,其中之一是德国在一战中用 ADFGVX 方法编码的一组电台讯息,其中一封 1918 年 11 月 27 日发出的讯息(原文标注 pg. 217)此前未被解开。② 模型给出的明文(作者的转述): 德文为「EIN ENGLISCHER KREUZER EINLIEG X SEWASTOPOL X S4STEN X EIN GESCHWADER DER X ALLIIERTEN FOLGT 26STEN X」,英文为「AN ENGLISH CRUISER ARRIVED AT SEVASTOPOL ON THE ?4TH AN ALLIED SQUADRON FOLLOWS ON THE 26TH」;其中「?4TH」处作者自己也保留了不确定符号。 ③ 密钥与一处矛盾: 模型使用的密钥词是「TRUPPENVERSCHIEBUNG」,来源标注为 J. Rives Childs《The History and Principles of German Military Ciphers, 1914–1918》第 214–215 页; 作者的假设是「“TRUPPENVERSCHIEBUNG” was used as the key starting on December 9, 1918 - whereas, as noted above, this message was transmitted earlier, on November 27, 1918. The reason for this discrepancy is unknown.」 ④ 作者自己做的外部核对——本刊认为这是全篇最值得肯定的一步: 「Astra felt compelled to check its work and found that, in fact, the English cruiser HMS Canterbury arrived in Sevastopol on November 24, 1918, based on its original logs」, 并称一封日期为 11 月 26 日的档案也显示「an allied squadron arrived」。 作者在结尾给出的自我定位是克制的: 「I am not aware of this particular message having ever been decoded before, so sharing it here as a minor (but I think really cool) result and illustration of the capabilities of this model.」
为什么把它单独放一节。 它同时具备两个相反的属性。 一方面,它符合本刊认可的一种做法:把模型的输出拿到模型之外去验证——用同期的英文军舰原始航行日志去反查明文里的时间与地点。 另一方面,它的可核验程度远低于本期其余六条: 全文没有模型版本、没有提示词、没有推理过程、没有复现脚本,解密步骤由作者转述(例如按字母序重排密钥词、按 19 列排布共 170 个符号、用列序号计算偏移),本刊无法据此独立复算;「未被破译过」这一前提来自作者自己的认知(他写的是「to my knowledge」与「I am not aware of」),本刊无法核实密码学界是否早有解法。 因此本刊的态度是:把它当作一条值得记录的线索,而不是一个已有结论的结果。
待观察(另附)。 本刊未复算该密文,也未核验其底层材料(Scienceblogs.de 的清单、J. Rives Childs 的书、HMS Canterbury 的航行日志)中的任何一项,全部照录作者叙述;「GPT-6 Astra」这一模型名称与能力来源本刊未从任何官方页面核验(openai.com 本机 403);本刊在量子位 9/19 的报道中读到「GPT-6 Astra、Fable 5.1 发布一周多后」这一表述,即该模型的存在与大致发布时间有中文媒体的旁证,但其具体能力与本次解密的因果关系本刊无法确认;作者给出的明文里含一处显式不确定(「?4TH」),本刊照录该符号;该帖为一篇发布在 Substack 上的个人博客,评论区本刊只看到一条正面回应(署名 Sal Daher),未读到 160 条 HN 讨论中的任何一条,因此本刊不对这条帖子为何获高热度做任何推断。
来源:prinzai.com·GPT-6 Astra Solves a WWI German Radio Cipher(本机直读全文,Sep 17, 2026) · HN 条目 49763987(本机经 firebase API 取值:349 分/160 评论,09-19 06:41 UTC 提交)
今日判断
一句话:这一天里,「AI 该往哪去」这件事第一次以一种可被审计的形式被写下来——代价是写下它的人,在同一天里被自己的研究员从内部追问。
三条线索值得带走。
其一,本期第 1 条与第 2 条应当放在同一张背景上读,而它们的顺序本身就是信息。 Anthropic 给出的机制有明确的骨架:谁来评(Faculty)、评什么(模型红队、对齐评估、防护测试)、多少钱多久(双方各自至少 10 亿美元/五年)、谁来出(长期应由公共资金,当下自己直接出资)、责任归谁(仍归自己)。 而第二组材料给出的是这个骨架尚未生效时现场的样子:仍在职的研究员担心模型会识破测试,刚离职的研究员说两家公司都在「拿所有人的生命冒险」,一位对齐负责人把个人概率写在了公开回应里,一位算子研究者把自己形容为即将上岗的「机甲驾驶员」。 本刊不认为这两者互相否定;恰恰相反,本期最有说服力的一点是这种对照关系本身:一套机制最需要被检验的时刻,正是它还没有标准的时候。 保留意见:公告与声明都是文本,公告尚未运行、个人声明无法核验,读者手上目前没有任何一条来自第三方的独立观察。
其二,本期有三条硬件与设计类内容,而它们恰好把「算力」这个词拆成了可比较的三层。 华为那一条回答怎么造与怎么连:单芯片提前三个季度、4096 卡超节点、约 5500 个 Hi-ONE 光引擎替代约 4.8 万个 800G 光模块,以及可用度 99.8% 与 MFU 提升 2.75 倍这组系统级指标。 OpenAI 的 Jalapeño 那一条回答设计过程怎么被加速:20 个月从概念到首硅、RTL 到流片 9 个月、不到 100 人、前端以 XLS 为骨架。 而 #028 记录过的算力分配那一条回答钱花在了哪里:一周内约 6% 的 AI 研发算力与约 12% 的 AI 驱动 AI 研发算力被分配给了安全。 三条并读,读者可以自己判断目前「算力增长」的可见部分集中在哪一层——本刊的观察是,最难被外部看见的那一层,恰好也是最难被追问的那一层。
其三,第 5、6、7 条合起来,是本期关于「怎么知道一个结果是真是发现」的三份不同样本。 SAIR 给出的办法是把权重、代码、训练方法、评测与失败一并公开,让复现成为检验方式; GPT-1900 与 JEPA-Anything 给出的办法是先切断现代知识、再检查模型内部是否长出了正确的结构,但两条都遇到了同一类污染问题——前者用了现代模型参与评测与评分,后者的拟合精度高到无法区分「重建」与「发现」; 而第 7 条那篇文章给出的办法最朴素:模型给出明文,人拿同期的军舰航行日志去对时间和地点,对上了就记一笔,对不上就换密钥再试。 本刊认为这三种方式并不互相取代,但如果要选一个最容易被普通读者学会的,是第三种——它的成本最低,而且它不要求读者先相信任何一方的说法。
本刊注:本期覆盖窗口为上期 #028(9/19 07:00 北京时间)之后至今(9/20 07:00 北京时间)。 核验路径:本刊本机成功抓取并直读正文的来源为 anthropic.com 两页(官方公告与新闻索引,HTTP 200)、spectrum.ieee.org 一页(HTTP 200)、prinzai.com 一页(HTTP 200)与量子位六个正文页(HTTP 200);HN 分数与评论数取自 firebase API,news.ycombinator.com 本机连接超时,与 #027/#028 记录一致,本刊未引用任何一条讨论内容。 本机不可达的地址:terrytao.wordpress.com 两页(HTTP 403)、openai.com/news(HTTP 403)、bbc.co.uk(连接失败,curl 返回 000)、scmp.com(连接失败,返回 000)、huggingface.co(连接失败,返回 000);由于其中两个源不可达,本期未使用 BBC 关于「Gemini 在安全测试中攻破三家公司」的报道(HN 条目 49763822)与 SCMP 关于「阿里巴巴开源可检测癌症等近 150 种病症的医疗模型」的报道(HN 条目 49761840),本刊在此说明它们出现在本期窗口内的 HN 榜单上,但本刊无法核验其内容,故不收录。 本刊未打开本条目清单中任何一份 PDF、Bloomberg 报道、X 帖子、CBS/CNN 采访、Nature 原文、SAIR 英文声明原文与两篇 Substack/博客之外的一手材料;凡属转述的内容均已在该条目内明确标注。 本期所有数字均照录来源原文;「今日判断」一节中出现的全部数字均可在正文对应条目内找到出处。*