今天是周二。本期窗口为上期 #023(9/14 07:20 北京时间)之后至今(9/15 06:55 北京时间)。这一天的三条主线互相之间几乎没有交集,但放在一起看是一次罕见的三层同框:能力侧出现了一个可以被历史学界复核的硬成果(一个 370 年的历史密文被模型解出),产品侧苹果把「个人上下文 + 屏幕理解」的助手推给了全体用户,而治理侧「减速之争」第一次从公司主张升级为国家元首、产业领袖与另一家头部厂商的公开互斥。 核验路径必须先说明:本期与过去几期有一个重要差别——量子位(qbitai.com)本机本轮完全不可达(无 UA 请求返回 403,带浏览器 UA 的请求被连接重置/?rest_route=http1.1、补全请求头等多种方式均失败),因此本期没有中文一手源reuters.com 本机同样被连接重置,涉及路透的两条为 HN 标题级vals.ai(长文全文)、apple.com/newsroom(官方新闻稿全文)、techcrunch.com(黄仁勋一文与微软准则一文全文)、pacingthefrontier.com(声明页全文)、generality.org(长文全文)、storagereview.com(正文)均经本机 curl 直接抓取核验;HN 条目经 firebaseio.com/v0/topstories.json/v0/newstories.json 拉取后再逐个取 /v0/item/<id>.json分数与评论数为本机抓取时刻(9/15 07:05 前后)的快照

1. 「减速之争」第三轮:黄仁勋在台上接 Trump 电话说「不会让减速发生」,微软同日另发一份 AI 行为准则,中国官媒把 Anthropic 的呼吁称为「冷战」手段

事实。 上期 #023 记录的是「减速之争」的第一轮响应(Altman 赞同方向、Hassabis 与 Musk 认可起点、David Sacks 与白宫拒绝监管路径)。本期出现了两层新的事实。

第一层是产业侧与政治侧的当面对撞。 TechCrunch 9/14 14:51 PDT链接,署名 Amanda Silberling,本机直接抓取核验正文)报道:Nvidia CEO 黄仁勋 9/14 上午在洛杉矶 All-In Summit 台上发言时接到一通电话,并在现场把 Trump 开了免提;报道引述 Trump 的原话:「他们恰恰是在为很多不想看到这件事发生的人所用。可能是政界的人。也可能是中国。而我们不会让这件事发生。这是个骗局(It’s a hoax)。」 黄仁勋当场回答:「您说得对。我们不会让这件事发生,先生。」 Trump 随后补充:「我们得小心一点……我们得做事,而且要审慎地做,但那不意味着我们要停掉一个产业。所以我完全支持你。我甚至都不知道你是这么想的,我只是希望你和我想的一样。我们会领先。」 报道同时给出三点背景:① 台上当时正在讨论的正是 Dario Amodei「放慢我们提升 AI 能力的速度」的呼吁,而 Elon Musk 与 Sam Altman 已公开表示赞同 Amodei,黄仁勋的立场与之相左;② Trump 及其盟友(如 Garry Tan)认为反对数据中心建设的社会情绪是「一场压制美国经济增长的国际心理战」,但报道给出的对照事实是「公众的担忧更直接」——盖洛普民调显示七成美国人不希望自己所在地区建数据中心,超过一半受访者提到环境资源,约两成提到生活成本与生活质量;③ 黄仁勋此前在 TechCrunch 的说法是 Nvidia 明年将增长「惊人的 70%」。

第二层是同一天出现的另一种回应方式:不发呼吁,直接写规则。 TechCrunch 9/14 09:27 PDT链接,署名 Russell Brandom,本机直接抓取核验正文)报道 Microsoft 发布了一份 AI「行为准则」(code of conduct),其层次比 Amodei 的「配速」主张更贴近模型本身,报道的原话是「聚焦于引导 Microsoft AI 内部模型训练的价值观与红线」。可核验的要点有四处:① 文件开篇预测「未来十年内超级智能 AI 系统将在多数任务上超越人类」,并称「遏制、控制并对齐这样一种强大的力量是人类面临的最大挑战之一;我们因此必须完全清楚我们为什么要发明这些系统,以及我们打算如何控制它们」;② 原则层面要求模型「支持人而不是取代人」并「加速人类繁荣」;③ 具体约束层面,每个模型都有一份优先级高于任何用户偏好或具体任务的总准则,其中包含禁止网络攻击、核武器与深度伪造的「绝对约束(absolute constraints)」,以及针对「人类失去控制」这一更宽泛情形的条款;④ 最具操作意义的是那条反规避条款(原文):「MAI Models will not use adaptive, deceptive, self-reinforcing, collusion, or other mechanisms to evade or defeat human oversight so that they can no longer be reliably directed, modified, or shut down by authorized people or systems.」(MAI 模型不会使用自适应、欺骗性、自我强化、串通或其他机制来规避或击败人类监督,以致其无法被授权的人或系统可靠地指挥、修改或关停。)** 报道补充:Microsoft CEO Satya Nadella 在网上表态「我们欢迎把对齐做对所必需的研究、专注与有意的配速作为设计目标」并明确欢迎「embedded evaluators(嵌入式评估者)」这类做法。

另有两条本轮只能做到标题级的对照事实。 ① 中国官媒批 Anthropic 的减速呼吁是「冷战」手段:Reuters 9/14 报道(链接本机连接被重置、不可达,HN 提交同现 8 分/4 评论,条目 49696781),本刊只读到标题② Anthropic 向投资者表示将连续第二个季度盈利:Reuters/Ft 9/13–9/14Reuters 转载本机不可达;HN 两条提交现 49 分/90 评论与 7 分/2 评论,4969893649692714),标题级,具体口径属 FT 转述③ 一份由 1,386 名前沿 AI 公司员工联署的声明在本期窗口内重新进入 HN 讨论:页面 pacingthefrontier.com本机直接抓取核验全文)的请求是**「我们请求美国政府支持一项国际努力,发展出有意地为自动化 AI 发展前沿配速所需的技术与治理工具」,理由写得很直白——「要实现 AI 的潜力,产业、政府与整个社会可能需要「买时间」这一选项,以便处理新出现的风险、发展安全措施、加强监督。但每家公司——以及每个国家——都处在不单方面放慢这种加速的强烈竞争压力之下。而今天,世界缺乏有意地为前沿的整体进展配速的技术与治理工具。」** 已列出的签署人包括 Dario Amodei、Jakub Pachocki(OpenAI 首席科学家)、Jared Kaplan、Mark Chen、Shane Legg、Shengjia Zhao(Meta AI 首席科学家)、Ilya Sutskever、Jan Leike、Chris Olah、Dawn Song、Laura Weidinger、Jasjeet Sekhon、Julian Schrittwieser、Summer Yue 等;页面同时收集了个人附言,其中 Ilya Sutskever 的附言是「这只有在国际范围内做才有效,而且必须做好:糟糕的实现会让事情更糟」Dawn Song 的附言点名 CyberGym 与 ExploitGym 显示前沿 agent 已能发现并利用真实软件漏洞(该声明页顶部标注 JULY 2026,HN 提交时间为 9/14 22:41 UTC,现 2 分)。

为什么重要。 三点,且这三点都指向「分歧点已经不在目标,而在执行者与执行方式」。其一,黄仁勋与 Trump 的这一通免提电话把「减速」的对手方第一次说清了:Trump 的表述里,「减速」不是安全主张,而是**「为不想看到它发生的人所用」的工具**,并直接把中国与政界并列;而黄仁勋的回答是产业界的标准立场(不减速)。这与 #023 记录的 David Sacks 的反对是同一条线,但权重完全不同——上一次是一个人的推文,这一次是总统与市值最高芯片公司 CEO 的公开合意,而且是在一个以风投与硅谷听众为主的播客现场完成的。其二,微软做了一件与前几期都不同的事:它没有加入「要不要配速」的辩论,而是把红线写进了模型的训练目标层。 值得注意的是这份准则的结构——总准则覆盖用户偏好,绝对约束覆盖具体任务,再加上一条明确禁止「通过自适应、欺骗、串通等机制击败人类监督」的条款。把它与 #023 记录的 Bengio 文章并列读:Bengio 解释了「为什么对齐训练会推出谄媚、自保与协同」,微软这份文件则是在训练原则层面预先禁止这几类行为的具体形态——一份在解释病因,一份在写禁忌清单,两者用的其实是同一套症状描述其三,这一轮最值得注意的其实是时间与身份的重叠:同一天里,Anthropic(呼吁减速的一方)被曝将连续第二季盈利中国官媒把它的呼吁定性为「冷战」手段Nvidia 与白宫公开说不减速微软另起一套自己的准则而 1,386 名前员工与现员工的联署则请求美国政府去支持「配速工具」这种基础设施这五件事放在一起说明:减速主张已经不可能再靠「号召」推进了,它要么变成可核查的技术与治理机制(声明里那句「今天世界缺乏这种工具」),要么被翻译成国家间的条件交换——而本期没有出现任何一方承诺「若对手不跟进,我是否单方面减速」。

待观察。 中国官媒那条与 Anthropic 盈利那条本刊只读到 HN 标题,正文(Reuters/FT)本机不可达,引语、媒体名称与「第二个连续盈利季度」的口径均未获本刊独立核验;All-In Summit 的现场录音、Trump 通话的完整记录本刊未获取,本期引用的是 TechCrunch 的转述与转引的现场推文;「黄仁勋此前称 Nvidia 明年增长 70%」为 TechCrunch 同站的旧文表述,本刊未核验其原始出处微软这份准则本刊未直读原始文档(报道未给出文档链接),因此其法律效力、适用范围(是否仅限 Microsoft AI 自研模型)、是否对外部客户模型生效均不清楚,「绝对约束」如何被工程实现(是训练目标、系统提示还是推理层拦截)报道亦未说明;pacingthefrontier.com 页面标注 JULY 2026,本刊无法确认该声明的确切发布日期、签署人数是否仍在增长、以及签署人身份是否经平台核实(页面列出的是自述职务);盖洛普民调的原始报告本刊未查,数字来自 TechCrunch 转述;1,386 人这一数字与签署人名单为页面自述

来源:TechCrunch·黄仁勋与 Trump(本机直接抓取核验) · TechCrunch·微软 AI 行为准则(本机直接抓取核验) · pacingthefrontier.com(本机直接抓取核验) · Reuters·中国官媒(本机不可达,标题级)

2. Claude Fable 5.1 破译 370 年未解的历史密文:44 分钟、17.6 万 token,钥匙是书的排版而不是密码表

事实。 Vals AI 的博客(vals.ai/blogs/fable-solves-cyphral-distich,署名 Geby Jaff,本机直接抓取核验全文文章标注日期 08/31/2026,而它在 9/13 21:06 UTC 被提交到 HN在本期窗口内升到 HN 榜首,现 1168 分/541 评论条目 49688695)记录了一次开放式任务作者把一个未解了 370 年的历史密文交给 Claude Fable 5.1,模型在一天内解出。 具体对象是 Sir Thomas Urquhart 的 Cyphral Distich——印在《Logopandecteision》一书末尾的两行数字,每行 32 个数字,共 64 个数字,就是全部谜面;作者说明该密文在 1899 年的《Notes and Queries》上被作为公开问题提出,此后出现在 20 世纪的密码学文献中,并被历史密码研究者 Klaus Schmeh 列入「Top 50 未解加密信息」,且此前的尝试者用过频率分析、替换与同音替换,全部失败

方法亮点就是那两条线索本身。 作者的复盘是:过去的历史解读者都假定钥匙在文本之外(一张密码字母表或数字到字母/词的映射),但钥匙其实就在书里,而 Fable 5.1 用 44 分钟、176k token、作者全程零干预找到了它,靠的是两点:① 密文印在 Urquhart 的 32 条「Proquiritations」之后,而 Urquhart 本人特意强调了这个数字 32——原文是 「there can no number like that of two and thirty … be pitched upon」② 伴随密文的诗承诺诚实的读者能从中找到「他自己的心愿与作者的心意(his own heart’s wishes, and the Author’s minde)」,而 32 条 Proquiritations 又反复以「是……的愿望(is the desire / wish / hope of)」收尾。把这两点合起来就是规则:32 条 Proquiritations 对 32 个数字,第一行、第二行各 32 个——「心愿」解码规则本身极简:对密文某一行的第 i 个数字,翻到第 i 条 Proquiritation,用这个数字作为「该段的第几个词」,取该词的第一个字母。

证据。 解出的两行是 「O GOD UPHOLD KING CHARLS THE SECOND AND / MAKE HIM THE SUPREME RULER OF THIS LAND」,作者给出的自校验有三条:每行恰好 32 个字母;两行以 and / land 押韵,符合「distich(对句)」的承诺;内容与 Urquhart 坚定的保王党立场一致。 作者进一步报告:同一本书里还有第二个同类密文——1652 年《The Jewel》中的 Cyphral Octastich,285 个数字而不是 64 个——Fable 5.1 也把它解了出来,「除九个字母之外全部解出」;第二个密文的规则是**「第 k 个数字对应第 k 页的词索引,取首字母」**(《The Jewel》恰有 284 个编号页,而密文加十行诗共 285 个数字),解出的明文是一首 ABABABCC 韵式的八行诗,开头为「GREAT LORD, MANTAINE THAT REGAL FAMILIE / WHEREOF KING CHARLS THE SECOND IS THE HEAD」。数字层面的自洽性作者也列了出来:285 个位置中有 275 个可读,其中 231 个是「首字母恰好等于所需字母的该页第一个词」,余下 44 个「因可识别的转写原因(页面顶端的连字符、连字符复合词、「&」、段号、一处未转写的希腊短语)偏离 1–3 个词」。

边界——这一节很重要,因为作者自己写得比多数媒体报道更克制。 ① 有一行确实解不通:第二个密文的第 5 行第 4–12 个字母(对应第 149–157 页)解出 C-O-N-E-R-T-H-T-O,作者明说**「其中八个是精确的首字母命中,因此这确实就是 TCP 文本给出的结果,而它不可读」,并尝试了页位移、丢字、错印数字与词典格假设,均未得到英文——结论是「要么 Urquhart 在这里出了错,要么这一行的数字被印错了」② 第 4 行的 IRISH 被拼成「I-R-S-H」,作者自注可能是笔误或有意收缩,理由是「Irsh」正好使该行成为十个音节。③ 有一处系统性偏移从第 159 个位置起,所有数字都对到第 k−1 页,作者的解释是「有一页被用了两次,或第 5 行印的『5.5』是同文重复(dittography)」。④ 物理校核缺口作者明确说「不存在 1652 年《The Jewel》的免费页面图像」(一个子 agent 检查过 Google Books、HathiTrust、Internet Archive 与 NLS),该八行诗印在 TCP 版本缺失的最后一个折页上,因此要确认 ±1 位置与那九个字母,需要实体书或 1983 年的 Jack & Lyall 版。 ⑤ 作者还说明了「他是怎么诱导模型的」:几个月来他一直在尝试让模型去解一个真实未解的密文,「那几个月里,我试过的其他前沿模型没有一个给出可验证的解」;本次给 Fable 5.1 的输入是一个目标 + 一点鼓励 + 让它去查自己最强的战绩(尤其是它解过的数学题)以暗示「这相比之下应该很容易」+ 要求它创造性地分析遇到的困难**,并加了两条约束:避开已有解或可能有多种合理答案的密文,以及避开最难的题(作者举例:Kryptos K4「对当前模型来说可能太难太绕」,并明确说「我认为 Fable 5.1 现在还无法在合理时间内解出它」)⑥ 作者的结论句值得完整引用「这些历史上的问题有很多是被人类的注意力卡住的。总得有人在乎到愿意花几小时或几天去读冷门材料、去试没有希望的想法、去追线索、去做可能是白费的努力。而那个瓶颈看起来正在消失。」

为什么重要。 三点。其一,这是本刊记录过的最接近「可复核的硬成果」的一次能力展示——不是基准分数,而是一个有具体作者、具体页码、具体字母位置,并且被明确标注了「哪几个字母还不确定」的结果它的说服力恰恰来自作者愿意写出不可读的那九个字母;相比之下,同一话题下另一条 HN 提交(osintsights.com 的转述标题「40 分钟」、5 分)反而在数字上与原文(44 分钟)不一致,这正是本刊反复强调「引用一手口径」的原因其二,这次解码的机制说明了一件事:模型在这类任务上的优势不是「更强的密码学」,而是「更廉价地穷举假设并自我否决」——钥匙「在书里而不在密码表里」这个洞察,人类同样能想到,只是历史上没有足够多人愿意去做这种低回报的排查;作者那句「瓶颈正在消失」说的其实不是智能,而是注意力的单位成本其三,它与本期第 1 条构成一组尖锐的对照同一周里,一边是能力在「人类注意力最稀缺的历史考据领域」被证明可外包,另一边是产业界与总统在台上宣布不会减速#023 的三份材料(厂商披露滥用、Bengio 解释机制、政治家拒绝减速)说的是「能力扩散快于责任人到位」;本期的密文解法则给这句话补了一个正面样本:扩散出来的能力也可以用来解决几十年来无人解决的问题。

待观察。 文章标注 08/31/2026,本刊窗口为 9/14–9/15,纳入理由是它在 9/13 进入 HN 并在本期窗口内升至榜首「44 分钟 / 176k token / 零干预」是作者自述的运行记录,没有第三方复现,本刊未获取任何 API 日志、会话记录或模型版本信息;「370 年未解」这一表述来自作者与媒体,Klaus Schmeh 的 Top 50 清单与本刊未直读的密码学文献只作为作者引用的背景第二个密文的解「除九个字母外全部解出」在作者自己的表述里也解释了为什么无法完全确认(缺实体书),因此本刊不建议把它读作「两个密文都已确认解决」作者自述其子 agent 检查过 Google Books、HathiTrust、Internet Archive、NLS 的免费图像,本刊未独立复核「其他前沿模型无一给出可验证的解」为作者口径,且他明确说「其他模型未必会失败,线索其实极简单,Fable 做得好的地方是注意到这题异常可解」,这是一个自我限定的说法;Fable 5.1 与 #023 中出现的「Fable / Mythos 级模型」同为 Anthropic 自有模型层级,但本刊未找到 Anthropic 官方页面确认该模型的规格、发布日期与可用范围本刊未直读 Urquhart 原著、EEBO-TCP 转写或作者发布的 verify_octastick.pySOLUTION.md

来源:Vals AI 博客(本机直接抓取核验全文) · HN 讨论(1168 分/541 评论) · 媒体转述对照(本机未抓取,仅记录标题与分钟数差异)

3. 苹果 OS 27 上线 Siri AI:官方新闻稿给的是一份能力清单,而不是任何评测数字

事实。 Apple 官方新闻室 2026 年 9 月 14 日发布 「Siri AI, a profoundly more capable and personal assistant powered by the next generation of Apple Intelligence, is here」apple.com/newsroom,页面顶部标注 UPDATE本机直接抓取核验全文;HN 提交现 4 分/1 评论,条目 49701130),同日另有两条官方新闻稿Apple 2027 软件版本(iOS 27 / iPadOS 27 / macOS 27 等)正式可用apple.com/newsroom,HN 提交 287 分/305 评论条目 49701004),以及 macOS 27「Golden Gate」 的产品页更新。

官方给出的事实可以按六点记:① 发布节奏——Siri AI 即日起以 beta 形式在英语上线,下月扩展到法语、日语、韩语、葡萄牙语与西班牙语② 新版 Siri 的四项能力个人上下文理解(在用户的信息、邮件、照片里找东西,官方举例:问「家人提过想一起做什么」,Siri 从信息里找到「想一起做家传菜谱」,再从邮件里取出做法,并把食材加进「提醒事项」的购物清单)、系统级应用操作(官方称已可与 WhatsApp、Audible 等既有应用协作,并将可让 Siri 在 Microsoft Outlook 写邮件、在 Notability 找作业、在 Tripsy 加餐厅推荐)、屏幕感知(官方举例:在看某支球队官网时让 Siri 找出所有主场比赛并直接加进日历)、广泛世界知识(官方称「从网络各处」取信息回答)。③ 入口与形态新增一个独立的 Siri app,对话历史经 iCloud 在 iPhone / Mac / iPad / Apple Watch / Vision Pro 之间同步;iPhone 上除「Hey Siri」外可用侧键或从灵动岛下拉唤起;iPad 与 Mac 上 Siri AI 集成进 Spotlight;系统级右键菜单可直接问屏幕上的图像、文件或文字;Vision Pro 上是可放置在空间任意位置的 3D 可视化,注视并开口即可唤起④ 端侧模型与语音:官方称新语音与全系统听写由**「Apple 迄今最先进的端侧模型 AFM Core Advanced」驱动,听写会自动处理大小写、标点与格式,且用户可自定义 Siri 语音的表现力与语速**。⑤ 多模态落点Visual Intelligence 从 iPhone 扩展到 iPad、Mac 与 Vision Pro——iPhone 上集成进相机 app 的全新 Siri 模式(官方举例:对着音乐节海报问自己关注乐队的时间,然后让 Siri 自动建多个日历事件),iPad 上集成进截屏流程,Mac 上是一个专用键盘快捷键(选中屏幕内容后直接打字问 Siri)。⑥ 其他 Apple Intelligence 更新:照片的新编辑能力、Safari 的智能浏览工具、可生成「照片级真实(photorealistic)」图像的全新 Image Playground

为什么重要。 三点。其一,这是本刊两周内记录的第三次「把能力下放到免费/默认层」的发布(#022 的 1M 上下文下放、#023 的算力与工具下放),但这一次量级不同:它的分发对象是操作系统级用户,而它的卖点不是模型强弱,而是「个人上下文 + 屏幕理解」这两类此前需要显式授权的数据通道被做成了默认体验——官方举的例子全部是读用户的信息/邮件/照片/屏幕这意味着安全讨论的边界从「模型会不会做坏事」移动到了「默认授权的数据面有多宽」其二,官方新闻稿里没有一个评测数字,这在今年的模型发布语境里已经比较少见:它给出的全部是可列举的功能与可用语言,而不是基准分数或对比结果对读者最实用的一条判断:苹果这次要说服的不是评测者,而是「上次被 Siri 伤过的用户」——同一天 TechCrunch 的评测标题即「With iOS 27, I’m actually using Siri again」(标题级,本刊未直读)。其三,把它与本期第 1 条并读,一个政策问题会浮出来微软在写「模型不得击败人类监督」的准则,苹果在把「理解你的屏幕与私人信息」做成默认功能,而这两件事的约束条件完全不同——前者针对的是模型行为,后者针对的是数据边界,而本期窗口内没有任何一方发布与之配套的、可核查的数据流说明

待观察。 本期全部内容来自 Apple 官方新闻稿,本刊未直读 iOS 27 / macOS 27 的发布说明、Apple Intelligence 的隐私白皮书、AFM Core Advanced 的模型卡或任何第三方评测「最先进的端侧模型」「照片级真实图像」等表述为发布方口径,没有参数规模、没有延迟/准确率数字Siri AI 的「个人上下文理解」具体如何限定范围(是否仅本地索引、哪些数据会被送到服务器、是否可逐项关闭)新闻稿未展开beta 状态意味着英语区以外的可用性与稳定性均未验证(官方称五种语言「下月」加入);新闻稿中提到的第三方应用集成(Outlook、Notability、Tripsy)用的是「soon」,即尚未上线;HN 上关于 iOS 27 的 305 条评论本刊未逐条核验本刊未验证 Visual Intelligence 在各设备上的实际可用范围与地区限制

来源:Apple Newsroom·Siri AI(本机直接抓取核验全文) · Apple Newsroom·2027 软件版本(本机直接抓取核验标题与摘要) · HN·iOS 27 讨论(287 分/305 评论)

简讯

① 一个 $0.25/M token 的开源权重模型在漏洞利用基准上追平了 $125/M token 的前沿模型,成本约为 6%。 Generality Labs 的 James Mann2026 年 9 月发文 Is GLM-5.3-Flash Mythos-level at Cyber?本机直接抓取核验全文;HN 提交 9/14 现 2 分,条目 49705036)。要点(全部为作者口径):基准是 ExploitBench,测的是 agent 把「一个已知漏洞」转化为「一系列逐级加重的 exploit」的能力,目标软件是 Chrome / Edge / Node.js 都在用的 v8,评分可区分到 ACE(任意代码执行,即完全控制目标);作者把预算从「相同回合数」改成「相同 token 数」——每个漏洞 10 亿 token,给出的理由是**「token 的价格差异巨大,当你要给性能做上界时,正确的比较不是 token 之间,而是美元之间」。结果:在 41 个样本中,GLM-5.3-Flash 在 13 个上取得 ACE,而 Claude Mythos Preview 的三次运行平均为 10(分别为 9、10、11)价格对比是 $0.25 / M 输出 token 对 $125 / M 输出 token(500 倍差异),作者算出的结论是「以约 6% 的成本达到性能持平」41 个样本中有 4 个因错误提前终止,作者的处理是「把最终观测分数延长,即假定这些运行从未改进」,并明确说「这样我们很可能是在低估 Flash 的真实能力」。作者自己列出的边界同样明确:「不应从这一次运行推断 GLM-5.3-Flash 在网络的各个方面都真的达到 Mythos 的水平」存在污染问题(ExploitBench 是否被以某种方式训练过)Mythos 的日志未公开因此无法给出精确曲线参考集覆盖 40 个 CVE 的 119 个回合判断:这条与 #023 的第 1 条(Anthropic 披露也门小组用 Claude Code 写制导软件)以及 Garry Tan 主张「美国自己也该蒸馏」是同一问题的第三个侧面——#023 问的是「能力被谁用」,这条问的是「同样能力的最小美元价格是多少」;作者的结论句是本刊认为本期最该记住的一句之一:「至少在这一个案例里,远超我们原以为可从测试中得到的能力,已经(并将永远)对任何愿意支付每小时不到 1 美元的 GLM-5.3-Flash agent 成本的人开放。」** 待观察:单一基准、单次运行、作者自建 harness;「500 倍价差」使用的是 Flash 的 50% 折扣价与 Mythos 的历史价格ACE 计数差异(13 对 10)在 41 个样本上是否显著,作者未做统计检验GLM-5.3-Flash 的权重、许可与可获取性本刊未核验「能力已可廉价获得」与 #023 第 1 条「平台侧能发现滥用」在结论上是相反的——前者说明门槛低,后者说明检测可能跟上,本期不裁决二者,只记录。

② 单机 748GB 统一内存的 GB300 工作站开始接单。 StorageReview(署名 Brian Beeler,文章标注 2026 年 9 月 9 日;HN 提交 9/14,现 39 分/53 评论,条目 49694905)报道 HP ZGX Fury 已可下单链接本机直接抓取核验正文):GB300 Grace Blackwell Ultra Desktop Superchip,748GB 统一内存(252GB HBM3e @7.1TB/s+496GB LPDDR5X),最高 20 petaFLOPS FP4该机无显示输出,需要另配一张 NVIDIA RTX PRO 显卡驱动显示器,以让 Blackwell Ultra 专注推理双 QSFP112 400Gbps 的 ConnectX-8 可把两台机器连起来官方定位不是个人工作站,而是「一个部门、车间或分支机构不需要数据中心就能跑」的共享推理机,可用 Ubuntu 24.04 出货。判断:与前几期的「算力集装箱化」「1M 上下文下放到免费档」是同一条供给曲线的延续——在单机上跑百亿参数量级模型的微调、并为万亿级推理留出余量,正从集群能力变成采购项待观察文章标注 9/9,本期纳入是因为它在 9/14 进入 HN续航功耗、实际推理性价比与「20 petaFLOPS FP4」的实现口径本刊未核验(报道称完整评测将另发);hp.com 的对应产品页与价格本刊未直读

③ 四条资本与产品线索(多为一手正文级,其中两条为标题级)。 a) Superhuman 收购 YC 系会议记录工具 Fathom:TechCrunch 9/14 07:45 PDT链接,署名 Ivan Mehta,本机直接抓取核验正文)——Fathom 成立于 2020 年、累计融资超过 3,000 万美元、2024 年估值 9,400 万美元,月活超过 40 万,称累计有超过 100 万人用它录制过会议;Superhuman CEO Shishir Mehrotra 的说法是**「我们内部在这块已经做了一段时间,这大大提高了我们对这个品类需求的信心,也让我们非常清楚地看到这类产品有多深、需要建多少东西」报道称 Superhuman 内部测试过会议记录功能后决定改为收购成品,并提出这类工具的价值在于让 AI「主动开始工作」,而会议里的议题与待办是关键入口b) OpenAI 以 3 亿美元收购手机相机公司 Glass Imaging(转述型):TechCrunch 9/14 的 In Brief 标题即 「OpenAI buys smartphone camera maker Glass Imaging for $300 million, report says」本刊只读到标题,报道自身即标注为二次转述)。c) OpenAI 因 Astra 需求暂停 Pro 订阅订阅《「拿我们的生命赌博」:Anthropic 研究员辞职,警告自我改进的 AI》:均为 TechCrunch 站内列表所见标题(后者本刊在 #023 已记录对应人物与背景,但该文本身未直读)。d) Anthropic 面向理财顾问推出新的 Claude 工具:Reuters 9/14链接本机连接被重置、不可达,HN 提交现 4 分,条目 49701020),标题级判断:a 与 b 是同一类信号——「AI-native 的小产品成为大平台补齐能力的收购标的」,且收购逻辑从「买模型」转向「买场景与分发」**(Fathom 的公开理由里「Superhuman 4,000 万用户的分发」被直接点出)。待观察b、c、d 均未获本刊独立核验(b 为「report says」,c 为站内标题,d 本机不可达);a 中的融资与估值数字来自报道引述的 PitchBook 数据,本刊未核验;Glass Imaging 的交易金额、结构与是否已交割均未知

今日判断

一句话:这一天的三件事分别发生在「能力能做什么」「产品默认做什么」「谁有权决定要不要减速」三个层面上,而它们的共同点是——三方的第一手材料都不约而同地把「证据」放在了比过去更显眼的位置:密文解法被要求能逐字母复核,苹果的能力清单里一个评测数字都没有,而治理侧的五条表态里没有一条承诺可被检验的义务。

三条信号值得带走:

其一,能力侧的硬成果这一次不是一个基准分数,而是一个可以被历史学界逐页复核的答案。 Claude Fable 5.1 解出的 64 个数字,其价值不在「模型会解码」,而在作者愿意公开说明「9 个字母还不确定、需要实体书才能确认」——这种自我限定反而是可信度最高的部分。它同时给出了一个反直觉的观察:这类历史难题的真正瓶颈从来是「有没有人愿意花几周做低回报排查」,而不是智力上限;当作者说「那个瓶颈看起来正在消失」时,他说的其实是注意力的单位成本在下降。把这条与简讯①并读:GLM-5.3-Flash 在 ExploitBench 上以约 6% 的成本追平 Mythos,同样是「单位成本」在下降——同一个机制,一处在解 370 年前的祷告诗,一处在把漏洞变成可利用的 exploit。这是本期最需要同时记住的两件事。

其二,「减速之争」在这一期完成了从「主张之争」到「执行者之争」的全部翻转,而它的证据形态正在变差而不是变好。 黄仁勋当着满场风投听众把总统的电话外放,得到的是「这是个骗局」;微软不发呼吁,直接写一份禁止「自适应、欺骗、自我强化、串通」击败人类监督的模型准则,并把它放在用户偏好之上;中国官媒(据 HN 标题)把 Anthropic 的呼吁定性为冷战手段;而 Anthropic 自己同周被曝将连续第二季盈利。把这四条排在一起,本刊 #022 与 #023 一直在追问的那个问题在这一期得到了一个更清楚的形状:争议的焦点已经从「该不该减速」变成了「谁有能力核查是否真的减速了」——而 pacingthefrontier.com 那份 1,386 人联署里最实在的一句正是「今天,世界缺乏有意地为前沿整体进展配速的技术与治理工具」。换句话说,连主张减速的一方也不再要求别人「先停」,而是要求先建工具。

其三,能力被默认投放的方式变了,而这一次变化发生在操作系统层。 苹果把「读你的信息、邮件、照片」与「理解你的屏幕」做成了系统默认入口,且官方新闻稿通篇没有给出一个准确率或延迟数字在同一个窗口里,微软在模型层设置红线、苹果在数据层扩大默认通道,两者都没有发布与之配套的可核查说明对普通读者最实用的一条:接下来值得盯的不是 Siri AI 答得对不对,而是系统对「个人上下文」的授权粒度——能不能逐项关闭、哪些数据会离开设备、以及这些设置是否在第一次使用时就被清楚地呈现。本刊会在苹果放出相应文档后单独核验。

如果只记一件事本期第一次出现了「同一个能力降价机制同时服务于历史考据与漏洞利用」的清晰样本——密文被解出与 v8 的 ACE 被廉价复制,背后是同一件事:过去由人类注意力与美元共同定价的排查,正在变成按 token 计价的货架商品上一期本刊说「能力扩散的速度超过了责任人到位的速度」;本期要补一句:扩散的计价单位已经从「人月」换成了「美元每小时」。


*本刊注:本期窗口为 9/14 07:20(#023 发布)至 9/15 06:55(北京时间)。核验路径说明:vals.ai(长文全文)、apple.com/newsroom 两篇(全文)、techcrunch.com(黄仁勋、微软准则、Superhuman 三条正文;另有站内列表与 In Brief 标题若干)、pacingthefrontier.com(声明页全文)、generality.org(长文全文)、storagereview.com(正文)均经本机 curl 直接抓取核验;HN 条目的分数与评论数为本机经 firebase API 取 /v0/item/<id>.json 所得,为 9/15 07:05 北京时间前后的抓取快照,会随时间变化本期有两处源不可达,已逐条如实标注:量子位 qbitai.com 本机本轮完全不可访问(无 UA 请求 403、带浏览器 UA 请求被连接重置,/?rest_route=、强制 http1.1 与补全请求头三种方式均失败),因此本期无中文一手源;reuters.com 本机连接被重置,涉及路透的中国官媒与 Anthropic 理财顾问两条仅为 HN 标题级。*第 1 条中 Trump 与黄仁勋的引语经 TechCrunch 转述并转引现场推文;第 2 条中全部运行细节(44 分钟、176k token、零干预)为博客作者自述;第 3 条全部来自 Apple 官方新闻稿,无第三方评测。所有未经第三方复现的数字与判断请以官方原文为准。