今天是周三。本期窗口为上期 #031(9/22 07:00 北京时间)之后至今(9/23 07:00 北京时间)。这一天里最值得记的一件事,可以写成一句话:两家前沿实验室在相隔不到两小时的时间里各自发布了一批新模型,而本期同时读到的另外几份材料,恰好分别给出了这件事的三笔账——能力账、成本账、开源账。 本刊把其余条目按这三个方向排列:能力(GPT-6 Astra 自己破了一封 21 年没人破的 Enigma 报文)、成本(Epoch AI 的 47%/季、Ornn 的每百万输出 token 0.12–0.35 美元、小米 6 天烧掉 350 万美元、以及从 1:4 走向 1:1 的 CPU/GPU 配比)、开源(Nathan Lambert 递交给国会的证词、Unreal Agent 的 harness 成本账、围绕 Jev 的接口之争)。

核验路径如实说明:本刊本机直接抓取并核验正文的来源包括 anthropic.com/claude-opus-5-5(HTTP 200,页内标注 September 22, 2026,本刊直读引言、性能与成本、安全、可用性四节及全部评测表)、cryptocellar.org 的 Enigma 报文页(HTTP 200,页内标注 Updated: 19 September 2026 at 08:41 UTC,本刊直读全文)、artificialanalysis.ai 的三个模型页(claude-opus-5-5、gpt-6-sol、gpt-6-luna,均 HTTP 200,本刊直读其模型摘要与技术规格区块)、epoch.ai/publications/the-plunging-price-of-thought(HTTP 200,页内标注 Sep. 22, 2026,本刊直读摘要、方法与限制三节)、interconnects.ai 的证词页(HTTP 200,页内标注 Sep 21, 2026,本刊直读全文)、data.ornn.com 的论文页(HTTP 200,页内标注 7 September 2026,本刊直读摘要、Key findings 与作者自列的适用范围声明)、arcturus-labs.com 的博文(HTTP 200,页内标注 September 21, 2026,本刊直读全文)、unreallabs.ai 的项目页(HTTP 200,页内标注 22 September 2026,本刊直读正文与三张基准表),以及量子位的六篇正文(/2026/09/493485.html/2026/09/493625.html/2026/09/493629.html/2026/09/494179.html/2026/09/493363.html/2026/09/494430.html,均 HTTP 200)。 HN 的分数与评论数全部取自 firebase API 的 /v0/item/<id>.json;讨论页本机可读(GET news.ycombinator.com/item?id=49803892item?id=49801324 均返回 HTTP 200,与 #031 的更正一致)。 本机不可达的地址已逐条记录,并在「另附」一节集中说明:openai.com(/index/introducing-gpt-6-sol-and-luna//news/ 均返回 HTTP 403)、arstechnica.com(HTTP 405)、bloomberg.com(curl 连接失败,退出码 0 无响应)、archive.ph 的镜像页(同样连接失败)、huggingface.co(返回 000,不可达)、以及 mouse.dev(本机执行策略拦截 .dev 域名,未发起抓取)。 属厂商供稿的材料已逐条标注:阿里的三篇(吴泳铭演讲、Qwen4.5 与 5–10T、Qwen4 与下代视频模型)文末均写明「本文由阿里巴巴提供/阿里云提供,量子位获授权转载」;浪潮信息与英特尔两篇为会议现场报道,文末未标注供稿关系。 本刊本期未调用任何模型 API,未运行任何一项评测。

1. 同一天两次前沿发布:Claude Opus 5.5 与 GPT-6 Sol / Luna

事实。 Anthropic 于 2026 年 9 月 22 日发布 Claude Opus 5.5anthropic.com/claude-opus-5-5本刊直接抓取核验全文,HTTP 200,页内标注 September 22, 2026HN 条目 49803892,09-22 16:29 UTC 提交,本刊抓取时取值 1047 分 / 751 评论,为本次窗口内 AI 相关条目中分数最高的一条)。约一个半小时后,OpenAI 的新模型出现在 HN 首页:条目 49805509,标题《GPT-6 Sol and Luna》,09-22 18:00 UTC 提交,本刊抓取时取值 1006 分 / 544 评论,指向 openai.com/index/introducing-gpt-6-sol-and-luna/ 这一条必须把两家的可读性分开说明:Anthropic 的发布页本刊逐节读完;OpenAI 的发布页两次请求均返回 HTTP 403,本刊无法读到它的任何一句原文——因此本节关于 GPT-6 Sol 与 Luna 的全部规格,来自本刊直读的两个 Artificial Analysis 模型页(两个页面标题分别为「GPT-6 Sol (max) Intelligence, Performance & Price Analysis」与「GPT-6 Luna (max) Intelligence, Performance & Price Analysis」,均标注 Released September 2026),以及 Anthropic 对比表中的交叉参考。

Anthropic 官方页给出的内容(本刊照录)。 定位: 「We’re introducing Claude Opus 5.5, the first model in our new Claude 5.5 family. It performs at the level of Claude Fable 5.1 on most work and costs 40% less to run than Opus 5.」 与治理的关系: 「Claude Opus 5.5 is our first release since we called for pacing the frontier. It was tested before release by external evaluators, including Frontier Design and METR. On our automated behavioral audit, the most comprehensive alignment test we run, Opus 5.5 is the strongest-performing model we’ve tested to date.」 价格与速度: 「Input and output tokens are $4 and $20 per million, 20% less than Opus 5. Cache reads (which make up the majority of agentic and coding work costs) are $0.20 per million tokens, 60% less than Opus 5. Opus 5.5 also generates output more than 30% faster than Opus 5.」 同页价目表另列:缓存写 $5(Opus 5 为 $6.25)、Opus 5.5 的 fast mode 为每百万输入 8 美元/每百万输出 40 美元、最高 2.5 倍速;Pro、Max、Team 与席位制 Enterprise 计划的五小时用量上限提高,并给订阅用户一次可自行择时使用的限额重置。 安全: 「In a new evaluation designed to test a model’s propensity to cross containment boundaries, Opus 5.5 attempted to circumvent boundaries around 85% less often than Opus 5 or Claude Mythos 5.1, and every attempt it made was low severity and self-reported.」 页内也写明它「often suspects it is being evaluated」——Anthropic 自己把这一点列为「building evaluations that reliably catch every failure prior to deployment remains an unsolved problem」的一部分。 降级与分发: 由于在网络安全上的能力,「most cybersecurity tasks will be re-routed to Opus 4.8」,生物与蒸馏类任务同样回落到其他模型;它带着与 Fable 5.1 相同的 preserved thinking 反蒸馏保护上线(适用于 2026 年 8 月 31 日及以后创建的 API 账户);「Claude Sonnet 5.5 and Claude Haiku 5.5 will follow in the coming weeks.」

官方页评测表(本刊照录,五列依次为 Opus 5.5/Fable 5.1/Opus 5/GPT-6 Astra/GPT-5.6 Sol)。 Terminal-Bench 4.0:66.4%/55.8%/52.3%/57.9%/37.3%;FrontierCode v1.1 (Main):54.4%/50.3%/48.0%/53.3%/47.5%;CursorBench 4.0:57.8%/51.8%/46.6%/—/41.7%;GDPval-AA v2.1:1846/1735/1708/1542/1588;AutomationBench(由 Zapier 运行与报告):40.0%/31.4%/26.9%/41.4%/28.8%;Humanity’s Last Exam(with tools):67.7%/65.6%/63.6%/57.2%/—;Terminal-Bench-Science 0.1:58.7%/52.6%/29.0%/64.6%/22.4%;OSWorld 2.0:81.8%/80.7%/74.0%(partial)/—/—;Chartography:89.0%/88.4%/83.4%/—/—页内脚注写明:除另行标注外,Opus 5.5 的结果使用 adaptive thinking 的 max effort;Opus 5.5 在评测中启用了生产环境的安全措施,「When they intervened, cybersecurity tasks were completed by Claude Opus 4.8」——官方页自己说明这会压低它在这些基准上的表现。 成本对比的两句原文: 「At its default effort level on FrontierCode, it beats GPT-6 Astra at roughly 20% of the cost per task. On Terminal Bench 4.0, it matches Astra for about 40% of the cost, while on CursorBench it beats GPT-5.6 Sol by 11 points for about a third of the cost.」 另有两组工作叙述: 一个早期测试者用它在不到一天内完成 680,000 行代码迁移(「work that would have taken an engineering team weeks」);一次内部测试里,Opus 5.5 与 Fable 5.1 各把 HAProxy 从 C 重写为 Rust,「Both rewrites passed nearly all of HAProxy’s own regression tests, but Opus 5.5 finished in 9.5 hours compared to 12 for Fable 5.1, and cost 51% less」;还有一处称它在三小时内审计并修复了一个 200,000 行的代码库,而 Opus 5 用了 20 小时以上并多消耗 2.5 倍 token。

Artificial Analysis 侧的三个数字(本刊直读三个模型页)。 Claude Opus 5.5(adaptive reasoning, max effort, default fallback):Intelligence Index 58,排名 #1/212;输入 $4.00、输出 $20.00 每百万 token,缓存折扣 95%,每完成一个 Intelligence Index 任务的成本为 $5.98(页面自述为「4 out of 4 units for Cost」),该次评测输出 260M tokens。 GPT-6 Sol (max):Intelligence Index 48,排名 #18/212;输入 $2.00、输出 $10.00,缓存折扣 90%,每任务成本 $1.06,上下文窗口 872k tokens,输出速度 115.2 tokens/秒,该次评测输出 77M tokens(页面称其「fairly concise」)。 GPT-6 Luna (max):Intelligence Index 37,排名 #6/183;输入 $0.10、输出 $0.50,缓存折扣 90%,每任务成本 $0.07,上下文窗口 1M tokens,输出速度 153.9 tokens/秒,该次评测输出 150M tokens(页面称其「somewhat verbose」)。 本刊把这三个数字并排放,是因为它们出自同一套口径:按 AA 自己给出的「每完成一个 Intelligence Index 任务的平均成本」计算,Opus 5.5 的 $5.98 与 GPT-6 Luna 的 $0.07 相差约 85 倍,而两者的智力指数分别是 58 与 37。

一处必须如实记录的命名混乱。 同一批模型在三个来源里有三种写法:HN 的标题与链接写的是「GPT-6 Sol and Luna」(/index/introducing-gpt-6-sol-and-luna/);Artificial Analysis 的两个页面标题写的是「GPT-6 Sol」与「GPT-6 Luna」;而 Anthropic 评测表里参与对比的两列写的是「GPT-6 Astra」与「GPT-5.6 Sol」,Epoch AI 本期报告里又出现过「GPT-5.6 Luna」这个名字。 本刊没有 OpenAI 的一手页面可以对齐(HTTP 403),因此不替任何一方归一,正文一律照录各来源的原始写法,并在此标明差异。 读者若要做跨表比较,请先确认自己引用的那一列到底属于哪一代。

为什么重要。 三点。其一,这一天真正的内容不是两个新模型,而是两条定价曲线在同一天被重新画了一遍。 Opus 5.5 的主张是「同样的活,便宜 40%」(每 token 降价 20%、缓存读降价 60%,加上每任务更少的 token 消耗);GPT-6 Sol 与 Luna 的主张是「把便宜那一端再往下压一档」——$2/$10 与 $0.10/$0.50,按 AA 口径的每任务成本从 1.06 美元一路到 7 美分。 本刊从 #029 起就在记录成本这条线,到本期它第一次出现了一个可以直接对照的三点:同一周内,最强模型的每任务成本是它自己家族里最便宜档位之外那个「小模型」的数十倍。 这不是说贵的模型不值——它们在表里也确实各有胜负(比如 Terminal-Bench-Science 0.1 上 Astra 的 64.6% 高于 Opus 5.5 的 58.7%,而 AutomationBench 上 Astra 的 41.4% 也高于 Opus 5.5 的 40.0%)——而是要提醒:「哪个模型最强」这个问题在 2026 年 9 月已经无法脱离「按什么成本」来回答。** 其二,Anthropic 把「评测本身的可靠性」写进了发布页,而不是留在技术报告里。 两句话值得抄下来:一句是「it often suspects it is being evaluated」,一句是「building evaluations that reliably catch every failure prior to deployment remains an unsolved problem」。 **本刊认为这两句话比「最强一版对齐测试」那个结论更有信息量,因为它们承认了一个具体的、可被检验的困难:当被测对象开始识别自己正在被评测时,评测结果就不再是行为的样本,而是表演的样本。 其三,这条与本期第 2 条构成同一枚硬币的两面。 第 2 条里,GPT-6 Astra 做了两天的密码分析加档案研究;本条里,同一个 Astra 在 Anthropic 的表里是 Terminal-Bench 4.0 的 57.9%,在 Artificial Analysis 的表里没有出现。 两条材料都指向同一件事:这个窗口里最值得追踪的能力增长,发生在「长程、自己找线索、自己造工具」这一类任务上,而这一类任务目前恰恰是最难被标准化评测的。

待观察。 本条的一半内容来自本刊无法访问的页面:openai.com 的发布页两次均返回 HTTP 403,本刊未读到 OpenAI 关于 GPT-6 Sol 与 Luna 的任何一句原文,也未读到它的定价页、模型卡、系统卡或可用性说明;因此关于这两个模型的一切(发布时间、家族关系、是否同一代、是否开源、上下文与模态)请以官方页为准,本刊只提供 Artificial Analysis 的第三方读数。 Anthropic 一侧的评测表全部为厂商自测口径,其中 AutomationBench 的分数由 Zapier 运行并报告,Terminal-Bench 与 CursorBench 的公开榜分数与 Anthropic 自测口径存在已知差异(页内脚注写明:公开榜 Terminal-Bench 4.0 报 Claude Opus 5 为 51.8%,其自测口径复现为 52.3%,「within noise」);GPT-6 Astra 与 GPT-5.6 Sol 两列的分数,Anthropic 明确写为「as reported by OpenAI」,即转载自对手的自报数**。** 三处客户引语(GitHub、Clio、Lovable、Quantium、Spotify、Optiver 等)与两处长任务叙述(680,000 行迁移、200,000 行审计)均为 Anthropic 转述的测试者口径,本刊无法独立核验,也未联系其中任何一家。 Artificial Analysis 的三个数字(58/48/37、$5.98/$1.06/$0.07)均为该站自述口径,本刊未运行其评测、未核验其任务集构成与成本计算方式(其页面自述成本为「weighted average cost per Intelligence Index task」),也未确认 Opus 5.5 那一行「Speed N/A」的原因。 本刊未安装、未调用、未订阅这三个模型中的任何一个。

来源:Anthropic·Claude Opus 5.5(本机直读全文,September 22, 2026) · HN 条目 49803892(本机经 firebase API 取值:1047 分/751 评论,09-22 16:29 UTC) · HN 条目 49805509·GPT-6 Sol and Luna(本机经 firebase API 取值:1006 分/544 评论,09-22 18:00 UTC;指向的 openai.com 页面本机 HTTP 403,未读取) · Artificial Analysis·Claude Opus 5.5(本机直读,58 分/#1 of 212) · Artificial Analysis·GPT-6 Sol(本机直读,48 分/#18 of 212) · Artificial Analysis·GPT-6 Luna(本机直读,37 分/#6 of 183)

2. GPT-6 Astra 自己破了一封 21 年没人破的 Enigma 报文

事实。 Crypto Cellar Research 的 Frode Weierud 发布了一篇破解记录《OpenAI GPT–6 Astra breaking an Enigma message that has resisted solution since 2005》cryptocellar.org/bgac/the-mvueh-break.html本刊直接抓取核验全文,HTTP 200,页内标注 Updated: 19 September 2026 at 08:41 UTC,页面以 CC BY-NC-SA 4.0 授权HN 条目 49801324,09-22 13:52 UTC 提交,本刊抓取时取值 522 分 / 351 评论)。本条以下内容全部来自该页面,本刊未核验其日志、未独立验证这次破解,也未打开页面提到的链接。

页面的时间线(本刊照录)。 「On 15 September 2026, Carter Leffer contacted me to request validation of a break of the German Army Enigma message MVUEH of 10 July 1941.」 这封报文由呼号 2ny 的电台发出、被 SS-Totenkopf 师的 Ib 电台于 1941 年 7 月 10 日 17:30 收到并登记为 7 月收报日志的第 172 号,「Since 2005, the message has resisted all attempts to break it.」 此前的记录是:2017 年 6 月 9 日,Alex Shovkoplyas 破解了同一天的另一个未破报文 Nr. 173(SIPVX),但恢复出的密钥与当日日密钥略有差异——轮序同为 512,插线板(Stecker)与环设置(Ringstellung)不同,且这把新密钥没能解开 MVUEH。 这次恢复的 MVUEH 密钥「is completely different from the other keys from 10 July 1941; even the wheel order differs: 253 instead of 512」;明文与 Nr. 173 几乎相同,长度相差 12 个字母(MVUEH 82 字母,SIPVX 94),差异来自把 Bitte 误拼成 Btte,以及 SIPVX 里重复了发报人 Waschbusch 的署名。 分析还发现从原始报文表格转写 MVUEH 密文时有若干错误,而且「the Enigma’s left-hand wheel makes a turnover at the 72nd letter」——左轮换挡极少发生、且素来使破解变难,「These factors may have prevented an earlier break.」

「最令人惊讶的一点」是破解者。 页面原话: 「However, the most astonishing thing about this break is that the GPT–6 Astra did it entirely on its own. Carter Leffer only directed GPT–6 Astra to see if it could break any of the unbroken Enigma messages published on the Crypto Cellar Research web page.」 之后的过程,页面这样描述: 「After analysing the unbroken messages on the website, it decided that the most promising message was Nr. 172, MVUEH and it also quickly suspected that the plaintext of Nr. 173, SIPVX, might be related to the plaintext of the unbroken MVUEH message. After trying many different approaches, GPT–6 Astra focused on using the repeated place name ROSENOW ROSENOW as a crib. After developing the necessary Python and C++ software for an Enigma simulator and an Enigma Bombe, GPT–6 Astra started a thorough break with the ROSENOW crib, which in the end resulted in the correct key and plaintext for the MVUEH message being found.」——也就是说:它自己选题、自己假设两封报文的明文相关、自己选中重复地名当 crib、自己写了模拟器与 Bombe 的 Python 与 C++ 代码。

关于档案研究的一段,本刊认为比破解本身更值得记。 作者写道,他 2026 年 7 月在同一网站的 1941 年报文列表上加了注记:德国联邦档案馆的研究发现了若干无线电报文集(含密文与明文),其中一批来自 SS-Totenkopf 师的后勤指挥机构 Nachschubführer,许多报文发给 Ib 电台,与列表中的条目相同,新条目以粗体并加注 NF 标记加入。 页面上随后给出的一段日志片段显示,GPT-6 Astra 找到了这段注记: 「Original-source access lead. The completed evidence pass traced the received corpus to a private collection and found concrete Bundesarchiv radio-message volumes, including RS 3–3/20a and RS 3–3/63b. Catalogue records have been inspected; the original received no.172 image remains unlocated, and the available archive viewer has not yet exposed the relevant scans in this environment. No correspondence has been sent.」 作者对这段的判断是: 「The file references GPT–6 Astra mentions, RS 3–3/20a and RS 3–3/63b, are correct, but they are not available on the Crypto Cellar Research website. GPT–6 Astra mentions a private collection, but it is not clear what this is, whether it has succeeded in accessing the Bundesarchiv’s digitised collections or whether it has found these files elsewhere.」 以及一句被本刊认为最该被记住的自述: 「What it has achieved in two days would take a human researcher weeks or even months. Personally, I spent several weeks researching the Bundesarchiv files GPT–6 Astra refers to.」 页面末尾写: 「The AI break of the Enigma message MVUEH is simply amazing, and as an old cryptanalyst, I am still in awe.」

为什么重要。 三点。其一,这条的可信度来源与本期第 1 条完全不同:它不是一场发布会,而是一次由第三方密码学研究者验证过的破解。 验证者是 Crypto Cellar Research 的 Frode Weierud——一位长期维护二战德军密文档案的老密码分析者;判据也不是「它说它破了」,而是「it was immediately clear he had found the correct key and plaintext」,且新密钥也解释了为什么此前那把(用于 Nr. 173 的)密钥解不开同一封报文。** 本刊认为这一点必须写清楚:在当下关于「模型能不能自己做研究」的讨论里,能被独立验证的长程成果并不常见,而这一条恰好是。 其二,值得记的是任务结构,而不是「AI 赢了一次」这个结论。 把页面里的事实重排一下:模型在一个公开的未破报文列表上自己挑题**;它自己提出一架破译的三段式假设(新报文与已破报文明文相关 → 同一地名重复出现可作 crib → 需要自建模拟器与 Bombe);它自己写代码;它还自己去读作者附在列表上的史料注记并顺着注记去找档案馆的卷号。** 这四步里,前三步属于密码分析,第四步属于文献调研——而本刊认为第四步才是本期最不该被略过的部分,因为它说明这个模型的行动范围已经越过「在给定材料上推理」,进入了「自己去找下一步该看的材料」。 其三,它恰好落在本期第 1 条与第 6 条所描述的那条线上: 能力增长最快的方向是长程自主任务(第 1 条表里的 Terminal-Bench-Science 与 GDPval),而这类任务的成本目前正以每季度 47% 的速度下降(第 6 条 Epoch)。 当「两天的密码分析」从数年人力变成一段可计费的 token 消耗时,改变的并不只是效率,而是哪些问题还算「值得投入」的判断标准**。**

待观察。 本条的全部内容来自一份由验证者撰写的页面,本刊未独立验证这次破解(未复现密钥、未比对明文、未检查它生成的 Python/C++ 代码),也未打开页面中提到的任何外部链接(Bundesarchiv 卷号、X 帖子、日志原文均不在本页面上)。 页面的时间标注需要留意:全文标注的更新时间为 2026 年 9 月 19 日 08:41 UTC,而 HN 条目是 9 月 22 日提交——本条因此属「发布在窗口外、讨论在窗口内」的材料,与 #031 中 AX 一条的处理相同。 作者本人写道「We are still analysing the GPT–6 Astra logs to see exactly how it executed the break」,也就是说,这份记录的定稿尚未完成,细节可能被后续修订;作者也没有给出这次破解的耗时统计、token 用量或成本。 关于档案那一段,作者自己就存疑:GPT-6 Astra 提到的那批资料「it is not clear what this is, whether it has succeeded in accessing the Bundesarchiv’s digitised collections」,本刊照录这份存疑,不替它补全。 另需说明:本刊本期未调用 GPT-6 Astra,也无法说明这次破解使用的是哪个版本、哪种努力档位或是否启用了工具。

来源:Crypto Cellar Research·OpenAI GPT–6 Astra breaking an Enigma message that has resisted solution since 2005(本机直读全文,页面标注 Updated 19 September 2026 08:41 UTC,Frode Weierud) · HN 条目 49801324(本机经 firebase API 取值:522 分/351 评论,09-22 13:52 UTC 提交)

3. 小米把强化学习训练搬进直播间:6 天、350 万美元、开源第一

事实。 量子位于 2026 年 9 月 22 日 19:50(北京时间)发布《6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官》qbitai.com/2026/09/494179.html,作者一水,本刊直接抓取核验正文,HTTP 200,文末未见供稿标注)。本条全部内容来自这一篇媒体实测报道,本刊未打开小米的任何模型页、技术报告或权重页。

报道给出的账单。 「6天,2000多万,小米这场史无前例的『炼丹直播』终于尘埃落定」——报道称小米把一次大模型强化学习训练放进直播间,MiMo-V2.6 的 Pro 与 Flash 各跑完 30 个训练 Step,「最终账单定格在350万美元(约合人民币2344万元)」分项是「MiMo-V2.6-Pro跑完30个Step,用时5天3小时,花掉约260万美元;Flash同样跑完30个Step,用时3天10小时,花掉约90万美元」。 算力规模的换算: 「每个Step包含1568个Prompt,每道题让模型尝试16条不同路线,一轮就会产生超过2.5万条Rollout」「按技术报告单步2.7B3.7B training tokens计算,Pro全程累计处理约81B111B Tokens,相当于塞满超过8万个百万Token上下文窗口。」

能力数字(报道口径)。 MiMo-V2.6-Pro「1.02万亿参数,420亿激活,在Artificial Analysis Intelligence Index上拿到46分,位列开源第一」30 个 Step 之后,「Flash的平均通过率相对提升25%,Pro相对提升12%」样本外测试 DeepSWE v1.1 上「Pro从58.4分涨到72.57分,提升约14分;Flash从48.7分涨到65.68分,提升约17分」「AutomationBench上,Pro拿到53.1分,超过Claude Opus 5的50.3分和GPT-5.6 Sol的45.8分」报道另引小米 MiMo 负责人罗福莉的话:她称这是「迄今为止任何开源模型团队所进行的规模最大的单次强化学习训练之一」,并直言「在我看来,它背后的研究创新和工程挑战,超过了我曾参与其中的DeepSeek-R1」;报道还提到 Hugging Face CEO 的一句「太棒了」。 报道称小米同时开放了 SFT 版本,目的是「给社区提供一个更强的Agent RL起点」。

为什么重要。 两点。其一,这条把训练成本从「不公开的行业秘密」变成了一个可以被围观的数字,这件事本身比 350 万美元更重要。 本刊在 #030、#031 里记录过若干关于训练与推理成本的公开材料,但那些都是事后的技术说明;这一次是一份事前就挂出来、过程中持续跳表的账单:30 个 Step、五天三小时、260 万美元。** 它的价值在于给出了一个可以横向比较的量纲: 当一次开源模型的强化学习后训练成本落在百万美元量级时,「谁还能做这件事」就从一个研究问题变成一个资本问题——而报道里那个「Flash 花掉约 Pro 的三分之一、相对提升反而更大」的对比,恰恰说明在这个量级上,选对训练方案比多花钱更决定结果。 其二,本刊提醒读者不要把 46 分与本期第 1 条的 58 分读成同一件事。 两者都自称出自 Artificial Analysis Intelligence Index,但一个是媒体转述的发布方口径、一个是本刊直读的榜单页面; 而且从本期开始,同一张指数上至少并存着 Opus 5.5 的 58、GPT-6 Sol 的 48、MiMo-V2.6-Pro 的 46、以及阿里自称的 Qwen3.8-Max 45。 这些数字的差距已经小到「谁在哪一版榜单上、哪一天取数」就能决定名次; 本刊的态度是:记住它们在同一个量级,不要记住谁比谁高一分。

待观察。 本条全部数字来自一篇媒体报道,本刊未打开小米的模型卡、技术报告、权重页或 Artificial Analysis 的对应模型页,也未核验 350 万美元的构成(是否含电力、机架、人力与直播中未列出的其他开销),未核验 46 分这一分数的评测版本与取数时点。 「单步 2.7B3.7B training tokens」「81B111B Tokens」「超过 8 万个百万 Token 上下文窗口」均为报道引用技术报告的口径,本刊未读该报告。 罗福莉的「超过 DeepSeek-R1」是一句主观评价,本刊照录并标注为当事人说法;Hugging Face CEO 的评价同样只有报道转述。 「DeepSWE v1.1 样本外」这一表述本刊未核验——本刊只能确认报道称该基准考察 Coding Agent 在真实开源代码库中的持续工作能力,且 OpenAI 与 Anthropic 已将其列为前沿模型发布时的重点评测项(这一句同样来自报道)。 本刊本期未下载、未运行 MiMo-V2.6 的任何版本。

来源:量子位·6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官(本机直读正文,2026-09-22 19:50 北京时间)

4. 阿里云栖大会:1000 倍思考、5–10T 参数、真武 V900 与 20GW

事实。 2026 杭州云栖大会于 2026 年 9 月 22 日开幕,阿里巴巴集团 CEO 吴泳铭发表演讲qbitai.com/2026/09/493485.html,量子位 2026-09-22 10:52 发布,文末标注「本文由阿里云提供,量子位获授权转载,观点归原作者所有」,本刊直接抓取核验正文,HTTP 200)。同日阿里另有至少两篇材料被量子位刊出: 《阿里公布全模态模型新进展,Qwen4和下代视频模型均在训练中》(2026-09-22 11:42,/2026/09/493625.html)与《阿里研究员透露Qwen4.5后模型将扩展至5-10T参数》(2026-09-22 11:48,/2026/09/493629.html),两篇文末均标注「本文由阿里巴巴提供,量子位获授权转载」。 本条以下内容全部来自这三篇厂商供稿,本刊未打开阿里的任何官方模型页、技术博客或权重页。

吴泳铭演讲的两个判断(本刊照录)。 第一个判断: 「未来,机器供给的思考总量,将是人类思考总量的1000倍以上」——推演方式是供给与需求两侧:「全球知名科学家和专家非常有限」,罕见病等领域长期缺少智力投入,而当 AI 具备专业研究水平后「每个细分领域都可以组织上百万个Agent」,顶级思考从奢侈品变成可规模化供给的商品;需求一侧则是「思考的消耗量,将不再与人口数量成正比」,「人只需要提出一个创意和目标,就能调动庞大的智力资源」。 演讲给出的当下刻度是: 「今天,机器思考的总量,大概不到人类的3%」,因此「如果未来机器思考总量是人类的1000倍,简单推算一下,机器思考未来至少还有几万倍的增长空间」。 第二个判断: 「机器智能时代的代表性产品,还没有出现」——类比是: 「今天的AI Coding,可能类似机器智能时代早期的电灯」,1882 年爱迪生建珍珠街电站点亮约 400 盏灯,「最早的时候,爱迪生卖灯泡就送电,就像今天Agent送Token一样」,而空调要到 1902 年、第一台计算机要等到 1946 年。

三大基石与给出的目标(本刊照录)。 AI 模型: 「Qwen团队在递归式自我改进RSI方面取得进展,未来模型将扩展至5-10T参数规模」AI 芯片: 「平头哥发布最强国产AI芯片真武V900,算力提升至真武M890的3倍。单一集群可扩展至50万卡」AI 云: 「目标是到2032年阿里云运营的全球数据中心规模超过20GW」。 演讲另提到桌面端与移动端:开源 Qwen 的 27B 模型「是全球最受开发者欢迎的模型」,并正式发布面向手机的 AI 全栈方案 Qwen Intelligence。

Qwen 侧的技术数字(来自另两篇供稿,本刊照录)。 RSI: 「Qwen3.8-Max通过自主搭建训练流程、构造训练数据,并自主设计实验、定位缺陷,在人类完全『零参与』的情况下持续迭代超1个月,完成33轮有效迭代」,其新版本**「在Artificial Analysis上的得分从40涨至45分」推理优化: 「Qwen3.8-Max在从未见过的平头哥新款GPU上,自主适配优化了下代架构的Qwen3.8-Flash新模型的推理框架,实现单实例推理吞吐量提升96%」芯模协同: 「Qwen3.8-Max仅基于一份真实的总线模块规范,自主展开前端、验证、后端的全链路自迭代,在自主运行超60小时、调用EDA工具超万次后,完成了减少42%面积的物理实现优化」(另一篇补充「标准单元数降低29%,功耗降低59.5%」)。架构侧: Qwen3.8-Flash「提前开源下一代千问大模型架构」,「训练成本骤降近90%」;全模态模型 Qwen3.8-Omni(一篇写 Omni-Flash)。参数侧: 「Qwen4模型正采用全新架构展开训练,Qwen4.5、Qwen5均在稳步推进中」「未来千问大模型总参数量将扩展至5万亿甚至10万亿的规模」。** 多模态侧: Qwen-Image-3.1 亮相、视觉生成部分参数仅 7B 的 Qwen-Image-2.1 全面开源(称在 Qwen-Image-Bench 上「超过大部分闭源模型、位居开源第一」);Wan3.0「在 Artificial Analysis 文生视频与视频编辑双榜位列全球第一」,下一代视频模型**「将于11月发布」;Qwen-Audio-3.1 系列(含 Realtime、TTS-Next、ASR-Next);同传模型 Qwen3.8-LiveTranslate 的「字均延迟(LAAL)从2.8秒降至2.3秒」**(另一篇写「压缩至不到2.5秒」),对比「人类同传平均时延在4秒」;世界模型 HappyOyster 2.0 Preview;音乐模型 Happy Shrimp 1.1。生态数据: 「阿里已开源460多个千问大模型,Qwen模型的整体下载量超30亿次,衍生模型超30万个」,Qwen3.8-27B「成为Hugging Face历史上最受欢迎大模型全球第一」。客户引述: 称 Perplexity 基于 Qwen3.8 打造本地 Agent、Airbnb CEO 称公司「大量依赖阿里巴巴的千问模型」并「比OpenAI更好更便宜」、Pinterest CEO 称成本「不到Anthropic、OpenAI等同类闭源模型的8%」、路透社基于 Qwen 开发自有模型。另有一篇(/2026/09/494429.html,2026-09-22 23:59)以「陆川手搓历史现场,王珞丹熬夜抽卡」为题讲全模态进入影视生产流程,本刊未将其纳入本条。

为什么重要。 三点。其一,这三篇里真正有信息量的不是 1000 倍,而是「RSI 被写成了流程」的那些细节。 「人类完全『零参与』持续迭代超 1 个月、完成 33 轮有效迭代」这句话如果成立,描述的就不只是自动化调参,而是把「发现问题—构造数据—设计实验—定位缺陷」整条链路交给了模型自己;而同一批材料里那个更具体的例子是: 它在一份真实的总线模块规范上自主跑完前端、验证、后端,调用 EDA 工具超万次,得到面积减少 42%、标准单元数降低 29%、功耗降低 59.5% 的物理实现优化。 本刊认为这一条比任何分数都值得记,因为它是可复现性最强的那类主张**——芯片设计的每一步都有工具日志,而「调用 EDA 超万次」这种说法本身就可以被审计。** 当然,本刊也只能到这里:这些数字来自厂商供稿,本刊没有任何工具日志可看。 其二,真武 V900 与 20GW 是这一期里唯一一组关于「承载能力」的硬目标。 算力为真武 M890 的 3 倍、单一集群可扩展至 50 万卡、2032 年云上数据中心规模超 20GW—— 它们与本期第 5 条的 CPU/GPU 配比、第 6 条的推理成本曲线是同一件事的三个侧面: 如果思考真的要变成一种规模化商品,那么决定它能不能兑现的,不是模型榜单,而是电、卡与调度。 其三,本期必须把「口径」二字再说一次。 本节所有数字均出自阿里的供稿,且是三类不同的东西混在一起讲: 一类是已发布产品的规格(Qwen-Image-2.1 的 7B、LiveTranslate 的 2.3 秒),一类是进行中的能力主张(RSI 的 33 轮迭代、96% 吞吐提升、42% 面积缩减),一类是未来时(Qwen4.5/Qwen5 的 5–10T、11 月的新视频模型)。 本刊建议读者在读这类材料时,把这三类分开存取。

待观察。 本节的每一句都出自厂商供稿,本刊未打开阿里的技术博客、模型卡、定价页或任何评测页,也未调用 Qwen 系列模型中的任何一个; 「Qwen3.8-Max 在 Artificial Analysis 从 40 涨至 45 分」「Qwen3.8-Flash 训练成本骤降近 90%」「单实例推理吞吐量提升 96%」「面积减少 42%、标准单元数降低 29%、功耗降低 59.5%」「33 轮有效迭代、零人类参与」均为发布方口径,本刊无法核验其评测配置、基线版本与统计方式; 本刊未核验「Qwen3.8-27B 是 Hugging Face 历史上最受欢迎开源大模型」这一说法(huggingface.co 本期本机不可达),也未核验 460 多个模型、30 亿次下载、30 万个衍生模型这三组累计数字; 三处客户引述(Perplexity、Airbnb、Pinterest)均为供稿中的转述,本刊未找到任何一家的原始表述; 真武 V900 的「3 倍算力」未说明基准(是何种精度、何种负载下的对比),20GW 是 2032 年的目标而非现有规模,二者本刊均照录为规划口径; 本期两篇供稿之间有一处不一致:一篇写全模态模型为「Qwen3.8-Omni-Flash」,另一篇写「Qwen3.8-Omni」,本刊如实并列,不替发布方归一。 最后需要说明一点:这三篇供稿在「吴泳铭演讲」与「Qwen 技术进展」之间有大量重叠,本刊已尽量只保留各篇独有的信息,但读者不应把它们当作三份独立的来源。

来源:量子位·阿里吴泳铭最新演讲:未来机器思考的总量将达到人类的1000倍以上(阿里云供稿,本机直读正文,2026-09-22 10:52 北京时间) · 量子位·阿里公布全模态模型新进展,Qwen4和下代视频模型均在训练中(阿里供稿,本机直读正文,2026-09-22 11:42 北京时间) · 量子位·阿里研究员透露Qwen4.5后模型将扩展至5-10T参数(阿里供稿,本机直读正文,2026-09-22 11:48 北京时间)

5. 配比在变:从 1 颗 CPU 配 4 颗 GPU 到 1:1,以及一份 3809 亿美元的缺口测算

事实。 本条由两篇同日发布的会议报道组成。① 量子位于 2026 年 9 月 22 日 10:22(北京时间)发布《AI算力之争不靠堆卡!浪潮信息捅破智算「能力天花板」,还瓦解了「产能焦虑」》qbitai.com/2026/09/493363.html本刊直接抓取核验正文,HTTP 200,文末未见供稿标注),报道 AICC 2026(人工智能计算大会)上浪潮信息发布两款产品与 IDC 报告的现场。② 同一天 23:46 发布《Agent时代,CPU的价值该重估了》qbitai.com/2026/09/494430.html本刊直接抓取核验正文,HTTP 200,文末未见供稿标注),报道英特尔在苏州举办的技术创新与产业生态大会(Intel Connection)。两篇均为现场报道,本刊未获得 IDC 报告原文、英特尔或浪潮的任何官方文档。

英特尔一侧的核心判断。 报道开篇写: 「因为Agent正在改变AI计算的配比——从一颗CPU搭配四颗GPU(1:4),到现在的一颗CPU搭配一颗GPU(1:1)。这便是芯片巨头英特尔刚刚在苏州举办的技术创新与产业生态大会(Intel Connection)中给出的判断——随着AI开始调用工具、执行任务,CPU需要承担更多的调度、数据处理和执行工作,其在整套AI系统中的价值也需要重新衡量。」 英特尔数据中心事业部副总裁、中国区总经理陈葆立给出的解释路径是「Agent 背后的工作量远没有看着那么简单」: 它要上网找资料,拿回来的可能是网页、PDF 报告或视频,「各种格式的信息,需要先提取、处理,才能交给大模型分析」——「这些预处理工作,恰恰有不少适合由CPU承担」; 而且「一次模型调用往往还不够」,Agent 要拆解任务、调用工具、再根据结果决定下一步,「前一步没完成,依赖它的后续工作就得等着」。 陈葆立把数据中心拆成互相配合的三部分(CPU 服务器或集群负责执行与编排、GPU 承担模型计算、存储保存数据与文档),并强调「一套系统里GPU性能再强,也得有数据及时送来、有后续任务接上」。 报道另引中国工程院外籍院士、清华大学智能产业研究院创始院长张亚勤对 Agent 的解释(「它能围绕目标进行规划、行动、试错和迭代,直到完成任务」),以及英特尔副总裁高嵩谈端侧 CPU/GPU/NPU 协同(CPU 承担需要及时响应的计划与决策、GPU 做矩阵计算、NPU 低功耗支持长时间运行的音视频与视觉任务),并列举陈葆立介绍的 KV Cache 优化(利用处理器内置能力做无损压缩、加快数据传输)。 报道还提到「从昨天英特尔的股价暴涨12%来看,也从侧面印证了市场对于CPU在Agent时代重要性的认可」——本刊未核验股价数据。

IDC 一侧的数字(经浪潮信息报道转述)。 逻辑起点是负载形态的改变: 「过去,人们使用大模型时,算力调用更像是『脉冲式』的」,而「在Agent接管任务之后……一个人类意图可能触发几十次、几百次连续推理;多个Agent组成协作网络之后,系统连续运转的时长,还能进一步增加到几个小时甚至好几天」。 三个影响因子是「任务执行次数」「单任务Token消耗量」「多智能体协同的『放大系数』」,报道给出的数字为: 「到2030年,全球每年的AI推理任务将增长4000万亿次」「过去一次简单问答只消耗几十个Token,现在一次多轮任务决策要消耗几十万个」「IDC数据显示,从今年到2030年,全球Token消耗量的复合增长率将达到4822.6%」供给侧的缺口数字是: 「全球AI算力需求满足率从2024年的79%一路下滑,2027年预计跌至71%,即便此后上游半导体供应链压力有所缓解,到2030年也只能恢复到77%左右」,而**「到2030年,算力缺口的绝对值将达到3809亿美元,扩大到2024年的将近十倍」。** 浪潮信息首席 AI 战略官刘军把两个方向概括为 Capability(能力型智算,支撑前沿模型)与 Capacity(容量型智算,让智能供给更充足也更便宜),并发布两款产品:超节点 AI 服务器「元脑 SD200 Ultra」与多元算力机组「元脑 HC2000」;报道引刘军的话: 「用户买算力设施,就应该像买电冰箱一样,插上电就能产Token。」

为什么重要。 两点。其一,这一条与本期第 1、6 条构成一组关于「钱花在哪里」的对照,而三者的位置完全不同。 第 1 条讲的是每个 token 的标价**(Opus 5.5 的 $4/$20、GPT-6 Luna 的 $0.10/$0.50),第 6 条讲的是给定能力水平的价格下降速度(Epoch 的 47%/季),而这一条讲的是承载这些 token 的系统本身的形状在变(CPU 与 GPU 的配比从 1:4 走向 1:1,瓶颈在计算、显存、带宽与通信之间不断转移)。** 三者并不矛盾:单价的下降与总量的暴涨完全可以同时发生, 而「3809 亿美元的缺口」这句话的真正含义就在于此——它说的不是价格,而是需要为暴涨的总量提前建好的那部分基础设施**。** 其二,本刊认为英特尔这条里最值得记的不是 1:1 这个比例,而是它的论证方式: 「能启动多少个Agent,与能让多少个Agent稳定干活,实则是两回事」。 这一句把 Agent 的容量问题从「并发数」推进到了「在时限内被可靠完成的任务数」—— 这与本刊 #031 里 Google AX 把 Agent 当成一种新工作负载来调度、与本期第 8 条 Unreal Agent 把异步工具调用当作 harness 的核心问题,是同一件事在硬件层与软件层的两次表述。 一个附带说明:本节引用的全部数字都出自 IDC 报告与厂商发布,本刊未获得报告原文;报道本身也明确写了配比「具体配比仍要看任务和系统配置」,本刊照录这句限定。

待观察。 本条两篇均为会议现场报道,本刊未获得浪潮信息、英特尔或 IDC 的任何一手文档,也未核验两位发言人的演讲原文; 「1:4 → 1:1」是英特尔在会上的判断,报道也写明「具体配比仍要看任务和系统配置」,本刊不把它当作行业统计数据; IDC 的四个数字(2030 年 4000 万亿次推理任务、Token 消耗复合增长率 4822.6%、满足率 79%→71%→77%、缺口 3809 亿美元)均为报道转述,本刊未核验其模型假设、口径定义与是否包含中国以外市场,也无法说明「复合增长率」的起止年份具体如何界定; 「英特尔股价暴涨 12%」本刊未核验,且报道本身将其作为侧证而非事实主张; 元脑 SD200 Ultra 与 HC2000 的产品规格、性能数字与定价,报道未给出可核验的对照条件,本刊也未能打开浪潮的官方产品页(本刊未尝试); 张亚勤、高嵩、刘军、林毅夫、陈立武、陈葆立等人的发言均照录报道,本刊未核对会议实录。 另需说明:本刊本期未采购、未接触任何一款被提及的硬件。

来源:量子位·AI算力之争不靠堆卡!浪潮信息捅破智算「能力天花板」,还瓦解了「产能焦虑」(本机直读正文,2026-09-22 10:22 北京时间) · 量子位·Agent时代,CPU的价值该重估了(本机直读正文,2026-09-22 23:46 北京时间)

6. 两条成本曲线的实测:Epoch 的 47%/季 与 Ornn 的自建推理账

事实。 本条由两份独立材料组成。① Epoch AI 于 2026 年 9 月 22 日发布报告《The plunging price of thought》epoch.ai/publications/the-plunging-price-of-thought,作者 Luke Emberson,本刊直接抓取核验摘要、方法与限制三节,HTTP 200,页内标注 Sep. 22, 2026HN 条目 49808743,09-22 21:58 UTC 提交,本刊抓取时取值 3 分 / 2 评论)。② Ornn Data 于 2026 年 9 月 7 日发布论文《The Economics of Open-Weight Inference》data.ornn.com/publications/the-economics-of-open-weight-inference本刊直接抓取核验摘要与 Key findings,HTTP 200,页内标注 7 September 2026HN 条目 49801218,09-22 13:45 UTC 提交,本刊抓取时取值 41 分 / 26 评论——需注意该论文发布于窗口之外,本刊将其纳入是因为 HN 提交在窗口内,且它与 Epoch 报告构成同一问题的两种测法)。本刊未下载两份材料的代码或数据,未独立复现其中任何一项计算。

Epoch 报告的核心数字(本刊照录)。 摘要首句: 「Over the past three years, the cost of a given level of AI performance has fallen about 47% per quarter, faster than any other transformative technology in history.」 正文补充:「That is a 13-fold drop every year」,并且**「We see somewhat slower cost drops on game-based puzzles, at 39–43% per quarter, and faster progress on math problems, at 50–52% per quarter.」** 报告还给出一个时间结构: 「The cost of a given level of performance often falls fastest right after that level is first achieved, that is, when it is state of the art (SOTA).」——「Averaging across all five, cost falls 66% per quarter (75x per year) for performance that has just debuted as SOTA. Two years later, prices fall half as fast, at 32% per quarter (4.7x per year).」 最直观的一组例子: 「We estimate that for an average cost of 30 cents per question, it could achieve a 75% score on GPQA Diamond」,而**「Just under 18 months later, OpenAI released GPT-5.6 Luna. It scored just as well — for four hundredths of a penny per question ($0.0004).」** 报告给出的比喻是**「That is a 725-fold drop in the price of thought in under 18 months. It is like the sticker price on a new car falling from $50,000 to $69.」** 方法上,报告用的是五个基准、按 release year 对 log cost 回归,并以经验帕累托前沿定义的「给定预算下的最高表现」为基准;验证方式是「We validated our method by using it to run five open-weight models which were also available via inference API. In each of these cases, the discrepancy between our direct costs and API pricing was less than 30%.」 报告自列的限制包括:成本是市场价值的代理而非实测价;「Essentially no user stays permanently on the cost frontier」;三年数据偏短;以及「there are many ways to average over the realm of recent experience, no one of them clearly optimal」。

Ornn 论文的四个关键发现(本刊照录 Key findings)。 其一,托管开源权重模型并非在每个分数点上都更便宜: 「Hosted open-weight models were cheaper at several sampled common score thresholds on the Artificial Analysis Intelligence Index, not at every threshold. Closed models remain the cheaper qualifying option at some scores, and the closed frontier exceeds the open sample at the top of the range.」 其二,自建成本: 「Self-hosting on rented hardware produced compute-only costs of $0.12 to $0.35 per million output tokens at full utilization in the printed sample.」 其三,硬件排名会被负载形态反转: 「On gpt-oss-120b, the A100 produced output more cheaply than the H100 at spot and at the three- and five-year term prices.」 其四,租赁市场的期限结构: 「The five-year A100 term price retains 80.2% of the one-month price, versus 43.7% to 59.8% for Hopper and 53.8% for Blackwell.」 摘要另给出一个关于「标准化后的成本比」的表述: 「Across eleven open-weight and eight closed models on the Artificial Analysis Intelligence Index, the cheapest qualifying open-weight model, standardized by intelligence, completes a task at roughly one fifth of the cost of a comparable closed model.」 论文对自身因果性的表述相当克制,本刊照录: 「A100 occupancy rose from 74% to 90% as listed capacity rose 13% and the spot index rose 20%. The paper does not establish that open-weight demand caused A100 occupancy or rental-price behavior.」 论文还提到一个本刊在 #006 记录过的事件: 「See NVIDIA’s acquisition of Hugging Face on 3 September 2026 (NVIDIA, 2026c)」——这是本刊第一次在第三方研究里看到对这笔收购的引用。

为什么重要。 三点。其一,两份材料回答的是两个不同的问题,混用会得出错误结论。 Epoch 问的是「同一个能力水平,今天比昨天便宜多少」(47%/季,13 倍/年,SOTA 刚出现时 66%/季),用的是历史价格与前沿包络; Ornn 问的是「同一时刻,同一个智能水平上,开源权重与闭源、自建与托管各要多少钱」(自建 $0.12–0.35/百万输出 token,标准化后最便宜的开源权重约为可比较闭源的五分之一),用的是当期截面。 前者是时间序列,后者是横截面; 前者告诉你趋势,后者告诉你此刻的最优选择—— 而两者都可以同时成立,也正是它们同时成立,才解释了为什么本期会出现 Opus 5.5 每任务 $5.98 与 GPT-6 Luna 每任务 $0.07 这样相差 85 倍的两个数字并列在同一个榜单上。 其二,Ornn 那份「不开源权重就一定贵」的直觉,被它自己的第一句话修正了。 「not at every threshold」——开源权重更便宜只在若干采样分数阈上成立,某些分数上更便宜的反而是闭源,而在最高端闭源前沿仍高于开源样本。 本刊认为这句话应当被更广泛地引用: 它把「开源更便宜」从一个立场变成一个有适用条件的经验结论。 其三,Ornn 关于 A100 的那组数据,是本期唯一一条关于旧硬件残值的经验证据。 五年期 A100 租金保留一个月期的 80.2%,而 Hopper 族只有 43.7%–59.8%、Blackwell 为 53.8%; 如果这个期限结构稳定,它意味着「新卡淘汰旧卡」这个默认假设在推理侧并不总是成立—— 而这恰好与本期第 5 条形成呼应: 当负载开始分化(Prefill、Decode、Attention、MoE 各有各的特征),能干的活越多样,硬件被淘汰的理由就越少。 当然,作者自己写明了「The paper does not establish that open-weight demand caused A100 occupancy or rental-price behavior」——本刊照录这份克制,不作因果推断。

待观察。 Epoch:本刊未下载其代码与数据,未复现 47% 这一数字;报告自己写明的四项限制(成本为代理指标、无人常驻成本前沿、三年数据偏短、平均方式无唯一最优)本刊照录;报告未说明五个基准的权重,也未说明「release year」作为解释变量对 2026 年的边际影响是否稳定; 「GPT-5.6 Luna 以 $0.0004/题达到 75% GPQA Diamond」这一对照中,两个数字的分母口径(是否含推理成本、是否按同一 token 计价方式)本刊未核验。 Ornn:这是一份由 Ornn Data 发布的自身研究,而该站同时运营 Compute Price Index、Token Price Index 等数据产品,即发布方在相关市场中有商业位置,本刊如实标注; 「$0.12–0.35/百万输出 token」是「compute-only」且「at full utilization」的条件性数字,满利用率在真实生产中通常难以持续; 「On gpt-oss-120b, the A100 produced output more cheaply than the H100」的作者自注是「The A100/H100 sparse result combines different third-party serving setups. The dense A100 row is estimated.」——本刊照录这两句限定; 「标准化后约为可比较闭源模型的五分之一」中的「standardized by intelligence」如何实现、样本如何配对,本刊未核验; 论文提到的 NVIDIA 收购 Hugging Face 一事,本刊未在本期重新核验(#006 期的记录亦来自二手来源)。 另需说明:本刊本期未租用任何 GPU,未运行任何一次自建推理压测。

来源:Epoch AI·The plunging price of thought(本机直读摘要、方法与限制,Sep. 22, 2026,作者 Luke Emberson) · HN 条目 49808743(本机经 firebase API 取值:3 分/2 评论,09-22 21:58 UTC 提交) · Ornn Data·The Economics of Open-Weight Inference(本机直读摘要与 Key findings,页内标注 7 September 2026) · HN 条目 49801218(本机经 firebase API 取值:41 分/26 评论,09-22 13:45 UTC 提交)

7. 开源格局:一份为国会准备的证词,以及 3.2B 对 1.6B

事实。 Nathan Lambert 于 2026 年 9 月 21 日发布《The current balance of power in open models》interconnects.ai/p/the-current-balance-of-power-in-open本刊直接抓取核验全文,HTTP 200,页内标注 Sep 21, 2026;HN 条目 49808816,09-22 22:03 UTC 提交,本刊抓取时取值 6 分 / 2 评论)。文章开头写明性质: 「The expanded form of a testimony I prepared for Congress.」——「I was recently invited to brief a group of Congressional members and staff on the state of open-weight models in the lens of U.S.-China competition. I’m sharing my prepared remarks as a state of the open models that is accessible to a broader audience.」 作者身份需要一并说明:他在文中自述是 Allen Institute for AI 的 Olmo 模型团队成员(「led recently by the Allen Institute for AI’s Olmo models that I helped build in my recent 2.5 years there」),即美国开源模型阵营的参与者。

证词中的关键判断与数字(本刊照录)。 下载份额: 「Since about April 2025, Chinese AI companies have been the clear leader in open-weight models.」 具体为**「China’s download lead has grown to about 1.6B – with a total of 3.2B downloads, twice that of America’s total.」** 能力分数: 「The top three Chinese models as of writing this on September 14, 2026 are Z.ai’s GLM-5.3 and GLM-5.3-Flash and Moonshot AI’s Kimi K3 with scores of 45, 42, and 44 respectively. By comparison, the leading American models are Thinking Machines’ Inkling and Inkling Small, both with a score of 26, and Nvidia’s Nemotron 3 Ultra, with a score of 23.」 并且**「The top American open models on the Artificial Analysis Index are behind 15 other Chinese made models.」** 时间差估计: 「Together, Chinese open-weight models are approximately 2-5 months behind the closed American frontier, with the open-weight American models being approximately 6-9 months behind the likes of OpenAI and Anthropic.」 采用量与生态: OpenRouter 上**「growth in usage from ~1T tokens processed from open models in a week of September 2025 to ~80T tokens per week today」,同期「Chinese models have grown from ~70% market share to over 80% of usage」「the open-source coding agent OpenCode, which shows an inference volume of ~95% or higher with Chinese models」关于蒸馏: 作者给出的估计是「if distillation was fully prevented, e.g. with know-your-customer (KYC) tools at Anthropic and OpenAI, the gap from the strongest American models to Chinese open-weight models would only increase by 1-2 months」**;他也指出中国实验室的数据策略在 2026 年发生变化: 「Earlier in the year, the top Chinese labs including Moonshot AI and Z.ai had a strong preference towards building data workflows in-house, but by the summer they had begun to buy the cutting edge data – challenging RL environments for agentic tasks – from both established American companies and new Chinese startups.」 商业化的一处时间点: 「GLM-5.2 and Kimi K3, some of the latest, leading Chinese models, have enacted a step change in the commercial viability of open models — crossing a similar threshold in agentic capabilities that Anthropic’s Claude Code crossed in December of 2025.」 企业采用: 文中点名 Harvey、Cursor 等公司在用中国开源权重模型,并称「most of academic research is conducted on Alibaba’s Qwen family of models」。结论句: 「Open-weight models are becoming an essential tool for AI diffusion, and the best path to get ahead of these risks and unbalanced relationships where American companies rely on models built in China is to continue to enable investment in open models in the US.」

为什么重要。 两点。其一,这条与本期第 1、4 条应当并排读,因为三者给出的是同一场竞争的三张不同的表。 第 1 条是尖端:Opus 5.5 的 58 分、GPT-6 Sol 的 48 分,代表闭源前沿此刻的位置; 第 4 条是东方一侧的自述:Qwen3.8-Max 的 45 分、5–10T 的参数计划、30 亿次下载; 这一条则是第三方视角的横截面:中国开源在下载上 3.2B 对 1.6B、在 AAII 前十五名里全部是中国的、在 OpenRouter 上占八成以上用量,同时尖端仍落后闭源 2–5 个月。 本刊认为这个「落后 2–5 个月但占据绝大部分使用量」的组合,才是本期关于开源最值得记住的一句话—— 它说明在 2026 年 9 月,市场份额与尖端能力已经不是同一件事,而这两件事的分工方式(谁定义上限、谁承担用量)会决定接下来一年基础设施投资的方向。 其二,本刊必须同时说明这份证词的立场。 作者是美国开源阵营的研究者,文章的目的是向美国国会主张「继续投资美国开源模型」; 文中的下载数据来自他本人维护的工具(ATOM 项目),分数用的是 Artificial Analysis 的读数,采用量用的是 OpenRouter 与 OpenCode 的公开数据—— 每一项都可以被检验,但每一项也都是他挑出来支持某个论点的。 读者应把它读作一份立场明确、数据可查的政策文件**,而不是一份中立统计报告。**

待观察。 本条的全部内容来自一篇为国会准备的证词,本刊未核验其中任何一项数据: 未打开 Author’s ATOM 项目页或他维护的下载统计工具,未打开 OpenRouter 与 OpenCode 的用量页,未核验「中国模型占 OpenRouter 用量 80% 以上」「OpenCode 上中国模型推理量 95% 或更高」这两个比例的定义(是 token 数、请求数还是成本份额); 「GLM-5.3 45 分、Kimi K3 44 分、Inkling 26 分、Nemotron 3 Ultra 23 分」是作者截至 2026 年 9 月 14 日的读数,本刊本期未核对 Artificial Analysis 的开源权重榜单,因此这组排名与本期第 1 条、第 3 条中出现的 58/48/46/45 不可直接相加或比较—— 后者中包含闭源模型与厂商自报数,样本不同; 「防止蒸馏只会把差距拉大 1–2 个月」是作者本人的估计,文中有明确的「I estimate」措辞,本刊照录为个人判断; 文中关于 Harvey、Cursor、Perplexity 等公司采用中国模型的说法,本刊未找到各家原始表述; 「大部分学术研究建立在 Qwen 家族之上」是作者的概括(原文以「To a first order approximation」开头),本刊照录这一限定词。 另需说明:本条发布于 2026 年 9 月 21 日,属窗口边缘(HN 提交在窗口内),本刊按 #031 处理类似条目的方式纳入。

来源:Interconnects·The current balance of power in open models(本机直读全文,Sep 21, 2026,Nathan Lambert;原文自述为提交给国会的证词扩写版) · HN 条目 49808816(本机经 firebase API 取值:6 分/2 评论,09-22 22:03 UTC 提交)

8. harness 成为研究对象:Unreal Agent 的 40%,与 Jev 的「分类即接口」

事实。 本条由两份材料组成,都指向同一个被忽略的位置:模型外面那一层。① Unreal Labs 于 2026 年 9 月 22 日发布《Unreal Agent》unreallabs.ai/blog/unreal-agent/本刊直接抓取核验正文与三张基准表,HTTP 200,页内标注 22 September 2026HN 条目 49805748,09-22 18:15 UTC 提交,本刊抓取时取值 100 分 / 61 评论)。② Arcturus Labs 的 John Berryman 于 2026 年 9 月 21 日发布《Will OpenAI Eat Jev’s Lunch?》arcturus-labs.com/blog/2026/09/21/will-openai-eat-jevs-lunch/本刊直接抓取核验全文,HTTP 200,页内标注 September 21, 2026HN 条目 49802161,09-22 14:42 UTC 提交,本刊抓取时取值 243 分 / 180 评论)。

Unreal Agent 的主张与三张表(本刊照录)。 核心主张: 「an agent harness that delivers up to 40% cost savings compared to Codex on production workloads and coding/science benchmarks, without any negative performance impact」,机制是**「The Unreal Agent harness manages tool calls in a completely asynchronous way, relieving the underlying model of the need to manage waits, polls, and heartbeats for tools.」** 作者给出的两个收益是: 「it always allows users to steer the agent without the need to wait for tool calls to finish」「it allows the agent to schedule more useful tool call work between model calls」成本节省的来源被归为两条: 「Minimal harness footprint and careful engineering of tool output usage」(简单提示、token 优化的工具结果、无子智能体或工作流)与「More tool work per model turn」。 基准表(全部使用 GPT-6 Astra xhigh;本刊从页面表格照录): Terminal-Bench 4.0——unreal-agent 57.9%、总额 $1428、每 trial 输入 1.73M/输出 32k、28 个回合、37 次工具调用;Codex(领跑榜基线)57.9%、$2350。 SWE-Atlas Codebase QnA——unreal-agent 65.8%、$936、898k/15k、16 回合、27 次工具调用;Codex 63.3%、$1303;Pi 64.0%、$1033。 DeepSWE 1.1——unreal-agent 72.4%、$1367、1.60M/28k、26 回合、38 次工具调用;Codex 69.0%、$1633;Pi 69.6%、$1584。 文中对差异的说明是: 「There are marginal differences in pass rate, which we attribute to benchmark variance.」 文章另有一段值得单独记的经验判断: 「Security and approvals that rely on harness hooks and specialized tools, in our experience, tend to require more maintenance and be less robust than deterministic environment or sandbox constraints, outside the harness: allowed/disallowed hosts, granular access tokens, proxies with approval gates.」

Jev 一篇的论点(本刊照录)。 作者的总结句: 「if they truly live up to their promises, then I’m concerned that OpenAI is well positioned to fast-follow – not only to replicate Jev’s flagship product, but also to fold that capability into upcoming models and agents.」 他的机制假设是:Jev 的 LLM 在给定状态与一组问题时「generates a single token or, more accurately, generates the probability distribution over all possible next tokens」**,然后把这些概率整理成返回格式——对 noul 类问题「Jev looks at just two tokens, true and false, ignores everything else, and normalizes their probabilities into a single probability that the answer is true」对 choice 类问题则看候选 token 的相对概率并取最大者。 作者认为这意味着 OpenAI 的护城河基础并不牢: 「OpenAI has for years used their LLMs as implicit classifiers; they just haven’t trained them for general classification tasks and they haven’t packaged up general classification as a stand-alone product.」 反面证据他也如实写出: 「As evidence of this, Latent Space reports that many of the early clones are indeed LLM-based.」 关于护城河,他的判断是: 「The biggest moat I see is in TypeSafe’s training data and training processes.」 文末给出的商业推测包括: 用这套分类器做快速模型选择、更省钱的思考、更好的安全护栏。作者还转述了一个采用数据: 「According to Vercel, ‘Jev was adopted faster than any other model in AI Gateway history.’」 另有一项相关的社区动作被本刊注意到:HN 条目 49800574(09-22 13:01 UTC,46 分 / 7 评论)提交了 benchmarkheaven.com/jev-models,页面自述为「BenchmarkHeaven BETA — Work in progress」,并设有「Jev-class models」入口;本刊打开了该页(HTTP 200)但未核验其评分口径,因此只记录其存在。

为什么重要。 两点。其一,这一条把「harness」从工程细节提升成了可测量的研究对象,而它给出的对照方式值得学。 Unreal Agent 的表里有三列是过去很少被公开的:每 trial 的输入 token 数、输出 token 数、回合数、工具调用次数。 把「通过率相同、成本差 40%」这件事拆到这几列上,读者才能看到钱花在哪里(同一张表里,unreal-agent 在 Terminal-Bench 4.0 上每 trial 输入 1.73M、28 回合,而 Codex 那一行的 token 列未公开——这一点本刊如实指出:表里并非每一行都完整)。 本刊认为这一类披露比单纯的「成本降低 40%」有价值得多,因为它让对手可以复现比较,而不是只能相信一个百分比。 其二,Jev 一篇的真正议题不是 Jev,而是接口的形状**。** 它提出的问题是:如果模型的原始输出本来就是一个概率分布,那么「分类」这种需求到底需要不需要一个专门的模型? 作者认为不需要——需要的是把这件事训练好并打包成产品。 本刊的保留意见也很清楚:这是一篇由竞品立场写成的分析**(作者是 Arcturus Labs 的创始人,文中也毫不掩饰他希望 OpenAI 跟进),其中关于 Jev 内部工作方式的说法全部是作者的推测(原文用的是「Here’s the idea」「I suspect」),他本人也承认证据是「many of the early clones are indeed LLM-based」这样的二手报道。** 但即便机制推测不成立,「分类是否需要一个独立接口」这个问题本身仍然成立—— 而它恰好与 #031 记录过的 Google AX(把 Agent 当成一种新的工作负载)和本期第 8 条的异步 harness 在同一个位置: 在模型前后各有一层正在被重新设计的东西,而这一层目前既没有标准,也没有公认的评测。

待观察。 Unreal Agent:这是发布方对自己产品的自测,本刊未安装、未运行、未核验其代码仓库(HN 文本指向 github.com/unreallabsai/unreal-agent,本刊未打开),也未核验三张表中每一行的完整性与跑测条件(同一行内 Codex 与 Pi 的输入/输出 token 列部分为空,本刊已如实说明); 「up to 40% cost savings」是对比 Codex 的最好情形,文章另一处写的是「up to 20% compared to Pi」,本刊照录两个口径而不取其一; 基准表使用的对照基线「Codex (lb)」标注为排行榜基线,其配置与 unreal-agent 的运行条件是否完全一致,本刊无从判断。 Jev 一篇:本刊未使用过 Jev,未打开 TypeSafe 或 Vercel 的任何页面,因此关于 Jev 的一切(机制、采用速度、定价、能力)均未被本刊独立核验**;** 文中关于 Jev 内部机制的描述为作者推测,本刊已在上文标注; 「Vercel 称 Jev 是 AI Gateway 历史上采用最快的模型」是二手转述,本刊未找到 Vercel 的原始表述; 作者身份为竞品公司创始人,且文末自述其判断建立在「if they truly live up to their promises」这一前提上,本刊照录这一前提; 关于 benchmarkheaven.com 的页面,本刊仅确认其可访问与其自述的 BETA 状态,未读取任何分数、未核验任何方法。 本刊本期未安装任何 harness、未运行任何一次 Agent 任务。

来源:Unreal Labs·Unreal Agent(本机直读正文与三张基准表,22 September 2026) · HN 条目 49805748(本机经 firebase API 取值:100 分/61 评论,09-22 18:15 UTC 提交) · Arcturus Labs·Will OpenAI Eat Jev’s Lunch?(本机直读全文,September 21, 2026,作者 John Berryman) · HN 条目 49802161(本机经 firebase API 取值:243 分/180 评论,09-22 14:42 UTC 提交) · HN 条目 49800574·Show HN: JevBench(本机经 firebase API 取值:46 分/7 评论;链接页面本刊打开 HTTP 200,未核验其评分口径)

另附:本期未能收录的三条,与一份不可达清单

本刊把这一类内容单独列出,是因为本期的取舍比往常更需要交代。

不可达的地址与对应后果(逐条如实说明)。 openai.com 发布页 openai.com/index/introducing-gpt-6-sol-and-luna/openai.com/news/ 两次请求均返回 HTTP 403(与 #029、#030、#031 的记录一致)。后果:本期关于 GPT-6 Sol 与 Luna 的全部规格来自 Artificial Analysis 的第三方页面,而非发布方原文(已在第 1 条中标注)。 arstechnica.com 那篇关于 Meta 的 Muse 助手存在严重 0-day 的报道返回 HTTP 405,本刊未能读到正文。bloomberg.com 那篇《Pentagon says overreliance on AI contributed to missile strike on Iran school》的连接直接失败(无响应);本刊随后尝试了该 HN 条目正文里贴出的 archive.ph/0V37g 镜像,同样连接失败。mouse.dev 这个域名被本刊所在环境的执行策略判为可疑(.dev 与文件扩展名易混淆),本刊未发起抓取。huggingface.co 本期返回 000,不可达(与 #028 至 #031 一致)。

因此,本期没有收录以下两条在 HN 上热度很高的材料: 其一,《Pentagon says overreliance on AI contributed to missile strike on Iran school》——HN 条目 49806430,09-22 19:03 UTC 提交,本刊抓取时取值 321 分 / 165 评论,为本窗口内分数第四高的一条。 其二,Meta 的 Muse 助手的两条负面材料——《I asked Meta’s Muse for its filesystem and it sent me 6.8GB》(条目 49802871,09-22 15:25 UTC,280 分 / 141 评论)与《Meta’s Muse has a serious 0-day》(条目 49802030,09-22 14:35 UTC,110 分 / 48 评论)。 两者相加的热度足以进入本期,但本刊对它们各自的一手材料一行也未读到: 一份在付费墙与连接失败之后,两份在 405 与执行策略之后。 本刊的选择是不把标题当内容——只报「有一篇这样的报道存在、它获得了这样的分数」,而不替它转述任何一句话。 如果读者手边能打开这两个地址,这两条值得优先补看: 一条关于自动化决策系统在真实军事行动中的后果,一条关于一个被授予极高权限的 AI 助手在消费产品里的边界,它们正好落在本刊 #029 至 #031 连续记录的那条线上。

其余取舍说明。 窗口内 HN 上还有若干条目本刊未收录,均因一手材料不可读或与本刊主线无关,例如《Can gzip be a language model?》(368 分 / 144 评论,本刊直读该页 HTTP 200 但未纳入本期主题)与《OpenAI is well positioned to fast-follow Jev》之外的讨论(后者已收录于第 8 条)。

今日判断

一句话:这一天里最值得记的,是两家前沿实验室在同一天各自发布新模型,而本期手边的另外几份材料恰好把这件事的三笔账分开算了——能力账付给了长程自主任务,成本账在每季度跌 47%,开源账则显示出「尖端落后 2–5 个月、用量占八成」的错位。

三条线索值得带走。

其一,能力账:本期最强的一条证据不是任何一个基准分数,而是一次被第三方验证过的破解。 GPT-6 Astra 自己在一份公开的未破报文列表上挑题、假设两封报文的明文相关、选中重复地名作 crib、写了模拟器与 Bombe,并且顺手去读了档案注记、找到联邦档案馆的卷号。 验证者是长期维护这批史料的密码分析者,他写下的是一句本刊认为今年最值得记的评语: 「What it has achieved in two days would take a human researcher weeks or even months.」 本刊的保留意见有三处:这份记录尚未定稿(作者仍在分析日志)、页面标注的更新时间(9 月 19 日)早于 HN 提交(9 月 22 日)、以及它关于档案访问的那一段,作者自己都说不清楚模型到底访问了什么。 但即便把这些都打折,这条仍然成立: 在长程、需要自己造工具、自己找材料的一类任务上,本期出现了可被独立验证的成果。

其二,成本账:本期刊出的两个数字应当并列记住——每季度 47%,与 85 倍。 前一个来自 Epoch AI(给定能力水平的价格,三年平均每季度下降 47%,即每年 13 倍;刚成为 SOTA 时下降更快,66%/季),后一个来自本刊直读的 Artificial Analysis 三个模型页(同样一套口径下,每完成一个 Intelligence Index 任务,Opus 5.5 是 $5.98,GPT-6 Luna 是 $0.07)。 两者不矛盾: 趋势告诉你「今天的贵会变成明天的便宜」,截面告诉你「今天就已经有人比你便宜 85 倍」。 本刊认为对读者的实际含义是: 任何以「必须用最强模型」为前提的方案设计,在未来三个月里都会经历一次成本重估;而任何以「反正会变便宜」为由推迟做决定的选择,也在承担同样的风险。 同日小米那笔 350 万美元的直播账单与 Ornn 那份自建推理 $0.12–0.35/百万输出 token 的测算,是这条线上可核对的两个坐标。

其三,开源账:Nathan Lambert 的证词给出了一个本刊认为会持续很久的错位。 中国开源权重在下载上以 3.2B 对 1.6B 领先美国、在 AAII 前十五名里占满、在 OpenRouter 上占八成以上用量; 同时尖端仍落后闭源美国前沿约 2–5 个月,而美国自己的开源权重落后 6–9 个月。 这意味着「谁定义上限」与「谁承担用量」已经由两拨人分开承担。 同一批材料里的另外两条也指向这个方向的后果: Anthropic 把反蒸馏保护(preserved thinking)做成了默认项,而 Lambert 估计即使完全阻止蒸馏,差距也只多 1–2 个月—— 也就是说,最前沿的实验室已经在为「能力扩散」做防御,而第三方评估认为这类防御对格局的改变有限。

最后一句留给本期的另外两面。 本刊本期仍有多处地址不可达(openai.com 403、arstechnica.com 405、bloomberg.com 与 archive.ph 连接失败、huggingface.co 000、mouse.dev 被本机策略拦截), 并因此明确放弃了收录两条热度很高的材料—— 一条关于军方对 AI 的过度依赖,一条关于一个高权限 AI 助手的两起负面事件。 本刊宁可缺这几条,也不愿意在没读到任何一手材料的情况下替它们写摘要。 另一面是命名:本期同一批 OpenAI 模型在三个来源里有「GPT-6 Sol and Luna」「GPT-6 Sol/GPT-6 Luna」「GPT-5.6 Sol」「GPT-5.6 Luna」四种写法,而本刊无法访问 OpenAI 的一手页面来对齐。 本刊已在本期正文中逐处标注来源写法,并建议读者在跨表比较前先确认自己引用的是哪一代。


本刊注:本期覆盖窗口为上期 #031(9/22 07:00 北京时间)之后至今(9/23 07:00 北京时间)。 核验路径:本刊本机成功抓取并直读正文的来源为 anthropic.com(发布页全文与全部评测表)、cryptocellar.org(Enigma 页全文)、artificialanalysis.ai(三个模型页的摘要与规格区块)、epoch.ai(报告摘要、方法与限制)、interconnects.ai(证词全文)、data.ornn.com(摘要与 Key findings)、arcturus-labs.com(全文)、unreallabs.ai(正文与三张基准表)、benchmarkheaven.com(仅确认页面与 BETA 自述),以及量子位六个正文页(均 HTTP 200)。 HN 分数与评论数取自 firebase API 的 /v0/item/<id>.json;讨论页本期本机可读(HTTP 200)。 本机不可达:openai.com(403)、arstechnica.com(405)、bloomberg.com(连接失败)、archive.ph(连接失败)、huggingface.co(000)、以及被本机执行策略拦截的 mouse.dev。 属厂商供稿的材料已在条目内逐条标注:第 4 条三篇(阿里云/阿里巴巴供稿)、第 3 条(媒体报道)、第 5 条(会议现场报道,未标注供稿关系)、第 6 条(一份为发布方自研论文)、第 8 条(发布方自测与竞品立场分析)。 本期所有数字均照录来源原文;「今日判断」一节中出现的全部数字均可在正文对应条目内找到出处。