今天是周三。本期的头条不是新模型,而是数学与 AI 碰撞出的第一场「国际事件」:9/8(美东)OpenAI 官网刊发《On the Navier–Stokes Millennium Prize Problem》,称其内部系统给出了 Navier-Stokes 千禧年问题的一个解——流体运动可在有限时间内发展出奇点,并附 Lean 形式化证明;几乎同时,NYU 数学家 Tristan Buckmaster 发布公开声明,讲述 OpenAI 如何在他与 Anthropic 的 Levent Alpöge 完成关键工作后「闻风而动」、并以作者身份为条件谈判。一天之内,HN 上出现两个千分帖(1058 分/897 评论 + 1165 分/512 评论),Altman 与 Bubeck 下场回应,Bubeck 就「毁掉职业生涯」的措辞公开道歉,陶哲轩则把这件事定性为开放科学的转折点警告。这与上期 #017 的叙事完全接续:Pachocki 刚呼吁「自愿减速」,OpenAI 就以最激烈的方式展示了「加速体制」的阴暗面——实验室之间用 agent 竞赛解题,「谁先解出」的激励开始侵蚀数学界「分享研究思路」的规范。

国产侧的主条同样延续 #017 的暗线(模型分工):量子位独家报道,华为诺亚方舟实验室前主任、盘古大模型负责人王云鹤创办的基元律动发布 Agent-Native 模型 NeoHorse——4B 模型经 Agentic Post-Training 后综合表现达/略超 9B 基础模型,「多模型路由执行经验第一次进入模型参数」,与上期 Mostik「大模型冻结、外挂表征桥」恰好构成两种相反的分工哲学。产业侧:Mistral 官宣 30 亿欧元融资(欧洲主权 AI 路线的最大单笔),Cognition 官宣 20 亿美元 E 轮(480 亿估值),DeepMind 则发布了把 AlphaGenome 预计算铺满全基因组的「Atlas」——AI4Science 正在从「解难题」转向「造基础设施」。下面四条主条 + 七条简讯。除标注「转述/引述/不可达」的内容外,均经官方页面或正文直接核验;openai.com、x.com、mistral.ai、ai.meta.com 本机不可达(403 / SSL 失败 / JS 壳),相关引文已如实标注核验路径。

1. OpenAI 官宣 Navier–Stokes 千禧年问题之解(有限时间奇点 + Lean 形式化),Buckmaster 公开声明指控「闻风抢先、剔除作者」,Bubeck 就威胁性措辞道歉——数学界的「scooping」事件

事实。 按时间线与可核验程度分层陈述:

① OpenAI 的主张openai.com/index/navier-stokes-solution本机仍为 Cloudflare 验证页、不可直读,与既往记录一致;HN 提交于 9/9 01:13 北京时间,现 1058 分、897 评论,HN 条目 49613262)。官方开场文案经评论者直接引语转述:「我们正在分享 Navier-Stokes 存在性与光滑性问题——千禧年问题之一——的一个解。该证明由 OpenAI 内部系统完成,表明流体运动的 Navier-Stokes 方程动力学可在有限时间内发展出奇点(singularity)。我们同时分享证明的文字稿与 Lean 形式化。」(评论者引用原文,含「internal OpenAI system」「formalization in Lean」字样。)官方立场声明(评论者直接引语):「我们(研究者与 agent)在他们公开发布前,未通过任何途径看到他们的工作——特别是,没有为解此题访问任何特定用户数据。虽然可能性不大,但我们无法排除:源于用户使用我们产品所得到的去标识数据帮助改进了我们的模型。不过,我们的证明显著不同,甚至在 Euler 情形下证明的具体结论也不同(forced vs unforced)。」

② Buckmaster 的公开声明cims.nyu.edu/~tristanb/statement.pdf本机未做 PDF 解析,要点经 HN 讨论多条直接引语交叉核验;HN 提交于 9/8 13:42 北京时间,1165 分、512 评论,HN 条目 49605915)。据 HN 评论者对声明全文的梳理(评论者转述口径):8 月 15 日,NYU 数学家 Tristan Buckmaster 与 Levent Alpöge(供职 Anthropic,此项研究独立于其职务,工具上混用 GPT 与 Claude 模型)在几个重要问题上取得突破——带光滑强迫的不可压缩多孔介质、Boussinesq 与 3D 不可压缩 Euler 的有限时间爆破;他们并不声称解决了百万美元千禧年问题本身,但声称证明了一个相近(非千禧年)的 Navier-Stokes 问题、可望铺路。9 月初,OpenAI 方面听到「Anthropic 解决了重大问题」的传闻,Buckmaster 主动电邮 OpenAI 澄清。随后 OpenAI 发布了千禧年问题版本的结果。争议焦点:① OpenAI 称其模型未直接访问用户数据,但未正面回答 Buckmaster 与模型的对话是否进入了训练;② OpenAI 表示愿意「部分致谢」Buckmaster(尽管他并未解决千禧年问题),条件是从作者名单中移除 Alpöge——因其供职 Anthropic(OpenAI 方理由:「Anthropic 的模型用于他们的 Euler 爆破证明,因此我无法认为 Levent 是独立的学者」,评论者引述);③ 声明记录了通话中的两句话——「你为什么要毁掉自己的职业生涯?」与「如果你不想让我客气,我也可以不客气」,以及事后发给 Alpöge 的「我不确定 Tristan 现在是否完全理性」的短信(评论者引述声明原文;Bubeck 已在 X 上承认「职业生涯」一句是「极其糟糕的用词」并公开道歉,称当场就收回了该说法——x.com 本机不可达,经 HN 评论者转引 xcancel 镜像)。

③ 双方阵营的匿名补充与社区争论(HN 讨论内,自称 OpenAI 员工者 4-5 条评论,未证实身份):辩护方称动机有二——新模型「看起来好得离谱」+ 听到多个千禧年问题被解决的传闻想试试自家模型能否做到;「没有读过任何私聊」;「我们的证明与他们非常不同,也远超已公开文献」;「这个未发布模型在大量未解数学问题上有野兽级表现,不只是 Euler」。质疑方反驳:OpenAI 的模型「训练于他们一整年的私密工作之上(博客文章本身也承认这一点)」(评论者说法);即便训练污染无法证实,「听到别人用方法 X 取得进展就 rush 去 scoop」本身就接近学术不端(评论者说法);举证责任归属成为争论焦点(OpenAI 支持者:方法源自 2023 年已发表文献、任何前沿模型都见过;质疑者:OpenAI 应证明自己的 agent 没看过即将发表的工作)。另有评论者给出工程细节:「1 万个 agent 协同跑了 88 小时」得出证明(评论者口径,单源)、证明附 Lean 证书(评论者口径);亦有评论提醒工程界视角:流体力学实际应用基本不受千禧年问题影响(评论者观点)。

④ 陶哲轩的评论mathstodon 帖,HN 提交 9/9 05:00 北京时间、73 分,HN 条目 49616968;引文经 HN 评论直接引语核验):「我们现在看到,即便只是『某人在研究某个问题』的传闻,也会触发大规模 AI 驱动的努力,在原创研究项目来得及发挥全部潜力之前就把它碾平。激励结构可能正指向:不再向更广的学界分享任何有前景的研究方向——这将逆转数百年开放科学传统,对该领域的未来造成严重长期伤害。」

为什么重要。 三点。其一,无论证明本身是否成立,这是「AI4Math 进入零和竞争时代」的第一次实弹演习:费马大定理形式化(#016 前量子位报道的 Claude 证明)、九问 RSI(#017 前后量子位)都还是「合作/工具」叙事,这一次变成了「实验室之间抢首发」。OpenAI 的动机结构(听闻对手接近 → 用 1 万 agent 连夜碾压 → 抢先发布)与 Pachocki 上期呼吁的「自愿减速」直接冲突——同一天里,OpenAI 一边发布主张减速的长文,一边用行动展示加速体制最极端的形态,这比任何评论都更能说明「减速呼吁」缺乏执行机制。其二,作者身份谈判把「模型时代的知识产权」问题摆上台面:OpenAI 以「剔除供职竞对实验室的作者」为致谢条件、Bubeck 的威胁性措辞(无论是否口误)——这些细节在数学界引发的愤怒(HN 评论一边倒站 Buckmaster)说明:当 AI 让「个人研究」可以被大规模复制逼近时,学术信用体系缺少对应的新规则。其三,陶哲轩的警告指向更深的公共品问题:如果「分享思路 = 给对手递刀」,数学社区会退回保密模式——AI 本应加速开放科学,反而可能先杀死开放科学的激励(HN 讨论中多位评论者以高斯、牛顿-莱布尼茨、怀尔斯七年保密等历史案例辩论「数学从来不是纯开放的」)。

待观察。 openai.com 全文与 Lean 形式化本机未直读,核心引文均为 HN 评论直接引语,引用原文前仍需官网核验;「1 万 agent/88 小时」为单条评论口径;Buckmaster 声明全文仅经评论者转述+片段引语,未逐段核验;双方「是否看过对方工作」均无第三方审计(OpenAI 声称去标识数据无法排除);x.com 上 Altman/Bubeck 原文与 Bubeck 道歉原文均未直读;证明本身(有限时间奇点构造)尚未经过同行评审,数学界普遍反应是「等看 Lean 证书与文字稿细节」;量子位等中文源截至抓取时(9/8 14:05)尚无 NS 报道,本刊为本轮中文首记录之一;「unforced 问题是否仍开放」在 HN 讨论中存在口径分歧(有评论称 unforced 仍开放,与 OpenAI 主张的关系待原文厘清)。

来源:HN 讨论(OpenAI 帖,1058 分,含官方文案与立场声明直接引语) · HN 讨论(Buckmaster 帖,1165 分,含声明片段引语) · Buckmaster 公开声明 PDF(本机未解析,经 HN 转述) · OpenAI《On the Navier–Stokes Millennium Prize Problem》(本机 403,未直读) · 陶哲轩 mathstodon 帖(引文经 HN 核验) · HN 条目 49616968(陶哲轩帖讨论) · x.com @sama / @SebastienBubeck(本机不可达,经 HN 评论转引)

2. 王云鹤创办基元律动、发布首个 Agent-Native 模型 NeoHorse:4B 经 Agentic Post-Training 达/略超 9B 基础模型——「多模型路由经验第一次进入模型参数」,与 #017 Mostik「模型桥」互为镜像

事实。 量子位 9/8 10:14 独家报道(485555,正文直接抓取核验):华为诺亚方舟实验室前主任、盘古大模型负责人王云鹤创办的基元律动发布首个 Agent-Native 模型 NeoHorse-1(含 4B 与 9B 两个版本),面向 Agent 工作所需的整组能力——调用工具、读取环境反馈、发现错误、调整路径并最终完成任务。算力与 Infra 优化由无问芯穹提供,清华大学、北京大学团队参与算法与训练方法研究。关键结果(企业/团队口径):在覆盖 Harness Agent、工具使用、代码与指令遵循等 10 项评测中,经 Agentic Post-Training 后,4B 模型综合表现已达到/略超 9B 基础模型。报道还交代了公司的方法论背景:基元律动长期做多模型协作(Routing Harness 层,旗下开源项目 OpenSquilla 已接入多款模型,在 Agent 运行中做细粒度路由、模型切换与多模型协作),其调度系统在运行中沉淀「什么任务需要什么能力」「模型在哪一步容易失败」「什么修复路径有效」等数据——NeoHorse 的意义被概括为把这类执行经验第一次写进模型参数,而非继续只做外部路由。报道亦如实记录了一个反问:一家强调多模型协作的公司为何开始自训模型?团队的回答逻辑是「当模型被放进 Agent 系统承担完整任务后,单一分数解释力下降,不同环节对能力要求不同,需要参数级的适配」。

为什么重要。 把这条与 #017 的 Mostik 并读,模型分工的两条技术路线在本周同时清晰化:Mostik 冻结大模型、训练一个表征层「桥」让隐藏状态直连(分工发生在推理期、模型权重不动);基元律动则把「路由-执行」经验蒸馏进小模型参数(分工发生在训练期、让小模型自己变强)。两者的共同前提是同一个判断——「模型分工」正在从文本 prompt 级(router 用文字判断)下沉到表征/参数级,而 NeoHorse 的特殊价值在于:它可能是「路由数据反哺模型」这一闭环第一次以国产创业公司产品形态出现(4B 打赢 9B base 的口径若复现,意味着小模型的 Agent 能力天花板主要由后训练数据质量而非参数量决定)。这同时呼应 #017 办公 Agent 报告里「新模型 3 天渗透率近 50%」的渠道判断——Agent 工作负载正在成为模型能力的真正考场。王云鹤的履历(盘古大模型负责人)也给这条新闻加了产业注脚:大厂模型负责人创业后没有直接押注「更大基座」,而是押注「Agent 原生的中小模型 + 路由经验」,这是对「参数军备竞赛」的一种分流判断。

待观察。 全部结果为量子位转述的团队口径:10 项评测的具体榜单、基线与「达/略超」的量化差距未公布;4B 版本对比的是「9B 基础模型」而非「9B 也做 Agentic Post-Training」——同规模训练公平性未说明;NeoHorse 权重是否开源、何时可用未披露(OpenSquilla 开源,模型本身未见开源声明);「清华北大参与」的具体分工边界未展开。模型发布页与基元律动官网本刊未另行核验。

来源:量子位(正文直接抓取核验)

3. Mistral 官宣 30 亿欧元融资,欧洲「主权开源」路线拿到迄今最大单笔(HN 804 分);同窗并读:Cognition(Devin)官宣 E 轮超 20 亿美元、480 亿估值——AI 资本继续「主权/垂直/通用」三分

事实。 两条融资,核验程度不同:

① MistralHN 条目 49605767,提交于 9/8 13:06 北京时间,804 分、563 评论;官方新闻页 mistral.ai/news/mistral-makes-sovereign-open-weight-ai-to-frontier 本机 SSL 连接失败(curl exit 35)不可达):HN 标题为「Mistral raises €3B」,即30 亿欧元融资;官方新闻标题含「sovereign open-weight AI to frontier」(使主权开源权重 AI 走向前沿)。金额与标题经 HN 核验,官方正文细节(投资方、估值、用途)本机不可达、未获第二信源,如实标注。HN 讨论(563 条)的主线不是金额而是战略评价:支持方称 Mistral 是「主权 AI」正解(欧洲机构客户、本地生态、避开与中国/美国的基准军备竞赛,与 Apple「不抢首发」策略同构);质疑方称其模型能力已掉队(有评论直言「任何 Mistral 模型都打不过一年前的 30B 级开源 Qwen」——评论者观点),「主权」不能替代「能力」;地缘背景(欧洲对美技术依赖的焦虑)被多位评论者视为这轮融资的深层驱动力。

② Cognition(Devin)cognition.com/blog/series-e官方博客直接抓取核验;HN 提交 9/9 01:16 北京时间、19 分,HN 条目 49613312):Cognition 官宣完成 E 轮超 20 亿美元、估值 480 亿美元,由新投资者 Andreessen Horowitz 与 Accel 领投,Founders Fund、General Catalyst、Avenir 等现有投资者及 Benchmark、Bessemer、Kleiner Perkins、Greylock、Lightspeed、DST 等跟投。官方披露的经营数字:自 5 月上一轮以来,run-rate 营收从 4.92 亿美元增至近 9 亿美元;客户用例覆盖 NVIDIA(芯片设计)、GE Aerospace(航空)、花旗(金融服务)等;产品面扩展 Devin Auto-Triage(事件调查)、Devin Security Swarm(漏洞排查)、Devin Automations(由 Slack/GitHub/Linear 事件触发、无需逐任务开对话);Cognition 自称定位「独立的 agent 实验室」(不被单一模型绑定、可选自有模型)。

为什么重要。 两条并读,AI 资本的分层在 24 小时内被画得清清楚楚:Mistral 融的是「主权」(欧洲机构与政府对非美/非中模型控制权的溢价,赌的是地缘而非榜单);Cognition 融的是「垂直」(软件工程 agent 的 run-rate 从 4.92 亿到 9 亿美元、半年近翻倍,赌的是 agent 取代「写代码的岗位」而非「模型」);而 Devin 的客户名单(NVIDIA/GE/花旗)与「Automations 让工作由事件触发、无需人开对话」的描述,正好接上 #017 办公 Agent 报告里「12.2% 无人值守调用」的曲线——agent 从对话框变成后台进程的叙事,正在被融资公告逐条坐实。Mistral 的 €3B 则提醒:当中国开源模型(上期 #017 的 Qwen/GLM 系)在能力上逼近前沿时,「开源权重」本身成了地缘资产,欧洲愿意为此付钱——这与 #016 以来反复出现的「模型分发渠道战」是同一枚硬币的两面。

待观察。 Mistral 官方细节不可达:投资方构成、估值、是否含债务/承诺额度、「30 亿欧元」的币种与结构均待官方原文;「主权 vs 能力」之争没有数据裁决(Mistral 新模型路线未公布);Cognition 的 run-rate 与 480 亿估值的隐含倍数、以及「近 9 亿 run-rate」中产品收入与服务的拆分未披露;E 轮后 Cognition 是否继续采购外部前沿模型(其「独立 agent 实验室」表述与自训模型的投入比例)未说明。

来源:HN 讨论(Mistral,804 分) · Mistral 官方新闻页(本机 SSL 不可达,未直读) · Cognition 官方博客(直接核验) · HN 讨论(Devin,19 分)

4. DeepMind 发布 AlphaGenome Atlas:对基因组 90 亿个单字母变异的分子效应做预计算预测的开放「图谱」——AI4Science 从「解难题」转向「造基础设施」

事实。 Google DeepMind 官方博客 9/8 发布(deepmind.google 官方页本机直接抓取核验;HN 提交 9/8 22:14 北京时间、76 分与 22:55、475 分两个条目,后者链接的 blog.google 镜像地址本机 404,以 deepmind.google 原址为准):AlphaGenome Atlas——把此前已发布的 AlphaGenome 模型(预测基因变异如何影响生物过程的 AI 模型)以全基因组尺度做预计算,产出对基因组中每一个可能的单字母 DNA 变异(约 90 亿个)的分子效应预测图谱,作为开放资源供研究者使用。官方博客的关键表述:「正如地图集是地图的集合,AlphaGenome Atlas 描绘了 DNA 变异在基因组上的分子效应」;「我们的受信外部合作者已用 AlphaGenome Atlas 在未确诊罕见病研究中识别并实验验证了关键变异,并找到了与常见性状相关的罕见变异」。本刊未在页面发现配套论文链接(页面提供的是社区入口)。

为什么重要。 这延续了 #016/#017 的「AI4Science 三条路线」判断中的一条:与「解难题」(费马大定理形式化、NS 千禧年)和「自动研究员」(九问 RSI、OpenAI research acceleration)并列,DeepMind 走的是第三条路——把模型能力铺成公共基础设施。「90 亿变异全覆盖 + 预计算 + 开放访问」的模式,等于把 AlphaGenome 从「按需分析工具」变成「查表即得的基因组字典」:对罕见病诊断这类长尾场景,预计算图谱让没有模型部署能力的临床实验室也能直接受益。它与同日 NS 风波的对照也值得记录:同样是 9/8 的 AI 科学新闻,一个选择把结果开放成基础设施(DeepMind),一个选择抢先发布引发信任危机(OpenAI)——「AI for science」的公共形象正在被这两种行为模式同时塑造。

待观察。 「实验验证」的具体变异数量与发表渠道未在页面给出;预计算基于的 AlphaGenome 模型版本与评测指标(变异效应预测的准确率基线)未在页面展开;「每一个可能的单字母变异」覆盖的是参考基因组单碱基替换(SNV),插入/缺失与结构变异不在其列(本刊推断,页面未明说);与 AlphaMissense(前代同类工作)的关系与增量未说明。

来源:Google DeepMind 官方博客(直接核验) · HN 讨论(475 分条目) · HN 讨论(76 分条目)

简讯

① GPT-6 Astra 的 3D 玩法火到烧穿额度,OpenAI 对全部付费订阅「全局重置」(量子位 9/8 14:05,485854,正文直接核验):量子位称全网用户拿 Astra 玩 3D 是「上线后最火的玩法」,类型包括按图纸/照片/工程图在 Blender 中重建物体、把真实城市变 3D 世界等;Astra 并非模拟鼠标操作,而是自己写 Python 脚本建几何、再按渲染结果迭代修改(示例:网友按老式蒸汽火车图纸让 Astra 重建出 3295 个独立对象、零件可继续编辑的模型);用量过大后 OpenAI 面向所有付费订阅做额度全局重置(预计北京时间 9/8 上午 10 点左右到账,量子位口径)。——这是「Astra 把生成从 2D 推到 3D 工作流」的第一个量化级现象证据,也与 #017 的 Sol「速度 6 倍」爆料互为背景。

② ChatGPT Images 2.5:官方称每周生成超 30 亿张图(openai.com 本机 403;HN 提交 9/9 02:37 北京时间、263 分,HN 条目 49614720;官方文案经评论者直接引语转述:「每周,人们在 ChatGPT Images 与 API 的 GPT-Image 模型上生成超过 30 亿张图像」)。注意:量子位 9/4 已报道过 GPT Image 2.5(改进 GPT Image 2 的噪点问题等),本条目并非「首发」新闻,而是该版本官方页本周在 HN 发酵 + 官方用量口径首次进入本刊记录;HN 讨论主线是「30 亿/周」的规模震撼与图像生成真实用途(修照片/装修预览为主)之争。

③ Kimi K3(2.8T MoE、1.45TB 专家权重)在 MacBook Pro 上从 SSD 流式跑到约 1 token/s(GitHub 仓库 argonautlabsai/deltafin,本机直接核验 README;HN 提交 9/9 04:07、195 分,HN 条目 49616257):第三方开发者(fork 自 gavamedia/deltafin,MIT 许可)实测在 M5 Max MacBook Pro(128GB)上、专家权重从 4 块 SSD 流式加载跑 Kimi K3:稳定解码约 1.00 token/s(512-token 回答;128-token 时 1.13;公开 17-token prompt 上 0.96);诚实记录瓶颈——512-token prompt 的首 token 需约 376 秒(prefill 每层专家被重读 8 次,修复方案已提出未实现);多盘扩展曲线:单盘≈四盘速度的 52%、双盘≈73%、三盘≈90%。——注:Kimi K3 权重通过何种渠道获取(官方开源或其他)本刊未核验;HN 讨论主线是「1 token/s 的本地模型仍有价值」(相当于免费获得一位通宵干活的人)与「ASIC/专用推理硬件才是终局」。这为「2.8T 级 MoE 落进消费级设备」提供了第一个可复现的工程基准。

④ Inception(Mercury)发布 2.5 版扩散 LLM:官方称 1107 token/s、智能较二代 +40%(inceptionlabs.ai 官方博客,本机直接核验;HN 提交 9/9 04:14、114 分,HN 条目 49616354):Mercury 2.5 自称「市面上最强扩散 LLM」,运行速度 1107 token/s、相对 Mercury 2 智能提升 40%、「可比肩成本优化的前沿模型」。——与简讯③并读,推理效率的两种极端(扩散 LLM 的千 token/s 生成 vs 2.8T MoE 的端侧流式)同一天出现,效率叙事正在从「单点优化」变成「架构级分叉」。

⑤ 深度智控(DeepCtrls)完成 B+ 轮数亿元融资,宁德时代领投(量子位 9/8 11:22,485784,正文直接核验):物理 AI 企业深度智控本轮由宁德时代领投,阿美投资(Aramco Ventures)、太平创新投资、广发信德、复星创富跟投,源码资本、光远资本等老股东追加;过去两个月内公司已连续完成三轮融资(企业口径)。业务面:以 PhyAI 物理 AI 引擎做能源系统的感知-预测-自主决策-实时寻优闭环控制,并从工业场景延伸至算力基础设施(液冷智控、算电协同)。——「宁德时代 + 沙特阿美」的产业资本组合是这条融资最值得读的信号:物理 AI 的买单方正在从财务投资人变成「能源-算力」双侧的基础设施巨头

⑥ Meta 发布个人 AI agent「Muse」(HN 提交 9/9 03:25、214 分,HN 条目 49615537;官方页 ai.meta.com/muse 本机返回 JS 壳/Error、不可达,仅标题级核验):Meta 推出面向个人的 AI agent「Muse」。本刊未核验其能力细节与发布形态,仅记录该条目的存在与热度;若与 #017 千问办公「多人工作台」并读,可视为「个人 agent 成为大厂标配」的又一数据点——此判断待官方页可访问后补证。

今日判断

一句话:AI 与数学的第一次「抢首发风波」把 #017 的「减速呼吁」照出了原形——实验室之间的 agent 竞赛已经开始重写学术竞争的规则,而陶哲轩警告的「激励转向保密」可能比任何模型能力都更深刻地改变科学的未来。 三条信号值得带走:

其一,「谁先解出」正在取代「能否解出」成为 AI4Math 的头号变量。OpenAI 用内部系统+Lean 形式化给出了 NS 千禧年问题的解(无论最终能否通过检验,这已是「周末级」的解题速度),但整个事件发酵的重心不在证明本身,而在「抢先」:传闻→万人 agent 连夜碾压→抢先发布→作者身份谈判。当解题能力被 agent 工业化,数学社区真正的稀缺资源变成了「研究方向的保密性」——这是对开放科学激励结构的釜底抽薪,其长期影响可能大于任何一个单点结果。对读者而言,往后看任何「AI 解决重大数学问题」的新闻,第一问都应该是:谁先知道的?谁在跑?

其二,模型分工的两条路线在一周内同时拿到商业化注脚:Mostik(表征桥)与基元律动 NeoHorse(路由经验进参数)说明「分工发生在哪一层」已成为可争论、可融资的技术问题;而 Devin 的 Automations(事件触发、无人值守)与 ChatGPT Images 的 30 亿图/周则在需求侧确认:agent 与生成式应用的真实使用形态正在远离「人坐在对话框前」。效率侧(Mercury 1107 token/s、Kimi K3 端侧 1 token/s)同日出现的两个极端,说明「推理效率」的下一轮竞争是架构级的,不是量化级的。

其三,资本与科学的流向出现有趣的分叉:Mistral 的 30 亿欧元与宁德时代领投深度智控,一个买「主权」、一个买「物理 AI 底座」;DeepMind 把 AlphaGenome 铺成全基因组图谱做公共品,OpenAI 则在同一天因抢先风波消耗学术信用——「AI for science」的公共形象正在被两种行为模式同时塑造,而信任一旦裂开,修复比训练模型慢得多


本刊注:openai.com、x.com、mistral.ai、ai.meta.com 本机不可达(403/SSL 失败/JS 壳),相关引文与数字均标注了核验路径;「官方口径/发布方」与「评论者转述」已尽数区分;Mistral 融资细节与 Meta Muse 能力细节因源不可达未获核验,请以官方原文为准。