今天是周四。本期窗口从上期 #018(9/9 08:00)之后开始:头条不是模型,而是苹果在 9/10 凌晨(北京时间)发布的首款折叠屏 iPhone Duo——以及它把 AI 放进工业设计(铰链)与操作系统(Siri AI 接入超 30 万个 App)的方式。国产侧两条主条同时落在「模型要能干活」这条线上:蚂蚁百灵开源首个金融增强模型 Ling-3.0-flash-Fin(把「回答一个问题」升级为「完成一项投研工作」),讯飞星火 X2.5(293B)上线、API 原生兼容 Anthropic/Responses 协议——让 Agent harness 直接插上。海外侧,Anthropic 发布了一份可直读的「经济未来三情景」研究,Meta Muse 的定价与安全细节也经社区转述补上了(#018 里它还只有标题)。本期除标注「官方口径/转述/不可达」的内容外,均经官方页面或正文直接核验;openai.com、ai.meta.com、gist.github.com、science.org 本机仍不可直读(JS 壳/SSL/网络层),相关条目已如实标注核验路径。
1. 苹果首款折叠屏 iPhone Duo 发布:15999 元起、A20 Pro(2nm/32 核神经引擎)、「液态金属」铰链用上 AI 辅助设计、Siri AI 系统级接入超 30 万个 App
事实。 量子位 9/10 03:24 发布会报道(486450,正文直接抓取核验;以下规格均为苹果发布会口径,经量子位转述,本机未直读 apple.com 官方页):苹果首款折叠屏正式命名 iPhone Duo(非传闻的 Ultra;Duo 对应「双屏」,词源拉丁语「两个」)——外屏 5.4 英寸、展开 7.6 英寸,内外屏均为 OLED,屏幕比例接近 iPad mini、支持 Apple Pencil,被量子位概括为「手机平板二合一」;按苹果说法是史上最薄 iPhone。结构件是本期最「AI」的部分:铰链核心为锆基非晶钛合金(「液态金属」),强度约为钛合金的 2.5 倍、比钢轻约 20%,无晶粒边界、天然抗金属疲劳,发布会称其设计过程用上了 AI 辅助。续航:双电池设计,充一次用 24 小时、20 分钟充至 50%;视频播放外屏 44 小时/内屏 31 小时。芯片:A20 Pro(2nm 制程),6 核 CPU(含两个苹果所称「桌面级」高性能核心,速度 +20%)、GPU 7 核(图形 +40%)、神经引擎来到 32 核、FP8 精度算力翻倍、内存带宽 +50%,配全新 C2 基带(毫米波 5G,上传 +50%、功耗较 C1 低 15%);影像为 4800 万主摄 + 4800 万融合式超广角(无独立长焦),侧边 Touch ID 回归。价格:1999 美元起(256G 起卖),国行 15999 元起,顶配 2T 为 26499 元。系统侧:iOS 27 为折叠形态专门优化(按钮右移、专属 Siri 弹窗与灵动岛、可当「迷你折叠电脑」立放),同场宣布 Siri AI「彻底打通操作系统,相机原生,接入超 30 万个 App」(发布会口径);另有 iPhone 18 Pro(9999 元起)/18 Pro Max、AirPods 5(降噪较上代提升 50%,官方口径)、Apple Watch 新感知系统。值得注意的是:标准版 iPhone 十年来首次缺席本次发布,Air 2 跳票至明年三月(量子位转述)。量子位还记录了一个市场信号:发布会结束后苹果股价翻红。
为什么重要。 苹果这张折叠屏答卷的 AI 含量不在「跑了个大模型」,而在两个隐蔽位置:一是 AI 进入工业设计流程——「液态金属」铰链的设计过程用上 AI 辅助,折叠屏最难的折痕/疲劳问题被定义为「材料+AI 优化」问题而非单纯结构问题;二是 Siri AI 以「系统级入口」而非「App 内功能」的形态接入 30 万+ App——这与 Meta Muse(见简讯)、ChatGPT Work 桌面端争夺的是同一个位置:个人 AI 的默认入口。把 15999 元起的定价、A20 Pro 端侧算力翻倍与「史上最薄」放在一起读,苹果的叙事是**「AI 终端」= 形态(折叠/最薄)+ 系统级交互(Siri AI)+ 端侧算力(神经引擎)三件套**,而不是参数榜。对国产折叠屏厂商而言,iPhone Duo 相当于把「AI 参与设计」「铰链材料学」的竞争水位直接抬高了一档。
待观察。 以上规格全部为发布会口径,真机折痕/铰链耐久/续航的独立实测尚未出现;「Siri AI 接入 30 万 App」的实现节奏与国行功能落地范围(Apple Intelligence 在华状态)报道未展开;「AI 辅助铰链设计」是工程实质还是营销话术待拆解;15999 元起的国行定价与安卓折叠旗舰(已做 8 年)的实际竞争关系要等首销数据;标准版 iPhone 缺席与 Air 2 跳票对产品线的长期影响未明。
来源:量子位(正文直接抓取核验) · apple.com 官方新闻稿本机未直读(量子位转述发布会口径)
2. 蚂蚁百灵开源首个金融增强开放模型 Ling-3.0-flash-Fin:124B 总参/5.1B 激活/256K,瞄准「完成一项投研工作」而非「回答一个问题」,同步开源 FinFIRST 评测基准
事实。 量子位 9/9 13:02 报道(486288,正文直接抓取核验;文末注明「本文由蚂蚁提供,量子位获授权转载」,以下均为蚂蚁发布方口径):蚂蚁集团百灵发布首个金融增强开放模型 Ling-3.0-flash-Fin,定位区别于「解决问答、摘要等单点任务」的传统金融大模型——瞄准真实金融工作流,让 AI 从『回答一个问题』走向『完成一项工作』,目前模型已正式开源(开放权重 + 面向开发者的 API 体验)。技术底座:基于 Ling-3.0-flash,延续 124B 总参数、5.1B 激活参数配置,256K 长上下文,经金融语料持续预训练、领域后训练与工具使用优化,强化对年报、财务工作簿、多份研究材料的处理。能力切面:率先切入投资研究场景的四项能力——信息检索(优先官方/一手/高可信信源,关注信息时点与统计口径)、研究推理(多步计算与交叉验证、构建可复核证据链)、估值建模(进入真实工作簿,支持公式切换、跨表依赖与异常排查)、研报撰写(产出可编辑、可审核的研究材料)。配套动作:同步开源 FinFIRST 评测基准(Financial Information Retrieval, Sourcing and Traceability)——由蚂蚁构建、中金公司投行团队提供专业支持、50 余位金融专业人士参与设计,重点评测金融搜索 Agent 在信息检索、信源选择、口径判断与推导过程的能力;数据覆盖中国内地/美国/中国香港等市场,中文题 60.2%、英文题 39.8%,61.8% 的题要求显式计算、32.5% 需要多信源、75.6% 不直接指定信源(需 Agent 自主搜索判断),全部使用公开可访问信源。官方称模型已在 FinFIRST、FinSearchComp Verified、Finance Agent、APEX-Agents、SpreadsheetBench、τ³-Banking 等多个金融智能体基准上测试,综合表现超过部分大尺寸旗舰模型、同尺寸模型中具备较强竞争力(报道未给出具体分数与榜单)。
为什么重要。 这条与 #018 的产业主线完全同向:金融 AI 的竞争正在从『知识问答』转向『可复核的工作流交付』——Ling-3.0-flash-Fin 的四项能力(检索→推理→建模→成稿)实际上是一条投研 Agent 的任务链定义,而「可复核的证据链」「可进入专业人员原有流程的工作簿」「可编辑可审核的研报」都在回答同一个问题:模型输出如何能被专业责任体系接管。更值得记录的是「模型 + 评测基准」的捆绑开源:FinFIRST 把「信息从哪来、口径是什么、结论怎么得出」变成可自动评测的维度,等于把金融 Agent 的验收标准开源了——这与 #018 蚂蚁/行业「用评测基准卡位」的路线一致(把『会干活』的定义权握在发布方手里)。蚂蚁在金融场景的渠道与数据禀赋(报告本身即由蚂蚁供稿)让它成为这条路线最有分量的国产玩家之一。
待观察。 所有性能表述均为蚂蚁口径,「超部分大尺寸旗舰」没有附带榜单分数,第三方复现未出现;开源许可证、权重获取渠道与模型卡细节报道未给出;「真实投研工作流」的落地案例(哪家机构在生产环境用、替代了哪些环节)未披露;FinFIRST 的题目由蚂蚁与中金构建,评测方与发布方的独立性需要留意;256K 上下文在长年报场景的实际有效长度未测。
3. 讯飞星火 X2.5(293B)上线:API 原生兼容 Anthropic/Responses 协议,可直插 OpenClaw/Claude Code/Codex 等 harness——量子位实测拆 61 页财报、反手指出研究漏洞
事实。 量子位 9/9 18:02 实测报道(486374,正文直接抓取核验;「293B 参数」为讯飞发布口径):星火 X2.5 上线讯飞开放平台,一个被报道重点标注的工程事实是——API 原生支持 Anthropic 协议与 Responses 协议,开发者可直接将其接入 OpenClaw、Claude Code、Codex、Hermes、Grok Build、Pi Agent 等第三方 harness 框架(官方口径;量子位自称直接调 API 接入 Codex 开跑)。背景衔接:讯飞此前已开源星火 X2.5 的两款端侧模型(4B 与 1.7B),均能在端侧原生跑 100 万 token 上下文。量子位实测三道关卡:① 创意落地——以「中秋祈福」为主题生成 3D 粒子手势交互网页(握拳聚粒成月、比手势拼出「中秋快乐」「阖家团圆」等祝福动画),并顺带做了个《月宫快递》小游戏;② 真实任务——拆解英伟达 61 页 Q2 财报:约半小时(一场早会)产出 9 份图表 + 1 份投研风险简报,报道称营收/利润/净利润等数据与原文一一对应;随后把两篇 Nature/Science 论文、一篇报道与 20 份 DeepSeek 生成的模拟问卷数据交给模型写论文实证初稿——模型先指出「数据来源真伪未说明、问卷样本少、未控制变量」等研究缺陷,还在电商数据截图任务中扒出了数据集里的统计 bug,并把分析报告渲染成可视化 PDF;③ 整站设计——为原创游戏《堕神余烬》生成可直接上线的哥特风格官网(含闯关地图与 Boss 专题板块)。报道给出的脉络:星火 X1 攻深度推理 → X2-Flash 加码代码与智能体 → X2-VL 补多模态理解 → X2.5 把代码与智能体能力摆到最前面,结论是「国产算力模型进入可交付时代」。
为什么重要。 这条的新闻眼不是 293B 的参数,而是协议兼容策略:API 原生支持 Anthropic/Responses 协议,意味着星火 X2.5 主动选择「兼容主流 harness 生态、让 Agent 框架无缝插拔」的路线——与 #018 基元律动「路由经验进参数」、NeoHorse 的 Agent-Native 定位是同一判断的两面:模型竞争的战场正在从「对话体验」移到「被 Agent 框架调用的顺滑度」。配合此前开源的 4B/1.7B 端侧模型(原生 1M ctx),讯飞走的是「旗舰供云端 Agent 调用 + 端侧小模型吃长上下文」的哑铃路线。实测部分的含金量在于「干活+纠错」:拆 61 页财报、指出研究设计与数据的漏洞、揪出统计 bug——这类『审计型』能力正是 #018 以来反复出现的『模型要对自己产出的可信度负责』叙事的实操样本(尽管是媒体实测、非标准化评测)。
待观察。 293B 为发布口径,独立评测与榜单未见;量子位实测为单次媒体体验,任务选择与主观判断成分高(「数据准确」仅抽查了部分图表);「原生支持 Anthropic/Responses 协议」的兼容完整度(工具调用、流式、多模态字段)未做技术核验;端侧 4B/1.7B 跑 1M ctx 的实际吞吐没有给出参考数字;定价与限流策略未披露。
来源:量子位(正文直接抓取核验) · 讯飞开放平台(官方口径,本机未另行核验)
4. Anthropic 发布《Scenarios for our Economic Future》:三情景推演 + 万人调研——modest≈互联网级影响、substantial=2030 年 AI 能做一半知识工作、extreme=年 GDP 增长 15%
事实。 Anthropic 官方研究页 9/9 发布(anthropic.com/institute/econ-scenarios,本机直接抓取核验;HN 提交 9/9 21:38 北京时间、现约 164 分,HN 条目 49626373):Anthropic 经济未来研究所给出三情景推演(官方明确为情景推演而非预测)——modest(温和):AI 的经济影响与互联网类似,真实但渐进、在宏观数据里不明显;substantial(实质):到 2030 年 AI 有能力完成一半的知识工作、且大部分可自主完成,但并未被全部采用,经济以正常速度两倍增长,知识工作者工资不涨、其他劳动者受益;extreme(极端):AI 在绝大多数知识工作任务上比人更有生产力、几乎全部自主完成、且几乎不创造新的知识工作岗位——需要递归自我改进型 AI 与快速采用,年 GDP 增长率达 15%、经济每 4.5 年翻一番,社会远更富有但知识工作就业大幅减少、失业率超过典型衰退水平。页面附带情景对比:2030 年美国 GDP(万亿美元口径)modest +1.6%(34.1T)、substantial +8.3%(36.3T)、extreme +32.4%(44.4T)(页面展示口径)。调研部分:8 月对 10,980 名美国人(另有 9,771 名站内访客)调查其对 AI 能力、采用、自主性与转行难度的看法——典型受访者的回答接近「substantial」情景:2030 年 GDP 较无 AI 情形高 10%、整体失业率升至约 5%;约 10% 受访者的预期落在 extreme 情景。页面还提供可交互的「scenario explorer」供读者自行设定能力/采用/自主性/生产力/调整时间五个变量。
为什么重要。 这是头部实验室少见的「把宏观经济学假设摆上桌」的动作:三情景的差异项(采用速度、自主程度、是否递归自我改进)恰恰是当前无法从模型评测回答、只能靠假设的问题,Anthropic 用「情景 + 调研」的方式把公众预期的分布也画了出来——典型美国人的预期(GDP +10%、失业率约 5%)落在中间情景,这本身就是一条值得记录的社会信号:经历了两年 Agent 产品化之后,公众对 AI 的宏观预期既不像 2023 年那样狂热、也没有滑向末日叙事。对产业观察者而言,substantial 情景的界定(2030 年能力到位但采用滞后、知识工作者工资承压)与 #018 Devin「run-rate 收入半年近翻倍」的微观数据形成对照:能力曲线与采用曲线之间的落差,正是未来几年最值得跟踪的变量。
待观察。 情景推演非预测,参数假设(尤其 extreme 的 15% 年增长)的敏感性未公开;「2030 年 AI 能做一半知识工作」的能力假设依据未在页面展开;调研的抽样方法与问题措辞(五个维度如何映射到情景)未详细说明;页面为研究入口而非论文,方法论细节待配套文档。
来源:Anthropic 官方研究页(本机直接抓取核验) · HN 讨论
简讯
① Meta 个人 AI agent「Muse」续报:定价与安全细节补上,HN 热度升至 636 分/698 评论(#018 曾以「仅标题级核验」记录;官方页 ai.meta.com/muse 本机仍不可达——返回 JS 壳/超时;HN 条目 49615537 现 636 分,讨论帖):新增细节主要来自 HN 讨论中一条对 Reuters 报道的转述(评论者 aryehof 摘要,Reuters 原文本机未直读,如实标注转述层级)——产品尽管存在内部对「技术可能不当访问敏感个人数据」的担忧仍如期上线;仅美国可用;基础版免费,另有两档订阅:20 美元/月与 100 美元/月(更重度使用);用户可选择退出让交互数据用于训练 Meta 的 AI 模型;另有评论者提及被指出的安全缺陷(如 agent 绕过护栏的案例)。安全设计侧,Meta AI 负责人 David Singleton 的 X 帖(经 HN 用户 simonw 引用转述)描述其 prompt injection 分层防御:模型训练识别与抵抗 + harness 标记一切不可信来源 + 确定性代码检查结果 + 在 agent 触达不到的位置运行分类器集成。社区争论主线:隐私信任(「把更多生活喂给 Meta」的质疑)、面向「normie 用户」的产品策略、以及内联浏览器 UX(可旁观/接管 agent 操作)的好评。判断:Muse 的 20/100 美元订阅结构、训练退出开关与「敏感数据访问担忧仍上线」的组合,是消费级个人 Agent 隐私/安全产品化的第一个大型公开样本;「分层防御」与 #018 OpenAI/Anthropic 的 harness 安全叙事同构。待观察:Reuters 原文细节(订阅档位的确切能力边界)、官方页能力清单、以及「仅美国」的扩展计划。来源:HN 讨论(636 分,含 Reuters 转述与安全设计引述) · ai.meta.com/muse 官方页(本机不可达,未直读) · Reuters 原文本机未直读
② OpenAI 官方博客发文谈 GPT-5.6 Sol 如何辅助量子计算实验(openai.com/index/codex-quantum-computing-experiments/,本机仍为 Cloudflare JS 壳、不可直读,仅标题级核验;HN 提交 9/9 15:22 北京时间、约 143 分,HN 条目 49622561):HN 标题为「How GPT‑5.6 Sol helps run quantum computing experiments」。正文内容本机未获,仅记录该条目的存在与热度;结合 #018 记录的「GPT-5.6 分 Sol/Terra/Luna 档位」社区信息,这是 OpenAI 把旗舰模型往「科研工作流」场景包装的又一信号——此判断待官网可访问后补证。
③ Science 发文《How an AI math breakthrough ignited a controversy》,复盘 NS 千禧年风波(science.org 本机未直读;HN 提交 9/9 18:25 北京时间、约 211 分,HN 条目 49624163):这是 #018 主条(OpenAI 宣称 NS 千禧年问题之解 + Buckmaster 声明指控抢先)的主流科学媒体跟进。正文未直读,仅记录其存在与传播热度——主流科学期刊开始下场复盘,说明该事件已从 HN 社区议题升级为学界公共事件。
④ 具身机器人进超市盘点:从 Demo 到货架,全球约七万门店场景正在验证(量子位 9/9 12:52,486280,仅标题级核验,正文未抓取):量子位报道称具身智能公司正让机器人承担超市货架盘点/理货,「全球七万门店」规模的零售场景成为具身落地的试验场(标题口径)。——与 #018 深度智控(物理 AI 能源控制)并读,具身/物理 AI 的落地正在从「演示」转向「算得过账的重复劳动」。
⑤ 社区观察:Qwen 3.8 的推理 prefill 风格追随 GPT-5.5 Pro(gist.github.com/wsxiaoys 上 gist,本机 SSL 连接失败不可达,仅标题级核验;HN 提交 9/10 01:24 北京时间、约 159 分,HN 条目 49630026):HN 标题为「Qwen 3.8 follows GPT-5.5 Pro reasoning prefills」。属第三方开发者(TabbyML 的 wsxiaoys)的社区分析而非官方发布,正文不可达、结论未核验,仅作「开源模型推理行为趋同」的观察线索记录,请以原文为准。
今日判断
一句话:这一天的新闻没有「新模型发布」,但四条主线全部指向同一个方向——AI 正在从「生成内容」迁移到「接管流程」:苹果把 Siri AI 做成系统级入口(30 万 App)、蚂蚁把金融模型做成可复核的投研工作链、讯飞让 API 兼容 Anthropic/Responses 协议以便 Agent 框架直插、Anthropic 则开始推演 AI 接管一半知识工作后的经济形态。 三条信号值得带走:
其一,「入口」之战进入系统层。iPhone Duo 的 Siri AI(系统级、相机原生、30 万 App)与 Meta Muse(免费 + 20/100 美元)、ChatGPT Work 桌面端在同一条赛道上:个人 AI 的默认入口不再是一个网页,而是操作系统、桌面应用与浏览器三者选一。苹果的牌是硬件+系统捆绑,Meta 的牌是社交关系链+订阅,OpenAI 的牌是模型能力+工作流——谁先成为「用户默认让 AI 代办事情的地方」,谁就拿到下一轮分发权。
其二,「能干活的模型」的验收标准正在被发布方重新定义。蚂蚁开源 Ling-3.0-flash-Fin 的同时开源 FinFIRST 评测(把「可复核的证据链」变成可自动评测的维度),星火 X2.5 用「拆 61 页财报 + 指出研究漏洞」的媒体实测立人设——当『会干活』难以用传统 benchmark 衡量时,掌握『验收标准定义权』与『展示干活场景』的人就掌握叙事。读者对这类「官方供稿实测」应保持 #018 以来的同一警觉:分数与场景都来自发布方,独立复现才是分水岭。
其三,能力曲线与采用曲线之间的落差,成为宏观叙事的新焦点。Anthropic 的三情景把「2030 年 AI 能做一半知识工作」作为中间情景的能力假设,而公众典型预期(GDP +10%、失业率约 5%)比能力假设更保守——模型能力在实验室里跑得比社会采用快,这个落差既是投资机会也是政策议题;它与 #018 Devin 收入翻倍、Muse 的订阅定价一起,构成「Agent 经济化」的微观注脚。
本刊注:本期窗口为 9/9 08:00(#018 发布)至 9/10 08:00;openai.com、ai.meta.com、gist.github.com、science.org、apple.com 本机不可达(JS 壳/SSL/网络层),相关引文与数字均标注了核验路径(官方口径/转述/标题级);蚂蚁一条为官方供稿转载、讯飞 293B 为发布方口径、Muse 定价与安全细节经 HN 讨论转引 Reuters(原文未直读),请以官方原文为准。