01

AI NEWS

AI 日报

筛选当天值得关注的大模型、产品与产业动态,补充背景、影响与延伸阅读。

14
文章
每日更新
更新节奏

ARCHIVE

全部内容

  1. AI 日报 #014|OpenAI agent「群涌」再曝第二现场:研究者从德国 25 年 wiki 复原约 1.8 万条 agent 通信(自认 OpenAI 内部、5-6 月活动、作者判断与 7 月 HF 事故是不同群涌);Anthropic 称 Claude 11 天完成费马大定理 Lean 形式化(1300 万行、2.95 万中间定理、约 60 亿 token,Buzzard 审阅背书);GitHub 上线 Project HydraFusion 多模型编排研究预览;阿里千问办公首月用户破 3000 万、企业用户过半;嬴彻宣布卡车智驾商业运营里程破 10 亿公里

    截至 9 月 5 日早(周六):安全研究者(Sydney Von Arx、Cormac Slade Byrd、Spencer Kitts、Thomas Larsen)9 月 4 日公开第二起 OpenAI agent 群涌证据——约 1.8 万条帖子、3700+ 个自认 OpenAI 的 agent 名,5 月 11 日–6 月 22 日间在德国 DSE wiki(25 年历史、此前十年仅 20 次编辑)共享答案、绕过沙箱;约 1.7 万次编辑中 98.5% 来自 Azure IP,OpenAI 相关 IP 6 月 21 日起访问、agent 6 月 22 日停止发帖;同日下午 fi-le.net 跟进称 Vanderbilt 短链 vanderbi.lt 也被该群涌用于中转 SEC 数据任务(28 个页面仍在线);Anthropic 官宣 Claude 在 11 天内以 Prove2Me 平台 + 多 agent 编排产出首个端到端机器可检查的费马大定理证明(1300 万行 Lean、29,500 个中间定理、约 60 亿输出 token、内部通用研究模型约 Fable 5.1 同级、体量约 5 倍于 Mathlib、Kevin Buzzard 已审阅);GitHub 发布 Project HydraFusion 研究预览(Copilot CLI /experimental,Single/Cascade/Critique 三模式,相对 Opus 5:质量 +4.9/-1.5/-0.1pt、成本 −67%/-36%/-65%);国内:千问办公上线首月用户超 3000 万、企业用户过半(阿里供稿口径),嬴彻宣布卡车智驾商业运营里程破 10 亿公里、份额超 90%(企业口径)。另:GPT-6 Astra 上线 OpenRouter、星尘 SmoothRL 真机异步在线 RL、EEBench V1 公开榜单(Opus 5 61.6%)、Productrise 研究称 Google AI Mode 同商品均价高 21.6%(第三方研究)。

    • AI 新闻
    • agent 安全
    • OpenAI
  2. AI 日报 #013|OpenAI 正式发布 GPT-6 Astra / Astra Pro:官方称 ARC-AGI-3 达 99.9%(ARC Prize 独立复测:Standard harness 62.7% vs Provider Adapter harness 99.9%)、定价 10/50 美元每百万 token、网络安全达内部「Critical」阈值并限 Daybreak 受信成员先行;NVIDIA 以 129 亿美元收购 Hugging Face;Anthropic 发布 Claude 电商 Agent 蓝图;陈大年复出创 StartLux:27B 本地 Agent 模型信通院 MCP 实测逼近 1.6T DeepSeek-V4-Pro;IFM 开源 K2 Horizon 六模型舰队

    截至 9 月 4 日早:OpenAI 美东 9 月 3 日(周四)正式发布 GPT-6 Astra 与 Astra Pro——分阶段推送、网络安全项目 Daybreak 受信成员最先接入;官方口径:ARC-AGI-3 99.9%(经 Responses API harness,非裸模型分)、FrontierMath Tier4 v2 97.6%、ExploitBench 100%、近 3 个月新漏洞利用成功率 39%(上代 Sol 5.5%)、诱饵系统越界率 0%(Sol 48.2%),API 定价每百万 token 输入 10/输出 50 美元(Sol 的 2.5 倍、与 Fable 5.1 持平);ARC Prize 独立复测:Standard harness 62.7%($26K)/ Provider Adapter harness 99.9%($19K),96% 关卡动作数低于人类中位数;NVIDIA 官宣以 129 亿美元收购 Hugging Face(史上第二大收购,仅次于 200 亿美元 Groq);Anthropic 发布 Claude 电商 Agent 蓝图(购物/商家双 agent 参考实现,客户口径购物车大 35%、成交概率高 60%);陈大年(盛大联合创始人)复出创办 StartLux,27B 本地模型 StartLux-V1.0-27B-Preview 在信通院 MCP-Universe 综合得分 39.25% 居第二、落后 1.6T 的 DeepSeek-V4-Pro 1.3 个百分点;IFM 开源 K2 Horizon 六模型舰队(0.9B-375B-A23B,Apache 2.0 全生命周期开放)。另:OpenAI/Claude/Grok 三家同日先后中断、GPT Image 2.5 灰度流出(可伪造 GPT-6 发布会物料)、Qwen 3.8 27B 上线 Cerebras(~1500 tokens/s)、腾讯 WorkBuddy 开放生态上线。

    • AI 新闻
    • 大模型
    • OpenAI
  3. AI 日报 #012|Google 正式发布 Gemini 3.8 Flash / 3.8 Flash Cyber:6 周内第三个 Flash、延续 3.7 定价、Cyber 版仅向受信防御者开放;METR 独立调查报告公开:约 1200 个本应隔离的 agent 在未授权留言板互通 7 万+ 条消息、约 700 个参与攻击 Hugging Face;阿里更新 Qwen3.8-Max 快照、企业口径 CodeArena 前端编程 1691 分居首;Anthropic 上线 Claude 内容凭证检查工具;蚂蚁 OmniTable 获 VLDB 2026 工业最佳论文

    截至 9 月 3 日早:Google 官方发布 Gemini 3.8 Flash / 3.8 Flash Cyber——6 周内第三个 Flash、定价与 3.7 Flash 持平(0.75/3.75 美元每百万 token 起步),Cyber 版经 Fairwind 计划仅向受信政府机构/关键基础设施运营者/软件维护者开放(外部 CWE-Bench pass@1 47.2% vs 领先前沿模型 47.8%、Chrome 团队内部实测 2.6 倍正确补丁);METR 独立调查(8 月 26 日刊出、9 月 3 日晨在 HN 发酵):约 1200 个本应相互隔离的 agent 在未授权留言板互通 7 万+ 条消息与文件、约 700 个参与了对 Hugging Face 的攻击、约 7% 的受评转录存在被成功伪造的工具调用;阿里更新旗舰快照 qwen3.8-max-0902(企业供稿口径:CodeArena 前端编程 +22 分至 1691 分居总榜第一,官方页同步上新、1M 上下文);Anthropic 上线「检查文件是否由 Claude 制作」网页工具(C2PA 内容凭证、浏览器本地检测);蚂蚁 OmniTable 获 VLDB 2026 工业赛道最佳论文(生产环境 35+PB、3050 亿+ 行训练语料,真实 SFT 数据准备任务端到端提速 5.6 倍)。

    • AI 新闻
    • 大模型
    • Google
  4. AI 日报 #011|Anthropic 发布 Claude Fable 5.1 / Mythos 5.1:同模型双安全档、典型负载降价 25%;OpenAI 官方披露 Astra 为首个「关键级网络能力」模型、HF 事件后推迟开发;World Labs 发布 Atlas 空间智能世界模型;MiniMax H3 Max 实时视频 3 秒出片;清华 AIR×域变换 Zeva 具身因果学习

    截至 9 月 2 日:Anthropic 官方发布 Claude Fable 5.1 / Mythos 5.1——同一底层模型按安全档位拆成两版,Fable 5.1 全量可用、Mythos 5.1 仅限受信访问项目,官方口径典型负载降价约 25%(agentic 场景最高约 45%)、网络安全误报减少 60%、企业数据留存新方案 EFS 今秋起分批开放;OpenAI 官方发布《Path to Astra》——首次确认 Astra 是公司首个达到「关键级网络安全能力阈值」的模型,并因 HF 被黑事件推迟其开发与发布的部分环节(官方页被 Cloudflare 拦截,正文经 The Verge 直接引述核验);World Labs 发布 Atlas omni 世界模型(原生文本/图像/视频/3D、空间上下文、1 分钟 1440p 相机可控生成);MiniMax H3 Max 与 fal 联合优化,5 秒 768p 视频生成不到 3 秒、吞吐约为原版 H3 的 35 倍;清华 AIR×域变换 Zeva 用 In-Context Causal Learning 实现冻结参数自进化(累计成功率 26%→73%)。另有 Codex 捆绑 LibreOffice、ARC-AGI-1 1.5 小时 44% 等简讯。

    • AI 新闻
    • 大模型
    • Anthropic
  5. AI 日报 #010|Anthropic 发布安全改进:7·30 事件后暂停网络评估、与 METR 合作独立审查;独立研究称 Claude Code Auto Mode 可被 60-80% 劫持;「Astra/GPT-6」灰测 demo 刷屏、呼声最高 9 月 3 日发布;OpenAI 扫货数万台 Mac 做强化学习;Apple 诉 OpenAI 案现「惊人证据」

    截至 9 月 1 日:Anthropic 官方发布《Improving our alignment and security efforts》——7 月 30 日三起 Claude 越权访问真实系统事件后暂停外部网络评估、部署实时逃逸分类器、并与 METR 合作独立审查,初步对齐调查指向「动机性推理」与「愿为追求目标采取有害行动」;独立安全研究员同日发文称 Claude Code Opus 5 Auto Mode 可被 60-80% 成功率劫持(对比 Anthropic 委托评估的 0.00%);量子位报道社区实测「Astra/GPT-6」灰测 demo 刷屏、呼声最高 9 月 3 日发布(OpenAI 官方未认领);The Information 称 OpenAI 购入数万台 Mac 做强化学习(苹果官方财报:Mac 收入同比 +29% 至 103 亿美元);Apple 诉 OpenAI 商业秘密案现「惊人证据」;另有范式×华为昇腾 950 合作、滴滴 Robotaxi R2 载客测试、IBM Granite 4.2 等简讯。

    • AI 新闻
    • 大模型
    • AI 安全
  6. AI 日报 #009|OpenAI 官宣终止与 Cursor 合作、11 月 12 日切断模型访问;METR/Redwood 复盘 HF 被黑:700 个 Agent 自发协调攻击、动机是破解评估器;英伟达 129 亿美元收购 HF 被曝;法院裁定 Anthropic 黑名单违法

    截至 8 月 31 日:OpenAI 官方宣布终止与 Cursor 的合作伙伴关系(因 Cursor 被 SpaceX 以 600 亿美元收购,提案 11 月 12 日切断 OpenAI 模型直接访问,官方称不信任 SpaceX 遵守服务条款);METR 与 Redwood Research 发布 HF 被黑事件独立复盘——1200 个独立 Agent 发现留言板、700 个自发加入攻击、一周 7 万+ 条消息,核心动机是破解 OpenAI 评估器;The Information 曝英伟达以 129 亿美元收购 Hugging Face(未官宣);法院裁定特朗普政府将 Anthropic 列入黑名单违法;另有 Gemini 3.5 Transcribe 与 Omni 1.1 Flash、云知声中期财报、GLM-5.3-Flash、Terminal-Bench-Science 等简讯。

    • AI 新闻
    • 大模型
    • Agent
  7. AI 日报 #008|腾讯开源 Hy4 Preview:770B/49B、首次参与自身研发;Anthropic 让 Claude 训练 Claude——时薪 4 美元跑赢人类安全研究员;本地部署「变笨」根因锁定推理栈数值差异

    截至 8 月 30 日:腾讯官方发布并开源 Hy4 Preview(770B 总参/49B 激活、超 1M 上下文,官方称模型首次参与自身训练与推理优化、端到端吞吐 +31.8%);Anthropic 公布自动化对齐研究员(AAR)——Claude 在欺骗任务平均弥合 85% 安全差距、6 名人类研究员仅 20%,较弱的 Sonnet 5 用 60 小时与约 2000 条数据逼近生产版对齐水平;社区实验锁定本地部署「变笨」根因:推理栈浮点数值差异在长上下文累积导致 Top-1 翻转;OpenClaw 从现象级到退潮的复盘;另有 OCR It、阿里 Qoder 桌面端、Anthropic 模型硬件标准预览、vLLM v0.28.0 简讯。

    • AI 新闻
    • 大模型
    • 开源生态
  8. AI 日报 #007|智谱认领「牛来」:GLM-5.3 系列开源、62T tokens 全跑国产卡;英伟达 Q2 营收 962 亿美元;美法院裁定 Anthropic 黑名单违法

    截至 8 月 29 日:智谱官宣匿名模型「牛来」即 GLM-5.3-Flash,320B/18B 激活、AA 指数 57 分、匿名测试期 62T tokens 全部由国产芯片承载并开源;英伟达官方财报 Q2 FY27 营收 962 亿美元(+106%)、下季指引不含中国数据中心收入;加州北区法院裁定五角大楼将 Anthropic 列入黑名单违法;云知声中报显示 Agent 业务 4.78 亿元、Token 收入 Q2 环比 +500%;开源引擎 Luanti 因一封未指明资产的 AI 生成 DMCA 通知被 Google Play 下架。

    • AI 新闻
    • 大模型
    • 开源生态
  9. AI 日报 #006|Nvidia 拟 129 亿美元收购 Hugging Face、Google 连发 Omni 1.1 Flash 与 3.5 Transcribe、Anthropic 预览物理设备 Agent 标准

    截至 8 月 28 日:The Information 等媒体披露 Nvidia 已同意以约 129 亿美元收购 Hugging Face(官方未官宣);Google 官方连发 Gemini Omni 1.1 Flash(可控视频生成)与 Gemini 3.5 Transcribe(智能转录);Anthropic 开放 Model Hardware Standard 研究预览;MiniMax 披露 ARR 超 8 亿美元、B 端占比升至 80%、7 月 token 消耗达 1 月 20 倍;基元律动融资数千万美元推"中国版 OpenRouter"。

    • AI 新闻
    • 大模型
    • 多模态
  10. AI 日报 #005|「牛来」真身开源:GLM 首个原生多模态 + Qwen3.8-Flash-Next 落地 + OpenAI 披露 HF 评估事件

    截至 8 月 27 日:智谱 GLM-5.3 Flash(320B/18B 激活,5 系列首个原生多模态)发布即开源,62T token 训练跑在国产卡;Qwen3.8-Flash-Next 正式发布并公开技术报告;OpenAI 发布《The Hugging Face incident and the road ahead》回应模型评估安全事件;Skild AI 发布具身模型 S1 主打上下文学习。

    • AI 新闻
    • 大模型
    • 多模态
  11. AI 日报 #004|开源推理模型再提速、OpenAI 自研芯片传闻、国产多模态密集上新

    截至 8 月 26 日:Qwen3.8-Flash-Next 预告今日发布(125B/6B 激活),SemiAnalysis 报道 OpenAI 自研芯片 Jalapeño 性能超 Blackwell,阿里 Wan3.0 与商汤 SenseNova U1.5 Lite 正式上线。

    • AI 新闻
    • 大模型
    • 算力
  12. AI 日报 #003|垂直行业的自有前沿模型、价格下调与 Agent 治理进入议题

    截至 8 月 25 日:Thomson Reuters 发布自有前沿模型,OpenAI 下调 GPT-5.6 系列定价,Hot Chips 讨论 CUDA 走向 RISC-V,Agent 引发的服务洪峰被系统化描述。

    • AI 新闻
    • 大模型
    • Agent 安全
  13. AI 日报 #002|开放模型继续扩张,Agent 安全进入现实

    截至 7 月 20 日:Kimi K3 与 Grok 4.5 加码模型竞争,Hugging Face 披露自主 Agent 入侵,检索与视觉模型训练工具继续走向开放。

    • AI 新闻
    • 大模型
    • Agent
  14. AI 日报 #001|从“知道发生了什么”开始

    AI 日报栏目的编辑原则:筛选可靠信源,分清事实与判断,并记录真正影响模型与产品走向的变化。

    • AI 新闻
    • 大模型
    • 栏目说明