AI 日报 · 2026-09-14(周一)

覆盖方向:AI Coding × 具身智能

统计窗口:2026-09-13 05:30 → 2026-09-14 05:30(北京时间,过去 24 小时)

实时数据源(抓取于 2026-09-14 05:33–05:40):① LiveBench 官网实时榜(release 2026-06-25)② Artificial Analysis Intelligence Index(官网实时页 JSON-LD 结构化直采,20 模型完整分数/吞吐/上下文)③ llm-stats.com(390 模型实时价/吞吐/分项)④ GitHub Trending(AI 专项日榜,05:35 现场抓取)⑤ 社区信源交叉验证(公开渠道,详见第一节)

社区一手信源:X / 中文社区(知乎·V2EX·Linux.do·微信公众号聚合号)/ 海外社区(Hacker News·r/LocalLLaMA·r/ClaudeAI·LessWrong)/ 开发者社区(GitHub Releases·Hugging Face)/ 聚合线索号(机器之心·量子位·新智元·智猩猩AI·科创板日报·FutureX Physical AI Daily·AGI Hunt·AI Weekly·quidproquo·腾讯研究院AI速递·太平洋科技每日观点)

免责声明:本文由自动化流程汇总公开信源生成,逐条标注「时效 / 来源 / 置信度」,仅供参考,不构成投资或商业决策依据。社区单源未交叉验证者一律单列「社区快讯(待验证)」,不入正式条目。所有价格、评分以各榜单官网实时页为准,跨口径对比仅看量级。


目录

章节内容关键标记
社区信源监控与浏览器门禁披露未执行项透明标注
DeepSeek 专项今日有 D ✅(D1–D6)
15 条精选 · 甲组 AI Coding(8 条)8 条
15 条精选 · 乙组 具身智能(7 条)7 条
社区快讯(待验证单列存疑线索
三口径能力评分与价格表LiveBench / AA / llm-stats
Price vs Performance 性价比双视角条形图
AI 社会效益7 领域
AI 经济效益6 维度
方法论与免责声明

一、社区信源监控

1.1 浏览器就绪门禁(步骤 0 · 必做)

结论:本运行(自动化无人值守)未执行 B 站 UP 主字幕提取,浏览器进程层未就绪。

对照历史:09-05 至 09-13 连续多期均为同一原因(控制通道未连接);本期依旧为「浏览器不可用(端口探活未连通)」,而非「已连接但提取受限」。

1.2 公开社区/二手信源交叉验证表(过去 24h)

#线索平台 / 来源发帖时效是否构成新闻交叉验证置信度
C1恶意 .git/configcore.fsmonitor)可让 Claude Code / Codex / Cursor 静默执行攻击者代码;Cursor 获 CVE-2026-48124(3.0.0 修复),Claude Code 存在跨 v2.0.24–v2.1.89 的网络绕过,Anthropic 修复耗时约 50 天 / 30 个版本Accomplish 官方披露 · The Hacker News · BleepingComputer · Cymulate Research Labs · BYOBot(09-13) · Pondero(09-13)09-13 集中披露✅ 是披露方 + 4 家安全媒体同向;CVE 编号可查已确认
C2Claude Code CLI 2.1.270:修复 2.1.269 回归(长会话后只读 git 命令误弹权限)、新增内联 Bash 执行、新增可派生子代理的 agent-launch 工具AGI Hunt(09-13) · dev.to《This week in Claude Code…》(09-13 周) · Anthropic 发布日志09-13✅ 是(官方发布日志)3 源同向 + 官方 changelog已确认
C3Codex 工程师 Thibault Sottiaux 回应质量投诉三点:旧模型 skills 误触发/阻塞自检、上下文管理实验(约 4–5k 用户,已停用)、引擎配置错误导致尾部质量下降;Astra 档位暂停为「维持广泛访问的最小措施」腾讯研究院AI速递(09-14 00:01) · AGI Hunt(09-13) · X09-13~09-14✅ 是(厂商自述)3 源同向,均为 OpenAI 单边口径大概率
C4Real-SWE 新基准:最强模型在约 1/3 真实任务上「漏掉需求」,最大失败模式是 missed requirementsr/LocalLLaMA 热帖(74 评论)· AI Morning Briefing(09-13) · HN09-13✅ 是(技术议题)社区热帖 + 2 聚合源大概率
C5huggingface_hub SDK 扫描环境变量识别 26 个已知 coding agent(Cursor/Copilot/Claude Code 等),给每次 Hub API 调用打 agent/ user-agent 遥测r/LocalLLaMA(09-12 流量审计) · AI Weekly(09-13) · promppy09-12~09-13✅ 是社区审计 + 2 源;HF 文档称「opt-in 可观测性」大概率
C6Amodei 发表《We Must Pace the Frontier》三步走(第三方驻场评估 / 民主协调 / 全球协调);Altman、马斯克、Hassabis 先后附议;白宫 PCAST 主席 Sacks 斥为「监管俘获」darioamodei.com(09-12) · 环球市场播报(09-14 04:39) · 财联社(09-14 03:25) · AI Weekly(09-13)09-12~09-14✅ 是当事人一手 + 4 家权威媒体已确认
C7Anthropic / OpenAI / Google 正磋商由行业主导成立 AI 标准机构(The Information)The Information · 财联社(09-14 03:25) · 东方财富09-14 03:25✅ 是单一爆料源 + 2 家转载,无当事方确认待验证
C8两位安全研究员 Joe Benton(Anthropic 可扩展监督前负责人)与 Josh Engels(Google DeepMind)09-12 离职加入 METR;Engels 称「房间里没有成年人」NBC News(09-12) · Pondero(09-13) · AI Weekly(09-13) · freepressjournal09-12~09-13✅ 是4 源同向 + 当事人具名已确认
C925 位菲尔兹奖得主(陶哲轩、Peter Scholze、邓煜等)联名声明,警示 AI 把「解题」当基准竞赛正损害数学科学与共同体腾讯研究院AI速递(09-14) · liorpachter 反驳文(09-13) · HN09-13~09-14✅ 是3 源同向,未见声明原文公开链接大概率
C10Anthropic 员工 Evan Hubinger 称个人估计未来十年 AI 灭绝人类概率 >10%;Altman 亦称 10% 不可接受环球市场播报(09-14) · 新浪财经09-14 04:39✅ 是(观点)2 源同向,属个人估计大概率
C11优必选柳州工业人形机器人超级智慧工厂 09-12 投产:14,000 ㎡、每 10 分钟下线 1 台、年产能超万台,主产 Walker S 与 Cruzr新华社(09-13) · 证券时报(09-13) · 腾讯新闻 · FutureX #119(09-14)09-12~09-14✅ 是4 源同向(含新华社)已确认
C12宇树人形机器人单价两年降约 72%(59.34 万 → 16.64 万元);2026 H1 全球人形出货约 19,100 台(近 3 倍增长),中国厂商份额 >97%证券时报(09-13) · Smart Analytics Global · 高盛 · FutureX #11909-13✅ 是3 源同向(出货量为第三方统计)大概率
C13具身触觉传感赛道 7 月以来至少 8 笔融资、合计超 25 亿元;帕西尼与一目科技各获 10 亿元第一财经(09-13) · 新浪 · FutureX #119(标注「媒体不完全统计」)09-13✅ 是2 源同向,媒体自述为不完全统计大概率
C14现代汽车自研 Atria AI 系统延期两年至 2029 下半年,2028 先上英伟达 Drive L2+ 方案The Korea Herald(09-12) · Reuters · 东网(09-13) · FutureX #11909-12~09-13✅ 是4 源同向(含路透)已确认
C15上海 AI 实验室发布「书生」物理世界模型 W0(异步双频架构);智元 WITA-Omni Preview 自称登顶 DailyOmni(85.21,八项中六项第一)新民晚报(09-13) · 文汇报(09-13) · FutureX #11909-13~09-14✅ 是3 源同向,分数为厂商自报大概率(分数待独立验证)
C16InfoQ 三组对照测试:同一底层模型,不同 AI 编程工具的 token 消耗相差最多 70 倍,差异主要来自 Agent 框架启动开销与缓存命中率InfoQ(09-13) · 中文聚合号09-13✅ 是2 源同向,测试方法未完全公开大概率
C17规模化 agent 的新瓶颈从 token/算力转向磁盘:Vincent Koc 团队每天跑 100–200 个 agent,现缺 scratch space;Uber 工程 VP 称一夜 Codex /goal 会话丢失整个 git worktreeAGI Hunt(09-13) · HN · X09-13✅ 是(工程实践议题)社区一手 + 聚合号待验证
C18Kimi K2.8 Preview 在 Kimi Code 与 Kimi Work 全量上线(09-11 官方),1M 上下文向所有会员开放;月之暗面 8 月 ARR 破 10 亿美元、已递表港交所月之暗面官方(09-11) · 腾讯研究院AI速递(09-14) · 量子位(09-13)官方 09-11 / 速递 09-14✅ 是官方一手 + 2 源已确认

二、DeepSeek 专项

今日有 D ✅(共 6 条,窗口 2026-09-13 05:30 → 2026-09-14 05:30)

时效硬核核验说明:本节所有条目的日期均已逐条对照官方一手来源核验。DeepSeek 官网新闻页(deepseek.com/news)当前最新条目为 2026-09-10「DeepSeek V4.1 Flash:更强、更快、更普惠」;V3.2 正式版对应 2025-12-01、V3.2-Exp 为 2025-09-29,均属超窗旧闻,本期不列为新发事件。官网首页横幅、版权年份一律不作为发布日期依据。

#事件时效来源核验置信度
D1爆料:DeepSeek 将推「Code 2.0」,参数量 3 万亿以上,设计重点为 Computer Use(电脑控制),发布窗口在 9 月,预计继续开源开放;同时 Pro 系列新品确定为 V4.1 Pro(升级内容未公布)。作为对照:K3 为 2.8 万亿、Qwen3.8 Max 2.4 万亿、DeepSeek V4 Pro 1.6 万亿2026-09-14 02:14(IT时代网)/ 2026-09-14(17173 快科技)IT时代网 · 17173 · 快科技爆料性质,DeepSeek 官方未发布任何公告;官网新闻页最新仍为 09-10待验证(单源爆料串,无官方一手)
D2今日(09-14)12:00 为官方原定的 V4 Pro 路由切换时点——原计划 deepseek-v4-pro 请求全部转由 V4.1 Flash 承接并按 Flash 计费;后因用户需求,官方改为「2026-09-14 之后继续提供 V4 Pro API,计费方式不变」。截至本期截稿(05:30)切换尚未执行,今日为名义上的 D-day官方公告 09-09 首发 / 修订落 09-11~09-12;D-day = 2026-09-14DeepSeek API Docs《Change Log》官方一手页 · 网易/三易生活(09-13 11:11) · 百度百科「DeepSeek-V4.1」词条官方一手页年份 = 2026 ✅;三源同向已确认
D3招商证券计算机行业周报(09-13)专章覆盖:V4.1 Flash 为全新架构下最小尺寸原生多模态 MoE,激活算力与 KV Cache 需求大幅下降,显著压缩 Agent 场景成本并同步下调 API 定价;公司拟启动科创板 IPO(已聘中信证券);2026 年前 7 个月营收约 4.75 亿元,约为 2025 全年营收的 10 倍2026-09-13招商证券《计算机行业周观察》(刘玉萍/周翔宇) · 新浪财经研报库券商研报,数字可追溯;营收数据为研报口径非公司披露大概率
D4太平洋科技《每日观点&资讯》(09-14) 将 V4.1 Flash 列为当日 AI 资讯要闻:552B MoE / Causal-Encoder-Decoder 非对称结构 / 输入激活 8B、输出激活 16B / 原生多模态视觉 / HBM 需求降至上一代 1/4、SSD 降至 1/82026-09-14太平洋证券《每日观点&资讯》(2026-09-14) · 同花顺财经券商日报,与 09-10 官方技术口径一致已确认(技术参数)/ 收录时点 大概率
D5三口径榜单同日收录 V4.1 Flash:LiveBench 81.1(总评第 5)/ 每成功任务成本 $0.029(全表最低档)/ Agentic Coding 77.3 全榜第一AA 智能指数 39.55(高于 V4 Pro 0813 的 36.28)、输出 227.8 tok/sllm-stats #12(51.8 / $0.24,Agent 分项 41.3)2026-09-14 05:33–05:40 实时直采livebench.ai · artificialanalysis.ai · llm-stats.com三家独立榜单同向收录,矛盾自检通过已确认
D6行业背景对照:智谱 09-13 宣布完成约 50 亿美元融资(约 20 亿美元股份配售 + 约 30 亿美元零息可转债,初始转股价 892.50 港元、较公告前收盘溢价约 12.55%);媒体将其与 DeepSeek 6 月超 500 亿元人民币首轮融资并列,定调大模型行业从「比跑得快」转向「比耐力」(造血能力 / 算力壁垒 / 生态落地)2026-09-13 20:55钱江晚报·潮新闻 · 智谱港交所公告非 DeepSeek 原生事件,仅作同赛道对照背景,不计入 DeepSeek 自身动态已确认(智谱)/ 叙事定性 大概率

超窗剔除清单(本期不作为新发事件)

事项真实日期剔除理由
DeepSeek-V3.2 正式版 / V3.2-Speciale2025-12-01年份 ≠ 本期年份;官网横幅为常驻营销内容,不构成发布日期
DeepSeek-V3.2-Exp2025-09-29同上
V4.1 Flash 首发2026-09-10已超出 24h 窗口(上期已报)
峰谷定价、App 灰度语音对话(四种音色)08-17 / 09-12超窗,仅作背景
内蒙古乌兰察布 1GW、16 万颗昇腾 950DT09-04(彭博首发)超窗
第二轮 500 亿元融资2026-06超窗

本期 DeepSeek 小结:真正的当日增量是 D1(Code 2.0 爆料,待验证D2(今日 12:00 为原定切换 D-day,实际已改为继续提供 V4 Pro);D3–D5 是 V4.1 Flash 发布后在券商研报与三家独立榜单上的同日收录与量化确认。V4.1 Flash 在 LiveBench「Agentic Coding」单项以 77.3 分位列全榜第一,同时每成功任务成本 $0.029 处于全表最低档——能力进入第一梯队、成本仍在地板,这是本期最值得注意的结构性变化。


三、15 条精选 · 甲组:AI Coding(8 条)

A1 · 恶意 .git/config 让三大编程 Agent 静默执行攻击者代码,沙箱不是边界

A2 · Claude Code 2.1.270:修复 2.1.269 回归、内联 Bash、可派生子代理

A3 · Codex 质量争议三连回应与 Astra 容量暂停

A4 · Real-SWE 新基准:最强模型在约 1/3 真实任务上「漏掉需求」

A5 · huggingface_hub 静默上报你正在用哪个 coding agent

A6 · Kimi K2.8 Preview 全量上线,1M 上下文向所有会员开放

A7 · Cursor Projects:从「单次交互」走向「长跑型组织」

A8 · 同模型不同工具,token 消耗相差 70 倍——AI 编程的隐性成本黑洞


四、15 条精选 · 乙组:具身智能(7 条)

B1 · 优必选柳州超级智慧工厂投产:每 10 分钟下线 1 台,年产能超万台

B2 · 宇树单价两年降约 72%,H1 全球人形出货约 19,100 台

B3 · 具身触觉传感赛道 7 月以来至少 8 笔融资、合计超 25 亿元

B4 · 核心零部件降价与国产化率超 75%

B5 · 上海 AI 实验室「书生」物理世界模型 W0 + 智元 WITA-Omni 登顶 DailyOmni

B6 · 现代汽车自研 Atria AI 延期两年至 2029 下半年

B7 · 具身智能融资结构转向「家庭场景 + 基础模型」,两月超 20 亿元


五、社区快讯(待验证

#线索来源 / 时点为何存疑缺哪一方验证
P1DeepSeek 将推 Code 2.0,3 万亿+ 参数,主打 Computer Use,9 月窗口,继续开源IT时代网(09-14 02:14) · 17173/快科技纯爆料串,无官方公告、无模型卡、无 GitHub Release;官网新闻页最新仍为 09-10缺 DeepSeek 官方一手确认
P2Anthropic / OpenAI / Google 正磋商成立行业主导的 AI 标准机构The Information · 财联社(09-14 03:25)单一爆料源 + 转载,三方均未公开确认;与 Sacks「监管俘获」指责方向相反缺任一当事方官方声明
P3规模化 agent 的瓶颈转向磁盘;Uber 工程 VP 一夜 Codex /goal 会话丢失整个 git worktreeAGI Hunt(09-13) · X个人陈述,无日志或复现;「磁盘瓶颈」未量化缺可复现的工程报告
P4用户质疑 Astra 生成质量退化(同提示词前后对比),OpenAI 称「模型未做任何改动、正在调查」腾讯研究院AI速递(09-14) · X对比样本为单用户自述,未排除路由/引擎/skills 变量缺第三方同条件复现
P5智元 WITA-Omni Preview 以 85.21 登顶 DailyOmni(八项中六项第一)文汇报(09-13) · FutureX #119厂商自报分数,榜单未见独立维护方核验缺第三方复跑
P6现代 Atria AI 延期消息中「42dot / Park Min-woo」相关组织调整细节The Korea Herald(09-12)人事细节为媒体转述缺现代汽车官方公告
P7半机械蟑螂废墟搜救:15cm 内注射成功率 95%、全流程 72%具身机器人行业动态(09-13) · 昆士兰大学仅在模型与猪肉上验证,距实用数年;非同行评审缺同行评审论文

六、三口径能力评分与价格表(截至 2026-09-14)

6.1 LiveBench 实时榜(release 2026-06-25,官网直采 2026-09-14 05:33)

#模型总评ReasoningCodingAgentic CodingMathData AnalysisLanguageIF每成功任务成本
1Claude Fable 5.1 Max Effort83.491.786.466.197.080.389.573.0$1.212
2Claude Fable 5 Max Effort83.089.786.062.296.080.590.775.8$1.439
3GPT-6 Astra Max Effort82.292.780.457.396.883.089.475.6$0.736
4Muse Spark 1.3 xHigh81.689.781.164.195.979.682.878.0$0.219
5DeepSeek V4.1 Flash Max(开源)81.186.780.077.393.379.381.270.0$0.029
6GPT-5.6 Sol Max81.091.783.956.296.279.887.771.8$0.515
7GPT-5.5 Thinking xHigh80.289.782.154.095.981.687.470.7$0.435
8Claude 5 Opus Thinking Max80.191.281.465.295.774.688.763.8$0.699
9Kimi K3(开源)79.290.781.462.284.478.785.571.4$0.348
10Gemini 3.7 Flash High78.887.878.958.393.568.085.579.9$0.157
11Qwen 3.8 Max(开源)78.588.272.964.691.378.479.774.1$0.275
12Grok 4.678.090.576.857.092.673.983.771.9$0.207
16DeepSeek V4 Pro 0813(开源)77.485.877.254.995.179.282.167.7$0.044
22GLM-5.3(开源)76.185.879.060.987.970.279.969.3$0.450
40GLM-5.3 Flash(开源)71.677.679.056.881.276.477.352.8$0.031
49Grok Build 0.167.876.465.445.878.470.872.565.2$0.024

口径说明:LiveBench 为 7 大类 23 项客观任务、每半年刷新;当前 release 2026-06-25(latest)。成本极差 50.5×($1.212 vs $0.024),而总分极差仅约 23%(83.4 vs 67.8);若只看前 5 名,总分极差仅 2.8%,成本却差 41.8 倍。DeepSeek V4.1 Flash 的 Agentic Coding 77.3 为全榜单项第一(高于 Claude Fable 5.1 的 66.1 达 11.2 分)。

6.2 Artificial Analysis Intelligence Index(官网实时页 JSON-LD 结构化直采,2026-09-14 05:34)

#模型智能指数输出速度 (tok/s)上下文
1Claude Fable 5.1 (max with fallback)53.3767.11.0M
2GPT-6 Astra (max)52.8160.11.0M
3Claude Opus 5 (max)50.7052.71.0M
4Claude Fable 5 (with fallback)49.7064.91.0M
5Muse Spark 1.3 (max)48.17236.71.0M
6GPT-5.6 Sol (max)47.0657.91.0M
7GLM-5.3 (max)(开源最佳)44.8672.01.0M
8Grok 4.6 (high)44.4160.0
9Kimi K3 (max)43.7836.81.0M
10GPT-5.6 Terra (max)42.25113.71.0M
11GLM-5.3-Flash41.91108.71.0M
12Gemini 3.8 Flash (high)41.19277.51.0M
13Qwen3.8 2.4T A95B40.04983.6K
14DeepSeek V4.1 Flash (max)39.55227.81.0M
15GPT-5.6 Luna (max)37.50119.71.0M
16DeepSeek V4 Pro 0813 (max)36.2877.91.0M
17Qwen3.8 27B (xhigh)33.90
18K2 Horizon 375B A23B30.79524K
19MiniMax-M329.61109.31.0M
20Inkling25.5489.31.0M

口径说明:AA 为闭源/开源混合的综合智能指数(含 AA-Briefcase 等智能体化评测),与 LiveBench 不同口径,不可直接比较绝对值。本期关键读数:DeepSeek V4.1 Flash 输出 227.8 tok/s,是同分数段(39–42 分)唯一进入 200+ 的模型;其智能指数 39.55 已超过自家 V4 Pro 0813 的 36.28。头部 Fable 5.1 速度仅 67.1 tok/s,与 V4.1 Flash 相差 3.4 倍

6.3 llm-stats 实时榜(390 模型,2026-09-14 05:35 直采)

#模型LLM Stats 分ReasoningCodingAgent上下文速度混合价 $/M许可
1GPT-6 Astra59.957.948.546.41.1M93 c/s$11.90闭源
2Claude Fable 5.155.953.035.541.81.0M80 c/s$11.90闭源
3GPT-5.6 Sol55.054.146.041.51.1M81 c/s$6.19闭源
4Claude Mythos Preview(未发布)54.955.844.836.5闭源
5Claude Opus 554.953.941.940.01.0M70 c/s$5.95闭源
6Muse Spark 1.354.451.841.740.41.0M65 c/s$0.10 ⚠️闭源
7Claude Fable 554.351.845.740.51.0M34 c/s$11.90闭源
8Kimi K353.151.843.339.51.0M3 c/s$3.39开源
9GLM-5.352.851.942.839.61.0M147 c/s$1.33开源
10DeepSeek-V4-Pro-081352.150.140.737.91.0M67 c/s$0.46开源
11Qwen3.8 Max51.950.639.637.71.0M125 c/s$1.81开源
12DeepSeek-V4.1-Flash51.848.944.441.31.0M$0.24开源
13Hy4 preview(腾讯)51.050.739.936.8开源
14Claude Opus 4.850.950.341.735.51.0M59 c/s$5.95闭源
15GPT-5.6 Terra50.849.242.238.21.1M135 c/s$2.48闭源

口径说明:llm-stats 为跨公开基准的 TrueSkill 合成分,混合价按 8 : 1(输入 : 输出)折算每百万 token。⚠️ Muse Spark 1.3 的 $0.10 是 Contributor 档价格(允许 Meta 使用流量训练),标准档为 $1.25/$4.25,折算混合价 $1.583——下文性价比表已按标准档重算,直接用 $0.10 会得出虚高 5 倍以上的结论。

6.4 GitHub AI 趋势榜(AI 专项日榜,2026-09-14 05:35 抓取)

#仓库Stars语言说明
1openclaw/openclaw389.6kTypeScript跨 OS/平台的通用 AI agent
2n8n-io/n8n204.2kTypeScript原生 AI 能力的工作流自动化
3Significant-Gravitas/AutoGPT187.3kPython自主 agent 经典项目
4langgenius/dify155.6kTypeScriptAgentic 工作流 + RAG
5langflow-ai/langflow154.7kPython可视化 agent 编排
6msitarzewski/agency-agents152.1kShell一整套「AI 代理公司」角色
7open-webui/open-webui151.9kPython自托管 AI 界面(Ollama/OpenAI API)
8langchain-ai/langchain146.2kPythonAgent 工程平台
9Shubhamsaboo/awesome-llm-apps137.9kPython100+ Agent / Skills / RAG 应用
13google-gemini/gemini-cli107.0kTypeScript终端 agent
14earendil-works/pi104.7kTypeScript统一 LLM API + 编码 agent CLI
15addyosmani/agent-skills94.0kJavaScript生产级 AI 编码 agent 技能包
16thedotmack/claude-mem93.8kTypeScript跨会话持久上下文
17vllm-project/vllm91.7kPython高吞吐推理引擎
19OpenHands/OpenHands87.8kTypeScriptAI 驱动开发

读榜:本期头部关键词是「持久上下文 + 技能包 + 自托管」——claude-mem(跨会话记忆)、agent-skills(生产级技能)、open-webui + vllm(自托管推理)同时在榜,与 A8 的 worktree 隔离、Codex 接 Ollama 共同印证「本地优先 / 长跑型 agent 运行时」成型。值得注意的是 deepseek-harness 本期跌出前 20(前几期长期稳居 #2)。


七、Price vs Performance 性价比(双视角)

重要:两个视角衡量的是不同东西。视角 A 衡量单位 token 的能力,视角 B 衡量单位成功任务的真实花费。跨口径合成(用 A 榜单的分数除以 B 榜单的价格)仅可用于看量级,不可作为采购依据。

视角 A · 单位 token 能力(llm-stats 分数 ÷ 混合价)

DeepSeek-V4.1-Flash
215.8
51.8 / $0.24
DeepSeek-V4-Pro-0813
113.3
52.1 / $0.46
GLM-5.3
39.7
52.8 / $1.33
Muse Spark 1.3(标准档)
34.4
54.4 / $1.583
Qwen3.8 Max
28.7
51.9 / $1.81
GPT-5.6 Terra
20.5
50.8 / $2.48
Kimi K3
15.7
53.1 / $3.39
Claude Opus 5
9.2
54.9 / $5.95
GPT-5.6 Sol
8.9
55.0 / $6.19
GPT-6 Astra
5.0
59.9 / $11.90
Claude Fable 5.1
4.7
55.9 / $11.90
Claude Fable 5
4.6
54.3 / $11.90

⚠️ 最易误读的数字:Muse Spark 1.3 若按 llm-stats 展示的 $0.10(Contributor 档)计算,性价比指数会飙到 544,直接跃居第一。但 $0.10 的前提是允许 Meta 用你的流量训练模型,绝大多数生产环境不会接受。按标准档 $1.25/$4.25(混合价 $1.583)重算后为 34.4,跌至第 4。任何只报 $0.10 的性价比榜单都应打问号。

视角 B · 单位任务真实成本(LiveBench 总评 ÷ 每成功任务成本)

Grok Build 0.1
2825.0
67.8 / $0.024
DeepSeek V4.1 Flash
2796.6
81.1 / $0.029
GLM-5.3 Flash
2309.7
71.6 / $0.031
Qwen 3.8 Flash Next
1814.3
76.2 / $0.042
DeepSeek V4 Pro 0813
1759.1
77.4 / $0.044
DeepSeek V4 Flash Vision Exp
1505.9
76.8 / $0.051
DeepSeek V4 Flash 0731
1236.7
74.2 / $0.060
Qwen3.8 27B
801.1
75.3 / $0.094
Grok 4.5
578.6
75.8 / $0.131
Gemini 3.7 Flash
501.9
78.8 / $0.157
GPT-5.2 Codex
395.7
74.0 / $0.187
Grok 4.6
376.8
78.0 / $0.207
Muse Spark 1.3 xHigh
372.6
81.6 / $0.219
Kimi K3
227.6
79.2 / $0.348
GPT-6 Astra Max
111.7
82.2 / $0.736
Claude Fable 5.1 Max
68.8
83.4 / $1.212

第 1 名需要打折看:Grok Build 0.1 总评仅 67.8(全榜第 49 位),靠极低的单任务成本登顶,属于「便宜但能力明显掉队」,实际可用性待验证。真正有意义的是第 2 名:DeepSeek V4.1 Flash 以 81.1 的总评(全榜第 5)拿到 2796.6 的性价比——它是本表唯一「能力进第一梯队、成本仍在地板」的模型。第 2–7 名全部为开源/开放权重模型。

双视角综合解读

  1. 能力差距在收敛,价格差距没有。 Claude Fable 5.1 Max(83.4)与 DeepSeek V4.1 Flash(81.1)总评仅差 2.8%,但每成功任务成本差 41.8 倍,视角 B 性价比差 40.6 倍。这是本期最硬的一个数字。
  2. 三榜首次在「性价比之王」上高度一致。 视角 A 第一是 V4.1-Flash,视角 B 第二也是它;AA 口径里它以 227.8 tok/s 成为 40 分档唯一 200+ 速度的模型;LiveBench 里它的 Agentic Coding 单项 77.3 为全榜第一。四家独立口径同向,矛盾自检通过。
  3. 但性价比指数不等于你的账单。 上期(09-12)D1 记录过一次实测:14 组对照约 3 亿 token,V4.1-Flash 账单 61.96 元 vs 旧 V4-Flash 45.47 元,反而涨了 36%,原因是输出 token 增至 4.5 倍、缓存命中 98.9% 时输出项占账单 93%。本期 A8 的「同模型不同工具 token 差 70 倍」是同一问题的另一面:单位 token 便宜,不代表单位任务便宜。
  4. 闭源前沿模型的定价权正在被侵蚀。 视角 B 前 7 名中 6 个是开源;视角 A 前 2 名全是 DeepSeek。当 Fable 5.1 的 $11.90 混合价对应 4.7 的性价比、而 V4.1-Flash 的 $0.24 对应 215.8 时,闭源溢价必须靠「开源做不到的任务」来证明,而不只是跑分。

八、AI 社会效益

8.1 分领域落地与影响(2026-09-13 ~ 09-14)

领域事件 / 数据时效来源置信度
就业结构《2026 国际 AI 安全报告》(英国政府)估算:发达经济体约 60%、新兴经济体约 40% 的岗位可能受 AI 影响;报告主笔 Stephen Clare 称有「提示性证据」显示高度暴露于 AI 的早期职业者更难找到工作2026-09-13 报道Al Jazeera(09-13) · 2026 International AI Safety Report已确认(报告)/ 就业影响为估算 大概率
就业结构Wipro 称 AI 释放了相当于 20,000 名员工的产能(已转岗),并正在为 10 万余名员工提供高级 AI 技能培训,转向「human-AI operating model」2026-09-13Al Jazeera(09-13) · Wipro CTO Sandhya Arun大概率(企业自述)
就业结构BIS(国际清算银行,2025-09)测量:生成式 AI 带来 10%–65% 的生产力提升与约 20%–50% 的时间节省,集中在编码、咨询与专业写作报告 2025-09,09-13 引用BIS · Al Jazeera(09-13)已确认
教育科研25 位菲尔兹奖得主(陶哲轩、Peter Scholze、邓煜等)联名声明,称 AI 公司把解题当基准测试的竞赛式推进正在损害数学科学与共同体;仓促发布的解答来不及规范写作与引用,引发成果归属与剽窃问题,数学家传承链条可能断裂2026-09-13~09-14腾讯研究院AI速递(09-14) · liorpachter 反驳文(09-13)大概率(未见声明原文公开链接)
教育科研CMU 教授 Zachary Lipton 称「CS 学术界搞坏了这个系统」、或许需要「烧掉重建」;导火索是 09-09 arXiv 单日 447 篇 cs.LG 新上传2026-09-13r/MachineLearning 热帖 · AI Weekly(09-13)大概率(观点 + 单日 arXiv 数据可查)
医疗健康服贸会亮相国内首款对标国际顶尖水平的诊室听译机器人:六麦阵列 + 自研抗噪技术分离医患对话,实时转写并自动结构化生成电子病历;中国中医科学院广安门医院「广医·岐智大模型 2.0」构建六大场景,提供 7×24 小时中医服务闭环2026-09-13中国青年报(09-13) · 上海证券报(09-13)已确认
政务服务服贸会:金山办公 WPS 365 政务版与 WPS Comate 覆盖公文起草、智能审校、数据报送,AI 从辅助写作延伸至任务执行;建设银行数字人客服「龙知微/龙知远」已上智慧柜员机,客户问题解决率达 98%2026-09-13上海证券报(09-13) · 中国青年报(09-13)已确认
数字鸿沟 / 技能普惠湖南省人社厅印发「技兴三湘 一人一技——人工智能专项培训行动」:3 年内上线不少于 100 门课程、举办不少于 1000 场公益培训与实训、补贴性培训 10 万人次、力争带动 30 万人次学 AI;覆盖零基础爱好者、产业工人、创业群体2026-09-13 07:25湖南日报(09-13) · 湖南省人社厅通知已确认
公共安全 / 风险治理AI agent 蜂群利用 PaperCut 两个 CVE(CVE-2026-81578 / CVE-2026-82078),72 小时内攻陷 48 国 395 个组织440 个 PaperCut 实例,从约 280 名受害者处收割凭据;攻击基于 OpenAI Codex 与某未具名 DeepSeek 模型2026-09-13Silverfort · The Hacker News · BleepingComputer大概率(缺 CISA/厂商官方通报)
公共安全 / 风险治理恶意 .git/config 可让 Claude Code / Codex / Cursor 静默执行攻击者代码(详见 A1);Anthropic 修复耗时约 50 天 / 30 个版本2026-09-13Accomplish · The Hacker News · BleepingComputer已确认
风险治理两位安全研究员(Joe Benton、Josh Engels)09-12 从 Anthropic / Google DeepMind 离职加入 METR;Benton 呼吁强制披露 RSI 进展、事故/未遂事件、最低安全标准与独立验证,称当前透明度「完全是自愿的」2026-09-12~09-13NBC News · Pondero(09-13) · AI Weekly已确认
数字鸿沟 / 能源数据中心扩张引发电力与水资源担忧:Gallup 民调显示 71% 的美国人反对在本地建设 AI 数据中心;犹他州一个拟建数据中心的用电量将超过全州2026-09-13Al Jazeera(09-13) · Gallup大概率(民调口径)

关键洞察

本期社会效益的主线是「三重不同步」。

第一重是能力与安全不同步——同一天里,诊室听译机器人在生成病历、建行数字人客服解决 98% 的问题、金山办公在起草公文;而恶意 .git/config 能让三个主流编程 agent 静默执行任意代码,agent 蜂群在 72 小时内攻陷 48 国 395 个组织。AI 进入业务流程的速度,明显快于围栏建设的速度——Amodei 呼吁「放慢能力提升」、Altman 与马斯克附议、三大实验室磋商标准机构,本质上都是对这一落差的反应。

第二重是技能供给与岗位重塑不同步。60%/40% 的岗位暴露度是估算,但「早期职业者更难找到工作」已经有提示性证据——这恰恰是最难自证、也最容易被宏观数据掩盖的部分。湖南「30 万人次学 AI」这类普惠培训的真正价值,不在于教多少人调 API,而在于把 AI 从「高精尖叙事」还原为普通劳动者可掌握的技能;Wipro 把 2 万人产能转岗并培训 10 万人,是企业侧同构的动作。

第三重是学术评价与 AI 产出不同步。25 位菲尔兹奖得主的联名与 Lipton 的「烧掉重建」,指向同一个病灶:当 447 篇论文一天涌入 arXiv、当「解题」被当作基准竞赛,现有的同行评议与署名体系就失去了辨识能力。这不是反 AI,而是反「用产出速度替代理解深度」

待观察线索


九、AI 经济效益

9.1 分维度数据与趋势(2026-09-13 ~ 09-14)

维度事件 / 数据时效来源置信度
价格通缩Silicon Data 的 LLM Token 支出指数跌破 1 美元,至 97 美分/百万 token,创历史新低;该指数今年 5 月高点为 2.05 美元8 月单月大跌 29%,较 5 月高点累计跌幅超 50%2026-09-14经济参考报(09-14) · Silicon Data已确认(指数)/ 归因分析 大概率
企业降本微软开始收紧内部 Token 使用管理,设置用量监控并逐步将内部默认工作负载切换至 GPT-5.6 Sol 以降低成本;部分企业 AI 支出已达数十亿美元量级2026-09-14 报道经济参考报(09-14)大概率(媒体报道,微软未公告)
产业规模工信部《信息通信行业发展"十五五"规划》:智能算力规模从 2025 年 1,590 EFLOPS 提升至 2030 年 9,800 EFLOPS(五年增长 5 倍以上);先进存力 1,680 EB → 1,700 EB;新建大型超大型算力设施 PUE < 1.2;行业收入 3.8 万亿 → 4.1 万亿规划 09-07 发布 / 09-13 密集解读工信部 · 华夏时报(09-13) · 中国科技投资(09-13)已确认
产业规模截至 2026 年 6 月底,我国智算规模达 2,185 EFLOPS,同比 +177%;存力较 2025 年增长约 11%;生成式 AI 服务备案数量较 2025 年底增长 32%2026-09-12(算力大会)中国信通院总工何宝宏 · 人民邮电报(09-13)已确认
产业规模2025 年我国算力市场规模 8,351 亿元,同比增长超 30%;中商产业研究院预测 2030 年 AI 算力市场规模超 3 万亿元2026-09-13中国信通院 · 中商产业研究院已确认(2025 实测)/ 预测 大概率
需求侧中国电信研究院《智能体时代 AI 基础设施发展研究报告(2026)》:预计 2026 年我国 Token 年消耗量达 10 亿亿2030 年超 3,500 亿亿,年复合增长率接近 12 倍;中国算力平台算力超市注册企业用户突破 1 万家,入驻算力服务商超 200 家,累计沉淀数十亿条监测数据2026-09-13(算力大会闭幕)中国电信研究院 · 21世纪经济报道(09-13) · 同花顺(09-13)已确认(预测为机构口径)
资本市场智谱 09-13 宣布完成约 50 亿美元融资(约 20 亿美元股份配售 + 约 30 亿美元零息可转债,初始转股价 892.50 港元、较公告前收盘价溢价约 12.55%);距 7 月配售约 40 亿美元仅两个月2026-09-13智谱港交所公告 · 钱江晚报·潮新闻(09-13)已确认
资本市场Cognition(Devin)完成超 20 亿美元 E 轮,估值达 480 亿美元(a16z 与 Accel 领投);年化收入从 5 月的 4.92 亿美元增至近 9 亿美元09-08 官宣 / 09-13 二次报道融中财经(09-13) · Cognition已确认(融资)/ 收入为公司自述 大概率
区域/政策国务院常务会议 09-11 研究算力网建设有关工作,指出算力网是 AI 发展的基础支撑,要发挥市场机制促进供需匹配;2026 年算力网和新一代通信网正式列入新型基础设施「六张网」2026-09-11~09-13国务院常务会议 · 21世纪经济报道(09-13)已确认
供应链长电科技 65 亿元定增加码先进封装;本周与华为在三维堆叠芯片量产上持续落地,麒麟 2026 已流片并随秋季新机出货、麒麟 2027 完成流片;高通与三星 2nm 代工谈判陷入僵局,量产推迟至 2027 年2026-09-12~09-13同花顺半导体日报(09-13) · The Bell(09-12)大概率

关键洞察

本期最反直觉的数据是「量升价跌」。 Token 消耗量在爆发(2026 年预计 10 亿亿、2030 年 3,500 亿亿,CAGR 近 12 倍),但单位价格跌破 1 美元、较 5 月高点腰斩。这与第七节的性价比表是同一件事的宏观镜像:当 DeepSeek V4.1 Flash 把每成功任务成本压到 $0.029、而 Claude Fable 5.1 Max 是 $1.212 时,全市场均价被结构性地拉下来了。Silicon Data 研究主管的判断值得记下:Token 价格下跌意味着供给已相对充沛,足以「满足绝大多数任务的技术需求」

第二个信号是资本正在从「估值故事」转向「造血能力」。 智谱两个月内两次融资共约 90 亿美元、Cognition 估值 480 亿美元对应近 9 亿美元 ARR——钱仍在涌入,但潮新闻的定调更准确:行业已进入以造血能力、算力壁垒、生态落地为核心的耐力赛。与之对照的是宇树市值从 4,448 亿回撤到不足 2,000 亿:同样在具身赛道,产能与订单能兑现的(优必选柳州工厂投产)在被加仓,只有概念溢价的在被重估。

第三个信号是政策把算力从「产业配套」升格为「国家级新基建」。 国常会专题研究算力网、算力网列入「六张网」、"十五五"规划给出 1,590 → 9,800 EFLOPS 的明确路径,同时要求 PUE < 1.2——量的扩张与质的约束同时写进规划,这意味着未来五年的算力投资不是无序扩张,而是「优结构、强调度、提利用率」。

待观察线索


十、方法论与免责声明

10.1 时效核验规则(本期执行情况)

  1. 官方一手源核对:所有「今日新发」条目均对照官方新闻页 / API Docs / 发布日志 / GitHub Release 核对到具体「年-月-日」,且年份必须等于本期年份(2026)。DeepSeek 专项逐条对照 deepseek.com/news(当前最新条目 = 2026-09-10「V4.1 Flash」),V3.2(2025-12-01)、V3.2-Exp(2025-09-29)已明确列为超窗旧闻
  2. 禁止把静态展示当新闻:官网首页横幅、版权年份、无日期的搜索摘要片段一律不作为发布日期依据。
  3. 矛盾自检:本期 DeepSeek V4.1 Flash 在 LiveBench / AA / llm-stats 三家独立榜单同日收录且方向一致,自检通过;若出现「宣称今日发布但榜单未收录」的情况,一律降为待验证
  4. 无法核验的处理:来源只提模型名/事件但无可验证日期的(如 DeepSeek Code 2.0 爆料),一律标「待验证」并单列社区快讯,不进入已确认条目。
  5. 超窗剔除:第二节已明确列出 6 项超窗事项及其真实日期。

10.2 三口径说明

榜单衡量什么本期状态
LiveBench7 类 23 项客观任务,每半年刷新,含每成功任务成本release 2026-06-25(latest),官网实时页直采
Artificial Analysis综合智能指数(含 agentic/推理/长文档),混合闭源与开源官网实时页 JSON-LD 结构化直采(本期连续第四日成功),20 模型完整分数/速度
llm-stats跨公开基准 TrueSkill 合成分 + 实时价/吞吐390 模型,混合价按 8:1(输入:输出)折算

三个口径不可直接比较绝对值(评测集、权重、更新频率均不同)。第七节的性价比表为跨口径合成,仅用于看量级,不可作为采购依据。

10.3 本期未执行项

10.4 免责声明


AI 日报 · 自动化生成 | 生成时间:2026-09-14 05:40(北京时间) | 统计窗口:2026-09-13 05:30 → 2026-09-14 05:30