AI 日报 · 2026-09-12(周六)

覆盖方向:AI Coding × 具身智能

统计窗口:2026-09-11 07:30 → 2026-09-12 07:30(北京时间,过去 24 小时)

实时数据源(抓取于 2026-09-12 07:31–07:35):① LiveBench 官网实时榜(release 2026-06-25)② Artificial Analysis Intelligence Index(官网实时页,本期为连续第三日直采成功)③ llm-stats.com(390 模型实时价/吞吐/分项)④ GitHub Trending(AI 专项日榜,07:32 现场抓取)⑤ 社区信源交叉验证(公开渠道,详见第一节)

社区一手信源:X / 中文社区(知乎·V2EX·Linux.do·微信公众号聚合号)/ 海外社区(Hacker News·r/LocalLLaMA·r/artificial·LessWrong)/ 开发者社区(GitHub Releases·Hugging Face·Baseten)/ 聚合线索号(机器之心·量子位·新智元·智猩猩AI·科创板日报·仿生人形日报·FutureX Physical AI Daily·quidproquo AI Daily·AI HOT·AGI Hunt·AI Weekly)

免责声明:本文由自动化流程汇总公开信源生成,逐条标注「时效 / 来源 / 置信度」,仅供参考,不构成投资或商业决策依据。社区单源未交叉验证者一律单列「社区快讯(待验证)」,不入正式条目。所有价格、评分以各榜单官网实时页为准,跨口径对比仅看量级。


目录

章节内容关键标记
社区信源监控与浏览器门禁披露未执行项透明标注
DeepSeek 专项今日有 D ✅(D1–D7)
15 条精选 · 甲组 AI Coding(8 条)8 条
15 条精选 · 乙组 具身智能(7 条)7 条
社区快讯(待验证单列存疑线索
三口径能力评分与价格表LiveBench / AA / llm-stats
Price vs Performance 性价比双视角条形图
AI 社会效益7 领域
AI 经济效益6 维度
方法论与免责声明

一、社区信源监控

1.1 浏览器就绪门禁(步骤 0 · 必做)

结论:本运行(自动化无人值守)未执行 B 站 UP 主字幕提取。

对照历史:09-05 至 09-11 连续多期均为同一原因(控制通道未连接,非门禁脚本失败)。信息源完整性已在下方以公开渠道补齐,但不构成与 UP 主字幕口径等价的一手实测增量。

1.2 公开社区/二手信源交叉验证表(过去 24h)

#线索平台 / 来源发帖时效是否构成新闻交叉验证置信度
C1DeepSeek V4.1-Flash 第三方实测:账单反涨 36%(14 组对照约 3 亿 token)微信公众号深度评测(钟sir百宝箱,09-12 00:10)· 今日头条千机阁(09-12 00:10)· 网易王煜全(09-12 06:31)09-12✅ 是(可量化实测)3 个独立中文源同向 + 官方定价表可复算大概率
C2KV Cache 每词元 890 字节(前代 3,514,初代 389,120,累计压缩约 437 倍)HF 模型卡(一手)· SemiAnalysis · askalphaxiv · Chosun Biz09-11✅ 是(官方模型卡)官方 + 3 源同向已确认
C3三星/SK海力士/美光因 DeepSeek 降 HBM 需求下挫Bloomberg(09-11 01:20)· ZeroHedge · Chosun Biz · 朝鲜日报中文09-11✅ 是权威通讯社 + 3 源已确认
C4AMD vLLM 镜像发布滞后 23 小时;NVIDIA 6 款 SKU Day-0 可用SemiAnalysis(09-11 04:00)· @teortaxestex · HuggingNews 汇总09-11✅ 是3 源同向大概率
C5OpenAI 暂停 ChatGPT Pro($200)新订阅,Astra 算力过载TechCrunch(09-10)· 新浪财经(09-11)· 快讯聚合09-10~09-11✅ 是权威科技媒体 + 2 源已确认
C6Anthropic 报告:近 2 亿次交互的蒸馏攻击,涉阿里/月之暗面/DeepSeek 等五起活动Reuters(09-11)· TechCrunch · techstartups · 生成式AI日报09-11✅ 是权威通讯社 + 3 源已确认
C7Cognition 用 Devin 多智能体完成 RSA-260 因式分解,破 RSA-250(2020)纪录Hacker News 热帖 · AI HOT 转述(09-11)· Cognition 员工 samyok09-11✅ 是2 源 + 当事人具名大概率
C8Shopify 从 React Native 全面迁回 Swift/Kotlin 原生Hacker News 热帖(09-11)· AI HOT 转述09-11✅ 是单平台热帖 + 聚合号,未见 Shopify 官方公告待验证
C9PaperCut 大规模 AI Agent 协同攻击:48 国 395 个组织,最快 7 分钟拿域管quidproquo AI Daily(09-12)· 安全社区09-12✅ 是单聚合源,缺官方/CISA 通报待验证
C10Claude Code 2.1.269 发布,98 项变更,新增 claude plugin eval@ClaudeCodeLog(X,09-12)· AGI Hunt · myaiguide Builders Weekly09-12✅ 是(官方发布日志)3 源同向已确认
C11Cognition Devin Fusion 扩展至 Desktop/CLI,双模型架构成本 -46%CryptoCortex(09-11)· Cognition 官方(6/29 预览)09-11✅ 是2 源,AA Coding Agent Index v1.5 可查大概率
C12远景「天机」气象大模型首登榜即夺双冠军,45 天预报极客公园(09-11)· 生成式AI日报09-11✅ 是2 源 + WeatherBench 2 榜单大概率
C13Anthropic 自曝第四起安全事件(8 月发现,回溯至 2026-01)Anthropic 官方(09-11)· AIdapted · aidapted.ro09-11✅ 是(官方自曝)官方 + 2 源已确认
C14加州再签 13 项 AI 法案(AI 陪伴机器人风险评估、未成年人沉迷限制)生成式AI日报(09-11)· 立法记录09-11✅ 是2 源大概率

二、DeepSeek 专项

今日有 D ✅(共 7 条,窗口 2026-09-11 07:30 → 2026-09-12 07:30)

时效硬核核验说明:以下每条均对照 DeepSeek 官方一手来源(Hugging Face 模型卡 deepseek-ai/DeepSeek-V4.1-Flash、DeepSeek API 公告)与权威通讯社逐条核对到 2026-09-11 / 2026-09-12,年份 = 本期年份(2026)。

超窗剔除(不计入今日有 D):V4.1-Flash 首发(2026-09-10,上期 D1 已报);16 万颗昇腾 950DT(彭博 2026-09-04 首发);V3.2 官网横幅(真实发布日 2025-12-01,非新闻);DeepSeek Harness CVE-2026-82533(09-10)。

#事件时效来源置信度值得关注的原因
D1V4.1-Flash 第三方实测:「单价降 60%,账单反涨 36%」。14 组对照任务(累计约 3 亿 token):V4.1-Flash 累计消费 61.96 元,旧版 V4-Flash 45.47 元,贵 16.49 元(+36%)。成因:模型更聪明→主动拆任务、开子 Agent、自我验证,输出 token 达旧版 4.5 倍。缓存命中率 98.9% 时输出项占账单 93%,而输出价仅降 11%09-12 00:10中文深度评测(钟sir百宝箱)· 今日头条千机阁 · 网易王煜全大概率这是本期最反直觉的数字:官方「最高降 60%」指的是降幅最大但单价最低的缓存命中项;真实 Agent 场景里决定账单的是输出价。也是首次有可复算的 token 级账目曝光「更强的模型 = 更贵的任务」
D2KV Cache 压缩引发存储芯片股下挫。V4.1-Flash 每词元全局 KV Cache 压到 890 字节(上一代 3,514、初代 389,120,累计压缩约 437 倍),HBM 需求降至 1/4、SSD 降至 1/8。09-11 三星电子 -4%+、SK 海力士 -3.5%+、隔夜费城半导体 -2.66%;港股 MiniMax、Z.AI 跌超 8%09-11Bloomberg(09-11 01:20)· ZeroHedge · Chosun Biz · 朝鲜日报中文已确认首次出现「模型架构优化 → 直接冲击存储芯片需求预期」的传导链。AA 把这种无差异化即淘汰的格局称为 DeepSeek 驱动的「死亡区」
D3Design Arena 总榜第 6,Elo 1347。比次高的 DeepSeek 模型高 39 位,与 Claude Fable 5.1 处于同一前端设计性能带09-11 03:12@designarena(X)· HuggingNews 汇总大概率前端/设计生成一向是闭源旗舰的自留地,开源模型首次打入同一性能带,直接冲击「设计类任务必须上旗舰」的选型常识
D4Day-0 部署出现阵营分化:NVIDIA vLLM 在 H100/H200/B200/B300/GB200/GB300 六款 SKU 上零问题开箱即用;而 AMD 文档指向的 vllm-openai-rocm:deepseekv41-flash-0909 镜像在发布后 23 小时仍未公开。SGLang 亦同步支持09-11 04:00SemiAnalysis(X)· HuggingNews大概率「开源 = 到处能跑」的假设被打破。对国产卡/AMD 生态用户,Day-0 可用性已成一个需要单独评估的采购项
D5Anthropic 指控蒸馏攻击,DeepSeek 被点名。报告称累计发现近 2 亿次相关交互、涉五起活动,其中一起归因于与阿里有关的运营者,交互量超过 1.51 亿次;同时披露生物武器研究、俄罗斯网络行动等滥用案例09-11Reuters · TechCrunch · techstartups已确认让「蒸馏」从道德争议变成可量化的合规议题。企业侧结论:调用外部模型的输出日志留存与可审计性,已成为自证清白的唯一凭据
D6Harness v0.1.5:模型开始为运行时做专项训练。六项更新:①模型在训练阶段即针对标准/PTC/极简三种模式优化 ②可保留 KV Cache 更新系统提示词 ③Web 端上传图片/PDF 并预览 ④插件标准化 UI 入口 ⑤父子 Agent 双向通信与插话/停止 ⑥实验性 Agent Teams(共享任务列表,默认关闭)。dsh-plugin 公开仓库 700+,社区插件一周内 300 → 4,000+09-10~09-11DeepSeek Harness Release Notes · 中文深度评测已确认护城河从「插件数量」转向「训练侧协同」。行业分工被逆转:框架不再是套在模型外的通用壳子,而成为模型能力的一部分。1–2 年内「模型 + Harness 联合优化」或成出厂标配
D7聘请中信证券筹备科创板 IPO(二次报道,正式辅导协议尚未签订)。公司 7 月完成第二轮融资,估值 5000 亿元,两轮累计募资超 1000 亿元,目前暂无外资机构参与09-11多家财经媒体 · 生成式AI日报待验证若落地将是 A 股「AI 大模型第一股」。但无官方公告、无辅导协议,仅作线索,不并入已确认条目

DeepSeek 小结:今日 D 的重心从「发布」转向「发布之后的账单、股价与生态反应」。三条独立线索(实测账单 +36%、存储芯片股下挫、AMD 镜像缺位)共同指向同一件事——架构级降本的外溢效应已经开始改写上下游的成本结构与预期,而不只是模型榜单上的名次变化。


三、15 条精选 · 甲组:AI Coding(8 条)

① OpenAI Agents API 公测:Codex harness 被平台化

② Cursor Projects + Origin:协调者智能体 + 原生代码托管

③ Cognition Devin Fusion 上线 Desktop/CLI:双模型 planner + executor

④ Claude Code 2.1.269:98 项变更,新增 plugin eval 可复现评分

⑤ 阿里 Qoder 推出 Mobile Use 插件:三端真机验证

⑥ Google Cloud coding-agent 插件 + A2A 官方 CLI

⑦ 大模型切入半导体设计:Kimi K3 自主 EDA 48 小时,OpenAI 自研推理芯片

⑧ PaperCut 大规模 AI Agent 协同攻击:48 国 395 个组织,最快 7 分钟拿到域管


四、15 条精选 · 乙组:具身智能(7 条)

① 支付宝 × 高德动量「AI 付·具身智能」:机器狗打通支付闭环

② 蚂蚁「灵影」:面向 AI 眼镜等新终端的 Agent 原生开放平台

③ 蚂蚁灵波开源 LingBot-World 2.0 Lite:1.3B 单卡实时生成世界

④ 高德发布 ABot-Earth 0.7:全球首个 3D 原生城市世界模型

⑤ 京东「狼团」异构机器人集群 + SuperBrain 3.0

⑥ Kinetix AI(超维动力)完成超 5 亿元天使轮融资

⑦ 外滩大会:上半年全球人形机器人出货约 1.91 万台,同比 +272%,中国厂商占比超 97%


五、社区快讯(待验证

以下线索未获得官方一手来源或仅单一信源,按验证规则不并入正式条目,仅作监控留痕。

#线索来源时效存疑点缺哪一方验证
V1Shopify 宣布从 React Native 全面迁回 Swift/Kotlin 原生,理由是「AI Agent 大幅降低跨平台重复开发成本」这一核心假设被推翻Hacker News 热帖(09-11)· AI HOT 转述09-11未见 Shopify 官方博客或工程公告,HN 原帖为二手转述Shopify 官方 / 工程博客
V2PaperCut 大规模 AI Agent 协同攻击(CVE-2026-81578 / CVE-2026-82078),48 国 395 组织,7 分钟拿域管quidproquo AI Daily(09-12)09-12缺 PaperCut 官方公告、CISA/NVD 条目、厂商确认PaperCut 官方 / NVD / CISA
V3DeepSeek 聘请中信证券筹备科创板 IPO,计划年内启动上市流程多家财经媒体(09-11)09-11正式辅导协议尚未签订,公司未公开确认DeepSeek 官方 / 证监会辅导备案公示
V4寒武纪等国产 AI 芯片厂商大幅上调 AI 处理器售价,下一代芯片较两个月前报价上涨 20%–30%界面新闻(09-11)09-11寒武纪工作人员已明确回应「公司并未发布涨价相关消息,切勿轻信市场传闻厂商官方调价函
V5Cognition 工程师用多个 Devin 智能体构建 GPU 格子筛,完成 RSA-260 因式分解,刷新 RSA-250(2020)公开纪录Hacker News 热帖 · AI HOT · Cognition 员工具名09-11未见正式论文或第三方复核,纪录认证机构未表态学术预印本 / RSA 挑战赛官方
V6OpenAI 因 GPT-6 Astra 算力不足,暂停 ChatGPT Pro($200/月)新订阅与升级TechCrunch(09-10)· 新浪财经(09-11)09-10~09-11OpenAI 未发布正式公告,仅媒体报道OpenAI 状态页 / 官方公告

六、三口径能力评分与价格表(截至 2026-09-12)

口径说明:三套榜单的测评方法、任务集与更新频率完全不同,绝对分值不可直接横向比较,仅供量级参考。所有数据于 2026-09-12 07:31–07:35 现场抓取。

6.1 LiveBench(release 2026-06-25, contamination-free,含「每成功任务成本」)

#模型总评ReasoningCodingAgentic CodingMathData AnalysisLanguageIF每成功任务成本
1Claude Fable 5.1 Max Effort83.491.786.466.197.080.389.573.0$1.212
2Claude Fable 5 Max Effort83.089.786.062.296.080.590.775.8$1.439
3GPT-6 Astra Max Effort82.292.780.457.396.883.089.475.6$0.736
4Muse Spark 1.3 xHigh81.689.781.164.195.979.682.878.0$0.219
5DeepSeek V4.1 Flash Max (open)81.186.780.077.393.379.381.270.0$0.029
6GPT-5.6 Sol Max Effort81.091.783.956.296.279.887.771.8$0.515
7GPT-5.5 Thinking xHigh80.289.782.154.095.981.687.470.7$0.435
8Claude 5 Opus Thinking Max80.191.281.465.295.774.688.763.8$0.699
9Kimi K3 (open)79.290.781.462.284.478.785.571.4$0.348
10Gemini 3.7 Flash High78.887.878.958.393.568.085.579.9$0.157
11Qwen 3.8 Max (open)78.588.272.964.691.378.479.774.1$0.275
12Grok 4.678.090.576.857.092.673.983.771.9$0.207
15GPT-5.6 Terra Max77.990.678.254.994.979.382.964.6$0.352
16DeepSeek V4 Pro 0813 (open)77.485.877.254.995.179.282.167.7$0.044
18DeepSeek V4 Flash Vision Exp (open)76.885.468.265.187.879.580.471.0$0.051
21Qwen 3.8 Flash Next (open)76.287.472.661.685.874.274.677.1$0.042
22GLM-5.3 (open)76.185.879.060.987.970.279.969.3$0.450
27Qwen3.8 27B (open)75.380.075.761.486.276.674.372.7$0.094
40GLM-5.3 Flash (open)71.677.679.056.881.276.477.352.8$0.031

关键读数

  1. DeepSeek V4.1 Flash 的 Agentic Coding 得分 77.3 为全榜第一,比总评第一的 Claude Fable 5.1 Max(66.1)高出 11.2 分——这是它在 AI Coding 场景最硬的凭据。
  2. 每成功任务成本极差 39.1 倍($1.212 vs $0.031),而总评极差仅 16.5%(83.4 vs 71.6)。成本结构远比能力差距悬殊。
  3. 总评前 5 中,第 5 名的成本比第 1 名低 41.8 倍($0.029 vs $1.212)。

6.2 Artificial Analysis 智能指数(官网实时页,2026-09-12 07:33 直采)

#模型智能指数上下文每任务成本输出 tok/s首字延迟(s)总响应(s)
1Claude Fable 5.1 (max w/ fallback)531M$7.6367278.20285.70
2Claude Fable 5.1 (xhigh w/ fallback)531M$5.986096.36104.75
3GPT-6 Astra (max)531M$3.2654323.31332.50
4GPT-6 Astra (xhigh)531M$2.3151160.90170.62
5Claude Fable 5.1 (high)511M$3.914920.6730.83
6GPT-6 Astra (high)511M$1.725040.1150.14
7Claude Opus 5 (max)511M$5.865179.0388.74
8Claude Fable 5 (w/ fallback)501M$8.756692.73100.27
9Muse Spark 1.3 (max)481M$1.6020626.1238.27
10GPT-5.6 Sol (max)471M$1.9957132.21140.92
12Muse Spark 1.3 (xhigh)451M$1.3720621.3833.49
14GLM-5.3 (max)(开源最佳)451M$2.01623.0943.18
16Grok 4.6 (high)44500k$1.865531.2840.30
19Kimi K3 (max)441.05M$2.00383.7169.14
23GPT-5.6 Terra (max)421M$1.4088195.58201.29
24GLM-5.3-Flash421M$0.25952.4928.83
25Gemini 3.8 Flash (high)411M$1.2426911.8213.67
27Qwen3.8 Max401M$2.67382.5768.66
30DeepSeek V4.1 Flash (max)401M$0.272131.1312.86
35Gemini 3.7 Flash (high)391M$0.932958.4910.19
38DeepSeek V4 Pro 0813 (max)361M$0.67691.7738.13
40DeepSeek V4 Flash Vision (max)351M$0.312171.0712.58

关键读数

  1. 四条目并列 53 分(Fable 5.1 max/xhigh + Astra max/xhigh),头部已完全挤平,智能指数进入「分辨不出第一」的阶段。
  2. DeepSeek V4.1 Flash 的首字延迟 1.13s,是全表唯一进入 1 秒区间的 40 分档模型,且输出 213 tok/s、每任务成本仅 $0.27——延迟、吞吐、成本三项同时占优
  3. GLM-5.3 以 45 分继续坐稳开源最佳
  4. 本期为 AA 官网实时页连续第三日直采成功,不再使用历史快照。

6.3 llm-stats(390 模型,含分项能力与实时价)

#模型LLM Stats 综合ReasoningCodingAgent上下文速度混合价 $/M许可
1GPT-6 Astra59.957.948.546.41.1M98 c/s$11.90闭源
2Claude Fable 5.155.953.035.541.81.0M81 c/s$11.90闭源
3GPT-5.6 Sol55.054.146.041.51.1M69 c/s$6.19闭源
4Claude Mythos Preview(未发布)54.955.844.836.5闭源
5Claude Opus 554.953.941.940.01.0M70 c/s$5.95闭源
6Muse Spark 1.354.451.841.740.41.0M73 c/s$0.10闭源
7Claude Fable 554.351.845.740.51.0M37 c/s$11.90闭源
8Kimi K353.151.843.339.51.0M23 c/s$3.39开源
9GLM-5.352.851.942.839.61.0M147 c/s$1.33开源
10DeepSeek-V4-Pro-081352.150.140.737.91.0M64 c/s$0.46开源
11Qwen3.8 Max51.950.639.637.71.0M152 c/s$1.81开源
12DeepSeek-V4.1-Flash51.848.944.441.31.0M$0.24开源
13Hy4 preview51.050.739.936.8开源
14Claude Opus 4.850.950.341.735.51.0M59 c/s$5.95闭源
15GPT-5.6 Terra50.849.242.238.21.1M135 c/s$2.48闭源

关键读数

  1. DeepSeek-V4.1-Flash 的 Agent 分项 41.3 高于 Claude Fable 5.1(41.8 接近)与 GPT-6 Astra 之外几乎所有模型,与 LiveBench「Agentic Coding 全榜第一」互相印证——两个完全独立的口径给出同向结论。
  2. V4.1-Flash 入榜即 #12,混合价 $0.24,是前 15 中单价最低的模型。
  3. Muse Spark 1.3 的 $0.10 是 Contributor 档价格(允许 Meta 使用流量训练),标准档实际为 $1.25/$4.25(混合约 $1.583)——若按 $0.10 计算会得出严重失真的性价比结论,下文已强制标注。

6.4 GitHub AI 趋势榜(AI 专项日榜,2026-09-12 07:32 抓取)

#仓库StarFork语言说明
1openclaw/openclaw389.5k81.9kTypeScriptThe AI that really does things. Any OS. Any Platform.
2deepseek-ai/deepseek-harness220.5k26.1kTypeScriptDeepSeek Harness: Everything is a Plugin.
3n8n-io/n8n204.0k60.6kTypeScript原生 AI 能力的工作流自动化平台
4Significant-Gravitas/AutoGPT187.3k46.0kPython自主 Agent 早期旗手
5langgenius/dify155.5k24.6kTypeScriptAgentic 工作流 + RAG
6langflow-ai/langflow154.6k10.1kPython可视化 Agent 构建
7open-webui/open-webui151.7k22.0kPython多后端 LLM 前端
8langchain-ai/langchain146.1k24.4kPythonThe agent engineering platform
9Shubhamsaboo/awesome-llm-apps137.2k20.2kPython100+ AI Agents / Agent Skills / RAG
10ggml-org/llama.cpp127.9k23.0kC++C/C++ LLM 推理
11nextlevelbuilder/ui-ux-pro-max-skill126.9k13.6kPython面向 UI/UX 的 AI Skill
12harry0703/MoneyPrinterTurbo122.5k18.9kPythonAI 一键生成短视频
14supabase/supabase109.1k13.7kTypeScriptPostgres 开发平台(Agent 后端首选)

关键读数deepseek-harness 单日 +1.4k 至 220.5k,稳居 #2;榜单头部关键词仍是 Agent 执行面 + 开源工具链,且 Skill 类仓库(#11 ui-ux-pro-max-skill)已进入前 15——与 Claude Code 本期新增 plugin eval 遥相呼应,技能包正在成为独立的分发品类


七、Price vs Performance 性价比(双视角)

计算口径:视角 A = llm-stats 综合分 ÷ 混合价($/M,8:1 输入:输出);视角 B = LiveBench 总评 ÷ 每成功任务成本。两者跨口径,仅看量级,不作精确换算

视角 A:llm-stats 综合分 ÷ 混合价

DeepSeek-V4.1-Flash
215.8
51.8 / $0.24
DeepSeek-V4-Pro-0813
113.3
52.1 / $0.46
GLM-5.3
39.7
52.8 / $1.33
Muse Spark 1.3(标准档 $1.583)
34.4
54.4 / $1.583
Qwen3.8 Max
28.7
51.9 / $1.81
GPT-5.6 Terra
20.5
50.8 / $2.48
Kimi K3
15.7
53.1 / $3.39
Claude Opus 5
9.2
54.9 / $5.95
GPT-5.6 Sol
8.9
55.0 / $6.19
GPT-6 Astra
5.0
59.9 / $11.90
Claude Fable 5.1
4.7
55.9 / $11.90

⚠️ 重要修正:Muse Spark 1.3 在 llm-stats 显示 $0.10,但这是 Contributor 档(允许 Meta 使用其流量训练模型)。标准档为 $1.25 输入 / $4.25 输出,混合价约 $1.583。若误用 $0.10 计算,性价比指数会虚假飙到 544,直接登顶——这是本期最易误读的数字,已按标准档重算至 34.4(第 4)

视角 B:LiveBench 总评 ÷ 每成功任务成本

DeepSeek V4.1 Flash(开源)
2797
81.1 / $0.029
GLM-5.3 Flash(开源)
2310
71.6 / $0.031
Qwen 3.8 Flash Next(开源)
1814
76.2 / $0.042
DeepSeek V4 Pro 0813(开源)
1759
77.4 / $0.044
DeepSeek V4 Flash Vision Exp(开源)
1506
76.8 / $0.051
Qwen3.8 27B(开源)
801
75.3 / $0.094
Gemini 3.7 Flash High
502
78.8 / $0.157
Grok 4.6
377
78.0 / $0.207
Muse Spark 1.3 xHigh
373
81.6 / $0.219
GPT-6 Astra Max Effort
112
82.2 / $0.736
Claude Fable 5.1 Max Effort
69
83.4 / $1.212

关键洞察

  1. 能力差 2.8%,成本差 41.8 倍。 Claude Fable 5.1 Max(83.4)与 DeepSeek V4.1 Flash(81.1)在 LiveBench 上仅差 2.3 分,但每成功任务成本分别是 $1.212 与 $0.029——差 41.8 倍。若任务可容忍这 2.8% 的能力落差,成本结构会发生数量级变化。
  2. 视角 B 前 5 名全部开源(DeepSeek × 3、GLM × 1、Qwen × 1)。开源模型在「单位成功任务的成本」这一维度已形成压倒性优势。
  3. 本期最大变化:V4.1-Flash 在视角 A 与视角 B 双双登顶(215.8 / 2797)。上一期它在视角 A 排第 1、视角 B 未入榜;两口径同时第一,是三个独立榜单(LiveBench / AA / llm-stats)罕见地给出同向结论。
  4. 但注意 D1 的反向证据:官方「最高降 60%」不等于账单降 60%。实测中更聪明的模型会主动拆任务、开子 Agent、做自检,输出 token 达旧版 4.5 倍,账单反涨 36%性价比指数衡量的是「单位 token 的能力」,不是「单位任务的真实花费」——这是本期最需要警惕的指标陷阱。

八、AI 社会效益

#领域事件 / 数据时效来源置信度
S1教育科研2026 外滩大会「硅基VS碳基」论坛(09-11):北大客座教授韦韬提出「AI 最危险的时候,是它答得太好」——孩子借助 AI 完成出色作业,不等于真正掌握;复旦肖仰华从「人的发展安全」角度指出,能力是在亲自尝试—反馈—修正中形成的,若这些过程被 AI 代办,需重新追问人是否仍拥有形成能力的真实机会09-11中国网科技(外滩大会现场)已确认
S2教育公平PISA 2025 数据(ICDL Romania 09-10 发布):罗马尼亚 40% 的 15 岁学生每周至少一次用 AI 聊天机器人辅助学习,但 57% 的学生在计算性问题解决上低于 Level 3。两组数据不构成因果,但揭示「用得上 AI」与「会用 AI」之间的能力断层09-10 发布ICDL Romania · AIdapted已确认
S3就业结构教育部 2026 年本科专业目录正式设立「交叉学科」门类,首批列入 15 种专业,含未来机器人、交叉工程等 11 种目录内专业,以及具身智能、脑机科学与技术等 4 种全新增设专业;此前教育部等五部门已印发《"人工智能+教育"行动计划》,推动 AI 成为高校公共基础课09-11 引述中宏网 · 教育部文件已确认
S4医疗健康蚂蚁集团在外滩大会推出 AI 健康管家「阿福」,可实时识别食物营养并定制方案;智元启元 Q1 人形机器人可通过握手 1 分钟完成心率、血氧等健康检测;蚂蚁联合多方开展村医 AI 技能培训,推动健康 AI 向基层下沉。同期蚂蚁灵波机器人在上海国大药房真实门店承担药品分拣,夜间缓解药剂师压力09-11智东西 · 中国证券报(09-12 A02)已确认
S5公共安全Anthropic 09-11 发布威胁情报报告:披露研究人员用 Claude 进行可能支持生物武器开发的实验(含病原体相关)、俄罗斯关联黑客组织针对乌克兰军政外交人员的网络行动;并自曝第四起安全事件(8 月发现,回溯至 2026-01,此前扫描约 14.1 万条对话记录时遗漏,后扩大至约 4.81 亿条并通知受影响者)09-11Reuters · Anthropic 官方 · AIdapted已确认
S6风险治理欧盟网络安全局 ENISA 在数月谈判后取得 Anthropic Mythos 5 与 OpenAI GPT-6 Astra 的独立测试权限(欧委会 09-10 确认),但仍无法接触 Anthropic 最新模型;加州州长纽森 09-09 签署全美首批州级 AI 安全法案(设独立评估机构框架与 AI 审计员注册制度,2029 年起无注册编号不得开展覆盖范围内的 AI 审计),09-11 再签 13 项法案(AI 陪伴类聊天机器人上线前须做风险评估,限制 16 岁以下用户沉迷功能与使用时长)09-09 ~ 09-11欧盟委员会 · AIdapted · 生成式AI日报已确认
S7数字鸿沟菲律宾政府发布 344 亿美元 AI+ 基建总体规划最终草案,目标成为区域 AI 基建枢纽;印度推出「盒式数据中心」FEMTO(本地部署、无需联网、功耗约为传统方案一半)面向主权 AI;埃及承诺 10 亿美元投入 AI 基建竞赛。印度支付监管机构正建立集中登记处核验与监控代用户执行交易的 AI Agent(先从 UPI 起步)09-11quidproquo AI Daily · Reuters · Analytics India Mag大概率

关键洞察:本期社会效益的重心从「AI 能做什么」转向「人还剩下什么」。S1 与 S2 是同一问题的两个切面——韦韬担忧的是能力形成过程被跳过,PISA 数据则给出量化佐证:AI 使用率已到 40%,而底层数字能力达标率不足 43%。这意味着「会不会用 AI」正在成为新的素养断层,且这个断层不会随工具普及自动弥合。与此同时 S6(ENISA 拿到测试权 + 加州连签法案)说明监管正从「原则宣示」进入「可操作的审计与准入制度」——2029 年无注册编号不得执业的条款,实际上是把 AI 审计变成了一个持牌职业。

待观察线索


九、AI 经济效益

#维度事件 / 数据时效来源置信度
E1资本市场 · 冲击DeepSeek V4.1-Flash 将 HBM 需求降至 1/4、SSD 降至 1/8 → 09-11 三星电子 -4%+、SK 海力士 -3.5%+、隔夜费城半导体指数 -2.66%;港股 MiniMax、Z.AI 跌超 8%,阿里跌超 2%;A 股 AI 算力芯片板块 -2.03%(成交 769 亿元),半导体设备跌近 5%,科创 50 跌超 3%09-11Bloomberg · Chosun Biz · 证券时报网 · A 股行情数据已确认
E2资本市场 · 逆势燧原科技 09-11 登陆科创板:发行价 142.18 元,首日收报 397 元(+179.22%),总市值 1708.5 亿元,拟募资约 61 亿元投向第五/六代 AI 芯片;2026 上半年营收 11.2 亿元(+279%)。至此摩尔线程、沐曦、壁仞、燧原「国产 GPU 四小龙」齐聚资本市场09-11看看新闻 · 生成式AI日报已确认
E3企业营收甲骨文 FY27Q1:调整后营收 193.5 亿美元(+30%),云基础设施部门营收 74 亿美元(+121%),调整后营业利润 81.5 亿美元(预期 78.1 亿);本季新增 AI 云合同超 300 亿美元,剩余履约义务(RPO)从 455 亿跃升至 664 亿美元(+46%);预计 FY27 总收入至少 900 亿美元。美股盘后涨 8%09-10/09-11界面新闻 · 甲骨文财报已确认
E4产业规模 · 基建SpaceX CFO 在高盛科技大会:新签 AI 算力托管协议,12 月 1 日起每月贡献约 11 亿美元(年化约 133 亿美元);2026 年底部署超 2GW 地面算力,2027 年底达 5–10GW;预计 2027 年每 GW AI 算力可带来 300–500 亿美元收入。泛林集团高管同场称半导体行业「基本处于售罄状态」09-10生成式AI日报 · 新浪财经大概率
E5政策投资工信部印发《信息通信行业发展"十五五"规划》:算力网建设新增直接投资 4 万亿元,围绕算电协同、超大规模智算集群持续加码。截至 2025 年 6 月底,全国智能算力规模同比 +177% 至 2185 EFLOPS;河北综合算力指数连续两年全国第一(智能算力 556.1 EFLOPS)09-11通信世界 · 工信部已确认
E6投融资具身智能 Kinetix AI(超维动力)完成超 5 亿元人民币天使/A 轮(祥峰投资领投,方广、万石跟投);韩国 AIDIN Robotics 完成 160 亿韩元战略轮(现代机器人、三星创投参投);AI 编程 Cognition 完成 20 亿美元 E 轮、估值 480 亿美元(a16z 与 Accel 领投,ARR 从 4.92 亿增至近 9 亿美元)09-08 ~ 09-12RobotToday · 界面新闻 · quidproquo大概率
E7债务风险施罗德基金经理 Dorian Carrell 指出,超大规模云厂商表外融资规模已达 1.5 万亿美元(约 10 万亿元人民币),部分企业现金流由正转负、杠杆率攀升(Alphabet 发行 6% 票息可转债以保护信用评级)。高盛警告:年内已累计约 3000 亿美元 AI 相关债券发行,2027 年超大规模云企业与芯片厂商发债规模或再增 40% 至约 3400 亿美元。摩根大通测算:2026 年迄今五大超大规模云厂商加英伟达发债约 3200 亿美元,长久期部分相当于同期美国财政部新增长久期借款的 68%09-11证券时报网(引述施罗德/高盛/摩根大通)大概率

关键洞察:本期出现了一个罕见的因果闭环样本——DeepSeek 一次架构优化(KV Cache 压缩 437 倍)在 24 小时内同时触发:存储芯片股下挫(E1)、AI 应用标的估值重估、以及「无差异化即淘汰」的行业叙事(AA 称之为「死亡区」)。这说明模型层的工程进步已经具备直接重塑上游资本开支预期的能量,而不只是影响自身毛利。与之对照的是 E7 的另一面:超大规模云厂商 1.5 万亿美元表外融资 + 2027 年发债预计再增 40%,一边是推理成本断崖式下降,一边是基建债务持续膨胀——这个剪刀差是未来 12 个月最值得跟踪的宏观风险。E2 燧原 +179% 与 E1 板块 -2% 同时发生,则说明资金正在从「通用算力」向「国产替代确定性」做结构性切换

待观察线索


十、方法论与免责声明

10.1 信源与时效核验

  1. 年份核验(硬规则):任何以「今日新闻 / 已确认」身份写入的条目,均须对照官方一手来源(官网 news/release 页、官方 API Docs、技术报告、GitHub Release、HF 模型卡、公司公告)确认「年-月-日」真实存在且年份 = 2026。本期 DeepSeek 全部条目已对照 HF 模型卡 deepseek-ai/DeepSeek-V4.1-Flash 与官方 API 公告逐条核对。
  2. 禁止把静态展示当新闻:官网首页横幅、版权年份行、无日期的搜索摘要、产品落地页 Hero 文案一律不作为发布日期依据。DeepSeek 官网长期挂 V3.2 横幅,但其真实发布日为 2025-12-01(V3.2-Exp 为 2025-09-29),本期已明确剔除,不作为新闻。
  3. 矛盾自检:本期 V4.1-Flash 被 LiveBench、Artificial Analysis、llm-stats 三榜同日同向收录(分别为 Agentic Coding 第一、40 分/$0.27/213 tok/s、#12/$0.24),无「宣称新发但榜单未收录」的矛盾信号。
  4. 超窗剔除清单:V4.1-Flash 首发(09-10,上期已报,本期只取 09-11~09-12 的后续反应);16 万颗昇腾 950DT(彭博 09-04 首发);V3.2 横幅(2025-12-01);Cognition E 轮融资(09-08/09-09,仅作背景);Kimi K3 EDA(09-09 首发,09-11 二次发酵,已标注)。
  5. 无法核验的处理:来源只提事件但无具体可验证日期的,一律不进「今日精选 / 今日有 D」,仅标「背景 / 待验证」并注明「未获取到可核验发布日期」(本期 D7、V1–V6)。

10.2 置信度分级

标签含义判定标准
已确认高确定性官方公告 / Release Notes / 权威一手报告证实,或多家权威媒体同向
大概率中高确定性≥2 个独立信源相互印证(或 1 社区源 + 1 官媒/官方),尚缺官方定论
待验证低确定性社区单源爆料、厂商单边口径、或已被当事方否认的传闻
中性/不适用标注「未开启 / 不适用 / 无数据」类状态

10.3 免责声明


AI 日报 · 自动化生成 · 生成时间 2026-09-12 07:35(北京时间)

覆盖窗口:2026-09-11 07:30 → 2026-09-12 07:30