AI 日报 · 2026-09-15(周二)

覆盖方向:AI Coding × 具身智能

统计窗口:2026-09-14 00:00 → 2026-09-15 08:40(北京时间,过去 24 小时 + 今晨)

实时数据源(抓取于 2026-09-15 08:43–08:47):① LiveBench 官网实时榜(release 2026-06-25)② Artificial Analysis Intelligence Index(官网实时页 JSON-LD 结构化直采,20 模型完整分数/吞吐/上下文)③ llm-stats.com(391 模型实时价/吞吐/分项,含 20:1 混合价)④ GitHub Trending(AI 专项日榜,08:43 现场抓取)⑤ 社区信源交叉验证(公开渠道,详见第一节)

社区一手信源:X / 中文社区(知乎·V2EX·Linux.do·微信公众号聚合号)/ 海外社区(Hacker News·r/LocalLLaMA·r/ClaudeAI·r/MachineLearning)/ 开发者社区(GitHub Releases·Hugging Face)/ 聚合线索号(机器之心·量子位·新智元·智猩猩AI·科创板日报·腾讯研究院AI速递·AGI Hunt·quidproquo·AI HOT·FutureX Physical AI Daily·仿生人形日报)

免责声明:本文由自动化流程汇总公开信源生成,逐条标注「时效 / 来源 / 置信度」,仅供参考,不构成投资或商业决策依据。社区单源未交叉验证者一律单列「社区快讯(待验证)」,不入正式条目。所有价格、评分以各榜单官网实时页为准,跨口径对比仅看量级。


目录

章节内容关键标记
社区信源监控与浏览器门禁披露未执行项透明标注
DeepSeek 专项今日有 D ✅(D1–D6)
15 条精选 · 甲组 AI Coding(8 条)8 条
15 条精选 · 乙组 具身智能(7 条)7 条
社区快讯(待验证单列存疑线索
三口径能力评分与价格表LiveBench / AA / llm-stats
Price vs Performance 性价比双视角条形图
AI 社会效益7 领域
AI 经济效益6 维度
方法论与免责声明

一、社区信源监控

1.1 浏览器就绪门禁(步骤 0 · 必做)

结论:本运行(自动化无人值守)浏览器进程层已就绪,但控制通道未连接,B 站 UP 主字幕提取未执行。

对照历史:09-05 至 09-14 连续多期均为同一原因(控制通道未连接)。本期特殊性:进程层门禁首次返回 STARTED,阻塞点已收敛到「控制通道」单一环节,而非「浏览器不可用」。

1.2 公开社区/二手信源交叉验证表(过去 24h)

#线索平台 / 来源发帖时效是否构成新闻交叉验证置信度
C1DeepSeek 拟聘任高瓴创投 90 后合伙人严文韬为首任 CFO,筹备科创板 IPO,估值约 5000 亿元(约 740 亿美元)路透 · 华尔街见闻早餐(09-15) · 虎嗅(09-14) · 凤凰网科技(09-14) · SCMP09-14 首发 / 09-15 集中转载✅ 是路透 + 4 家中外媒体同向;DeepSeek 未官宣大概率
C2DeepSeek-V4.1-Flash (Max) 进入 Agent Arena 开源模型榜第 3,净提升 +4.87%,每任务中位成本 $0.07;比第 2 名 Hy4 preview 成本低 68%、成绩仅差 0.09ppAI HOT(09-15) · Agent Arena 官方榜09-15✅ 是(榜单直采)榜单可直接核验 + 聚合源转载已确认
C3Claude Code CLI 2.1.271:96 项变更,Remote fast mode(提示 token −28.7%)、沙箱按命令域名白名单、modelPricing 支持 10× 内部分摊倍率AGI Hunt(09-15) · X @ClaudeCodeLog(36 分钟前)09-15✅ 是2 源同向 + 版本可核验已确认
C4火山引擎 OpenViking 登上 GitHub Trending:3.67 万星,AI Agent 上下文数据库,LoCoMo 长对话记忆准确率 24–57% → 80–83%,输入 token 消耗 −34.3%~−91.0%墨天轮数据库日报(09-14) · 掘金 · GitHub Trending09-12 登榜 / 09-14 报道✅ 是3 源同向 + 仓库可核验已确认
C5Anthropic 披露 GTG-50014 凭据窃取战役:牟利组织用 AI agent 自动化整条攻击链,34 小时内从 40+ 企业租户窃取 Azure AD 令牌Anthropic 官方披露 · AI Daily(09-15) · 安全媒体转载09-15✅ 是(厂商一手)官方披露 + 聚合源已确认
C6JFrog Artifactory 三漏洞链式利用(CVE-2026-42016 / 42018 / 82329)被 CISA 列入 KEV,两周整改窗口CISA KEV · AI Daily(09-15)09-15✅ 是CISA 官方目录可查已确认
C7治理层成 coding agent 生态新主线:CopilotKit/OpenBot(CEL 策略闸门优先 deny)、Tencent/teamai-cli(push→review→pull 团队配置同步)、agentverse-os/AgentVerse-OS(Incus 隔离工作区)同日上榜quidproquo AI Agent GitHub Digest(09-15) · GitHub Trending09-15✅ 是聚合源 + 仓库可核验已确认
C8宇树 G1+ 发布:标准版 9.5 万元,25 自由度,肩腰电机峰值扭矩 +110%、同扭矩发热 −72%,颈部新增 2 自由度宇树官方 · 浙江在线(09-15) · 具身机器人每日速递(09-15) · 腾讯研究院AI速递(09-15)09-14 发布 / 09-15 发酵✅ 是(官方发布)官方 + 4 源同向已确认
C9国家数据局将适时推动具身智能数据标准建设(09-10 刘烈宏主持具身智能座谈会,09-13 官网发布)国家数据局官网(2026.09.13) · 新华财经早报(09-14) · 科创板日报 · 腾讯新闻(09-14)09-13 官宣 / 09-14~15 密集转载✅ 是(政策)官网一手 + 3 家权威媒体已确认
C10具脑磐石 Cog-WM 1.0 类脑认知世界模型:HM3D-ObjectNav 子集导航成功率 78.50% → 86.89%,较 Nature Communications 的 BSC-Nav 基线相对提升 10.69%浦江创新论坛(09-14) · 具身机器人每日速递(09-15) · arXiv09-14✅ 是论坛发布 + 论文可查;分数为企业/论文自报大概率(分数待独立验证)
C11杭州柯林 × 英伟达:基于 NVIDIA 物理 AI 全栈,插装/压装等工业接触任务真机成功率 >80%,Jetson Thor 力觉闭环毫秒级英伟达官微(09-14) · 具身机器人每日速递(09-15)09-14✅ 是2 源同向;成功率为企业自报大概率
C12Anthropic 重构测试影响分析服务:工程师季度交付代码量为 2021–2025 年均值的 8 倍,80% 代码由 Claude 编写,CI 任务 6 个月增长 25 倍;此前三次快速修补分别只撑 70 天 / 29 天 / 不到一天Anthropic 工程博客 · AI HOT(09-15)09-15✅ 是(厂商一手)官方工程博客 + 聚合源已确认
C13硅基流动上线 Hy4 preview:770B 总参数 / 49B 激活 / 1M 上下文 / Apache 2.0,可直连 Claude Code、Codex、Cursor硅基流动(09-15) · AI HOT(09-15) · 每日数讯(09-15)09-15✅ 是平台公告 + 2 聚合源已确认
C14小红书 AllSpark 开源 Search Agent 模型 Iris:35B 与 397B 双版本同量级成绩领先,权重与评测代码已公开小红书技术公众号 · AI HOT(09-15)09-15✅ 是权重可核验;数据与训练配方未公布大概率
C15Amodei 呼吁放缓前沿 AI 开发(近 4000 字),Altman、Hassabis、Nadella 相继响应;中国外交部 09-14 回应「散播 AI 威胁叙事不符合任何一方利益」darioamodei.com · 新华网(09-14) · AI HOT(09-15)09-12~09-15✅ 是当事人一手 + 官方回应 + 3 家媒体已确认
C16Anthropic 选定纳斯达克上市,洽谈英伟达作为锚定投资者(或达 100 亿美元),目标募资 1000 亿美元、估值或至 2.3 万亿美元路透 · FT · 华尔街见闻(09-15)09-15✅ 是路透 + FT 双源;未发布招股书大概率
C17恶意 AI agent 攻击 RubyGems.org:YARD .yardopts --load 执行任意代码 + Fastly 缓存密钥利用;涉 OpenAI 机器人相关 GemStuffer 恶意 gem安全研究者分析(09-15) · RubyGems 官方 · AI HOT09-15✅ 是攻击归因存争议(「与 OpenAI 相关」未证实)待验证(归因)
C18波士顿动力 × 宝马多年期 Atlas 部署(初批 5 家工厂);Figure 03 已在宝马 Spartanburg 商业落地AI Daily 汇总(09-15)09-15⚠️ 待核单一聚合源,无当事方官宣待验证

二、DeepSeek 专项

今日有 D ✅(2026-09-14 → 2026-09-15,共 6 条)

官方一手核验(必做):已逐条对照 DeepSeek 官网新闻页(deepseek.com/news)——最新官方条目为 2026-09-10「DeepSeek V4.1 Flash:更强、更快、更普惠」;V3.2 正式版 + V3.2-Speciale 为 2025-12-01,V3.2-Exp 为 2025-09-29。官网首页横幅与版权年份不作为发布日期依据。本期 D 条目均为「官方模型之外的公司/生态动态」,无一条把静态展示当新发事件。

#事件时效来源置信度值得关注的原因
D1DeepSeek 拟聘任高瓴创投 90 后合伙人严文韬为首任 CFO,筹备科创板 IPO。严文韬 1991 年生、复旦毕业,曾参与字节跳动、智谱、MiniMax、小红书投资。中信证券已介入筹备(路透 09-07 先行披露),二轮融资投前估值目标约 5000 亿元(约 740 亿美元),首轮已募超 500 亿元(梁文锋个人约 200 亿)09-14 首发 / 09-15 集中转载路透 · 华尔街见闻早餐(09-15) · 虎嗅(09-14) · 凤凰网科技(09-14) · SCMP · GetFinanceBrief(09-15 00:26 UTC)大概率(DeepSeek 未正式官宣,来源为知情人士)首任 CFO 是 IPO 最明确的前置信号——比「聘请券商」更靠后一步。这意味着 DeepSeek 从「研究驱动的对冲基金副产品」正式切换到「需要财务披露与内控的准公众公司」。对中国大模型行业是估值锚:一旦挂牌,将首次公开前沿实验室的算力开支、API 毛利与亏损结构
D2DeepSeek-V4.1-Flash (Max) 进入 Agent Arena 开源模型榜第 3 名,净提升 +4.87%,每任务中位成本 $0.07;比第 2 名 Hy4 preview 成本低 68% 而成绩仅差 0.09pp;与第 1 名 Kimi K3 (Max) 仅差 1.52pp 而成本低 91%。总榜第 12,按信号统计以 +13.75% 位列 Confirmed Success 第 409-15AI HOT(09-15) · Agent Arena 官方榜已确认(榜单直采)这是「帕累托前沿被重塑」的量化证据:不是绝对能力第一,而是用 1/10 的成本买到 98.5% 的能力。对 agent 产品团队来说,这直接改变了「旗舰 vs 平价」的选型分界线
D3V4.1 Flash 正式上线阿里云千问 AI 平台,API 服务与 Token Plan 同步开放(约 $6/月起档位)09-14阿里云公告 · 每日经济新闻 · 多家财经媒体已确认(平台公告)千问是 DeepSeek 的直接竞品平台。竞品上架竞品模型,说明国产大模型的分发逻辑已从「生态封闭竞争」转向「调用量优先」。叠加 D2,V4.1-Flash 正在成为中国 agent 开发的默认底座
D4V4.1 Flash 上线三天升至 OpenRouter 全球调用量榜第 6,周调用 4.94 万亿 token09-14 报道OpenRouter 数据 · 每日经济新闻大概率(平台统计口径,非官方披露)与 D2 互为印证:榜单上是「能力强且便宜」,实际调用上是「开发者真在用」。同期全球调用量前五中国模型占四席、中国大模型周调用 61.17 万亿 token 连续二十周全球第一
D5价格锚点被重新标定:V4.1-Flash 缓存命中输入 $0.003/百万 token,对比 GPT-5.6 Sol $0.40、Claude Opus 5 $0.50(约 1/133 与 1/167)09-15 报道VentureBeat · Juniper Research · Cryptopolitan(09-15)大概率(第三方测算,非官方对照表)缓存命中价是长程 agent 会话的真实成本项。当缓存命中价被压到小数点后三位,agent 的「每任务 economics」从「能跑」变成「可以无限跑」,这是 coding agent 从 demo 走向 7×24 长程运行的前提
D6财务数据流出:2026 年前 7 个月营收约 4.75 亿元(约为 2025 全年的 10 倍),毛利率 44.6%,API 业务毛利率 82.9%,净亏损 7.15 亿元(较 2025 全年 9.35 亿元收窄),AI 基础设施支出暴涨至约 110 亿元、同比增长近 10 倍09-14虎嗅(09-14) · 招商证券周报(09-13)待验证(单一媒体源,DeepSeek 未确认,口径为第三方估算)这是本期最反直觉的一条:API 毛利率 82.9% 说明卖 token 本身是高毛利生意,但净亏损来自 110 亿元基建支出。也就是说,DeepSeek 的低价不是补贴获客,而是把成本压在 CapEx 端而非毛利端——这与「烧钱换份额」是两种完全不同的财务模型

超窗剔除(明确不计入)

事件真实日期剔除理由
DeepSeek V3.2 正式版 + V3.2-Speciale2025-12-01(官网新闻页)年份 ≠ 本期年份,官网横幅常驻但非新发
DeepSeek-V3.2-Exp2025-09-29(官网新闻页)一年前旧闻
V4.1 Flash 正式发布2026-09-10(官网新闻页最新条目)上期已报,本期只取后续反应(D2/D3/D4)
V4-Pro GA / V4-Pro 08132026-08-13超窗,仅作评分表对比基线
拟采购 16 万颗华为昇腾 950DT2026-09-04(彭博首发)超窗,且经二次放大,未获官方确认
首轮 500 亿元融资2026-06超窗,仅作 D1 背景

三、15 条精选 · 甲组 AI Coding(8 条)

A1 · Claude Code CLI 2.1.271:96 项变更,远程 fast mode 把提示 token 砍掉 28.7%

A2 · 硅基流动上线 Hy4 preview:770B 总参数 / 1M 上下文 / Apache 2.0,直连三大 coding CLI

A3 · 阿里云 PolarDB Agentic Data Foundation:把数据库改造成 agent 的记忆/上下文/执行态统一层

A4 · 火山引擎开源 OpenViking:自进化上下文数据库,长对话记忆准确率 24–57% → 80–83%

A5 · Sourcegraph Agentic Batch Changes:一个工程师用 agent 跨数千仓库做代码迁移

A6 · Agent 安全进入「真实大规模攻击」阶段:Anthropic 披露 GTG-50014 + JFrog 三漏洞入 CISA KEV

A7 · 治理层成为 coding agent 生态新主线:OpenBot / teamai-cli / AgentVerse-OS 同日上榜

A8 · Anthropic 工程博客:80% 代码由 Claude 编写,CI 任务 6 个月增长 25 倍


四、15 条精选 · 乙组 具身智能(7 条)

B1 · 宇树 G1+ 发布:9.5 万元起,肩腰扭矩 +110% 而同扭矩发热 −72%

B2 · 国家数据局:适时推动具身智能数据标准建设

B3 · 具脑磐石 Cog-WM 1.0:类脑认知世界模型,无预建图导航成功率 +10.69%

B4 · 杭州柯林 × 英伟达:工业接触任务真机成功率 >80%,力觉闭环毫秒级

B5 · 生数科技 Motus2:具身动作世界模型,让机器人自主评估动作结果并迭代

B6 · 傲鲨 VIATRIX X:第七代消费级外骨骼,2.58kg / 续航 25km,9-22 开售

B7 · 海外人形进入「真产线 + 真交付」:波士顿动力 × 宝马、Figure 03、UBTech U1


五、社区快讯(待验证

#线索时效来源存疑原因缺哪一方验证
Q1波士顿动力与宝马达成多年期 Atlas 部署合作(初批 5 家工厂);Figure 03 在宝马 Spartanburg 进入商业部署09-15AI Daily 汇总(单源)无当事方(波士顿动力 / 宝马 / Figure)官方公告或新闻稿任意一方官方确认
Q2恶意 AI agent 攻击 RubyGems.org 的「GemStuffer」与 OpenAI 机器人相关,上传 2000+ 恶意包且未披露09-15安全研究者代码分析、AI HOT攻击归因基于代码相似性推断,无司法或平台方结论;OpenAI 此前对同类指控有不同表述RubyGems 官方 / OpenAI 官方定性
Q3智谱完成约 50 亿美元融资(约 20 亿美元配售 + 约 30 亿美元零息可转债),约 60%(约 235 亿港元)投向下一代 GLM 与「完全自训练」体系09-14~15港交所公告、腾讯研究院AI速递(09-15)港交所公告部分可核验,但「完全自训练」的实际技术路径与效果无第三方验证;GLM-6.0 尚未发布模型实物与独立评测
Q4Anthropic 已选定纳斯达克上市,洽谈英伟达作为锚定投资者(或达 100 亿美元),目标募资 1000 亿美元、估值或至 2.3 万亿美元09-15路透、FT双权威源但未发布招股说明书,仅向小范围投资者分享文件;估值区间为传闻口径Anthropic 官方与 SEC 文件
Q5开源模型 Nex-N2.5-Pro(397B 总参 / 约 17B 激活 MoE)OSWorld-G 得分 87.4,超过 Claude Opus 5 的 76.8 与 GPT-5.6 Sol 的 77.709-08 发布 / 09-15 传播Nex AGI 官方 model card、quidproquo(09-15)全部为厂商用自研 NexAU/NexCUA harness 自测,无独立第三方复现;官方未重新公布参数量、疑为后训练升级而非新基座独立第三方复现
Q6电子皮肤订单快速放量:某企业 6 月单月获 1.3 万件仿生外皮订单、某企业累计交付超 4 万套;2030 年国内需求 152.5 万平方米 / 约 274 亿元09-13~15央视新闻、行业预测订单数据未具名,2030 预测为机构外推具名企业披露

六、三口径能力评分与价格表(截至 2026-09-15)

6.1 LiveBench(release 2026-06-25,官网实时榜直采)

#模型总评ReasoningCodingAgentic CodingMathData AnalysisLanguageIF每成功任务成本
1Claude Fable 5.1 Max Effort83.491.786.466.197.080.389.573.0$1.212
2Claude Fable 5 Max Effort83.089.786.062.296.080.590.775.8$1.439
3GPT-6 Astra Max Effort82.292.780.457.396.883.089.475.6$0.736
4Muse Spark 1.3 xHigh Effort81.689.781.164.195.979.682.878.0$0.219
5DeepSeek V4.1 Flash Max Effort(开源)81.186.780.077.393.379.381.270.0$0.029
6GPT-5.6 Sol Max Effort81.091.783.956.296.279.887.771.8$0.515
7GPT-5.5 Thinking xHigh Effort80.289.782.154.095.981.687.470.7$0.435
8Claude 5 Opus Thinking Max Effort80.191.281.465.295.774.688.763.8$0.699
9Kimi K3(开源)79.290.781.462.284.478.785.571.4$0.348
10Qwen 3.8 Max(开源)78.588.272.964.691.378.479.774.1$0.275
11Grok 4.678.090.576.857.092.673.983.771.9$0.207
12DeepSeek V4 Pro 0813(开源)77.485.877.254.995.179.282.167.7$0.044
13DeepSeek V4 Flash Vision Exp(开源)76.885.468.265.187.879.580.471.0$0.051
14Qwen 3.8 Flash Next(开源)76.287.472.661.685.874.274.677.1$0.042
15GLM-5.3(开源)76.185.879.060.987.970.279.969.3$0.450
16GLM-5.3 Flash(开源)71.677.679.056.881.276.477.352.8$0.031

关键读数

6.2 Artificial Analysis Intelligence Index(官网实时页 JSON-LD 直采,20 模型)

#模型Intelligence Index输出速度 (tok/s)上下文
1Claude Fable 5.1 (max with fallback)53.3765.11.0M
2GPT-6 Astra (max)52.8160.01.0M
3Claude Opus 5 (max)50.7051.71.0M
4Claude Fable 5 (with fallback)49.7060.61.0M
5Muse Spark 1.3 (max)48.17232.61.0M
6GPT-5.6 Sol (max)47.0663.31.0M
7GLM-5.3 (max)(开源最佳)44.8673.01.0M
8Grok 4.6 (high)44.4158.5
9Kimi K3 (max)(开源)43.7835.71,048,576
10GPT-5.6 Terra (max)42.25113.31.0M
11GLM-5.3-Flash(开源)41.91107.71.0M
12Gemini 3.8 Flash (high)41.19302.91.0M
13Qwen3.8 2.4T A95B(开源)40.04983,616
14DeepSeek V4.1 Flash (max)(开源)39.55222.81.0M
15GPT-5.6 Luna (max)37.50117.81.0M
16DeepSeek V4 Pro 0813 (max)(开源)36.2888.51.0M
17Qwen3.8 27B(开源)33.90
18K2 Horizon 375B A23B(开源)30.79524,288
19MiniMax-M329.61107.31.0M
20Inkling25.5489.21.0M

关键读数

6.3 llm-stats(391 模型实时榜,官网首页直采,含 20:1 混合价)

#模型LLM Stats 分ReasoningCodingAgent上下文速度混合价 ($/1M)许可
1GPT-6 Astra59.957.948.546.41.1M93 c/s$11.90专有
2Claude Fable 5.155.953.035.541.81.0M76 c/s$11.90专有
3GPT-5.6 Sol55.054.146.041.51.1M85 c/s$6.19专有
4Claude Mythos Preview(UNRELEASED54.955.844.836.5专有
5Claude Opus 554.953.941.940.01.0M55 c/s$5.95专有
6Muse Spark 1.3(⚠️ 见注)54.451.841.740.41.0M65 c/s$0.10专有
7Claude Fable 554.351.845.740.51.0M34 c/s$11.90专有
8Kimi K353.151.843.339.51.0M3 c/s$3.39开源
9GLM-5.352.851.942.839.61.0M147 c/s$1.33开源
10DeepSeek-V4-Pro-081352.150.140.737.91.0M64 c/s$0.46开源
11Qwen3.8 Max51.950.639.637.71.0M115 c/s$1.81开源
12DeepSeek-V4.1-Flash(NEW)51.848.944.441.31.0M$0.24开源
13Hy4 preview(腾讯)51.050.739.936.8开源
14Claude Opus 4.850.950.341.735.51.0M59 c/s$5.95专有
15GPT-5.6 Terra50.849.242.238.21.1M135 c/s$2.48专有

⚠️ Muse Spark 1.3 的 $0.10 是 Contributor 档价格(允许 Meta 使用流量训练)。按标准档($1.25/$4.25,20:1 混合约 $1.39)重算,其性价比指数从 544 降至约 39.1。这是本期最容易被误读的数字,请勿直接引用 $0.10 做横评。

关键读数


七、Price vs Performance 性价比

视角 A · llm-stats 能力分 ÷ 20:1 混合价(单位 token 的能力单价)

DeepSeek-V4.1-Flash(开源)
215.8
51.8 / $0.24
DeepSeek-V4-Pro-0813(开源)
113.3
52.1 / $0.46
GLM-5.3(开源)
39.7
52.8 / $1.33
Qwen3.8 Max(开源)
28.7
51.9 / $1.81
GPT-5.6 Terra
20.5
50.8 / $2.48
Kimi K3(开源)
15.7
53.1 / $3.39
Claude Opus 5
9.2
54.9 / $5.95
GPT-5.6 Sol
8.9
55.0 / $6.19
GPT-6 Astra
5.0
59.9 / $11.90
Claude Fable 5.1
4.7
55.9 / $11.90

Muse Spark 1.3 若按 Contributor 档 $0.10 计算为 544(虚假榜首);按标准档 $1.39 重算为 39.1,约第 3–4 位。已强制标注,避免误读。

视角 B · LiveBench 总评 ÷ 每成功任务成本(单位任务的真实花费)

Grok Build 0.1
2825.0
67.8 / $0.024
DeepSeek V4.1 Flash Max Effort(开源)
2796.6
81.1 / $0.029
GLM-5.3 Flash(开源)
2309.7
71.6 / $0.031
Qwen 3.8 Flash Next(开源)
1814.3
76.2 / $0.042
DeepSeek V4 Pro 0813(开源)
1759.1
77.4 / $0.044
DeepSeek V4 Flash Vision Exp(开源)
1505.9
76.8 / $0.051
DeepSeek V4 Flash 0731(开源)
1236.7
74.2 / $0.060
Qwen3.8 27B(开源)
801.1
75.3 / $0.094
Gemini 3.7 Flash High
501.9
78.8 / $0.157
GPT-5.6 Luna Max Effort
435.5
73.6 / $0.169
Grok 4.6
376.8
78.0 / $0.207
Muse Spark 1.3 xHigh Effort
372.6
81.6 / $0.219
Qwen 3.8 Max(开源)
285.5
78.5 / $0.275
GLM-5.3(开源)
169.1
76.1 / $0.450
GPT-6 Astra Max Effort
111.7
82.2 / $0.736
Claude Fable 5.1 Max Effort
68.8
83.4 / $1.212

关键洞察

  1. Grok Build 0.1 居首(2825)属于「低成本撑起来的伪冠军」:总评仅 67.8(全表倒数区间),靠 $0.024 的极低成本上榜。实际可用性待验证,不建议据此选型。
  2. 视角 B 第 2–7 名全部是开源模型(DeepSeek ×3、GLM-5.3-Flash、Qwen3.8 Flash Next、DeepSeek V4 Flash Vision Exp)。这是本期最重要的横向发现:在「每个成功任务花多少钱」这个最贴近生产的口径上,闭源旗舰已经全面落后
  3. 能力与成本的分化达到 40 倍量级:Claude Fable 5.1 Max(83.4 / $1.212)与 DeepSeek V4.1 Flash(81.1 / $0.029)总评仅差 2.8%,每成功任务成本差 41.8 倍,视角 B 性价比差 40.6 倍
  4. 四家独立口径同向,矛盾自检通过:LiveBench(Agentic Coding 77.3 全榜第一)、AA(39.55 分 / 222.8 tok/s 为同档最快)、llm-stats(Agent 41.3 开源最高)、Agent Arena(开源榜第 3,每任务 $0.07)——四个互不相关的评价体系同时把 V4.1 Flash 指向「高能力 + 极低成本」象限
  5. ⚠️ 性价比指数衡量的是单位 token 的能力,不是单位任务的真实花费。上一期(09-12)已记录反例:V4.1-Flash 在真实账单口径下反而比旧 V4-Flash 涨 36%(输出 token 膨胀 4.5 倍)。选型时请同时看视角 A、视角 B 与真实账单。

八、AI 社会效益

领域事件 / 数据时效来源置信度
医疗健康贵州普安县 174 名村医中 170 余名已接受 AI 技能培训并使用「阿福」AI 医疗智能体;村医独自服务 1–2 千名村民,AI 用于辅助诊疗、健康咨询、用药建议与智能转诊。实例:AI 提示 40 岁村民有脑梗风险,村医综合判断后及时转诊未延误09-14央广网(09-14)、海外网(09-14)已确认(官媒实地采访)
医疗健康讯飞医疗 AI 辅助诊断系统已覆盖全国 811 个县级区域,支持 25 万余名基层医生,累计提供超 12 亿次诊断建议;正在试点糖尿病等十余种慢病 AI 管理2026-07 WAIC 披露 / 09-15 引用新华社、WAIC(07-19)已确认(新华社)
公共安全杭州「杭警智行」全国首支机器人交警中队完成升级:全天候自主巡岗、多模态融合定位、过斑马线遵循信号灯、中英双语嘈杂环境问答。投用 4 个月累计便民服务 1.1 万余次、交通违法劝导 23 万余次,重点路口高峰警力负荷优化 30%–50%09-14杭州市公安局交通管理支队(09-14)已确认(政务发布)
政务服务国家数据局 09-10 召开具身智能座谈会(09-13 官网发布),将适时推动具身智能数据标准建设;此前 6 月印发《关于推进行业高质量数据集建设行动的实施方案》,目标 2028 年底建成一批覆盖重点领域、经应用验证的行业高质量数据集09-13 官宣国家数据局官网(2026.09.13)、新华财经(09-14)已确认
风险治理《人工智能安全治理框架 3.0》在 2026 年国家网络安全宣传周开幕式发布(全国网络安全标准化技术委员会),延续风险分类 / 技术应对 / 综合治理逻辑,更新风险分类与应对举措09-14全国网安标委、网信中国已确认
风险治理全球首个「人工智能 + 脑机接口」医疗器械标准发布(国家药监局 09-14 批准),系统规范脑电数据采集、处理、标注、存储、访问全流程技术要求与测试方法,2027-09-01 实施09-14国家药监局、新华网已确认
就业结构2026 年本科专业目录正式设立「交叉学科」门类,首批 15 种专业,含具身智能、脑机科学与技术等 4 种全新增设专业;教育部等五部门《"人工智能+教育"行动计划》推动 AI 成为高校公共基础课2026 年内教育部、中宏网已确认
数字鸿沟AI 让短剧译制出海成本从 约 400 元/分钟(3 人协作)降至 100–150 元/分钟(1 人 2–3 天),同一素材最高并行生成 40 个版本;中小企业与个人创作者获得过去只有大团队才有的产能09-14海外网(09-14)、外滩大会大概率(案例为单一平台自述)

关键洞察

本期社会效益的两条主线高度一致:AI 的实际价值正在从「替代人力」转向「补齐稀缺专业能力」。贵州普安的村医案例最能说明问题——AI 没有取代村医,而是让一个独自服务两千人、行医近 30 年的 68 岁村医,第一次有了「遇到疑难杂症能查、能判断该不该转诊」的能力。杭州机器人交警同理:不是替代交警,而是把高峰警力负荷优化 30%–50%,把人力释放到更需要判断力的环节。

与此同时,治理侧的步伐明显加快:具身智能数据标准进入国家统筹、《人工智能安全治理框架 3.0》发布、全球首个人工智能+脑机接口医疗器械标准落地。一个值得注意的节奏是——标准往往先于规模化落地出台(脑机接口标准 2027-09-01 才实施,具身智能数据集质量标准 11-01 实施),这说明监管选择的是「提前铺轨道」而非「事后补漏洞」。

待观察线索


九、AI 经济效益

维度事件 / 数据时效来源置信度
投融资智谱完成约 50 亿美元融资:约 20 亿美元 H 股配售(每股 714 港元,较公告前收盘折让约 9.96%)+ 约 30 亿美元零息可转债(发行价本金 100.5%,初始转股价 892.50 港元,较配售价溢价 25%);合计净募约 393 亿港元,为上市不足九个月内第三轮融资,累计净募约 755 亿港元。约 60%(约 235 亿港元)投向下一代 GLM 与「完全自训练」体系09-14~15港交所公告、腾讯研究院AI速递(09-15)、华尔街见闻(09-15)已确认(港交所公告可核验)
投融资DeepSeek 拟聘任首任 CFO,二轮融资投前估值目标约 5000 亿元(约 740 亿美元);首轮已募超 500 亿元(梁文锋个人约 200 亿、腾讯约 100 亿、宁德时代体系约 50 亿、京东/网易/砺思/IDG 各约 30 亿、国家人工智能产业投资基金 10 亿)09-14~15路透、虎嗅(09-14)、凤凰网科技(09-14)大概率(估值与出资明细为媒体口径,未官宣)
资本市场Anthropic 选定纳斯达克上市:洽谈英伟达作为锚定投资者(或达 100 亿美元),目标募资 1000 亿美元、估值或至 2.3 万亿美元(或成史上最大 IPO)。季度营收同比增长 14 倍至 115 亿美元,截至 7 月底年化收入运行率 650 亿美元,分析师预计年底可达 1200 亿美元;毛利率超 80%(未扣合作伙伴分成与训练成本);已实现连续第二个季度盈利(调整后指标)09-15路透、FT、华尔街见闻早餐(09-15)大概率(未发布招股书)
产业规模截至 2026-06 底,全国智能算力规模达 2185 EFLOPS、同比增长 177%(为去年同期 2.8 倍),首个全国产 10 万卡 AI 超大规模集群建成;国家级 AI 开源社区汇聚用户 1100 余万、托管模型超 7 万个,国产万亿级参数开源大模型全球累计下载突破 100 亿次;高质量数据集超 12 万个;AI 相关行业保持 30% 以上高增长,规上制造业企业 AI 技术应用普及率超 30%2026-07-31 发改委发布会国家发改委已确认(官方发布)
企业降本增效2026 上半年软件业务收入 77182 亿元、同比增长 9.5%,软件业利润总额 8999 亿元、同比增长 1%;国家人工智能产业投资基金启动运行、规模 600 亿元;2025 年新增 446 款生成式 AI 服务完成网信办备案2026 上半年工信部、国家网信办已确认(官方统计)
企业降本增效某家电企业自研「5G+AI」工业视觉检测系统把检测准确率提升至 99.98%人均生产效率提升 275%;2025 前三季度智能眼镜出货超 178 万副(近八成为 AI 眼镜)2025–2026同花顺财经(09-15)综述、引官方数据大概率(综述引用,企业未具名)
投资结构Stanford HAI AI Index 2026:2025 年中国 AI 私人投资 124.1 亿美元(同比 +32.2%,全球第二);美国 2858.8 亿美元(同比 +160.2%,为中国的 23.1 倍);生成式 AI 细分差距最大(美 1636.4 亿 vs 中 14.8 亿)。2013–2025 中国 AI 累计融资 1318.3 亿美元2026 年度报告Stanford HAI AI Index 2026、OECD、PitchBook已确认(多机构报告)
供应链变现机器人电子皮肤订单快速放量:某企业 6 月单月获 1.3 万件仿生外皮订单、某企业累计交付超 4 万套;预测 2030 年国内人形机器人电子皮肤需求 152.5 万平方米 / 约 274 亿元09-13~15央视新闻、行业预测大概率(订单未具名,2030 为外推)
板块表现工信部明确「加快推动人工智能产业发展和赋能应用」,《人工智能安全治理框架 3.0》发布;国内多家公司(香山股份、奥瑞德、润泽科技等)大举投入 AI 算力建设或收购算力资产;同时微软与英伟达限制部分模型使用,美股芯片股盘前下跌——板块内部出现「国产替代加速」与「海外映射回调」的分化09-15 00:16第一财经(09-15)大概率(券商观点,非事实性数据)

关键洞察

本期经济效益最值得琢磨的,是资本正在从「投模型能力」转向「投资本结构本身」。同一天出现的三件事——智谱上市不足九个月完成第三轮融资(累计净募 755 亿港元)、DeepSeek 聘任首任 CFO 筹备科创板、Anthropic 选定纳斯达克并洽谈英伟达作锚定投资者——指向同一个判断:2026 Q3–Q4 是头部大模型公司集中从私募市场走向公开市场的窗口期

这带来一个结构性变化:估值锚将从「谁的跑分高」变成「谁的财务模型能自洽」。Anthropic 的「连续两季度盈利」是调整后指标(剔除股权激励),毛利率 80% 尚未扣除给 Amazon 的分成与训练成本;DeepSeek 的 API 毛利率 82.9% 但基建支出 110 亿元同比增近 10 倍。两组数字都说明:AI 公司的单位经济模型(token 毛利)看起来很好看,但整体盈利能力取决于 CapEx 节奏——这恰好是公开市场最不擅长定价的部分。

另一条线索是供应链先于整机兑现收入:电子皮肤在整机尚未大规模上量时已有 4 万套累计交付、274 亿元的 2030 年需求预测;谐波减速器、行星滚柱丝杠、六维力传感器同样如此。这与具身智能本体厂估值回撤形成对照——「卖铲人」的现金流比「淘金者」的估值更实在

待观察线索


十、方法论与免责声明

10.1 时效核验规则(本期执行情况)

  1. 官方一手核验:本期所有条目均对照官方一手来源核对「年-月-日」且年份 = 2026。DeepSeek 专项已逐条对照 deepseek.com/news 官方新闻页,确认最新官方条目为 2026-09-10(V4.1 Flash);V3.2 正式版 = 2025-12-01、V3.2-Exp = 2025-09-29,均已列入超窗剔除。官网首页横幅与版权年份不作为发布日期依据。
  2. 禁止静态展示当新闻:本期未采用官网横幅、轮播、「© 年份」版权行或搜索摘要中无日期的片段作为发布依据。
  3. 矛盾自检:本期通过。四家独立评价体系(LiveBench / Artificial Analysis / llm-stats / Agent Arena)在 2026-09-15 同日收录 DeepSeek V4.1 Flash 且指标同向,未出现「榜单仍以旧版本为标杆」的自相矛盾信号。
  4. 无日期即降级:任何只提模型名/事件但无可核验日期的线索,一律不进「15 条精选」与「今日有 D」,仅留在「社区快讯(待验证)」或标注为背景。
  5. 社区单源规则:社区单源爆料标「待验证」,不进正式条目;≥2 独立社区源或 1 社区源 + 1 官方/官媒相互印证升为「大概率」;官方公告 / Release Notes 证实标「已确认」。

10.2 数据抓取说明

10.3 免责声明


AI 日报 · 自动化生成 | 生成时间:2026-09-15 08:40(北京时间)| 统计窗口:2026-09-14 00:00 → 2026-09-15 08:40