覆盖方向:AI Coding × 具身智能
统计窗口:2026-09-14 00:00 → 2026-09-15 08:40(北京时间,过去 24 小时 + 今晨)
实时数据源(抓取于 2026-09-15 08:43–08:47):① LiveBench 官网实时榜(release 2026-06-25)② Artificial Analysis Intelligence Index(官网实时页 JSON-LD 结构化直采,20 模型完整分数/吞吐/上下文)③ llm-stats.com(391 模型实时价/吞吐/分项,含 20:1 混合价)④ GitHub Trending(AI 专项日榜,08:43 现场抓取)⑤ 社区信源交叉验证(公开渠道,详见第一节)
社区一手信源:X / 中文社区(知乎·V2EX·Linux.do·微信公众号聚合号)/ 海外社区(Hacker News·r/LocalLLaMA·r/ClaudeAI·r/MachineLearning)/ 开发者社区(GitHub Releases·Hugging Face)/ 聚合线索号(机器之心·量子位·新智元·智猩猩AI·科创板日报·腾讯研究院AI速递·AGI Hunt·quidproquo·AI HOT·FutureX Physical AI Daily·仿生人形日报)
免责声明:本文由自动化流程汇总公开信源生成,逐条标注「时效 / 来源 / 置信度」,仅供参考,不构成投资或商业决策依据。社区单源未交叉验证者一律单列「社区快讯(待验证)」,不入正式条目。所有价格、评分以各榜单官网实时页为准,跨口径对比仅看量级。
| 章节 | 内容 | 关键标记 |
|---|---|---|
| 一 | 社区信源监控与浏览器门禁披露 | 未执行项透明标注 |
| 二 | DeepSeek 专项 | 今日有 D ✅(D1–D6) |
| 三 | 15 条精选 · 甲组 AI Coding(8 条) | 8 条 |
| 四 | 15 条精选 · 乙组 具身智能(7 条) | 7 条 |
| 五 | 社区快讯(待验证) | 单列存疑线索 |
| 六 | 三口径能力评分与价格表 | LiveBench / AA / llm-stats |
| 七 | Price vs Performance 性价比 | 双视角条形图 |
| 八 | AI 社会效益 | 7 领域 |
| 九 | AI 经济效益 | 6 维度 |
| 十 | 方法论与免责声明 | — |
结论:本运行(自动化无人值守)浏览器进程层已就绪,但控制通道未连接,B 站 UP 主字幕提取未执行。
STARTED(Edge 153.0.4234.32 已带调试端口拉起,共享用户 profile,端口 9223)。对照历史:09-05 至 09-14 连续多期均为同一原因(控制通道未连接)。本期特殊性:进程层门禁首次返回 STARTED,阻塞点已收敛到「控制通道」单一环节,而非「浏览器不可用」。
| # | 线索 | 平台 / 来源 | 发帖时效 | 是否构成新闻 | 交叉验证 | 置信度 |
|---|---|---|---|---|---|---|
| C1 | DeepSeek 拟聘任高瓴创投 90 后合伙人严文韬为首任 CFO,筹备科创板 IPO,估值约 5000 亿元(约 740 亿美元) | 路透 · 华尔街见闻早餐(09-15) · 虎嗅(09-14) · 凤凰网科技(09-14) · SCMP | 09-14 首发 / 09-15 集中转载 | ✅ 是 | 路透 + 4 家中外媒体同向;DeepSeek 未官宣 | 大概率 |
| C2 | DeepSeek-V4.1-Flash (Max) 进入 Agent Arena 开源模型榜第 3,净提升 +4.87%,每任务中位成本 $0.07;比第 2 名 Hy4 preview 成本低 68%、成绩仅差 0.09pp | AI HOT(09-15) · Agent Arena 官方榜 | 09-15 | ✅ 是(榜单直采) | 榜单可直接核验 + 聚合源转载 | 已确认 |
| C3 | Claude Code CLI 2.1.271:96 项变更,Remote fast mode(提示 token −28.7%)、沙箱按命令域名白名单、modelPricing 支持 10× 内部分摊倍率 | AGI Hunt(09-15) · X @ClaudeCodeLog(36 分钟前) | 09-15 | ✅ 是 | 2 源同向 + 版本可核验 | 已确认 |
| C4 | 火山引擎 OpenViking 登上 GitHub Trending:3.67 万星,AI Agent 上下文数据库,LoCoMo 长对话记忆准确率 24–57% → 80–83%,输入 token 消耗 −34.3%~−91.0% | 墨天轮数据库日报(09-14) · 掘金 · GitHub Trending | 09-12 登榜 / 09-14 报道 | ✅ 是 | 3 源同向 + 仓库可核验 | 已确认 |
| C5 | Anthropic 披露 GTG-50014 凭据窃取战役:牟利组织用 AI agent 自动化整条攻击链,34 小时内从 40+ 企业租户窃取 Azure AD 令牌 | Anthropic 官方披露 · AI Daily(09-15) · 安全媒体转载 | 09-15 | ✅ 是(厂商一手) | 官方披露 + 聚合源 | 已确认 |
| C6 | JFrog Artifactory 三漏洞链式利用(CVE-2026-42016 / 42018 / 82329)被 CISA 列入 KEV,两周整改窗口 | CISA KEV · AI Daily(09-15) | 09-15 | ✅ 是 | CISA 官方目录可查 | 已确认 |
| C7 | 治理层成 coding agent 生态新主线:CopilotKit/OpenBot(CEL 策略闸门优先 deny)、Tencent/teamai-cli(push→review→pull 团队配置同步)、agentverse-os/AgentVerse-OS(Incus 隔离工作区)同日上榜 | quidproquo AI Agent GitHub Digest(09-15) · GitHub Trending | 09-15 | ✅ 是 | 聚合源 + 仓库可核验 | 已确认 |
| C8 | 宇树 G1+ 发布:标准版 9.5 万元,25 自由度,肩腰电机峰值扭矩 +110%、同扭矩发热 −72%,颈部新增 2 自由度 | 宇树官方 · 浙江在线(09-15) · 具身机器人每日速递(09-15) · 腾讯研究院AI速递(09-15) | 09-14 发布 / 09-15 发酵 | ✅ 是(官方发布) | 官方 + 4 源同向 | 已确认 |
| C9 | 国家数据局将适时推动具身智能数据标准建设(09-10 刘烈宏主持具身智能座谈会,09-13 官网发布) | 国家数据局官网(2026.09.13) · 新华财经早报(09-14) · 科创板日报 · 腾讯新闻(09-14) | 09-13 官宣 / 09-14~15 密集转载 | ✅ 是(政策) | 官网一手 + 3 家权威媒体 | 已确认 |
| C10 | 具脑磐石 Cog-WM 1.0 类脑认知世界模型:HM3D-ObjectNav 子集导航成功率 78.50% → 86.89%,较 Nature Communications 的 BSC-Nav 基线相对提升 10.69% | 浦江创新论坛(09-14) · 具身机器人每日速递(09-15) · arXiv | 09-14 | ✅ 是 | 论坛发布 + 论文可查;分数为企业/论文自报 | 大概率(分数待独立验证) |
| C11 | 杭州柯林 × 英伟达:基于 NVIDIA 物理 AI 全栈,插装/压装等工业接触任务真机成功率 >80%,Jetson Thor 力觉闭环毫秒级 | 英伟达官微(09-14) · 具身机器人每日速递(09-15) | 09-14 | ✅ 是 | 2 源同向;成功率为企业自报 | 大概率 |
| C12 | Anthropic 重构测试影响分析服务:工程师季度交付代码量为 2021–2025 年均值的 8 倍,80% 代码由 Claude 编写,CI 任务 6 个月增长 25 倍;此前三次快速修补分别只撑 70 天 / 29 天 / 不到一天 | Anthropic 工程博客 · AI HOT(09-15) | 09-15 | ✅ 是(厂商一手) | 官方工程博客 + 聚合源 | 已确认 |
| C13 | 硅基流动上线 Hy4 preview:770B 总参数 / 49B 激活 / 1M 上下文 / Apache 2.0,可直连 Claude Code、Codex、Cursor | 硅基流动(09-15) · AI HOT(09-15) · 每日数讯(09-15) | 09-15 | ✅ 是 | 平台公告 + 2 聚合源 | 已确认 |
| C14 | 小红书 AllSpark 开源 Search Agent 模型 Iris:35B 与 397B 双版本同量级成绩领先,权重与评测代码已公开 | 小红书技术公众号 · AI HOT(09-15) | 09-15 | ✅ 是 | 权重可核验;数据与训练配方未公布 | 大概率 |
| C15 | Amodei 呼吁放缓前沿 AI 开发(近 4000 字),Altman、Hassabis、Nadella 相继响应;中国外交部 09-14 回应「散播 AI 威胁叙事不符合任何一方利益」 | darioamodei.com · 新华网(09-14) · AI HOT(09-15) | 09-12~09-15 | ✅ 是 | 当事人一手 + 官方回应 + 3 家媒体 | 已确认 |
| C16 | Anthropic 选定纳斯达克上市,洽谈英伟达作为锚定投资者(或达 100 亿美元),目标募资 1000 亿美元、估值或至 2.3 万亿美元 | 路透 · FT · 华尔街见闻(09-15) | 09-15 | ✅ 是 | 路透 + FT 双源;未发布招股书 | 大概率 |
| C17 | 恶意 AI agent 攻击 RubyGems.org:YARD .yardopts --load 执行任意代码 + Fastly 缓存密钥利用;涉 OpenAI 机器人相关 GemStuffer 恶意 gem | 安全研究者分析(09-15) · RubyGems 官方 · AI HOT | 09-15 | ✅ 是 | 攻击归因存争议(「与 OpenAI 相关」未证实) | 待验证(归因) |
| C18 | 波士顿动力 × 宝马多年期 Atlas 部署(初批 5 家工厂);Figure 03 已在宝马 Spartanburg 商业落地 | AI Daily 汇总(09-15) | 09-15 | ⚠️ 待核 | 单一聚合源,无当事方官宣 | 待验证 |
官方一手核验(必做):已逐条对照 DeepSeek 官网新闻页(deepseek.com/news)——最新官方条目为 2026-09-10「DeepSeek V4.1 Flash:更强、更快、更普惠」;V3.2 正式版 + V3.2-Speciale 为 2025-12-01,V3.2-Exp 为 2025-09-29。官网首页横幅与版权年份不作为发布日期依据。本期 D 条目均为「官方模型之外的公司/生态动态」,无一条把静态展示当新发事件。
| # | 事件 | 时效 | 来源 | 置信度 | 值得关注的原因 |
|---|---|---|---|---|---|
| D1 | DeepSeek 拟聘任高瓴创投 90 后合伙人严文韬为首任 CFO,筹备科创板 IPO。严文韬 1991 年生、复旦毕业,曾参与字节跳动、智谱、MiniMax、小红书投资。中信证券已介入筹备(路透 09-07 先行披露),二轮融资投前估值目标约 5000 亿元(约 740 亿美元),首轮已募超 500 亿元(梁文锋个人约 200 亿) | 09-14 首发 / 09-15 集中转载 | 路透 · 华尔街见闻早餐(09-15) · 虎嗅(09-14) · 凤凰网科技(09-14) · SCMP · GetFinanceBrief(09-15 00:26 UTC) | 大概率(DeepSeek 未正式官宣,来源为知情人士) | 首任 CFO 是 IPO 最明确的前置信号——比「聘请券商」更靠后一步。这意味着 DeepSeek 从「研究驱动的对冲基金副产品」正式切换到「需要财务披露与内控的准公众公司」。对中国大模型行业是估值锚:一旦挂牌,将首次公开前沿实验室的算力开支、API 毛利与亏损结构 |
| D2 | DeepSeek-V4.1-Flash (Max) 进入 Agent Arena 开源模型榜第 3 名,净提升 +4.87%,每任务中位成本 $0.07;比第 2 名 Hy4 preview 成本低 68% 而成绩仅差 0.09pp;与第 1 名 Kimi K3 (Max) 仅差 1.52pp 而成本低 91%。总榜第 12,按信号统计以 +13.75% 位列 Confirmed Success 第 4 | 09-15 | AI HOT(09-15) · Agent Arena 官方榜 | 已确认(榜单直采) | 这是「帕累托前沿被重塑」的量化证据:不是绝对能力第一,而是用 1/10 的成本买到 98.5% 的能力。对 agent 产品团队来说,这直接改变了「旗舰 vs 平价」的选型分界线 |
| D3 | V4.1 Flash 正式上线阿里云千问 AI 平台,API 服务与 Token Plan 同步开放(约 $6/月起档位) | 09-14 | 阿里云公告 · 每日经济新闻 · 多家财经媒体 | 已确认(平台公告) | 千问是 DeepSeek 的直接竞品平台。竞品上架竞品模型,说明国产大模型的分发逻辑已从「生态封闭竞争」转向「调用量优先」。叠加 D2,V4.1-Flash 正在成为中国 agent 开发的默认底座 |
| D4 | V4.1 Flash 上线三天升至 OpenRouter 全球调用量榜第 6,周调用 4.94 万亿 token | 09-14 报道 | OpenRouter 数据 · 每日经济新闻 | 大概率(平台统计口径,非官方披露) | 与 D2 互为印证:榜单上是「能力强且便宜」,实际调用上是「开发者真在用」。同期全球调用量前五中国模型占四席、中国大模型周调用 61.17 万亿 token 连续二十周全球第一 |
| D5 | 价格锚点被重新标定:V4.1-Flash 缓存命中输入 $0.003/百万 token,对比 GPT-5.6 Sol $0.40、Claude Opus 5 $0.50(约 1/133 与 1/167) | 09-15 报道 | VentureBeat · Juniper Research · Cryptopolitan(09-15) | 大概率(第三方测算,非官方对照表) | 缓存命中价是长程 agent 会话的真实成本项。当缓存命中价被压到小数点后三位,agent 的「每任务 economics」从「能跑」变成「可以无限跑」,这是 coding agent 从 demo 走向 7×24 长程运行的前提 |
| D6 | 财务数据流出:2026 年前 7 个月营收约 4.75 亿元(约为 2025 全年的 10 倍),毛利率 44.6%,API 业务毛利率 82.9%,净亏损 7.15 亿元(较 2025 全年 9.35 亿元收窄),AI 基础设施支出暴涨至约 110 亿元、同比增长近 10 倍 | 09-14 | 虎嗅(09-14) · 招商证券周报(09-13) | 待验证(单一媒体源,DeepSeek 未确认,口径为第三方估算) | 这是本期最反直觉的一条:API 毛利率 82.9% 说明卖 token 本身是高毛利生意,但净亏损来自 110 亿元基建支出。也就是说,DeepSeek 的低价不是补贴获客,而是把成本压在 CapEx 端而非毛利端——这与「烧钱换份额」是两种完全不同的财务模型 |
| 事件 | 真实日期 | 剔除理由 |
|---|---|---|
| DeepSeek V3.2 正式版 + V3.2-Speciale | 2025-12-01(官网新闻页) | 年份 ≠ 本期年份,官网横幅常驻但非新发 |
| DeepSeek-V3.2-Exp | 2025-09-29(官网新闻页) | 一年前旧闻 |
| V4.1 Flash 正式发布 | 2026-09-10(官网新闻页最新条目) | 上期已报,本期只取后续反应(D2/D3/D4) |
| V4-Pro GA / V4-Pro 0813 | 2026-08-13 | 超窗,仅作评分表对比基线 |
| 拟采购 16 万颗华为昇腾 950DT | 2026-09-04(彭博首发) | 超窗,且经二次放大,未获官方确认 |
| 首轮 500 亿元融资 | 2026-06 | 超窗,仅作 D1 背景 |
/fast 开启;② 沙箱网络按命令级域名白名单(Bash / PowerShell / Monitor 在 auto-sandbox 下只放行该命令实际需要的 host);③ modelPricing 支持最高 10× 倍率(面向内部计价/成本分摊);④ 全屏 /config 面板鼠标支持;⑤ --drain-marker-file 供自托管 runner 在 SIGTERM 上报主机排空;⑥ omitClaudeMd 与 --agents JSON 让子代理不加载 CLAUDE.md;⑦ claude plugin install/update 新增 --accept-command 替代 -y。.git/config 投毒类攻击的直接工程回应。viking:// 类文件系统协议统一寻址;AGFS 存储 + 向量索引 + L0/L1/L2 三层上下文加载机制。官方基准:LoCoMo 长对话记忆准确率从 24%–57% 提升至 80%–83%,输入 Token 消耗下降 34.3%–91.0%。最新版本 v0.4.19(09-08)。.yardopts --load 执行任意代码 + Fastly 缓存密钥利用。| # | 线索 | 时效 | 来源 | 存疑原因 | 缺哪一方验证 |
|---|---|---|---|---|---|
| Q1 | 波士顿动力与宝马达成多年期 Atlas 部署合作(初批 5 家工厂);Figure 03 在宝马 Spartanburg 进入商业部署 | 09-15 | AI Daily 汇总(单源) | 无当事方(波士顿动力 / 宝马 / Figure)官方公告或新闻稿 | 缺任意一方官方确认 |
| Q2 | 恶意 AI agent 攻击 RubyGems.org 的「GemStuffer」与 OpenAI 机器人相关,上传 2000+ 恶意包且未披露 | 09-15 | 安全研究者代码分析、AI HOT | 攻击归因基于代码相似性推断,无司法或平台方结论;OpenAI 此前对同类指控有不同表述 | 缺 RubyGems 官方 / OpenAI 官方定性 |
| Q3 | 智谱完成约 50 亿美元融资(约 20 亿美元配售 + 约 30 亿美元零息可转债),约 60%(约 235 亿港元)投向下一代 GLM 与「完全自训练」体系 | 09-14~15 | 港交所公告、腾讯研究院AI速递(09-15) | 港交所公告部分可核验,但「完全自训练」的实际技术路径与效果无第三方验证;GLM-6.0 尚未发布 | 缺模型实物与独立评测 |
| Q4 | Anthropic 已选定纳斯达克上市,洽谈英伟达作为锚定投资者(或达 100 亿美元),目标募资 1000 亿美元、估值或至 2.3 万亿美元 | 09-15 | 路透、FT | 双权威源但未发布招股说明书,仅向小范围投资者分享文件;估值区间为传闻口径 | 缺 Anthropic 官方与 SEC 文件 |
| Q5 | 开源模型 Nex-N2.5-Pro(397B 总参 / 约 17B 激活 MoE)OSWorld-G 得分 87.4,超过 Claude Opus 5 的 76.8 与 GPT-5.6 Sol 的 77.7 | 09-08 发布 / 09-15 传播 | Nex AGI 官方 model card、quidproquo(09-15) | 全部为厂商用自研 NexAU/NexCUA harness 自测,无独立第三方复现;官方未重新公布参数量、疑为后训练升级而非新基座 | 缺独立第三方复现 |
| Q6 | 电子皮肤订单快速放量:某企业 6 月单月获 1.3 万件仿生外皮订单、某企业累计交付超 4 万套;2030 年国内需求 152.5 万平方米 / 约 274 亿元 | 09-13~15 | 央视新闻、行业预测 | 订单数据未具名,2030 预测为机构外推 | 缺具名企业披露 |
| # | 模型 | 总评 | Reasoning | Coding | Agentic Coding | Math | Data Analysis | Language | IF | 每成功任务成本 |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 Max Effort | 83.4 | 91.7 | 86.4 | 66.1 | 97.0 | 80.3 | 89.5 | 73.0 | $1.212 |
| 2 | Claude Fable 5 Max Effort | 83.0 | 89.7 | 86.0 | 62.2 | 96.0 | 80.5 | 90.7 | 75.8 | $1.439 |
| 3 | GPT-6 Astra Max Effort | 82.2 | 92.7 | 80.4 | 57.3 | 96.8 | 83.0 | 89.4 | 75.6 | $0.736 |
| 4 | Muse Spark 1.3 xHigh Effort | 81.6 | 89.7 | 81.1 | 64.1 | 95.9 | 79.6 | 82.8 | 78.0 | $0.219 |
| 5 | DeepSeek V4.1 Flash Max Effort(开源) | 81.1 | 86.7 | 80.0 | 77.3 | 93.3 | 79.3 | 81.2 | 70.0 | $0.029 |
| 6 | GPT-5.6 Sol Max Effort | 81.0 | 91.7 | 83.9 | 56.2 | 96.2 | 79.8 | 87.7 | 71.8 | $0.515 |
| 7 | GPT-5.5 Thinking xHigh Effort | 80.2 | 89.7 | 82.1 | 54.0 | 95.9 | 81.6 | 87.4 | 70.7 | $0.435 |
| 8 | Claude 5 Opus Thinking Max Effort | 80.1 | 91.2 | 81.4 | 65.2 | 95.7 | 74.6 | 88.7 | 63.8 | $0.699 |
| 9 | Kimi K3(开源) | 79.2 | 90.7 | 81.4 | 62.2 | 84.4 | 78.7 | 85.5 | 71.4 | $0.348 |
| 10 | Qwen 3.8 Max(开源) | 78.5 | 88.2 | 72.9 | 64.6 | 91.3 | 78.4 | 79.7 | 74.1 | $0.275 |
| 11 | Grok 4.6 | 78.0 | 90.5 | 76.8 | 57.0 | 92.6 | 73.9 | 83.7 | 71.9 | $0.207 |
| 12 | DeepSeek V4 Pro 0813(开源) | 77.4 | 85.8 | 77.2 | 54.9 | 95.1 | 79.2 | 82.1 | 67.7 | $0.044 |
| 13 | DeepSeek V4 Flash Vision Exp(开源) | 76.8 | 85.4 | 68.2 | 65.1 | 87.8 | 79.5 | 80.4 | 71.0 | $0.051 |
| 14 | Qwen 3.8 Flash Next(开源) | 76.2 | 87.4 | 72.6 | 61.6 | 85.8 | 74.2 | 74.6 | 77.1 | $0.042 |
| 15 | GLM-5.3(开源) | 76.1 | 85.8 | 79.0 | 60.9 | 87.9 | 70.2 | 79.9 | 69.3 | $0.450 |
| 16 | GLM-5.3 Flash(开源) | 71.6 | 77.6 | 79.0 | 56.8 | 81.2 | 76.4 | 77.3 | 52.8 | $0.031 |
关键读数:
| # | 模型 | Intelligence Index | 输出速度 (tok/s) | 上下文 |
|---|---|---|---|---|
| 1 | Claude Fable 5.1 (max with fallback) | 53.37 | 65.1 | 1.0M |
| 2 | GPT-6 Astra (max) | 52.81 | 60.0 | 1.0M |
| 3 | Claude Opus 5 (max) | 50.70 | 51.7 | 1.0M |
| 4 | Claude Fable 5 (with fallback) | 49.70 | 60.6 | 1.0M |
| 5 | Muse Spark 1.3 (max) | 48.17 | 232.6 | 1.0M |
| 6 | GPT-5.6 Sol (max) | 47.06 | 63.3 | 1.0M |
| 7 | GLM-5.3 (max)(开源最佳) | 44.86 | 73.0 | 1.0M |
| 8 | Grok 4.6 (high) | 44.41 | 58.5 | — |
| 9 | Kimi K3 (max)(开源) | 43.78 | 35.7 | 1,048,576 |
| 10 | GPT-5.6 Terra (max) | 42.25 | 113.3 | 1.0M |
| 11 | GLM-5.3-Flash(开源) | 41.91 | 107.7 | 1.0M |
| 12 | Gemini 3.8 Flash (high) | 41.19 | 302.9 | 1.0M |
| 13 | Qwen3.8 2.4T A95B(开源) | 40.04 | — | 983,616 |
| 14 | DeepSeek V4.1 Flash (max)(开源) | 39.55 | 222.8 | 1.0M |
| 15 | GPT-5.6 Luna (max) | 37.50 | 117.8 | 1.0M |
| 16 | DeepSeek V4 Pro 0813 (max)(开源) | 36.28 | 88.5 | 1.0M |
| 17 | Qwen3.8 27B(开源) | 33.90 | — | — |
| 18 | K2 Horizon 375B A23B(开源) | 30.79 | — | 524,288 |
| 19 | MiniMax-M3 | 29.61 | 107.3 | 1.0M |
| 20 | Inkling | 25.54 | 89.2 | 1.0M |
关键读数:
| # | 模型 | LLM Stats 分 | Reasoning | Coding | Agent | 上下文 | 速度 | 混合价 ($/1M) | 许可 |
|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra | 59.9 | 57.9 | 48.5 | 46.4 | 1.1M | 93 c/s | $11.90 | 专有 |
| 2 | Claude Fable 5.1 | 55.9 | 53.0 | 35.5 | 41.8 | 1.0M | 76 c/s | $11.90 | 专有 |
| 3 | GPT-5.6 Sol | 55.0 | 54.1 | 46.0 | 41.5 | 1.1M | 85 c/s | $6.19 | 专有 |
| 4 | Claude Mythos Preview(UNRELEASED) | 54.9 | 55.8 | 44.8 | 36.5 | — | — | — | 专有 |
| 5 | Claude Opus 5 | 54.9 | 53.9 | 41.9 | 40.0 | 1.0M | 55 c/s | $5.95 | 专有 |
| 6 | Muse Spark 1.3(⚠️ 见注) | 54.4 | 51.8 | 41.7 | 40.4 | 1.0M | 65 c/s | $0.10 | 专有 |
| 7 | Claude Fable 5 | 54.3 | 51.8 | 45.7 | 40.5 | 1.0M | 34 c/s | $11.90 | 专有 |
| 8 | Kimi K3 | 53.1 | 51.8 | 43.3 | 39.5 | 1.0M | 3 c/s | $3.39 | 开源 |
| 9 | GLM-5.3 | 52.8 | 51.9 | 42.8 | 39.6 | 1.0M | 147 c/s | $1.33 | 开源 |
| 10 | DeepSeek-V4-Pro-0813 | 52.1 | 50.1 | 40.7 | 37.9 | 1.0M | 64 c/s | $0.46 | 开源 |
| 11 | Qwen3.8 Max | 51.9 | 50.6 | 39.6 | 37.7 | 1.0M | 115 c/s | $1.81 | 开源 |
| 12 | DeepSeek-V4.1-Flash(NEW) | 51.8 | 48.9 | 44.4 | 41.3 | 1.0M | — | $0.24 | 开源 |
| 13 | Hy4 preview(腾讯) | 51.0 | 50.7 | 39.9 | 36.8 | — | — | — | 开源 |
| 14 | Claude Opus 4.8 | 50.9 | 50.3 | 41.7 | 35.5 | 1.0M | 59 c/s | $5.95 | 专有 |
| 15 | GPT-5.6 Terra | 50.8 | 49.2 | 42.2 | 38.2 | 1.1M | 135 c/s | $2.48 | 专有 |
⚠️ Muse Spark 1.3 的 $0.10 是 Contributor 档价格(允许 Meta 使用流量训练)。按标准档($1.25/$4.25,20:1 混合约 $1.39)重算,其性价比指数从 544 降至约 39.1。这是本期最容易被误读的数字,请勿直接引用 $0.10 做横评。
关键读数:
Muse Spark 1.3 若按 Contributor 档 $0.10 计算为 544(虚假榜首);按标准档 $1.39 重算为 39.1,约第 3–4 位。已强制标注,避免误读。
| 领域 | 事件 / 数据 | 时效 | 来源 | 置信度 |
|---|---|---|---|---|
| 医疗健康 | 贵州普安县 174 名村医中 170 余名已接受 AI 技能培训并使用「阿福」AI 医疗智能体;村医独自服务 1–2 千名村民,AI 用于辅助诊疗、健康咨询、用药建议与智能转诊。实例:AI 提示 40 岁村民有脑梗风险,村医综合判断后及时转诊未延误 | 09-14 | 央广网(09-14)、海外网(09-14) | 已确认(官媒实地采访) |
| 医疗健康 | 讯飞医疗 AI 辅助诊断系统已覆盖全国 811 个县级区域,支持 25 万余名基层医生,累计提供超 12 亿次诊断建议;正在试点糖尿病等十余种慢病 AI 管理 | 2026-07 WAIC 披露 / 09-15 引用 | 新华社、WAIC(07-19) | 已确认(新华社) |
| 公共安全 | 杭州「杭警智行」全国首支机器人交警中队完成升级:全天候自主巡岗、多模态融合定位、过斑马线遵循信号灯、中英双语嘈杂环境问答。投用 4 个月累计便民服务 1.1 万余次、交通违法劝导 23 万余次,重点路口高峰警力负荷优化 30%–50% | 09-14 | 杭州市公安局交通管理支队(09-14) | 已确认(政务发布) |
| 政务服务 | 国家数据局 09-10 召开具身智能座谈会(09-13 官网发布),将适时推动具身智能数据标准建设;此前 6 月印发《关于推进行业高质量数据集建设行动的实施方案》,目标 2028 年底建成一批覆盖重点领域、经应用验证的行业高质量数据集 | 09-13 官宣 | 国家数据局官网(2026.09.13)、新华财经(09-14) | 已确认 |
| 风险治理 | 《人工智能安全治理框架 3.0》在 2026 年国家网络安全宣传周开幕式发布(全国网络安全标准化技术委员会),延续风险分类 / 技术应对 / 综合治理逻辑,更新风险分类与应对举措 | 09-14 | 全国网安标委、网信中国 | 已确认 |
| 风险治理 | 全球首个「人工智能 + 脑机接口」医疗器械标准发布(国家药监局 09-14 批准),系统规范脑电数据采集、处理、标注、存储、访问全流程技术要求与测试方法,2027-09-01 实施 | 09-14 | 国家药监局、新华网 | 已确认 |
| 就业结构 | 2026 年本科专业目录正式设立「交叉学科」门类,首批 15 种专业,含具身智能、脑机科学与技术等 4 种全新增设专业;教育部等五部门《"人工智能+教育"行动计划》推动 AI 成为高校公共基础课 | 2026 年内 | 教育部、中宏网 | 已确认 |
| 数字鸿沟 | AI 让短剧译制出海成本从 约 400 元/分钟(3 人协作)降至 100–150 元/分钟(1 人 2–3 天),同一素材最高并行生成 40 个版本;中小企业与个人创作者获得过去只有大团队才有的产能 | 09-14 | 海外网(09-14)、外滩大会 | 大概率(案例为单一平台自述) |
本期社会效益的两条主线高度一致:AI 的实际价值正在从「替代人力」转向「补齐稀缺专业能力」。贵州普安的村医案例最能说明问题——AI 没有取代村医,而是让一个独自服务两千人、行医近 30 年的 68 岁村医,第一次有了「遇到疑难杂症能查、能判断该不该转诊」的能力。杭州机器人交警同理:不是替代交警,而是把高峰警力负荷优化 30%–50%,把人力释放到更需要判断力的环节。
与此同时,治理侧的步伐明显加快:具身智能数据标准进入国家统筹、《人工智能安全治理框架 3.0》发布、全球首个人工智能+脑机接口医疗器械标准落地。一个值得注意的节奏是——标准往往先于规模化落地出台(脑机接口标准 2027-09-01 才实施,具身智能数据集质量标准 11-01 实施),这说明监管选择的是「提前铺轨道」而非「事后补漏洞」。
| 维度 | 事件 / 数据 | 时效 | 来源 | 置信度 |
|---|---|---|---|---|
| 投融资 | 智谱完成约 50 亿美元融资:约 20 亿美元 H 股配售(每股 714 港元,较公告前收盘折让约 9.96%)+ 约 30 亿美元零息可转债(发行价本金 100.5%,初始转股价 892.50 港元,较配售价溢价 25%);合计净募约 393 亿港元,为上市不足九个月内第三轮融资,累计净募约 755 亿港元。约 60%(约 235 亿港元)投向下一代 GLM 与「完全自训练」体系 | 09-14~15 | 港交所公告、腾讯研究院AI速递(09-15)、华尔街见闻(09-15) | 已确认(港交所公告可核验) |
| 投融资 | DeepSeek 拟聘任首任 CFO,二轮融资投前估值目标约 5000 亿元(约 740 亿美元);首轮已募超 500 亿元(梁文锋个人约 200 亿、腾讯约 100 亿、宁德时代体系约 50 亿、京东/网易/砺思/IDG 各约 30 亿、国家人工智能产业投资基金 10 亿) | 09-14~15 | 路透、虎嗅(09-14)、凤凰网科技(09-14) | 大概率(估值与出资明细为媒体口径,未官宣) |
| 资本市场 | Anthropic 选定纳斯达克上市:洽谈英伟达作为锚定投资者(或达 100 亿美元),目标募资 1000 亿美元、估值或至 2.3 万亿美元(或成史上最大 IPO)。季度营收同比增长 14 倍至 115 亿美元,截至 7 月底年化收入运行率 650 亿美元,分析师预计年底可达 1200 亿美元;毛利率超 80%(未扣合作伙伴分成与训练成本);已实现连续第二个季度盈利(调整后指标) | 09-15 | 路透、FT、华尔街见闻早餐(09-15) | 大概率(未发布招股书) |
| 产业规模 | 截至 2026-06 底,全国智能算力规模达 2185 EFLOPS、同比增长 177%(为去年同期 2.8 倍),首个全国产 10 万卡 AI 超大规模集群建成;国家级 AI 开源社区汇聚用户 1100 余万、托管模型超 7 万个,国产万亿级参数开源大模型全球累计下载突破 100 亿次;高质量数据集超 12 万个;AI 相关行业保持 30% 以上高增长,规上制造业企业 AI 技术应用普及率超 30% | 2026-07-31 发改委发布会 | 国家发改委 | 已确认(官方发布) |
| 企业降本增效 | 2026 上半年软件业务收入 77182 亿元、同比增长 9.5%,软件业利润总额 8999 亿元、同比增长 1%;国家人工智能产业投资基金启动运行、规模 600 亿元;2025 年新增 446 款生成式 AI 服务完成网信办备案 | 2026 上半年 | 工信部、国家网信办 | 已确认(官方统计) |
| 企业降本增效 | 某家电企业自研「5G+AI」工业视觉检测系统把检测准确率提升至 99.98%、人均生产效率提升 275%;2025 前三季度智能眼镜出货超 178 万副(近八成为 AI 眼镜) | 2025–2026 | 同花顺财经(09-15)综述、引官方数据 | 大概率(综述引用,企业未具名) |
| 投资结构 | Stanford HAI AI Index 2026:2025 年中国 AI 私人投资 124.1 亿美元(同比 +32.2%,全球第二);美国 2858.8 亿美元(同比 +160.2%,为中国的 23.1 倍);生成式 AI 细分差距最大(美 1636.4 亿 vs 中 14.8 亿)。2013–2025 中国 AI 累计融资 1318.3 亿美元 | 2026 年度报告 | Stanford HAI AI Index 2026、OECD、PitchBook | 已确认(多机构报告) |
| 供应链变现 | 机器人电子皮肤订单快速放量:某企业 6 月单月获 1.3 万件仿生外皮订单、某企业累计交付超 4 万套;预测 2030 年国内人形机器人电子皮肤需求 152.5 万平方米 / 约 274 亿元 | 09-13~15 | 央视新闻、行业预测 | 大概率(订单未具名,2030 为外推) |
| 板块表现 | 工信部明确「加快推动人工智能产业发展和赋能应用」,《人工智能安全治理框架 3.0》发布;国内多家公司(香山股份、奥瑞德、润泽科技等)大举投入 AI 算力建设或收购算力资产;同时微软与英伟达限制部分模型使用,美股芯片股盘前下跌——板块内部出现「国产替代加速」与「海外映射回调」的分化 | 09-15 00:16 | 第一财经(09-15) | 大概率(券商观点,非事实性数据) |
本期经济效益最值得琢磨的,是资本正在从「投模型能力」转向「投资本结构本身」。同一天出现的三件事——智谱上市不足九个月完成第三轮融资(累计净募 755 亿港元)、DeepSeek 聘任首任 CFO 筹备科创板、Anthropic 选定纳斯达克并洽谈英伟达作锚定投资者——指向同一个判断:2026 Q3–Q4 是头部大模型公司集中从私募市场走向公开市场的窗口期。
这带来一个结构性变化:估值锚将从「谁的跑分高」变成「谁的财务模型能自洽」。Anthropic 的「连续两季度盈利」是调整后指标(剔除股权激励),毛利率 80% 尚未扣除给 Amazon 的分成与训练成本;DeepSeek 的 API 毛利率 82.9% 但基建支出 110 亿元同比增近 10 倍。两组数字都说明:AI 公司的单位经济模型(token 毛利)看起来很好看,但整体盈利能力取决于 CapEx 节奏——这恰好是公开市场最不擅长定价的部分。
另一条线索是供应链先于整机兑现收入:电子皮肤在整机尚未大规模上量时已有 4 万套累计交付、274 亿元的 2030 年需求预测;谐波减速器、行星滚柱丝杠、六维力传感器同样如此。这与具身智能本体厂估值回撤形成对照——「卖铲人」的现金流比「淘金者」的估值更实在。
artificialanalysis.ai/models 页面内嵌 JSON-LD 结构化直采,一次获取 20 个模型的 Intelligence Index、outputSpeed、medianOutputSpeed、contextWindowTokens,未使用历史快照。AI 日报 · 自动化生成 | 生成时间:2026-09-15 08:40(北京时间)| 统计窗口:2026-09-14 00:00 → 2026-09-15 08:40