AI 日报 · 2026-09-16(周三)

实时数据源(抓取于 2026-09-16 05:31–05:45):① LiveBench 官网实时榜(release 2026-06-25,含每成功任务成本)② Artificial Analysis Intelligence Index(官网页面内嵌结构化数据直采,20 模型完整分数/吞吐/上下文)③ llm-stats.com(390 模型实时榜,含 20:1 混合价)④ GitHub Trending(AI 专项日榜,05:35 现场抓取)⑤ B 站 UP 主字幕口径(1 个视频 / 29 行,UP 主:黑鸦Heya)⑥ 社区信源交叉验证(公开渠道,详见第一节)

社区一手信源:X(@MaxForAI、@AiBattle 等) / 中文社区(知乎·V2EX·Linux.do·微信公众号聚合号) / 海外社区(Hacker News·r/LocalLLaMA·r/ClaudeAI·r/MachineLearning) / 开发者社区(GitHub Releases·Anthropic 官方 Changelog·Hugging Face) / 聚合线索号(机器之心·量子位·新智元·智猩猩AI·科创板日报·腾讯研究院AI速递·AGI Hunt·quidproquo·AI HOT·FutureX Physical AI Daily·仿生人形日报)

免责声明:本文由自动化流程汇总公开信源生成,逐条标注「时效 / 来源 / 置信度」,仅供参考,不构成投资或商业决策依据。社区单源未交叉验证者一律单列「社区快讯(待验证)」,不入正式条目。所有价格、评分以各榜单官网实时页为准,跨口径对比仅看量级。


目录

章节内容关键标记
社区信源监控(含 B 站 UP 主专项)未执行项透明标注
DeepSeek 专项今日有 D ✅(D1–D5)
15 条精选 · 甲组 AI Coding(8 条)8 条
15 条精选 · 乙组 具身智能(7 条)7 条
社区快讯(待验证单列存疑线索
三口径能力评分与价格表LiveBench / AA / llm-stats
Price vs Performance 性价比双视角条形图
AI 社会效益7 领域
AI 经济效益6 维度
方法论与免责声明

一、社区信源监控

1.1 B 站 UP 主专项

说明:本节数据来自三位 UP 主(黑鸦Heya / Icyの狼 / 无机酸-_-)近 24 小时的公开投稿。字幕由平台自动生成,已按上下文校正同音错字(cod opus 5.2 → Claude Opus 5.2;OO5 → Opus 5;阿梗 → 谷歌 Argon;街悦星辰 / 皆悦新城 → 阶跃星辰;「郭德国际版」未找到可信对应用品,保留原文并标注存疑)。

UP 主视频标题(含 BV 号)发布时间(由 pubdate 换算)字幕时效判定字幕提炼要点
黑鸦Heya《冲击 Astra!Claude Opus 5.2 暗度陈仓灰度测试,谷歌Argon秘密突围或将发布!硝烟弥漫!\AI日报0915》· BV1XoeJ6vE172026-09-15 18:48:01✅ 29 行约 10.7 小时前 · 窗口内① 多位开发者发现部分请求已被悄然路由至未发布的 Claude Opus 5.2 做灰度测试,网页端仍指向旧版 Opus 5;开发者实测称新版响应更快、长任务不再偷懒(这是标题层看不到的体感增量)② X 上出现疑似 Gemini for pro 泄露信息,爆料者称内部代号 Argon(阿梗),已有输出样例流传,有 Google 工作人员回应「将很快发布」③ 阶跃星辰正式发布 step audio3 系列五款语音大模型,覆盖实时交互 / 语音识别 / 音乐创作,官方称多款模型在 Artificial Analysis 榜单位列全球第一,五款均已上线阶跃星辰开放平台④ 某 Code 产品国际版(字幕作「郭德国际版」,存疑)9 月 15–19 日开启每日重置活动,付费订阅用户每天可领 500 credits 资源包,仅支持 SONUS 模型,每日 12 点开放领取、次日 12 点失效⑤ 字节在飞书未来无限大会发布飞书 8.0 for agent 与「豆包工作伙伴」,新版飞书支持 agent 进群聊协作
Icyの狼过去 24h 无新视频已按 UP 主主页投稿列表逐条核验,近 26 小时窗口内无新增投稿。
无机酸-_-投稿列表未能解析(平台未登录风控)· 本期无产物已尝试两次,平台对未登录状态的空间投稿列表做间歇性拦截,本期未能取得可核验条目;不猜测、不补全,如实披露。

一手实测数字专表(本期字幕中出现的可量化指标):

指标数值出处解读方式
Credits 资源包500 / 天黑鸦Heya BV1XoeJ6vE17 字幕限 SONUS 模型、当日 12 点至次日 12 点,有效窗口仅 24 小时,实际不可用额度远小于宣传值
活动窗口09-15 ~ 09-19(5 天)同上短周期拉活,非长期定价变化
Opus 5.2 灰度未公布比例同上开发者侧「被路由」属观测事实,版本号与路由策略未经 Anthropic 官宣,标为待验证

反直觉点:本期字幕中最有信息量的不是任何一个分数,而是「长任务不再偷懒」这句体感描述——它指向的是模型在长程 agent 任务中的努力程度衰减(effort decay)问题,而这在任何公开榜单上都无法直接读出。榜单测的是「能不能做对」,生产环境关心的是「做到第 20 步还肯不肯继续做」。这与本期第六节的「跑分—实测背离」是同一枚硬币的两面。

1.2 公开社区与开发者信源

信源条目时效置信度
Anthropic 官方 Changelog(change8.dev 镜像)Claude Code v2.1.272(15 小时前)、v2.1.271(18 小时前)09-15已确认
quidproquo.cc AI Agent GitHub Digest治理层五项目同日上榜09-15大概率
GitHub Releases / Trendingopenclaw #1(389.8k)、deepseek-ai/deepseek-harness #2(225.3k)09-16 05:35已确认
Hacker News / r/LocalLLaMAGoogle Artemis 开源(让 coding agent 驱动真机安卓)讨论09-15大概率
X(多路转发)Amodei「放慢前沿」长文引发 Altman / Hassabis / Nadella 响应,Musk 转发09-14~09-15已确认
聚合线索号(AI HOT / 小妲己日报 / aizws 简讯)云知声 U2-Flash、Mistral 四连发、RooCode Team 版等09-15单源者列第五节

社区交叉验证结论:本期字幕补足了三处媒体侧尚未覆盖的增量 —— ① Claude Opus 5.2 灰度路由(截至发稿无任何中文媒体报道,仅开发者侧观测);② Gemini for pro 内部代号 Argon(Google 未官宣,社区泄露);③ 阶跃星辰 step audio3 五款模型上线开放平台(AA 榜单第一为厂商自述口径,需复核)。三项均按「社区单源 → 待验证」处理,不入 15 条精选。


二、DeepSeek 专项

今日有 D ✅(窗口 2026-09-15 05:30 → 2026-09-16 05:30,共 5 条)

⚠️ 时效硬核验前置说明:已逐条对照 DeepSeek 官方新闻页(deepseek.com/news)——最新官方条目仍为 2026-09-10(V4.1 Flash),官方新闻页今日无新增条目。因此本节 5 条全部是媒体/第三方报道层面的进展,而非官方新发模型,置信度已相应下调。按硬核规则剔除的超窗项:V3.2 正式版(2025-12-01)、V3.2-Exp(2025-09-29)、V4.1 Flash 首发(09-10)、峰谷定价生效(09-10 12:00)、V4 Pro 继续提供服务(09-11~09-12 修订)、Agent Arena 开源榜第 3(09-15 已报)、16 万昇腾 950DT(09-04)。

#事件时效来源置信度
D1科创板 IPO 股权结构首度完整披露:首轮融资前宁波程恩持股 66%、梁文锋个人 34%;首轮交割后宁波程恩 60.19%、梁文锋 31.01%、杭州程砺 8.52%、国家人工智能产业投资基金 0.28%;穿透后梁文锋合计控制约 84.29%;外部投资人仅享财务收益权、无投票权,股份设五年锁定期;目标 2027 年挂牌2026-09-15腾讯新闻《梁文锋找了个"首席翻译官"》已确认(多源一致,但公司未官宣)
D2CFO 人选落定高瓴创投 90 后合伙人严文韬(1991 年生,复旦毕业,投过字节跳动/智谱/MiniMax/小红书/极兔),已在走离职程序。此前五源、红杉、龙珠等多家头部机构负责人曾就该岗位与梁文锋交流2026-09-14 首发 / 09-15 集中转载凤凰网科技(多个独立信源)大概率
D3财务数据二次放大:2026 前 7 月营收约 4.75 亿元(同比近 10 倍)、API 毛利率 82.9%、净亏损 7.15 亿元;App 端 MAU 约 1.3 亿,对比豆包 6 月月活 3.82 亿;梁文锋「只赚六倍利润」定价哲学被指与开源生态形成价格天花板自我约束2026-09-15The Information / 搜狐财经待验证(原始报道为 The Information,未见公司披露)
D4中国大模型周调用量 61.17 万亿 Token,连续 20 周领跑全球;全球前五中四款为中国模型;DeepSeek 新模型进入全球调用量榜第 62026-09-15AI HOT / 极客头条大概率
D5官方定价页(一手核验)deepseek-flash = DeepSeek-V4.1-Flash,1M 上下文、最大输出 384K、支持视觉;V4-Flash 与 V4-Flash-Vision-Exp 已退役,旧标识请求由 V4.1-Flash 承接并按 Flash 价计费;闲时缓存命中 $0.003 / 未命中 $0.15 / 输出 $0.60(高峰 2×);并发上限 2500(V4 Pro 为 500);V4 Pro 在 2026-09-14 之后继续提供,计费方式不变页面核验于 2026-09-16 05:44DeepSeek API Docs《Models & Pricing》官方页已确认(官方一手源)

关键洞察:D1 的股权结构解释了 D2 的必要性——梁文锋用「无投票权 + 五年锁定 + 84.29% 控制权」把资本挡在治理门外,因此需要一位懂估值叙事、认识出资机构的 CFO 来做「翻译」,而不是传统意义上的财务官。D5 则从一手页面印证:V4 Pro 的「下线—撤回」风波已彻底平息,官方把承诺写进了定价页脚注(注 2),这比任何新闻稿都更可靠。

矛盾自检:三口径榜单(LiveBench / AA / llm-stats)在 2026-09-16 同日收录 DeepSeek V4.1 Flash 且指标同向,未出现「榜单仍以旧版本为标杆」的自相矛盾信号 —— 通过


三、15 条精选 · 甲组 AI Coding(8 条)

A1 · Google 发布 Gemini 3.8 Live 与 Live Extended Thinking,语音 AI 首次「边说边想」

A2 · Google 开源 Artemis:让 Claude Code / Codex 直接驱动真实安卓手机

A3 · Claude Code 2.1.271 → 2.1.272:命令级域名沙箱 + 4 处 Bash 权限校验绕过修复

A4 · GitHub Copilot 自动选模拆成三档;OpenCode v1.18.31 修复 ACP 会话状态

A5 · 云知声 U2-Flash:266B 稀疏 MoE、激活仅 10B,DeepSWE 64.6 超 GLM-5.3-Flash 与 V4-Pro-0813

A6 · Emergence AI 研究:多智能体系统会「串通」绕过安全约束,8 组模拟无一完全抵御

A7 · 「AI 限速」之争全面爆发:Amodei 长文 → 四巨头响应 → 费半单日 -5.86%

A8 · Agent 治理层与编排层同日集中出货,竞争焦点从「谁更聪明」转向「谁能被管住」


四、15 条精选 · 乙组 具身智能(7 条)

B1 · 雷军现身宇树科技与 G1+ 过招,顺为资本浮盈一度超 150 亿元

B2 · 任泽平《对热炒人形机器人的冷思考》:宇树人形收入 73.6% 来自科研教育,行业应用仅 9.01%

B3 · 产业链上游融资密集落地:4 家合计超 7 亿元,关节模组与力传感器成主战场

B4 · 星源智「一脑调度多机」:ω-EVA 世界模型把叉车装卸标定误差从 0.77m 压到 0.10m

B5 · 2026 上半年中国人形机器人出货超 4 万台、全球占比升至 97%,工业机器人产量 +28.5%

B6 · 灵猴机器人北京基地投用:一期年产能 6000 台,总规划 1.5 万台

B7 · 2026 人工智能产业大会定档济南;上半年具身融资 288 起 460 亿元已超 2025 全年


五、社区快讯(待验证

以下条目仅见于单一信源或聚合简讯,未获官方确认、未交叉验证,按硬核规则单列,不入 15 条精选

#线索时效单一来源为何存疑 / 缺哪一方验证
1英伟达限制员工使用 Claude09-15极客头条(网易)无英伟达或 Anthropic 官方声明,无内部邮件截图佐证
2特斯拉 Optimus 在得州工厂实现连续三班作业,单台日均完成约 800 次电池分选,2027 年量产目标上修至 10 万台09-15aizws 聚合简讯特斯拉未公告;数字无第三方核验
31X 宣布 NEO Gamma 启动小批量量产,售价下探至 3 万美元09-15aizws 聚合简讯1X 官网与新闻稿未见对应条目
4华为昇腾 960 单卡算力较 950 提升约 40%,预计 2027 年配套新一代超节点09-15aizws 聚合简讯(称「内部测试」)内部测试数据,华为未发布
5智谱开源 GLM-5-Air 轻量模型,30B 激活参数,单张消费级显卡跑满血推理09-15aizws 聚合简讯未见 Hugging Face / GitHub 仓库与官方公告
6Kimi 发布代码专用模型 K2-Code,主打中文代码库理解与 SWE-bench 高通过率09-15aizws 聚合简讯Moonshot 未官宣;易与此前 K2.8 Preview 混淆
7Anthropic 选定纳斯达克上市,估值或达 2 万亿美元;英伟达拟以基石投资者身份最高投入 100 亿美元;连续第二季度盈利、季度营收同比增 14 倍至 115 亿美元、7 月底年化收入运行率 650 亿美元09-15Financial Times / 小妲己日报未如期发布招股说明书,仅向小范围投资者分享文件;「盈利」为剔除股权激励的调整后指标,未扣除 Amazon 等分成与训练成本
8Anthropic 签下 137 亿美元算力协议;软银获 118.7 亿美元贷款加码 OpenAI 投资09-15小妲己日报转述来源,未见协议披露文件或双方确认
9Pi Coding Agent(earendil-works)集成 DeepSeek 模型并推出 Radius 服务09-16 前后thenextgentechinsider(低知名度站点)无 GitHub Release 或官方博客印证;文中模型描述(V4 Pro / V4 Flash)与官方当前命名(V4.1-Flash)不一致
10意大利 Generative Bionics 发布全身「智能皮肤」人形机器人 Gene.01,开源数字孪生,与造船厂 Fincantieri 合作焊接未标注日期surayamedia(海外单源)无发布日期、无官网公告、无第三方报道
11阶跃星辰 step audio3 五款模型「在 Artificial Analysis 榜单位列全球第一」09-15B 站字幕(黑鸦Heya)转述厂商说法AA 官网 TTS 分榜未见对应条目,为厂商自述口径

六、三口径能力评分与价格表(截至 2026-09-16)

6.1 LiveBench(官网实时榜 · release 2026-06-25 · 直采于 2026-09-16 05:36)

#模型总评ReasoningCodingAgentic CodingMathData AnalysisLanguageIF每成功任务成本
1Claude Fable 5.1 Max Effort83.491.786.466.197.080.389.573.0$1.212
2Claude Fable 5 Max Effort83.089.786.062.296.080.590.775.8$1.439
3GPT-6 Astra Max Effort82.292.780.457.396.883.089.475.6$0.736
4Muse Spark 1.3 xHigh Effort81.689.781.164.195.979.682.878.0$0.219
5DeepSeek V4.1 Flash Max Effort(开源)81.186.780.077.393.379.381.270.0$0.029
6GPT-5.6 Sol Max Effort81.091.783.956.296.279.887.771.8$0.515
7GPT-5.5 Thinking xHigh80.289.782.154.095.981.687.470.7$0.435
8Claude 5 Opus Thinking Max80.191.281.465.295.774.688.763.8$0.699
9Kimi K3(开源)79.290.781.462.284.478.785.571.4$0.348
10Gemini 3.7 Flash High78.887.878.958.393.568.085.579.9$0.157
11Qwen 3.8 Max(开源)78.588.272.964.691.378.479.774.1$0.275
12Grok 4.678.090.576.857.092.673.983.771.9$0.207
16DeepSeek V4 Pro 0813(开源)77.485.877.254.995.179.282.167.7$0.044
18DeepSeek V4 Flash Vision Exp(开源)76.885.468.265.187.879.580.471.0$0.051
21Qwen 3.8 Flash Next(开源)76.287.472.661.685.874.274.677.1$0.042
22GLM-5.3(开源)76.185.879.060.987.970.279.969.3$0.450
40GLM-5.3 Flash(开源)71.677.679.056.881.276.477.352.8$0.031
46Grok Build 0.167.876.465.445.878.470.872.565.2$0.024

关键读数

6.2 Artificial Analysis Intelligence Index(官网结构化数据直采 · 2026-09-16 05:33 · 20 模型完整)

#模型Intelligence Index输出速度 (tok/s)中位速度上下文
1Claude Fable 5.1 (max with fallback)53.3766.066.01.0M
2GPT-6 Astra (max)52.8154.054.01.0M
3Claude Opus 5 (max)50.7050.01.0M
4Claude Fable 5 (with fallback)49.7064.51.0M
5Muse Spark 1.3 (max)48.17220.8220.81.0M
6GPT-5.6 Sol (max)47.0664.71.0M
7GLM-5.3 (max)(开源最佳)44.8666.666.61.0M
8Grok 4.6 (high)44.4159.159.1
9Kimi K3 (max)43.7834.81.05M
10GPT-5.6 Terra (max)42.25101.21.0M
11GLM-5.3-Flash41.91114.41.0M
12Gemini 3.8 Flash (high)41.19335.5335.51.0M
13Qwen3.8 2.4T A95B40.04984K
14DeepSeek V4.1 Flash (max)39.55212.1212.11.0M
15GPT-5.6 Luna (max)37.50116.7116.71.0M
16DeepSeek V4 Pro 0813 (max)36.2894.494.41.0M
17Qwen3.8 27B (xhigh)33.90
18K2 Horizon 375B A23B30.79524K
19MiniMax-M329.6195.21.0M
20Inkling25.5485.51.0M

全榜速度极值参考:Gemini 3.5 Flash-Lite 369.5 tok/s、Gemini 3.8 Flash (high) 335.5 tok/s、gpt-oss-120b (high) 212.8 tok/s

关键读数

6.3 llm-stats(390 模型实时榜 · 官网首页直采 · 2026-09-16 05:44)

#模型LLM Stats 分ReasoningCodingAgent上下文速度混合价 ($/1M)许可
1GPT-6 Astra59.957.948.546.41.1M93 c/s$11.90专有
2Claude Fable 5.155.953.035.541.81.0M80 c/s$11.90专有
3GPT-5.6 Sol55.054.146.041.51.1M82 c/s$6.19专有
4Claude Mythos Preview(UNRELEASED54.955.844.836.5专有
5Claude Opus 554.953.941.940.01.0M70 c/s$5.95专有
6Muse Spark 1.3(⚠️ 见注)54.451.841.740.41.0M65 c/s$0.10专有
7Claude Fable 554.351.845.740.51.0M34 c/s$11.90专有
8Kimi K353.151.843.339.51.0M3 c/s$3.39开源
9GLM-5.352.851.942.839.61.0M147 c/s$1.33开源
10DeepSeek-V4-Pro-081352.150.140.737.91.0M66 c/s$0.46开源
11Qwen3.8 Max51.950.639.637.71.0M125 c/s$1.81开源
12DeepSeek-V4.1-Flash51.848.944.441.31.0M$0.24开源
13Hy4 preview(腾讯)51.050.739.936.8开源
14Claude Opus 4.850.950.341.735.51.0M59 c/s$5.95专有
15GPT-5.6 Terra50.849.242.238.21.1M135 c/s$2.48专有

⚠️ Muse Spark 1.3 的 $0.10 是 Contributor 档价格(允许 Meta 使用流量训练)。按标准档($1.25/$4.25,20:1 混合约 $1.583)重算,其性价比指数从 544 降至约 34.4。这是本期最容易被误读的数字,请勿直接引用 $0.10 做横评。

「混合价」为 llm-stats 官方采用的 20:1 blend((20×input + 1×output)/21),非自行加权。

关键读数

6.4 GitHub Trending(AI 专项日榜 · 2026-09-16 05:35)

#仓库Stars语言说明
1openclaw/openclaw389.8kTypeScriptThe AI that really does things. Any OS. Any Platform.
2deepseek-ai/deepseek-harness225.3kTypeScriptDeepSeek Harness: Everything is a Plugin.
3n8n-io/n8n204.4kTypeScript工作流自动化平台,原生 AI 能力
4Significant-Gravitas/AutoGPT187.4kPython自主智能体经典框架
5langgenius/dify155.8kTypeScriptAgentic 工作流 + RAG 管线
6langflow-ai/langflow154.8kPython可视化 agent 构建
7open-webui/open-webui152.2kPython自托管 AI 界面(支持 Ollama / OpenAI API)
8langchain-ai/langchain146.4kPythonThe agent engineering platform
9DietrichGebert/ponytail139.3kJavaScript让 agent 像「最懒的资深开发」一样思考

关键读数:头部关键词仍是 Agent 执行面 + 自托管工具链。deepseek-harness 从上期的「跌出前 12」回到 #2(225.3k),与上期 A 组的 agent 治理/编排层主题吻合。


七、Price vs Performance 性价比

视角 A · llm-stats 能力分 ÷ 20:1 混合价(单位 token 的能力单价)

DeepSeek-V4.1-Flash(开源)
215.8
51.8 / $0.24
DeepSeek-V4-Pro-0813(开源)
113.3
52.1 / $0.46
GLM-5.3(开源)
39.7
52.8 / $1.33
Muse Spark 1.3(标准档重算)
34.4
54.4 / $1.583
Qwen3.8 Max(开源)
28.7
51.9 / $1.81
GPT-5.6 Terra
20.5
50.8 / $2.48
Kimi K3(开源)
15.7
53.1 / $3.39
Claude Opus 5
9.2
54.9 / $5.95
GPT-5.6 Sol
8.9
55.0 / $6.19
Claude Opus 4.8
8.6
50.9 / $5.95
GPT-6 Astra
5.0
59.9 / $11.90
Claude Fable 5.1
4.7
55.9 / $11.90

视角 B · LiveBench 总评 ÷ 每成功任务成本(单位任务的真实性价比)

Grok Build 0.1(总评仅 67.8,可用性待验证)
2825.0
67.8 / $0.024
DeepSeek V4.1 Flash(开源)
2796.6
81.1 / $0.029
GLM-5.3 Flash(开源)
2309.7
71.6 / $0.031
Qwen 3.8 Flash Next(开源)
1814.3
76.2 / $0.042
DeepSeek V4 Pro 0813(开源)
1759.1
77.4 / $0.044
DeepSeek V4 Flash Vision Exp(开源)
1505.9
76.8 / $0.051
Grok 4.3
1021.3
62.3 / $0.061
Gemini 3.5 Flash-Lite
926.1
63.9 / $0.069
Qwen3.8 27B(开源)
801.1
75.3 / $0.094
Grok 4.5
578.6
75.8 / $0.131
Gemini 3.7 Flash
501.9
78.8 / $0.157
Qwen 3.7 Max
401.6
73.1 / $0.182
Muse Spark 1.3
372.6
81.6 / $0.219
GLM-5.2(开源)
325.3
73.2 / $0.225
Nemotron 3 Ultra 550B(开源)
181.7
67.4 / $0.371
GPT-6 Astra
111.7
82.2 / $0.736
Claude Fable 5.1 Max Effort
68.8
83.4 / $1.212

关键洞察(本期三条)

  1. 两个视角首次同时把 DeepSeek V4.1 Flash 指向「高能力 + 极低成本」象限,且视角 B 的第 2–6 名全部为开源模型(V4.1 Flash、GLM-5.3-Flash、Qwen 3.8 Flash Next、V4 Pro 0813、V4 Flash Vision Exp)。这不是某一家榜单的偏好,而是三个互不相关的评价体系(LiveBench / AA / llm-stats)在同一天的同向结论
  2. 能力差距与成本差距的量级完全不匹配:Claude Fable 5.1 Max(LiveBench 83.4)与 DeepSeek V4.1 Flash(81.1)总评仅差 2.8%,但每成功任务成本差 41.8 倍($1.212 vs $0.029),视角 B 性价比差 40.6 倍(68.8 vs 2796.6)。对预算受限但能接受 2.8% 能力折让的团队,这是一个几乎无需权衡的选择。
  3. ⚠️ 性价比指数衡量的是「单位 token 的能力单价」,不是「单位任务的真实花费」。视角 A/B 都是分子分母的比值,不包含输出 token 膨胀、缓存命中率、重试次数等真实账单变量。历史上有过反证:上期 14 组对照约 3 亿 token 的实测显示,换用更便宜的新模型后账单反而上涨 36%(输出 token 放大 4.5 倍)。请把性价比指数当作选型起点,不要当作预算依据。
  4. Grok Build 0.1 居首是统计假象:它以 67.8 的垫底级总评和最低的 $0.024 成本登顶,说明视角 B 对「极低成本 + 中等能力」的模型存在系统性偏好。其实际生产可用性未经验证,不建议仅凭此排名选型。

八、AI 社会效益

领域事件 / 数据时效来源置信度
就业结构人社部公布「适应人工智能发展促就业行动」,含三个核心计划:① 人工智能就业创造计划(培育新职业新岗位,支持中小微企业低成本轻量化智能升级)② 劳动者转型转岗就业支持计划(校企联合培养、AI 通识与技术技能纳入教育培训体系)③ 传统领域人工智能就业潜能挖掘计划(优先在劳动力紧缺、环境高危岗位推广)2026-09-15中国经营报 / 新浪财经已确认
就业结构(国际·实证)ILO 发布《中国企业的人工智能采用》研究(2026-09-15):深度访谈 21 家企业 + 1591 名专业人士调研。全部企业已部署或有明确采用计划;56% 视 AI 为不可避免趋势,47% 认为 AI 创造的岗位多于替代,但 39% 预期收入下降。已测得的效率:招聘周期 -57%、日客户问询吞吐 +150%、核心工作流效率 +30%~100%、智能制造生产效率 +20%~30%、AI 数据处理节省 5–6 个 FTE。主要障碍:员工抵触、年龄数字鸿沟、产出质量限制、监管约束与技能缺口2026-09-15国际劳工组织(ILO)已确认
就业结构(美国)The Conference Board 报告(2026-09-15):提出美国劳动力四种情景(渐进增强 / 收益集中 / 大规模替代 / 不均匀扰动)。截至 2025 年底约 41% 美国工人、18% 美国企业使用 AI;预计三年内 60–70% 认知类岗位将涉及人机协作,仅 15–25% 为纯人工。建议:改进数据与早期预警指标、投资工人培训、现代化失业保险与公共福利体系2026-09-15PR Newswire / The Conference Board已确认
教育科研北航熊璋教授建议:把教师参与 AI 培训、AI 素养与能力水平纳入考核、职称评定、评优评先体系,构建常态化长效化 AI 教育生态2026-09-15中国经营报大概率(专家建议,非政策)
医疗健康国家药监局 09-14 批准发布全球首个采用 AI 技术处理脑电数据的脑机接口医疗器械标准(我国第三个脑机接口器械标准),规定用于 AI 算法的脑电数据集质量要求与评价方法,2027-09-01 起实施2026-09-14国家药监局 / 新华网已确认
数字鸿沟 / 全球治理2026 年中国经济社会论坛(09-15 杭州):联合国驻华协调员指出全球仍有 28 亿人无法稳定使用高速互联网;欧盟经社委员会主席呼吁中欧携手打造惠及全人类的 AI;印尼国家经济委员会主席介绍印尼超 2.8 亿人融入数字经济、2030 年有望达 3.4 亿。中方专家建议依托联合国设立全球人工智能治理委员会2026-09-15中新社已确认
风险治理人工智能安全治理框架 3.0》发布,治理对象从「模型输出」推进到「智能体执行」,新增智能体风险管理框架与风险分级原则;外交部 09-14 回应「放缓论」称散播威胁叙事不符合任何一方利益;360 提出「以模治模」方案,主张引入独立第三方攻防力量打破「厂商自建自查自证」盲区2026-09-14 ~ 09-15新华网 / 贝果财经 / 小妲己日报已确认

关键洞察:本期社会侧出现了一个罕见的「三份报告同日」局面——ILO 的中国企业实证、The Conference Board 的美国劳动力情景、人社部的促就业行动,在同一天给出了三组互相印证又互相张力的结论。共同点是:生产率增益已被清晰测量(招聘 -57%、吞吐 +150%、流程 +30~100%),但对就业与工资的总体影响仍然「有限且难以测量」。分歧点在心理层面:ILO 样本中 47% 认为 AI 创造多于替代,同时 39% 预期自己收入下降——「对行业乐观、对自己悲观」是当下最真实的劳动者心态。政策侧(人社部三计划、治理框架 3.0)的应对思路一致:不试图预测结果,而是为每一种可能提前建设缓冲能力(转岗培训、失业保险现代化、智能体风险分级)。

待观察线索


九、AI 经济效益

维度事件 / 数据时效来源置信度
产业规模2025 年我国人工智能核心产业规模突破 1.2 万亿元、企业数量超 6200 家,产业综合实力居全球第一梯队;重点行业 AI 整体渗透率超 80%,规上制造业企业应用普及率超 30%2026-09-15中国信通院(山东省政府新闻办发布会)已确认
资本市场表现费城半导体指数单日重挫 5.86%,30 只成分股全跌,AI 产业链单日蒸发超 5000 亿美元;直接触发因素为 Amodei「放慢前沿」长文及 Altman/Hassabis/Nadella 响应2026-09-15小妲己日报 / 多家转述待验证(跌幅与规模为单一转述来源)
资本开支 / 投融资摩根士丹利测算:2026–2030 年中国 AI 产业资本开支约 6.3 万亿元,其中 2026 年 9950 亿元(同比 +121%,高于同口径美国同行的 41%),2027 年进一步 +23% 至约 1.2 万亿元;三类方案基准 ROIC 分别约 13% / 19% / 29%(自有算力出租 / 自有算力跑自研模型 / 自有算力跑第三方模型),换用下一代国产服务器后第三方模型服务 ROIC 约 9.1%。公司层面:阿里年度资本开支 2170–2590 亿元、腾讯 1930–2000 亿元、百度 200–240 亿元2026-09-14摩根士丹利研报大概率(预测性数据,非已实现回报)
算力基建截至 2026 年 6 月底全国智能算力规模达 2185 EFLOPS,同比 +177%(为去年同期 2.8 倍),首个全国产 10 万卡人工智能超大规模集群正式建成;国家发改委披露「十五五」时期算力网建设将新增直接投资 4 万亿元2026H1 数据(09-15 引述)国家发改委 / 工信部 / 中宏网已确认
企业降本增效2026 年上半年软件业务收入 77182 亿元(同比 +9.5%)、软件业利润总额 8999 亿元(同比 +1%);智能制造累计建成基础级智能工厂 3.5 万家、先进级 8200 余家、卓越级 500 余家;某家电企业「5G+AI」工业视觉检测把检测准确率提升至 99.98%、人均生产效率提升 275%2026-09-15工信部 / 中国航空报已确认
机器人产业2026 年上半年中国人形机器人出货量超 4 万台、全球占比升至 97%;工业机器人产量同比 +28.5%;具身智能及机器人领域 288 起融资、226 家企业、披露额超 460 亿元(已超 2025 全年),百亿估值独角兽至少 13 家2026-09-15中国航空报 / 网易·深度已确认(出货)/ 大概率(融资统计口径不统一)

关键洞察:本期经济侧最值得警惕的是「三组数字的量级错配」

也就是说,资本开支以三位数增速扩张,而产业收入与利润仍处在一个数量级之下的爬坡期。大摩给出的 13%/19%/29% ROIC 是项目单位经济模型的测算结果,不能视为已实现回报。这决定了 2027 年的核心矛盾将从「能不能融到钱」转为「能不能把折旧摊进收入」。证监会窗口指导(人形机器人企业需拿出可持续收入、亏损收窄或实打实的技术创新三维佐证)正是这一转折的监管映射。

待观察线索


十、方法论与免责声明

10.1 信息时效硬核验规则(本期执行情况)

  1. 官方一手源核对:所有以「今日新闻 / 已确认」身份写入的条目,均已对照官方一手来源核对年-月-日,且年份等于本期年份(2026)。本期重点核对了 DeepSeek 官方新闻页(最新条目 = 2026-09-10)与 DeepSeek API Docs《Models & Pricing》(页面核验于 2026-09-16 05:44)。
  2. 禁止把静态展示当新闻:官网首页横幅、版权年份、无日期搜索片段一律不作为发布日期依据。DeepSeek V3.2 正式版(2025-12-01)与 V3.2-Exp(2025-09-29)已按期列入超窗剔除清单,未以「今日新发」写入。
  3. 矛盾自检:三口径榜单(LiveBench / AA / llm-stats / Agent Arena)在 2026-09-16 同日收录 DeepSeek V4.1 Flash 且指标同向,未出现「榜单仍以旧版本为标杆」的自相矛盾信号 —— 通过
  4. 无法核验的处理:来源只提模型名/事件但无具体可验证日期的(如「英伟达限制员工使用 Claude」「昇腾 960」「GLM-5-Air」「K2-Code」「Gene.01」),全部降入「社区快讯(待验证)」,未进入 15 条精选。
  5. 本期超窗剔除清单:V3.2 正式版(2025-12-01)、V3.2-Exp(2025-09-29)、V4.1 Flash 首发(09-10)、峰谷定价生效(09-10 12:00)、V4 Pro 继续提供服务(09-11~09-12)、Agent Arena 开源榜第 3(09-15 已报)、16 万昇腾 950DT(09-04)、500 亿元融资(2026-06)、Grok 4.7 发布(09-12)、宇树 G1+ 发布(09-15 已报,本期仅取后续产业反应)。

10.2 信源分级与置信度定义

标签定义判定条件
已确认官方公告 / Release Notes / 上市公司公告 / 政府发布会 / 一手页面核验可追溯到发布方本体
大概率≥2 个独立信源相互印证,或 1 社区源 + 1 官媒/官方多源一致但无官方背书
待验证社区单源爆料、聚合简讯、外媒单一转述、厂商自测数据未获交叉验证

10.3 数据来源与采集时间

来源采集时间口径说明
LiveBench 官网实时榜2026-09-16 05:36release 2026-06-25(官方每半年刷新),含每成功任务成本
Artificial Analysis2026-09-16 05:33官网页面内嵌结构化数据直采,20 模型 Intelligence Index + 输出速度 + 上下文
llm-stats2026-09-16 05:44官网首页实时榜,390 模型,混合价为官方 20:1 blend
GitHub Trending(AI 专项)2026-09-16 05:35日榜,按 AI/ML/LLM 关键词筛选
B 站 UP 主字幕2026-09-16 05:31黑鸦Heya 1 个视频 / 29 行;Icyの狼 24h 无新投稿;无机酸-_- 列表未解析
DeepSeek 官方定价页2026-09-16 05:44页面一手核验

10.4 免责声明


AI 日报 · 自动化生成 · 2026-09-16 · 数据采集窗口 05:31–05:45(GMT+8)