实时数据源(抓取于 2026-09-16 05:31–05:45):① LiveBench 官网实时榜(release 2026-06-25,含每成功任务成本)② Artificial Analysis Intelligence Index(官网页面内嵌结构化数据直采,20 模型完整分数/吞吐/上下文)③ llm-stats.com(390 模型实时榜,含 20:1 混合价)④ GitHub Trending(AI 专项日榜,05:35 现场抓取)⑤ B 站 UP 主字幕口径(1 个视频 / 29 行,UP 主:黑鸦Heya)⑥ 社区信源交叉验证(公开渠道,详见第一节)
社区一手信源:X(@MaxForAI、@AiBattle 等) / 中文社区(知乎·V2EX·Linux.do·微信公众号聚合号) / 海外社区(Hacker News·r/LocalLLaMA·r/ClaudeAI·r/MachineLearning) / 开发者社区(GitHub Releases·Anthropic 官方 Changelog·Hugging Face) / 聚合线索号(机器之心·量子位·新智元·智猩猩AI·科创板日报·腾讯研究院AI速递·AGI Hunt·quidproquo·AI HOT·FutureX Physical AI Daily·仿生人形日报)
免责声明:本文由自动化流程汇总公开信源生成,逐条标注「时效 / 来源 / 置信度」,仅供参考,不构成投资或商业决策依据。社区单源未交叉验证者一律单列「社区快讯(待验证)」,不入正式条目。所有价格、评分以各榜单官网实时页为准,跨口径对比仅看量级。
| 章节 | 内容 | 关键标记 |
|---|---|---|
| 一 | 社区信源监控(含 B 站 UP 主专项) | 未执行项透明标注 |
| 二 | DeepSeek 专项 | 今日有 D ✅(D1–D5) |
| 三 | 15 条精选 · 甲组 AI Coding(8 条) | 8 条 |
| 四 | 15 条精选 · 乙组 具身智能(7 条) | 7 条 |
| 五 | 社区快讯(待验证) | 单列存疑线索 |
| 六 | 三口径能力评分与价格表 | LiveBench / AA / llm-stats |
| 七 | Price vs Performance 性价比 | 双视角条形图 |
| 八 | AI 社会效益 | 7 领域 |
| 九 | AI 经济效益 | 6 维度 |
| 十 | 方法论与免责声明 | — |
说明:本节数据来自三位 UP 主(黑鸦Heya / Icyの狼 / 无机酸-_-)近 24 小时的公开投稿。字幕由平台自动生成,已按上下文校正同音错字(cod opus 5.2 → Claude Opus 5.2;OO5 → Opus 5;阿梗 → 谷歌 Argon;街悦星辰 / 皆悦新城 → 阶跃星辰;「郭德国际版」未找到可信对应用品,保留原文并标注存疑)。
| UP 主 | 视频标题(含 BV 号) | 发布时间(由 pubdate 换算) | 字幕 | 时效判定 | 字幕提炼要点 | |
|---|---|---|---|---|---|---|
| 黑鸦Heya | 《冲击 Astra!Claude Opus 5.2 暗度陈仓灰度测试,谷歌Argon秘密突围或将发布!硝烟弥漫!\ | AI日报0915》· BV1XoeJ6vE17 | 2026-09-15 18:48:01 | ✅ 29 行 | 约 10.7 小时前 · 窗口内 | ① 多位开发者发现部分请求已被悄然路由至未发布的 Claude Opus 5.2 做灰度测试,网页端仍指向旧版 Opus 5;开发者实测称新版响应更快、长任务不再偷懒(这是标题层看不到的体感增量)② X 上出现疑似 Gemini for pro 泄露信息,爆料者称内部代号 Argon(阿梗),已有输出样例流传,有 Google 工作人员回应「将很快发布」③ 阶跃星辰正式发布 step audio3 系列五款语音大模型,覆盖实时交互 / 语音识别 / 音乐创作,官方称多款模型在 Artificial Analysis 榜单位列全球第一,五款均已上线阶跃星辰开放平台④ 某 Code 产品国际版(字幕作「郭德国际版」,存疑)9 月 15–19 日开启每日重置活动,付费订阅用户每天可领 500 credits 资源包,仅支持 SONUS 模型,每日 12 点开放领取、次日 12 点失效⑤ 字节在飞书未来无限大会发布飞书 8.0 for agent 与「豆包工作伙伴」,新版飞书支持 agent 进群聊协作 |
| Icyの狼 | — | — | — | 过去 24h 无新视频 | 已按 UP 主主页投稿列表逐条核验,近 26 小时窗口内无新增投稿。 | |
| 无机酸-_- | — | — | — | 投稿列表未能解析(平台未登录风控)· 本期无产物 | 已尝试两次,平台对未登录状态的空间投稿列表做间歇性拦截,本期未能取得可核验条目;不猜测、不补全,如实披露。 |
一手实测数字专表(本期字幕中出现的可量化指标):
| 指标 | 数值 | 出处 | 解读方式 |
|---|---|---|---|
| Credits 资源包 | 500 / 天 | 黑鸦Heya BV1XoeJ6vE17 字幕 | 限 SONUS 模型、当日 12 点至次日 12 点,有效窗口仅 24 小时,实际不可用额度远小于宣传值 |
| 活动窗口 | 09-15 ~ 09-19(5 天) | 同上 | 短周期拉活,非长期定价变化 |
| Opus 5.2 灰度 | 未公布比例 | 同上 | 开发者侧「被路由」属观测事实,版本号与路由策略未经 Anthropic 官宣,标为待验证 |
反直觉点:本期字幕中最有信息量的不是任何一个分数,而是「长任务不再偷懒」这句体感描述——它指向的是模型在长程 agent 任务中的努力程度衰减(effort decay)问题,而这在任何公开榜单上都无法直接读出。榜单测的是「能不能做对」,生产环境关心的是「做到第 20 步还肯不肯继续做」。这与本期第六节的「跑分—实测背离」是同一枚硬币的两面。
| 信源 | 条目 | 时效 | 置信度 |
|---|---|---|---|
| Anthropic 官方 Changelog(change8.dev 镜像) | Claude Code v2.1.272(15 小时前)、v2.1.271(18 小时前) | 09-15 | 已确认 |
| quidproquo.cc AI Agent GitHub Digest | 治理层五项目同日上榜 | 09-15 | 大概率 |
| GitHub Releases / Trending | openclaw #1(389.8k)、deepseek-ai/deepseek-harness #2(225.3k) | 09-16 05:35 | 已确认 |
| Hacker News / r/LocalLLaMA | Google Artemis 开源(让 coding agent 驱动真机安卓)讨论 | 09-15 | 大概率 |
| X(多路转发) | Amodei「放慢前沿」长文引发 Altman / Hassabis / Nadella 响应,Musk 转发 | 09-14~09-15 | 已确认 |
| 聚合线索号(AI HOT / 小妲己日报 / aizws 简讯) | 云知声 U2-Flash、Mistral 四连发、RooCode Team 版等 | 09-15 | 单源者列第五节 |
社区交叉验证结论:本期字幕补足了三处媒体侧尚未覆盖的增量 —— ① Claude Opus 5.2 灰度路由(截至发稿无任何中文媒体报道,仅开发者侧观测);② Gemini for pro 内部代号 Argon(Google 未官宣,社区泄露);③ 阶跃星辰 step audio3 五款模型上线开放平台(AA 榜单第一为厂商自述口径,需复核)。三项均按「社区单源 → 待验证」处理,不入 15 条精选。
今日有 D ✅(窗口 2026-09-15 05:30 → 2026-09-16 05:30,共 5 条)
⚠️ 时效硬核验前置说明:已逐条对照 DeepSeek 官方新闻页(deepseek.com/news)——最新官方条目仍为 2026-09-10(V4.1 Flash),官方新闻页今日无新增条目。因此本节 5 条全部是媒体/第三方报道层面的进展,而非官方新发模型,置信度已相应下调。按硬核规则剔除的超窗项:V3.2 正式版(2025-12-01)、V3.2-Exp(2025-09-29)、V4.1 Flash 首发(09-10)、峰谷定价生效(09-10 12:00)、V4 Pro 继续提供服务(09-11~09-12 修订)、Agent Arena 开源榜第 3(09-15 已报)、16 万昇腾 950DT(09-04)。
| # | 事件 | 时效 | 来源 | 置信度 |
|---|---|---|---|---|
| D1 | 科创板 IPO 股权结构首度完整披露:首轮融资前宁波程恩持股 66%、梁文锋个人 34%;首轮交割后宁波程恩 60.19%、梁文锋 31.01%、杭州程砺 8.52%、国家人工智能产业投资基金 0.28%;穿透后梁文锋合计控制约 84.29%;外部投资人仅享财务收益权、无投票权,股份设五年锁定期;目标 2027 年挂牌 | 2026-09-15 | 腾讯新闻《梁文锋找了个"首席翻译官"》 | 已确认(多源一致,但公司未官宣) |
| D2 | CFO 人选落定高瓴创投 90 后合伙人严文韬(1991 年生,复旦毕业,投过字节跳动/智谱/MiniMax/小红书/极兔),已在走离职程序。此前五源、红杉、龙珠等多家头部机构负责人曾就该岗位与梁文锋交流 | 2026-09-14 首发 / 09-15 集中转载 | 凤凰网科技(多个独立信源) | 大概率 |
| D3 | 财务数据二次放大:2026 前 7 月营收约 4.75 亿元(同比近 10 倍)、API 毛利率 82.9%、净亏损 7.15 亿元;App 端 MAU 约 1.3 亿,对比豆包 6 月月活 3.82 亿;梁文锋「只赚六倍利润」定价哲学被指与开源生态形成价格天花板自我约束 | 2026-09-15 | The Information / 搜狐财经 | 待验证(原始报道为 The Information,未见公司披露) |
| D4 | 中国大模型周调用量 61.17 万亿 Token,连续 20 周领跑全球;全球前五中四款为中国模型;DeepSeek 新模型进入全球调用量榜第 6 | 2026-09-15 | AI HOT / 极客头条 | 大概率 |
| D5 | 官方定价页(一手核验):deepseek-flash = DeepSeek-V4.1-Flash,1M 上下文、最大输出 384K、支持视觉;V4-Flash 与 V4-Flash-Vision-Exp 已退役,旧标识请求由 V4.1-Flash 承接并按 Flash 价计费;闲时缓存命中 $0.003 / 未命中 $0.15 / 输出 $0.60(高峰 2×);并发上限 2500(V4 Pro 为 500);V4 Pro 在 2026-09-14 之后继续提供,计费方式不变 | 页面核验于 2026-09-16 05:44 | DeepSeek API Docs《Models & Pricing》官方页 | 已确认(官方一手源) |
关键洞察:D1 的股权结构解释了 D2 的必要性——梁文锋用「无投票权 + 五年锁定 + 84.29% 控制权」把资本挡在治理门外,因此需要一位懂估值叙事、认识出资机构的 CFO 来做「翻译」,而不是传统意义上的财务官。D5 则从一手页面印证:V4 Pro 的「下线—撤回」风波已彻底平息,官方把承诺写进了定价页脚注(注 2),这比任何新闻稿都更可靠。
矛盾自检:三口径榜单(LiveBench / AA / llm-stats)在 2026-09-16 同日收录 DeepSeek V4.1 Flash 且指标同向,未出现「榜单仍以旧版本为标杆」的自相矛盾信号 —— 通过。
allowed_domains——单条命令所需主机随该命令一起被审查并仅为它开放,其余主机一律拒绝,取代此前的全量网络白名单;② fast mode 进入 Remote 会话;③ claude self-hosted-runner --drain-marker-file 支持优雅排空;④ modelPricing 与 gateway pricing 支持 1–10 倍 multiplier,用于组织内部加价计费(chargeback);⑤ omitClaudeMd 让子代理跳过用户/项目 CLAUDE.md。2.1.272(09-15)为纯修复版。fmt/column 等命令在未知选项后读取的文件未被计入;通配符位于命令 pattern 或选项值中时展开的文件被跳过(如 grep -v dir/* file);shell 变量声明标志可歪曲实际执行命令;含双 cd、子 shell 或 cd+git 链的命令在 permissions.blockReadsOutsideWorkingDirectories 下绕过提示。tee 的写入规则与以 ! 开头的禁止规则(行为已变更)。modelPricing multiplier(组织内部计费)是同一趋势的两端:一端给个人调成本,一端给组织记账。以下条目仅见于单一信源或聚合简讯,未获官方确认、未交叉验证,按硬核规则单列,不入 15 条精选。
| # | 线索 | 时效 | 单一来源 | 为何存疑 / 缺哪一方验证 |
|---|---|---|---|---|
| 1 | 英伟达限制员工使用 Claude | 09-15 | 极客头条(网易) | 无英伟达或 Anthropic 官方声明,无内部邮件截图佐证 |
| 2 | 特斯拉 Optimus 在得州工厂实现连续三班作业,单台日均完成约 800 次电池分选,2027 年量产目标上修至 10 万台 | 09-15 | aizws 聚合简讯 | 特斯拉未公告;数字无第三方核验 |
| 3 | 1X 宣布 NEO Gamma 启动小批量量产,售价下探至 3 万美元 | 09-15 | aizws 聚合简讯 | 1X 官网与新闻稿未见对应条目 |
| 4 | 华为昇腾 960 单卡算力较 950 提升约 40%,预计 2027 年配套新一代超节点 | 09-15 | aizws 聚合简讯(称「内部测试」) | 内部测试数据,华为未发布 |
| 5 | 智谱开源 GLM-5-Air 轻量模型,30B 激活参数,单张消费级显卡跑满血推理 | 09-15 | aizws 聚合简讯 | 未见 Hugging Face / GitHub 仓库与官方公告 |
| 6 | Kimi 发布代码专用模型 K2-Code,主打中文代码库理解与 SWE-bench 高通过率 | 09-15 | aizws 聚合简讯 | Moonshot 未官宣;易与此前 K2.8 Preview 混淆 |
| 7 | Anthropic 选定纳斯达克上市,估值或达 2 万亿美元;英伟达拟以基石投资者身份最高投入 100 亿美元;连续第二季度盈利、季度营收同比增 14 倍至 115 亿美元、7 月底年化收入运行率 650 亿美元 | 09-15 | Financial Times / 小妲己日报 | 未如期发布招股说明书,仅向小范围投资者分享文件;「盈利」为剔除股权激励的调整后指标,未扣除 Amazon 等分成与训练成本 |
| 8 | Anthropic 签下 137 亿美元算力协议;软银获 118.7 亿美元贷款加码 OpenAI 投资 | 09-15 | 小妲己日报 | 转述来源,未见协议披露文件或双方确认 |
| 9 | Pi Coding Agent(earendil-works)集成 DeepSeek 模型并推出 Radius 服务 | 09-16 前后 | thenextgentechinsider(低知名度站点) | 无 GitHub Release 或官方博客印证;文中模型描述(V4 Pro / V4 Flash)与官方当前命名(V4.1-Flash)不一致 |
| 10 | 意大利 Generative Bionics 发布全身「智能皮肤」人形机器人 Gene.01,开源数字孪生,与造船厂 Fincantieri 合作焊接 | 未标注日期 | surayamedia(海外单源) | 无发布日期、无官网公告、无第三方报道 |
| 11 | 阶跃星辰 step audio3 五款模型「在 Artificial Analysis 榜单位列全球第一」 | 09-15 | B 站字幕(黑鸦Heya)转述厂商说法 | AA 官网 TTS 分榜未见对应条目,为厂商自述口径 |
| # | 模型 | 总评 | Reasoning | Coding | Agentic Coding | Math | Data Analysis | Language | IF | 每成功任务成本 |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 Max Effort | 83.4 | 91.7 | 86.4 | 66.1 | 97.0 | 80.3 | 89.5 | 73.0 | $1.212 |
| 2 | Claude Fable 5 Max Effort | 83.0 | 89.7 | 86.0 | 62.2 | 96.0 | 80.5 | 90.7 | 75.8 | $1.439 |
| 3 | GPT-6 Astra Max Effort | 82.2 | 92.7 | 80.4 | 57.3 | 96.8 | 83.0 | 89.4 | 75.6 | $0.736 |
| 4 | Muse Spark 1.3 xHigh Effort | 81.6 | 89.7 | 81.1 | 64.1 | 95.9 | 79.6 | 82.8 | 78.0 | $0.219 |
| 5 | DeepSeek V4.1 Flash Max Effort(开源) | 81.1 | 86.7 | 80.0 | 77.3 | 93.3 | 79.3 | 81.2 | 70.0 | $0.029 |
| 6 | GPT-5.6 Sol Max Effort | 81.0 | 91.7 | 83.9 | 56.2 | 96.2 | 79.8 | 87.7 | 71.8 | $0.515 |
| 7 | GPT-5.5 Thinking xHigh | 80.2 | 89.7 | 82.1 | 54.0 | 95.9 | 81.6 | 87.4 | 70.7 | $0.435 |
| 8 | Claude 5 Opus Thinking Max | 80.1 | 91.2 | 81.4 | 65.2 | 95.7 | 74.6 | 88.7 | 63.8 | $0.699 |
| 9 | Kimi K3(开源) | 79.2 | 90.7 | 81.4 | 62.2 | 84.4 | 78.7 | 85.5 | 71.4 | $0.348 |
| 10 | Gemini 3.7 Flash High | 78.8 | 87.8 | 78.9 | 58.3 | 93.5 | 68.0 | 85.5 | 79.9 | $0.157 |
| 11 | Qwen 3.8 Max(开源) | 78.5 | 88.2 | 72.9 | 64.6 | 91.3 | 78.4 | 79.7 | 74.1 | $0.275 |
| 12 | Grok 4.6 | 78.0 | 90.5 | 76.8 | 57.0 | 92.6 | 73.9 | 83.7 | 71.9 | $0.207 |
| 16 | DeepSeek V4 Pro 0813(开源) | 77.4 | 85.8 | 77.2 | 54.9 | 95.1 | 79.2 | 82.1 | 67.7 | $0.044 |
| 18 | DeepSeek V4 Flash Vision Exp(开源) | 76.8 | 85.4 | 68.2 | 65.1 | 87.8 | 79.5 | 80.4 | 71.0 | $0.051 |
| 21 | Qwen 3.8 Flash Next(开源) | 76.2 | 87.4 | 72.6 | 61.6 | 85.8 | 74.2 | 74.6 | 77.1 | $0.042 |
| 22 | GLM-5.3(开源) | 76.1 | 85.8 | 79.0 | 60.9 | 87.9 | 70.2 | 79.9 | 69.3 | $0.450 |
| 40 | GLM-5.3 Flash(开源) | 71.6 | 77.6 | 79.0 | 56.8 | 81.2 | 76.4 | 77.3 | 52.8 | $0.031 |
| 46 | Grok Build 0.1 | 67.8 | 76.4 | 65.4 | 45.8 | 78.4 | 70.8 | 72.5 | 65.2 | $0.024 |
关键读数:
| # | 模型 | Intelligence Index | 输出速度 (tok/s) | 中位速度 | 上下文 |
|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 (max with fallback) | 53.37 | 66.0 | 66.0 | 1.0M |
| 2 | GPT-6 Astra (max) | 52.81 | 54.0 | 54.0 | 1.0M |
| 3 | Claude Opus 5 (max) | 50.70 | — | 50.0 | 1.0M |
| 4 | Claude Fable 5 (with fallback) | 49.70 | 64.5 | — | 1.0M |
| 5 | Muse Spark 1.3 (max) | 48.17 | 220.8 | 220.8 | 1.0M |
| 6 | GPT-5.6 Sol (max) | 47.06 | 64.7 | — | 1.0M |
| 7 | GLM-5.3 (max)(开源最佳) | 44.86 | 66.6 | 66.6 | 1.0M |
| 8 | Grok 4.6 (high) | 44.41 | 59.1 | 59.1 | — |
| 9 | Kimi K3 (max) | 43.78 | — | 34.8 | 1.05M |
| 10 | GPT-5.6 Terra (max) | 42.25 | 101.2 | — | 1.0M |
| 11 | GLM-5.3-Flash | 41.91 | 114.4 | — | 1.0M |
| 12 | Gemini 3.8 Flash (high) | 41.19 | 335.5 | 335.5 | 1.0M |
| 13 | Qwen3.8 2.4T A95B | 40.04 | — | — | 984K |
| 14 | DeepSeek V4.1 Flash (max) | 39.55 | 212.1 | 212.1 | 1.0M |
| 15 | GPT-5.6 Luna (max) | 37.50 | 116.7 | 116.7 | 1.0M |
| 16 | DeepSeek V4 Pro 0813 (max) | 36.28 | 94.4 | 94.4 | 1.0M |
| 17 | Qwen3.8 27B (xhigh) | 33.90 | — | — | — |
| 18 | K2 Horizon 375B A23B | 30.79 | — | — | 524K |
| 19 | MiniMax-M3 | 29.61 | 95.2 | — | 1.0M |
| 20 | Inkling | 25.54 | 85.5 | — | 1.0M |
全榜速度极值参考:Gemini 3.5 Flash-Lite 369.5 tok/s、Gemini 3.8 Flash (high) 335.5 tok/s、gpt-oss-120b (high) 212.8 tok/s。
关键读数:
| # | 模型 | LLM Stats 分 | Reasoning | Coding | Agent | 上下文 | 速度 | 混合价 ($/1M) | 许可 |
|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra | 59.9 | 57.9 | 48.5 | 46.4 | 1.1M | 93 c/s | $11.90 | 专有 |
| 2 | Claude Fable 5.1 | 55.9 | 53.0 | 35.5 | 41.8 | 1.0M | 80 c/s | $11.90 | 专有 |
| 3 | GPT-5.6 Sol | 55.0 | 54.1 | 46.0 | 41.5 | 1.1M | 82 c/s | $6.19 | 专有 |
| 4 | Claude Mythos Preview(UNRELEASED) | 54.9 | 55.8 | 44.8 | 36.5 | — | — | — | 专有 |
| 5 | Claude Opus 5 | 54.9 | 53.9 | 41.9 | 40.0 | 1.0M | 70 c/s | $5.95 | 专有 |
| 6 | Muse Spark 1.3(⚠️ 见注) | 54.4 | 51.8 | 41.7 | 40.4 | 1.0M | 65 c/s | $0.10 | 专有 |
| 7 | Claude Fable 5 | 54.3 | 51.8 | 45.7 | 40.5 | 1.0M | 34 c/s | $11.90 | 专有 |
| 8 | Kimi K3 | 53.1 | 51.8 | 43.3 | 39.5 | 1.0M | 3 c/s | $3.39 | 开源 |
| 9 | GLM-5.3 | 52.8 | 51.9 | 42.8 | 39.6 | 1.0M | 147 c/s | $1.33 | 开源 |
| 10 | DeepSeek-V4-Pro-0813 | 52.1 | 50.1 | 40.7 | 37.9 | 1.0M | 66 c/s | $0.46 | 开源 |
| 11 | Qwen3.8 Max | 51.9 | 50.6 | 39.6 | 37.7 | 1.0M | 125 c/s | $1.81 | 开源 |
| 12 | DeepSeek-V4.1-Flash | 51.8 | 48.9 | 44.4 | 41.3 | 1.0M | — | $0.24 | 开源 |
| 13 | Hy4 preview(腾讯) | 51.0 | 50.7 | 39.9 | 36.8 | — | — | — | 开源 |
| 14 | Claude Opus 4.8 | 50.9 | 50.3 | 41.7 | 35.5 | 1.0M | 59 c/s | $5.95 | 专有 |
| 15 | GPT-5.6 Terra | 50.8 | 49.2 | 42.2 | 38.2 | 1.1M | 135 c/s | $2.48 | 专有 |
⚠️ Muse Spark 1.3 的 $0.10 是 Contributor 档价格(允许 Meta 使用流量训练)。按标准档($1.25/$4.25,20:1 混合约 $1.583)重算,其性价比指数从 544 降至约 34.4。这是本期最容易被误读的数字,请勿直接引用 $0.10 做横评。
「混合价」为 llm-stats 官方采用的 20:1 blend((20×input + 1×output)/21),非自行加权。
关键读数:
| # | 仓库 | Stars | 语言 | 说明 |
|---|---|---|---|---|
| 1 | openclaw/openclaw | 389.8k | TypeScript | The AI that really does things. Any OS. Any Platform. |
| 2 | deepseek-ai/deepseek-harness | 225.3k | TypeScript | DeepSeek Harness: Everything is a Plugin. |
| 3 | n8n-io/n8n | 204.4k | TypeScript | 工作流自动化平台,原生 AI 能力 |
| 4 | Significant-Gravitas/AutoGPT | 187.4k | Python | 自主智能体经典框架 |
| 5 | langgenius/dify | 155.8k | TypeScript | Agentic 工作流 + RAG 管线 |
| 6 | langflow-ai/langflow | 154.8k | Python | 可视化 agent 构建 |
| 7 | open-webui/open-webui | 152.2k | Python | 自托管 AI 界面(支持 Ollama / OpenAI API) |
| 8 | langchain-ai/langchain | 146.4k | Python | The agent engineering platform |
| 9 | DietrichGebert/ponytail | 139.3k | JavaScript | 让 agent 像「最懒的资深开发」一样思考 |
关键读数:头部关键词仍是 Agent 执行面 + 自托管工具链。deepseek-harness 从上期的「跌出前 12」回到 #2(225.3k),与上期 A 组的 agent 治理/编排层主题吻合。
关键洞察(本期三条):
| 领域 | 事件 / 数据 | 时效 | 来源 | 置信度 |
|---|---|---|---|---|
| 就业结构 | 人社部公布「适应人工智能发展促就业行动」,含三个核心计划:① 人工智能就业创造计划(培育新职业新岗位,支持中小微企业低成本轻量化智能升级)② 劳动者转型转岗就业支持计划(校企联合培养、AI 通识与技术技能纳入教育培训体系)③ 传统领域人工智能就业潜能挖掘计划(优先在劳动力紧缺、环境高危岗位推广) | 2026-09-15 | 中国经营报 / 新浪财经 | 已确认 |
| 就业结构(国际·实证) | ILO 发布《中国企业的人工智能采用》研究(2026-09-15):深度访谈 21 家企业 + 1591 名专业人士调研。全部企业已部署或有明确采用计划;56% 视 AI 为不可避免趋势,47% 认为 AI 创造的岗位多于替代,但 39% 预期收入下降。已测得的效率:招聘周期 -57%、日客户问询吞吐 +150%、核心工作流效率 +30%~100%、智能制造生产效率 +20%~30%、AI 数据处理节省 5–6 个 FTE。主要障碍:员工抵触、年龄数字鸿沟、产出质量限制、监管约束与技能缺口 | 2026-09-15 | 国际劳工组织(ILO) | 已确认 |
| 就业结构(美国) | The Conference Board 报告(2026-09-15):提出美国劳动力四种情景(渐进增强 / 收益集中 / 大规模替代 / 不均匀扰动)。截至 2025 年底约 41% 美国工人、18% 美国企业使用 AI;预计三年内 60–70% 认知类岗位将涉及人机协作,仅 15–25% 为纯人工。建议:改进数据与早期预警指标、投资工人培训、现代化失业保险与公共福利体系 | 2026-09-15 | PR Newswire / The Conference Board | 已确认 |
| 教育科研 | 北航熊璋教授建议:把教师参与 AI 培训、AI 素养与能力水平纳入考核、职称评定、评优评先体系,构建常态化长效化 AI 教育生态 | 2026-09-15 | 中国经营报 | 大概率(专家建议,非政策) |
| 医疗健康 | 国家药监局 09-14 批准发布全球首个采用 AI 技术处理脑电数据的脑机接口医疗器械标准(我国第三个脑机接口器械标准),规定用于 AI 算法的脑电数据集质量要求与评价方法,2027-09-01 起实施 | 2026-09-14 | 国家药监局 / 新华网 | 已确认 |
| 数字鸿沟 / 全球治理 | 2026 年中国经济社会论坛(09-15 杭州):联合国驻华协调员指出全球仍有 28 亿人无法稳定使用高速互联网;欧盟经社委员会主席呼吁中欧携手打造惠及全人类的 AI;印尼国家经济委员会主席介绍印尼超 2.8 亿人融入数字经济、2030 年有望达 3.4 亿。中方专家建议依托联合国设立全球人工智能治理委员会 | 2026-09-15 | 中新社 | 已确认 |
| 风险治理 | 《人工智能安全治理框架 3.0》发布,治理对象从「模型输出」推进到「智能体执行」,新增智能体风险管理框架与风险分级原则;外交部 09-14 回应「放缓论」称散播威胁叙事不符合任何一方利益;360 提出「以模治模」方案,主张引入独立第三方攻防力量打破「厂商自建自查自证」盲区 | 2026-09-14 ~ 09-15 | 新华网 / 贝果财经 / 小妲己日报 | 已确认 |
关键洞察:本期社会侧出现了一个罕见的「三份报告同日」局面——ILO 的中国企业实证、The Conference Board 的美国劳动力情景、人社部的促就业行动,在同一天给出了三组互相印证又互相张力的结论。共同点是:生产率增益已被清晰测量(招聘 -57%、吞吐 +150%、流程 +30~100%),但对就业与工资的总体影响仍然「有限且难以测量」。分歧点在心理层面:ILO 样本中 47% 认为 AI 创造多于替代,同时 39% 预期自己收入下降——「对行业乐观、对自己悲观」是当下最真实的劳动者心态。政策侧(人社部三计划、治理框架 3.0)的应对思路一致:不试图预测结果,而是为每一种可能提前建设缓冲能力(转岗培训、失业保险现代化、智能体风险分级)。
待观察线索:
| 维度 | 事件 / 数据 | 时效 | 来源 | 置信度 |
|---|---|---|---|---|
| 产业规模 | 2025 年我国人工智能核心产业规模突破 1.2 万亿元、企业数量超 6200 家,产业综合实力居全球第一梯队;重点行业 AI 整体渗透率超 80%,规上制造业企业应用普及率超 30% | 2026-09-15 | 中国信通院(山东省政府新闻办发布会) | 已确认 |
| 资本市场表现 | 费城半导体指数单日重挫 5.86%,30 只成分股全跌,AI 产业链单日蒸发超 5000 亿美元;直接触发因素为 Amodei「放慢前沿」长文及 Altman/Hassabis/Nadella 响应 | 2026-09-15 | 小妲己日报 / 多家转述 | 待验证(跌幅与规模为单一转述来源) |
| 资本开支 / 投融资 | 摩根士丹利测算:2026–2030 年中国 AI 产业资本开支约 6.3 万亿元,其中 2026 年 9950 亿元(同比 +121%,高于同口径美国同行的 41%),2027 年进一步 +23% 至约 1.2 万亿元;三类方案基准 ROIC 分别约 13% / 19% / 29%(自有算力出租 / 自有算力跑自研模型 / 自有算力跑第三方模型),换用下一代国产服务器后第三方模型服务 ROIC 约 9.1%。公司层面:阿里年度资本开支 2170–2590 亿元、腾讯 1930–2000 亿元、百度 200–240 亿元 | 2026-09-14 | 摩根士丹利研报 | 大概率(预测性数据,非已实现回报) |
| 算力基建 | 截至 2026 年 6 月底全国智能算力规模达 2185 EFLOPS,同比 +177%(为去年同期 2.8 倍),首个全国产 10 万卡人工智能超大规模集群正式建成;国家发改委披露「十五五」时期算力网建设将新增直接投资 4 万亿元 | 2026H1 数据(09-15 引述) | 国家发改委 / 工信部 / 中宏网 | 已确认 |
| 企业降本增效 | 2026 年上半年软件业务收入 77182 亿元(同比 +9.5%)、软件业利润总额 8999 亿元(同比 +1%);智能制造累计建成基础级智能工厂 3.5 万家、先进级 8200 余家、卓越级 500 余家;某家电企业「5G+AI」工业视觉检测把检测准确率提升至 99.98%、人均生产效率提升 275% | 2026-09-15 | 工信部 / 中国航空报 | 已确认 |
| 机器人产业 | 2026 年上半年中国人形机器人出货量超 4 万台、全球占比升至 97%;工业机器人产量同比 +28.5%;具身智能及机器人领域 288 起融资、226 家企业、披露额超 460 亿元(已超 2025 全年),百亿估值独角兽至少 13 家 | 2026-09-15 | 中国航空报 / 网易·深度 | 已确认(出货)/ 大概率(融资统计口径不统一) |
关键洞察:本期经济侧最值得警惕的是「三组数字的量级错配」:
也就是说,资本开支以三位数增速扩张,而产业收入与利润仍处在一个数量级之下的爬坡期。大摩给出的 13%/19%/29% ROIC 是项目单位经济模型的测算结果,不能视为已实现回报。这决定了 2027 年的核心矛盾将从「能不能融到钱」转为「能不能把折旧摊进收入」。证监会窗口指导(人形机器人企业需拿出可持续收入、亏损收窄或实打实的技术创新三维佐证)正是这一转折的监管映射。
待观察线索:
| 标签 | 定义 | 判定条件 |
|---|---|---|
| 已确认 | 官方公告 / Release Notes / 上市公司公告 / 政府发布会 / 一手页面核验 | 可追溯到发布方本体 |
| 大概率 | ≥2 个独立信源相互印证,或 1 社区源 + 1 官媒/官方 | 多源一致但无官方背书 |
| 待验证 | 社区单源爆料、聚合简讯、外媒单一转述、厂商自测数据 | 未获交叉验证 |
| 来源 | 采集时间 | 口径说明 |
|---|---|---|
| LiveBench 官网实时榜 | 2026-09-16 05:36 | release 2026-06-25(官方每半年刷新),含每成功任务成本 |
| Artificial Analysis | 2026-09-16 05:33 | 官网页面内嵌结构化数据直采,20 模型 Intelligence Index + 输出速度 + 上下文 |
| llm-stats | 2026-09-16 05:44 | 官网首页实时榜,390 模型,混合价为官方 20:1 blend |
| GitHub Trending(AI 专项) | 2026-09-16 05:35 | 日榜,按 AI/ML/LLM 关键词筛选 |
| B 站 UP 主字幕 | 2026-09-16 05:31 | 黑鸦Heya 1 个视频 / 29 行;Icyの狼 24h 无新投稿;无机酸-_- 列表未解析 |
| DeepSeek 官方定价页 | 2026-09-16 05:44 | 页面一手核验 |
AI 日报 · 自动化生成 · 2026-09-16 · 数据采集窗口 05:31–05:45(GMT+8)