覆盖方向:AI Coding × 具身智能
统计窗口:2026-09-11 07:30 → 2026-09-12 07:30(北京时间,过去 24 小时)
实时数据源(抓取于 2026-09-12 07:31–07:35):① LiveBench 官网实时榜(release 2026-06-25)② Artificial Analysis Intelligence Index(官网实时页,本期为连续第三日直采成功)③ llm-stats.com(390 模型实时价/吞吐/分项)④ GitHub Trending(AI 专项日榜,07:32 现场抓取)⑤ 社区信源交叉验证(公开渠道,详见第一节)
社区一手信源:X / 中文社区(知乎·V2EX·Linux.do·微信公众号聚合号)/ 海外社区(Hacker News·r/LocalLLaMA·r/artificial·LessWrong)/ 开发者社区(GitHub Releases·Hugging Face·Baseten)/ 聚合线索号(机器之心·量子位·新智元·智猩猩AI·科创板日报·仿生人形日报·FutureX Physical AI Daily·quidproquo AI Daily·AI HOT·AGI Hunt·AI Weekly)
免责声明:本文由自动化流程汇总公开信源生成,逐条标注「时效 / 来源 / 置信度」,仅供参考,不构成投资或商业决策依据。社区单源未交叉验证者一律单列「社区快讯(待验证)」,不入正式条目。所有价格、评分以各榜单官网实时页为准,跨口径对比仅看量级。
| 章节 | 内容 | 关键标记 |
|---|---|---|
| 一 | 社区信源监控与浏览器门禁披露 | 未执行项透明标注 |
| 二 | DeepSeek 专项 | 今日有 D ✅(D1–D7) |
| 三 | 15 条精选 · 甲组 AI Coding(8 条) | 8 条 |
| 四 | 15 条精选 · 乙组 具身智能(7 条) | 7 条 |
| 五 | 社区快讯(待验证) | 单列存疑线索 |
| 六 | 三口径能力评分与价格表 | LiveBench / AA / llm-stats |
| 七 | Price vs Performance 性价比 | 双视角条形图 |
| 八 | AI 社会效益 | 7 领域 |
| 九 | AI 经济效益 | 6 维度 |
| 十 | 方法论与免责声明 | — |
结论:本运行(自动化无人值守)未执行 B 站 UP 主字幕提取。
对照历史:09-05 至 09-11 连续多期均为同一原因(控制通道未连接,非门禁脚本失败)。信息源完整性已在下方以公开渠道补齐,但不构成与 UP 主字幕口径等价的一手实测增量。
| # | 线索 | 平台 / 来源 | 发帖时效 | 是否构成新闻 | 交叉验证 | 置信度 |
|---|---|---|---|---|---|---|
| C1 | DeepSeek V4.1-Flash 第三方实测:账单反涨 36%(14 组对照约 3 亿 token) | 微信公众号深度评测(钟sir百宝箱,09-12 00:10)· 今日头条千机阁(09-12 00:10)· 网易王煜全(09-12 06:31) | 09-12 | ✅ 是(可量化实测) | 3 个独立中文源同向 + 官方定价表可复算 | 大概率 |
| C2 | KV Cache 每词元 890 字节(前代 3,514,初代 389,120,累计压缩约 437 倍) | HF 模型卡(一手)· SemiAnalysis · askalphaxiv · Chosun Biz | 09-11 | ✅ 是(官方模型卡) | 官方 + 3 源同向 | 已确认 |
| C3 | 三星/SK海力士/美光因 DeepSeek 降 HBM 需求下挫 | Bloomberg(09-11 01:20)· ZeroHedge · Chosun Biz · 朝鲜日报中文 | 09-11 | ✅ 是 | 权威通讯社 + 3 源 | 已确认 |
| C4 | AMD vLLM 镜像发布滞后 23 小时;NVIDIA 6 款 SKU Day-0 可用 | SemiAnalysis(09-11 04:00)· @teortaxestex · HuggingNews 汇总 | 09-11 | ✅ 是 | 3 源同向 | 大概率 |
| C5 | OpenAI 暂停 ChatGPT Pro($200)新订阅,Astra 算力过载 | TechCrunch(09-10)· 新浪财经(09-11)· 快讯聚合 | 09-10~09-11 | ✅ 是 | 权威科技媒体 + 2 源 | 已确认 |
| C6 | Anthropic 报告:近 2 亿次交互的蒸馏攻击,涉阿里/月之暗面/DeepSeek 等五起活动 | Reuters(09-11)· TechCrunch · techstartups · 生成式AI日报 | 09-11 | ✅ 是 | 权威通讯社 + 3 源 | 已确认 |
| C7 | Cognition 用 Devin 多智能体完成 RSA-260 因式分解,破 RSA-250(2020)纪录 | Hacker News 热帖 · AI HOT 转述(09-11)· Cognition 员工 samyok | 09-11 | ✅ 是 | 2 源 + 当事人具名 | 大概率 |
| C8 | Shopify 从 React Native 全面迁回 Swift/Kotlin 原生 | Hacker News 热帖(09-11)· AI HOT 转述 | 09-11 | ✅ 是 | 单平台热帖 + 聚合号,未见 Shopify 官方公告 | 待验证 |
| C9 | PaperCut 大规模 AI Agent 协同攻击:48 国 395 个组织,最快 7 分钟拿域管 | quidproquo AI Daily(09-12)· 安全社区 | 09-12 | ✅ 是 | 单聚合源,缺官方/CISA 通报 | 待验证 |
| C10 | Claude Code 2.1.269 发布,98 项变更,新增 claude plugin eval | @ClaudeCodeLog(X,09-12)· AGI Hunt · myaiguide Builders Weekly | 09-12 | ✅ 是(官方发布日志) | 3 源同向 | 已确认 |
| C11 | Cognition Devin Fusion 扩展至 Desktop/CLI,双模型架构成本 -46% | CryptoCortex(09-11)· Cognition 官方(6/29 预览) | 09-11 | ✅ 是 | 2 源,AA Coding Agent Index v1.5 可查 | 大概率 |
| C12 | 远景「天机」气象大模型首登榜即夺双冠军,45 天预报 | 极客公园(09-11)· 生成式AI日报 | 09-11 | ✅ 是 | 2 源 + WeatherBench 2 榜单 | 大概率 |
| C13 | Anthropic 自曝第四起安全事件(8 月发现,回溯至 2026-01) | Anthropic 官方(09-11)· AIdapted · aidapted.ro | 09-11 | ✅ 是(官方自曝) | 官方 + 2 源 | 已确认 |
| C14 | 加州再签 13 项 AI 法案(AI 陪伴机器人风险评估、未成年人沉迷限制) | 生成式AI日报(09-11)· 立法记录 | 09-11 | ✅ 是 | 2 源 | 大概率 |
时效硬核核验说明:以下每条均对照 DeepSeek 官方一手来源(Hugging Face 模型卡
deepseek-ai/DeepSeek-V4.1-Flash、DeepSeek API 公告)与权威通讯社逐条核对到 2026-09-11 / 2026-09-12,年份 = 本期年份(2026)。超窗剔除(不计入今日有 D):V4.1-Flash 首发(2026-09-10,上期 D1 已报);16 万颗昇腾 950DT(彭博 2026-09-04 首发);V3.2 官网横幅(真实发布日 2025-12-01,非新闻);DeepSeek Harness CVE-2026-82533(09-10)。
| # | 事件 | 时效 | 来源 | 置信度 | 值得关注的原因 |
|---|---|---|---|---|---|
| D1 | V4.1-Flash 第三方实测:「单价降 60%,账单反涨 36%」。14 组对照任务(累计约 3 亿 token):V4.1-Flash 累计消费 61.96 元,旧版 V4-Flash 45.47 元,贵 16.49 元(+36%)。成因:模型更聪明→主动拆任务、开子 Agent、自我验证,输出 token 达旧版 4.5 倍。缓存命中率 98.9% 时输出项占账单 93%,而输出价仅降 11% | 09-12 00:10 | 中文深度评测(钟sir百宝箱)· 今日头条千机阁 · 网易王煜全 | 大概率 | 这是本期最反直觉的数字:官方「最高降 60%」指的是降幅最大但单价最低的缓存命中项;真实 Agent 场景里决定账单的是输出价。也是首次有可复算的 token 级账目曝光「更强的模型 = 更贵的任务」 |
| D2 | KV Cache 压缩引发存储芯片股下挫。V4.1-Flash 每词元全局 KV Cache 压到 890 字节(上一代 3,514、初代 389,120,累计压缩约 437 倍),HBM 需求降至 1/4、SSD 降至 1/8。09-11 三星电子 -4%+、SK 海力士 -3.5%+、隔夜费城半导体 -2.66%;港股 MiniMax、Z.AI 跌超 8% | 09-11 | Bloomberg(09-11 01:20)· ZeroHedge · Chosun Biz · 朝鲜日报中文 | 已确认 | 首次出现「模型架构优化 → 直接冲击存储芯片需求预期」的传导链。AA 把这种无差异化即淘汰的格局称为 DeepSeek 驱动的「死亡区」 |
| D3 | Design Arena 总榜第 6,Elo 1347。比次高的 DeepSeek 模型高 39 位,与 Claude Fable 5.1 处于同一前端设计性能带 | 09-11 03:12 | @designarena(X)· HuggingNews 汇总 | 大概率 | 前端/设计生成一向是闭源旗舰的自留地,开源模型首次打入同一性能带,直接冲击「设计类任务必须上旗舰」的选型常识 |
| D4 | Day-0 部署出现阵营分化:NVIDIA vLLM 在 H100/H200/B200/B300/GB200/GB300 六款 SKU 上零问题开箱即用;而 AMD 文档指向的 vllm-openai-rocm:deepseekv41-flash-0909 镜像在发布后 23 小时仍未公开。SGLang 亦同步支持 | 09-11 04:00 | SemiAnalysis(X)· HuggingNews | 大概率 | 「开源 = 到处能跑」的假设被打破。对国产卡/AMD 生态用户,Day-0 可用性已成一个需要单独评估的采购项 |
| D5 | Anthropic 指控蒸馏攻击,DeepSeek 被点名。报告称累计发现近 2 亿次相关交互、涉五起活动,其中一起归因于与阿里有关的运营者,交互量超过 1.51 亿次;同时披露生物武器研究、俄罗斯网络行动等滥用案例 | 09-11 | Reuters · TechCrunch · techstartups | 已确认 | 让「蒸馏」从道德争议变成可量化的合规议题。企业侧结论:调用外部模型的输出日志留存与可审计性,已成为自证清白的唯一凭据 |
| D6 | Harness v0.1.5:模型开始为运行时做专项训练。六项更新:①模型在训练阶段即针对标准/PTC/极简三种模式优化 ②可保留 KV Cache 更新系统提示词 ③Web 端上传图片/PDF 并预览 ④插件标准化 UI 入口 ⑤父子 Agent 双向通信与插话/停止 ⑥实验性 Agent Teams(共享任务列表,默认关闭)。dsh-plugin 公开仓库 700+,社区插件一周内 300 → 4,000+ | 09-10~09-11 | DeepSeek Harness Release Notes · 中文深度评测 | 已确认 | 护城河从「插件数量」转向「训练侧协同」。行业分工被逆转:框架不再是套在模型外的通用壳子,而成为模型能力的一部分。1–2 年内「模型 + Harness 联合优化」或成出厂标配 |
| D7 | 聘请中信证券筹备科创板 IPO(二次报道,正式辅导协议尚未签订)。公司 7 月完成第二轮融资,估值 5000 亿元,两轮累计募资超 1000 亿元,目前暂无外资机构参与 | 09-11 | 多家财经媒体 · 生成式AI日报 | 待验证 | 若落地将是 A 股「AI 大模型第一股」。但无官方公告、无辅导协议,仅作线索,不并入已确认条目 |
DeepSeek 小结:今日 D 的重心从「发布」转向「发布之后的账单、股价与生态反应」。三条独立线索(实测账单 +36%、存储芯片股下挫、AMD 镜像缺位)共同指向同一件事——架构级降本的外溢效应已经开始改写上下游的成本结构与预期,而不只是模型榜单上的名次变化。
claude plugin eval——运行可复现、可打分的插件评测套件,输出 JSON + HTML 报告;②Bash 工具现在会附带该命令所改动文件的 diff,编辑与输出同屏可见;③新增 /output-style 命令;④/diff 常驻交互式面板实时更新;⑤桌面端支持弹出面板与并排会话(可把终端或 diff 拖到第二屏)。周内 2.1.265→2.1.269 五版连发,另有 maxEffortLevel 跨 provider 强制上限、bash/task 输出上限 128K 字符、工具结果上限 1 GB、14 天未活动会话自动归档、组织级 managed MCP server 分发等 23 项更新。plugin eval 把「插件/技能包」从经验品变成可量化资产——这与 GitHub Trending 被 skills 仓库刷屏(见第六节)是同一趋势的两端。当技能包市场成型,评测与打分机制就是它的定价基础设施。AI 编码 CLI 已进入日更节奏,工具链的迭代速度本身正在成为竞争壁垒。code.find MCP 工具(CVE-2026-88938,中危)未把路径限制在项目根目录,可让 agent session 读取范围外源码;AutoAgent 存在未授权 RCE(CVE-2026-86124),任何能连到其 TCP 端口的人都可以 root 身份下发命令。以下线索未获得官方一手来源或仅单一信源,按验证规则不并入正式条目,仅作监控留痕。
| # | 线索 | 来源 | 时效 | 存疑点 | 缺哪一方验证 |
|---|---|---|---|---|---|
| V1 | Shopify 宣布从 React Native 全面迁回 Swift/Kotlin 原生,理由是「AI Agent 大幅降低跨平台重复开发成本」这一核心假设被推翻 | Hacker News 热帖(09-11)· AI HOT 转述 | 09-11 | 未见 Shopify 官方博客或工程公告,HN 原帖为二手转述 | Shopify 官方 / 工程博客 |
| V2 | PaperCut 大规模 AI Agent 协同攻击(CVE-2026-81578 / CVE-2026-82078),48 国 395 组织,7 分钟拿域管 | quidproquo AI Daily(09-12) | 09-12 | 缺 PaperCut 官方公告、CISA/NVD 条目、厂商确认 | PaperCut 官方 / NVD / CISA |
| V3 | DeepSeek 聘请中信证券筹备科创板 IPO,计划年内启动上市流程 | 多家财经媒体(09-11) | 09-11 | 正式辅导协议尚未签订,公司未公开确认 | DeepSeek 官方 / 证监会辅导备案公示 |
| V4 | 寒武纪等国产 AI 芯片厂商大幅上调 AI 处理器售价,下一代芯片较两个月前报价上涨 20%–30% | 界面新闻(09-11) | 09-11 | 寒武纪工作人员已明确回应「公司并未发布涨价相关消息,切勿轻信市场传闻」 | 厂商官方调价函 |
| V5 | Cognition 工程师用多个 Devin 智能体构建 GPU 格子筛,完成 RSA-260 因式分解,刷新 RSA-250(2020)公开纪录 | Hacker News 热帖 · AI HOT · Cognition 员工具名 | 09-11 | 未见正式论文或第三方复核,纪录认证机构未表态 | 学术预印本 / RSA 挑战赛官方 |
| V6 | OpenAI 因 GPT-6 Astra 算力不足,暂停 ChatGPT Pro($200/月)新订阅与升级 | TechCrunch(09-10)· 新浪财经(09-11) | 09-10~09-11 | OpenAI 未发布正式公告,仅媒体报道 | OpenAI 状态页 / 官方公告 |
口径说明:三套榜单的测评方法、任务集与更新频率完全不同,绝对分值不可直接横向比较,仅供量级参考。所有数据于 2026-09-12 07:31–07:35 现场抓取。
| # | 模型 | 总评 | Reasoning | Coding | Agentic Coding | Math | Data Analysis | Language | IF | 每成功任务成本 |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 Max Effort | 83.4 | 91.7 | 86.4 | 66.1 | 97.0 | 80.3 | 89.5 | 73.0 | $1.212 |
| 2 | Claude Fable 5 Max Effort | 83.0 | 89.7 | 86.0 | 62.2 | 96.0 | 80.5 | 90.7 | 75.8 | $1.439 |
| 3 | GPT-6 Astra Max Effort | 82.2 | 92.7 | 80.4 | 57.3 | 96.8 | 83.0 | 89.4 | 75.6 | $0.736 |
| 4 | Muse Spark 1.3 xHigh | 81.6 | 89.7 | 81.1 | 64.1 | 95.9 | 79.6 | 82.8 | 78.0 | $0.219 |
| 5 | DeepSeek V4.1 Flash Max (open) | 81.1 | 86.7 | 80.0 | 77.3 | 93.3 | 79.3 | 81.2 | 70.0 | $0.029 |
| 6 | GPT-5.6 Sol Max Effort | 81.0 | 91.7 | 83.9 | 56.2 | 96.2 | 79.8 | 87.7 | 71.8 | $0.515 |
| 7 | GPT-5.5 Thinking xHigh | 80.2 | 89.7 | 82.1 | 54.0 | 95.9 | 81.6 | 87.4 | 70.7 | $0.435 |
| 8 | Claude 5 Opus Thinking Max | 80.1 | 91.2 | 81.4 | 65.2 | 95.7 | 74.6 | 88.7 | 63.8 | $0.699 |
| 9 | Kimi K3 (open) | 79.2 | 90.7 | 81.4 | 62.2 | 84.4 | 78.7 | 85.5 | 71.4 | $0.348 |
| 10 | Gemini 3.7 Flash High | 78.8 | 87.8 | 78.9 | 58.3 | 93.5 | 68.0 | 85.5 | 79.9 | $0.157 |
| 11 | Qwen 3.8 Max (open) | 78.5 | 88.2 | 72.9 | 64.6 | 91.3 | 78.4 | 79.7 | 74.1 | $0.275 |
| 12 | Grok 4.6 | 78.0 | 90.5 | 76.8 | 57.0 | 92.6 | 73.9 | 83.7 | 71.9 | $0.207 |
| 15 | GPT-5.6 Terra Max | 77.9 | 90.6 | 78.2 | 54.9 | 94.9 | 79.3 | 82.9 | 64.6 | $0.352 |
| 16 | DeepSeek V4 Pro 0813 (open) | 77.4 | 85.8 | 77.2 | 54.9 | 95.1 | 79.2 | 82.1 | 67.7 | $0.044 |
| 18 | DeepSeek V4 Flash Vision Exp (open) | 76.8 | 85.4 | 68.2 | 65.1 | 87.8 | 79.5 | 80.4 | 71.0 | $0.051 |
| 21 | Qwen 3.8 Flash Next (open) | 76.2 | 87.4 | 72.6 | 61.6 | 85.8 | 74.2 | 74.6 | 77.1 | $0.042 |
| 22 | GLM-5.3 (open) | 76.1 | 85.8 | 79.0 | 60.9 | 87.9 | 70.2 | 79.9 | 69.3 | $0.450 |
| 27 | Qwen3.8 27B (open) | 75.3 | 80.0 | 75.7 | 61.4 | 86.2 | 76.6 | 74.3 | 72.7 | $0.094 |
| 40 | GLM-5.3 Flash (open) | 71.6 | 77.6 | 79.0 | 56.8 | 81.2 | 76.4 | 77.3 | 52.8 | $0.031 |
关键读数:
| # | 模型 | 智能指数 | 上下文 | 每任务成本 | 输出 tok/s | 首字延迟(s) | 总响应(s) |
|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 (max w/ fallback) | 53 | 1M | $7.63 | 67 | 278.20 | 285.70 |
| 2 | Claude Fable 5.1 (xhigh w/ fallback) | 53 | 1M | $5.98 | 60 | 96.36 | 104.75 |
| 3 | GPT-6 Astra (max) | 53 | 1M | $3.26 | 54 | 323.31 | 332.50 |
| 4 | GPT-6 Astra (xhigh) | 53 | 1M | $2.31 | 51 | 160.90 | 170.62 |
| 5 | Claude Fable 5.1 (high) | 51 | 1M | $3.91 | 49 | 20.67 | 30.83 |
| 6 | GPT-6 Astra (high) | 51 | 1M | $1.72 | 50 | 40.11 | 50.14 |
| 7 | Claude Opus 5 (max) | 51 | 1M | $5.86 | 51 | 79.03 | 88.74 |
| 8 | Claude Fable 5 (w/ fallback) | 50 | 1M | $8.75 | 66 | 92.73 | 100.27 |
| 9 | Muse Spark 1.3 (max) | 48 | 1M | $1.60 | 206 | 26.12 | 38.27 |
| 10 | GPT-5.6 Sol (max) | 47 | 1M | $1.99 | 57 | 132.21 | 140.92 |
| 12 | Muse Spark 1.3 (xhigh) | 45 | 1M | $1.37 | 206 | 21.38 | 33.49 |
| 14 | GLM-5.3 (max)(开源最佳) | 45 | 1M | $2.01 | 62 | 3.09 | 43.18 |
| 16 | Grok 4.6 (high) | 44 | 500k | $1.86 | 55 | 31.28 | 40.30 |
| 19 | Kimi K3 (max) | 44 | 1.05M | $2.00 | 38 | 3.71 | 69.14 |
| 23 | GPT-5.6 Terra (max) | 42 | 1M | $1.40 | 88 | 195.58 | 201.29 |
| 24 | GLM-5.3-Flash | 42 | 1M | $0.25 | 95 | 2.49 | 28.83 |
| 25 | Gemini 3.8 Flash (high) | 41 | 1M | $1.24 | 269 | 11.82 | 13.67 |
| 27 | Qwen3.8 Max | 40 | 1M | $2.67 | 38 | 2.57 | 68.66 |
| 30 | DeepSeek V4.1 Flash (max) | 40 | 1M | $0.27 | 213 | 1.13 | 12.86 |
| 35 | Gemini 3.7 Flash (high) | 39 | 1M | $0.93 | 295 | 8.49 | 10.19 |
| 38 | DeepSeek V4 Pro 0813 (max) | 36 | 1M | $0.67 | 69 | 1.77 | 38.13 |
| 40 | DeepSeek V4 Flash Vision (max) | 35 | 1M | $0.31 | 217 | 1.07 | 12.58 |
关键读数:
| # | 模型 | LLM Stats 综合 | Reasoning | Coding | Agent | 上下文 | 速度 | 混合价 $/M | 许可 |
|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra | 59.9 | 57.9 | 48.5 | 46.4 | 1.1M | 98 c/s | $11.90 | 闭源 |
| 2 | Claude Fable 5.1 | 55.9 | 53.0 | 35.5 | 41.8 | 1.0M | 81 c/s | $11.90 | 闭源 |
| 3 | GPT-5.6 Sol | 55.0 | 54.1 | 46.0 | 41.5 | 1.1M | 69 c/s | $6.19 | 闭源 |
| 4 | Claude Mythos Preview(未发布) | 54.9 | 55.8 | 44.8 | 36.5 | — | — | — | 闭源 |
| 5 | Claude Opus 5 | 54.9 | 53.9 | 41.9 | 40.0 | 1.0M | 70 c/s | $5.95 | 闭源 |
| 6 | Muse Spark 1.3 | 54.4 | 51.8 | 41.7 | 40.4 | 1.0M | 73 c/s | $0.10 | 闭源 |
| 7 | Claude Fable 5 | 54.3 | 51.8 | 45.7 | 40.5 | 1.0M | 37 c/s | $11.90 | 闭源 |
| 8 | Kimi K3 | 53.1 | 51.8 | 43.3 | 39.5 | 1.0M | 23 c/s | $3.39 | 开源 |
| 9 | GLM-5.3 | 52.8 | 51.9 | 42.8 | 39.6 | 1.0M | 147 c/s | $1.33 | 开源 |
| 10 | DeepSeek-V4-Pro-0813 | 52.1 | 50.1 | 40.7 | 37.9 | 1.0M | 64 c/s | $0.46 | 开源 |
| 11 | Qwen3.8 Max | 51.9 | 50.6 | 39.6 | 37.7 | 1.0M | 152 c/s | $1.81 | 开源 |
| 12 | DeepSeek-V4.1-Flash | 51.8 | 48.9 | 44.4 | 41.3 | 1.0M | — | $0.24 | 开源 |
| 13 | Hy4 preview | 51.0 | 50.7 | 39.9 | 36.8 | — | — | — | 开源 |
| 14 | Claude Opus 4.8 | 50.9 | 50.3 | 41.7 | 35.5 | 1.0M | 59 c/s | $5.95 | 闭源 |
| 15 | GPT-5.6 Terra | 50.8 | 49.2 | 42.2 | 38.2 | 1.1M | 135 c/s | $2.48 | 闭源 |
关键读数:
| # | 仓库 | Star | Fork | 语言 | 说明 |
|---|---|---|---|---|---|
| 1 | openclaw/openclaw | 389.5k | 81.9k | TypeScript | The AI that really does things. Any OS. Any Platform. |
| 2 | deepseek-ai/deepseek-harness | 220.5k | 26.1k | TypeScript | DeepSeek Harness: Everything is a Plugin. |
| 3 | n8n-io/n8n | 204.0k | 60.6k | TypeScript | 原生 AI 能力的工作流自动化平台 |
| 4 | Significant-Gravitas/AutoGPT | 187.3k | 46.0k | Python | 自主 Agent 早期旗手 |
| 5 | langgenius/dify | 155.5k | 24.6k | TypeScript | Agentic 工作流 + RAG |
| 6 | langflow-ai/langflow | 154.6k | 10.1k | Python | 可视化 Agent 构建 |
| 7 | open-webui/open-webui | 151.7k | 22.0k | Python | 多后端 LLM 前端 |
| 8 | langchain-ai/langchain | 146.1k | 24.4k | Python | The agent engineering platform |
| 9 | Shubhamsaboo/awesome-llm-apps | 137.2k | 20.2k | Python | 100+ AI Agents / Agent Skills / RAG |
| 10 | ggml-org/llama.cpp | 127.9k | 23.0k | C++ | C/C++ LLM 推理 |
| 11 | nextlevelbuilder/ui-ux-pro-max-skill | 126.9k | 13.6k | Python | 面向 UI/UX 的 AI Skill |
| 12 | harry0703/MoneyPrinterTurbo | 122.5k | 18.9k | Python | AI 一键生成短视频 |
| 14 | supabase/supabase | 109.1k | 13.7k | TypeScript | Postgres 开发平台(Agent 后端首选) |
关键读数:deepseek-harness 单日 +1.4k 至 220.5k,稳居 #2;榜单头部关键词仍是 Agent 执行面 + 开源工具链,且 Skill 类仓库(#11 ui-ux-pro-max-skill)已进入前 15——与 Claude Code 本期新增 plugin eval 遥相呼应,技能包正在成为独立的分发品类。
计算口径:视角 A = llm-stats 综合分 ÷ 混合价($/M,8:1 输入:输出);视角 B = LiveBench 总评 ÷ 每成功任务成本。两者跨口径,仅看量级,不作精确换算。
⚠️ 重要修正:Muse Spark 1.3 在 llm-stats 显示 $0.10,但这是 Contributor 档(允许 Meta 使用其流量训练模型)。标准档为 $1.25 输入 / $4.25 输出,混合价约 $1.583。若误用 $0.10 计算,性价比指数会虚假飙到 544,直接登顶——这是本期最易误读的数字,已按标准档重算至 34.4(第 4)。
| # | 领域 | 事件 / 数据 | 时效 | 来源 | 置信度 |
|---|---|---|---|---|---|
| S1 | 教育科研 | 2026 外滩大会「硅基VS碳基」论坛(09-11):北大客座教授韦韬提出「AI 最危险的时候,是它答得太好」——孩子借助 AI 完成出色作业,不等于真正掌握;复旦肖仰华从「人的发展安全」角度指出,能力是在亲自尝试—反馈—修正中形成的,若这些过程被 AI 代办,需重新追问人是否仍拥有形成能力的真实机会 | 09-11 | 中国网科技(外滩大会现场) | 已确认 |
| S2 | 教育公平 | PISA 2025 数据(ICDL Romania 09-10 发布):罗马尼亚 40% 的 15 岁学生每周至少一次用 AI 聊天机器人辅助学习,但 57% 的学生在计算性问题解决上低于 Level 3。两组数据不构成因果,但揭示「用得上 AI」与「会用 AI」之间的能力断层 | 09-10 发布 | ICDL Romania · AIdapted | 已确认 |
| S3 | 就业结构 | 教育部 2026 年本科专业目录正式设立「交叉学科」门类,首批列入 15 种专业,含未来机器人、交叉工程等 11 种目录内专业,以及具身智能、脑机科学与技术等 4 种全新增设专业;此前教育部等五部门已印发《"人工智能+教育"行动计划》,推动 AI 成为高校公共基础课 | 09-11 引述 | 中宏网 · 教育部文件 | 已确认 |
| S4 | 医疗健康 | 蚂蚁集团在外滩大会推出 AI 健康管家「阿福」,可实时识别食物营养并定制方案;智元启元 Q1 人形机器人可通过握手 1 分钟完成心率、血氧等健康检测;蚂蚁联合多方开展村医 AI 技能培训,推动健康 AI 向基层下沉。同期蚂蚁灵波机器人在上海国大药房真实门店承担药品分拣,夜间缓解药剂师压力 | 09-11 | 智东西 · 中国证券报(09-12 A02) | 已确认 |
| S5 | 公共安全 | Anthropic 09-11 发布威胁情报报告:披露研究人员用 Claude 进行可能支持生物武器开发的实验(含病原体相关)、俄罗斯关联黑客组织针对乌克兰军政外交人员的网络行动;并自曝第四起安全事件(8 月发现,回溯至 2026-01,此前扫描约 14.1 万条对话记录时遗漏,后扩大至约 4.81 亿条并通知受影响者) | 09-11 | Reuters · Anthropic 官方 · AIdapted | 已确认 |
| S6 | 风险治理 | 欧盟网络安全局 ENISA 在数月谈判后取得 Anthropic Mythos 5 与 OpenAI GPT-6 Astra 的独立测试权限(欧委会 09-10 确认),但仍无法接触 Anthropic 最新模型;加州州长纽森 09-09 签署全美首批州级 AI 安全法案(设独立评估机构框架与 AI 审计员注册制度,2029 年起无注册编号不得开展覆盖范围内的 AI 审计),09-11 再签 13 项法案(AI 陪伴类聊天机器人上线前须做风险评估,限制 16 岁以下用户沉迷功能与使用时长) | 09-09 ~ 09-11 | 欧盟委员会 · AIdapted · 生成式AI日报 | 已确认 |
| S7 | 数字鸿沟 | 菲律宾政府发布 344 亿美元 AI+ 基建总体规划最终草案,目标成为区域 AI 基建枢纽;印度推出「盒式数据中心」FEMTO(本地部署、无需联网、功耗约为传统方案一半)面向主权 AI;埃及承诺 10 亿美元投入 AI 基建竞赛。印度支付监管机构正建立集中登记处核验与监控代用户执行交易的 AI Agent(先从 UPI 起步) | 09-11 | quidproquo AI Daily · Reuters · Analytics India Mag | 大概率 |
关键洞察:本期社会效益的重心从「AI 能做什么」转向「人还剩下什么」。S1 与 S2 是同一问题的两个切面——韦韬担忧的是能力形成过程被跳过,PISA 数据则给出量化佐证:AI 使用率已到 40%,而底层数字能力达标率不足 43%。这意味着「会不会用 AI」正在成为新的素养断层,且这个断层不会随工具普及自动弥合。与此同时 S6(ENISA 拿到测试权 + 加州连签法案)说明监管正从「原则宣示」进入「可操作的审计与准入制度」——2029 年无注册编号不得执业的条款,实际上是把 AI 审计变成了一个持牌职业。
待观察线索:
| # | 维度 | 事件 / 数据 | 时效 | 来源 | 置信度 |
|---|---|---|---|---|---|
| E1 | 资本市场 · 冲击 | DeepSeek V4.1-Flash 将 HBM 需求降至 1/4、SSD 降至 1/8 → 09-11 三星电子 -4%+、SK 海力士 -3.5%+、隔夜费城半导体指数 -2.66%;港股 MiniMax、Z.AI 跌超 8%,阿里跌超 2%;A 股 AI 算力芯片板块 -2.03%(成交 769 亿元),半导体设备跌近 5%,科创 50 跌超 3% | 09-11 | Bloomberg · Chosun Biz · 证券时报网 · A 股行情数据 | 已确认 |
| E2 | 资本市场 · 逆势 | 燧原科技 09-11 登陆科创板:发行价 142.18 元,首日收报 397 元(+179.22%),总市值 1708.5 亿元,拟募资约 61 亿元投向第五/六代 AI 芯片;2026 上半年营收 11.2 亿元(+279%)。至此摩尔线程、沐曦、壁仞、燧原「国产 GPU 四小龙」齐聚资本市场 | 09-11 | 看看新闻 · 生成式AI日报 | 已确认 |
| E3 | 企业营收 | 甲骨文 FY27Q1:调整后营收 193.5 亿美元(+30%),云基础设施部门营收 74 亿美元(+121%),调整后营业利润 81.5 亿美元(预期 78.1 亿);本季新增 AI 云合同超 300 亿美元,剩余履约义务(RPO)从 455 亿跃升至 664 亿美元(+46%);预计 FY27 总收入至少 900 亿美元。美股盘后涨 8% | 09-10/09-11 | 界面新闻 · 甲骨文财报 | 已确认 |
| E4 | 产业规模 · 基建 | SpaceX CFO 在高盛科技大会:新签 AI 算力托管协议,12 月 1 日起每月贡献约 11 亿美元(年化约 133 亿美元);2026 年底部署超 2GW 地面算力,2027 年底达 5–10GW;预计 2027 年每 GW AI 算力可带来 300–500 亿美元收入。泛林集团高管同场称半导体行业「基本处于售罄状态」 | 09-10 | 生成式AI日报 · 新浪财经 | 大概率 |
| E5 | 政策投资 | 工信部印发《信息通信行业发展"十五五"规划》:算力网建设新增直接投资 4 万亿元,围绕算电协同、超大规模智算集群持续加码。截至 2025 年 6 月底,全国智能算力规模同比 +177% 至 2185 EFLOPS;河北综合算力指数连续两年全国第一(智能算力 556.1 EFLOPS) | 09-11 | 通信世界 · 工信部 | 已确认 |
| E6 | 投融资 | 具身智能 Kinetix AI(超维动力)完成超 5 亿元人民币天使/A 轮(祥峰投资领投,方广、万石跟投);韩国 AIDIN Robotics 完成 160 亿韩元战略轮(现代机器人、三星创投参投);AI 编程 Cognition 完成 20 亿美元 E 轮、估值 480 亿美元(a16z 与 Accel 领投,ARR 从 4.92 亿增至近 9 亿美元) | 09-08 ~ 09-12 | RobotToday · 界面新闻 · quidproquo | 大概率 |
| E7 | 债务风险 | 施罗德基金经理 Dorian Carrell 指出,超大规模云厂商表外融资规模已达 1.5 万亿美元(约 10 万亿元人民币),部分企业现金流由正转负、杠杆率攀升(Alphabet 发行 6% 票息可转债以保护信用评级)。高盛警告:年内已累计约 3000 亿美元 AI 相关债券发行,2027 年超大规模云企业与芯片厂商发债规模或再增 40% 至约 3400 亿美元。摩根大通测算:2026 年迄今五大超大规模云厂商加英伟达发债约 3200 亿美元,长久期部分相当于同期美国财政部新增长久期借款的 68% | 09-11 | 证券时报网(引述施罗德/高盛/摩根大通) | 大概率 |
关键洞察:本期出现了一个罕见的因果闭环样本——DeepSeek 一次架构优化(KV Cache 压缩 437 倍)在 24 小时内同时触发:存储芯片股下挫(E1)、AI 应用标的估值重估、以及「无差异化即淘汰」的行业叙事(AA 称之为「死亡区」)。这说明模型层的工程进步已经具备直接重塑上游资本开支预期的能量,而不只是影响自身毛利。与之对照的是 E7 的另一面:超大规模云厂商 1.5 万亿美元表外融资 + 2027 年发债预计再增 40%,一边是推理成本断崖式下降,一边是基建债务持续膨胀——这个剪刀差是未来 12 个月最值得跟踪的宏观风险。E2 燧原 +179% 与 E1 板块 -2% 同时发生,则说明资金正在从「通用算力」向「国产替代确定性」做结构性切换。
待观察线索:
deepseek-ai/DeepSeek-V4.1-Flash 与官方 API 公告逐条核对。| 标签 | 含义 | 判定标准 |
|---|---|---|
| 已确认 | 高确定性 | 官方公告 / Release Notes / 权威一手报告证实,或多家权威媒体同向 |
| 大概率 | 中高确定性 | ≥2 个独立信源相互印证(或 1 社区源 + 1 官媒/官方),尚缺官方定论 |
| 待验证 | 低确定性 | 社区单源爆料、厂商单边口径、或已被当事方否认的传闻 |
| 中性/不适用 | — | 标注「未开启 / 不适用 / 无数据」类状态 |
AI 日报 · 自动化生成 · 生成时间 2026-09-12 07:35(北京时间)
覆盖窗口:2026-09-11 07:30 → 2026-09-12 07:30