覆盖方向:AI Coding × 具身智能
统计窗口:2026-09-13 05:30 → 2026-09-14 05:30(北京时间,过去 24 小时)
实时数据源(抓取于 2026-09-14 05:33–05:40):① LiveBench 官网实时榜(release 2026-06-25)② Artificial Analysis Intelligence Index(官网实时页 JSON-LD 结构化直采,20 模型完整分数/吞吐/上下文)③ llm-stats.com(390 模型实时价/吞吐/分项)④ GitHub Trending(AI 专项日榜,05:35 现场抓取)⑤ 社区信源交叉验证(公开渠道,详见第一节)
社区一手信源:X / 中文社区(知乎·V2EX·Linux.do·微信公众号聚合号)/ 海外社区(Hacker News·r/LocalLLaMA·r/ClaudeAI·LessWrong)/ 开发者社区(GitHub Releases·Hugging Face)/ 聚合线索号(机器之心·量子位·新智元·智猩猩AI·科创板日报·FutureX Physical AI Daily·AGI Hunt·AI Weekly·quidproquo·腾讯研究院AI速递·太平洋科技每日观点)
免责声明:本文由自动化流程汇总公开信源生成,逐条标注「时效 / 来源 / 置信度」,仅供参考,不构成投资或商业决策依据。社区单源未交叉验证者一律单列「社区快讯(待验证)」,不入正式条目。所有价格、评分以各榜单官网实时页为准,跨口径对比仅看量级。
| 章节 | 内容 | 关键标记 |
|---|---|---|
| 一 | 社区信源监控与浏览器门禁披露 | 未执行项透明标注 |
| 二 | DeepSeek 专项 | 今日有 D ✅(D1–D6) |
| 三 | 15 条精选 · 甲组 AI Coding(8 条) | 8 条 |
| 四 | 15 条精选 · 乙组 具身智能(7 条) | 7 条 |
| 五 | 社区快讯(待验证) | 单列存疑线索 |
| 六 | 三口径能力评分与价格表 | LiveBench / AA / llm-stats |
| 七 | Price vs Performance 性价比 | 双视角条形图 |
| 八 | AI 社会效益 | 7 领域 |
| 九 | AI 经济效益 | 6 维度 |
| 十 | 方法论与免责声明 | — |
结论:本运行(自动化无人值守)未执行 B 站 UP 主字幕提取,浏览器进程层未就绪。
http://127.0.0.1:9223/json/version 返回 连接失败(curl exit 7),端口未连通。对照历史:09-05 至 09-13 连续多期均为同一原因(控制通道未连接);本期依旧为「浏览器不可用(端口探活未连通)」,而非「已连接但提取受限」。
| # | 线索 | 平台 / 来源 | 发帖时效 | 是否构成新闻 | 交叉验证 | 置信度 |
|---|---|---|---|---|---|---|
| C1 | 恶意 .git/config(core.fsmonitor)可让 Claude Code / Codex / Cursor 静默执行攻击者代码;Cursor 获 CVE-2026-48124(3.0.0 修复),Claude Code 存在跨 v2.0.24–v2.1.89 的网络绕过,Anthropic 修复耗时约 50 天 / 30 个版本 | Accomplish 官方披露 · The Hacker News · BleepingComputer · Cymulate Research Labs · BYOBot(09-13) · Pondero(09-13) | 09-13 集中披露 | ✅ 是 | 披露方 + 4 家安全媒体同向;CVE 编号可查 | 已确认 |
| C2 | Claude Code CLI 2.1.270:修复 2.1.269 回归(长会话后只读 git 命令误弹权限)、新增内联 Bash 执行、新增可派生子代理的 agent-launch 工具 | AGI Hunt(09-13) · dev.to《This week in Claude Code…》(09-13 周) · Anthropic 发布日志 | 09-13 | ✅ 是(官方发布日志) | 3 源同向 + 官方 changelog | 已确认 |
| C3 | Codex 工程师 Thibault Sottiaux 回应质量投诉三点:旧模型 skills 误触发/阻塞自检、上下文管理实验(约 4–5k 用户,已停用)、引擎配置错误导致尾部质量下降;Astra 档位暂停为「维持广泛访问的最小措施」 | 腾讯研究院AI速递(09-14 00:01) · AGI Hunt(09-13) · X | 09-13~09-14 | ✅ 是(厂商自述) | 3 源同向,均为 OpenAI 单边口径 | 大概率 |
| C4 | Real-SWE 新基准:最强模型在约 1/3 真实任务上「漏掉需求」,最大失败模式是 missed requirements | r/LocalLLaMA 热帖(74 评论)· AI Morning Briefing(09-13) · HN | 09-13 | ✅ 是(技术议题) | 社区热帖 + 2 聚合源 | 大概率 |
| C5 | huggingface_hub SDK 扫描环境变量识别 26 个已知 coding agent(Cursor/Copilot/Claude Code 等),给每次 Hub API 调用打 agent/ user-agent 遥测 | r/LocalLLaMA(09-12 流量审计) · AI Weekly(09-13) · promppy | 09-12~09-13 | ✅ 是 | 社区审计 + 2 源;HF 文档称「opt-in 可观测性」 | 大概率 |
| C6 | Amodei 发表《We Must Pace the Frontier》三步走(第三方驻场评估 / 民主协调 / 全球协调);Altman、马斯克、Hassabis 先后附议;白宫 PCAST 主席 Sacks 斥为「监管俘获」 | darioamodei.com(09-12) · 环球市场播报(09-14 04:39) · 财联社(09-14 03:25) · AI Weekly(09-13) | 09-12~09-14 | ✅ 是 | 当事人一手 + 4 家权威媒体 | 已确认 |
| C7 | Anthropic / OpenAI / Google 正磋商由行业主导成立 AI 标准机构(The Information) | The Information · 财联社(09-14 03:25) · 东方财富 | 09-14 03:25 | ✅ 是 | 单一爆料源 + 2 家转载,无当事方确认 | 待验证 |
| C8 | 两位安全研究员 Joe Benton(Anthropic 可扩展监督前负责人)与 Josh Engels(Google DeepMind)09-12 离职加入 METR;Engels 称「房间里没有成年人」 | NBC News(09-12) · Pondero(09-13) · AI Weekly(09-13) · freepressjournal | 09-12~09-13 | ✅ 是 | 4 源同向 + 当事人具名 | 已确认 |
| C9 | 25 位菲尔兹奖得主(陶哲轩、Peter Scholze、邓煜等)联名声明,警示 AI 把「解题」当基准竞赛正损害数学科学与共同体 | 腾讯研究院AI速递(09-14) · liorpachter 反驳文(09-13) · HN | 09-13~09-14 | ✅ 是 | 3 源同向,未见声明原文公开链接 | 大概率 |
| C10 | Anthropic 员工 Evan Hubinger 称个人估计未来十年 AI 灭绝人类概率 >10%;Altman 亦称 10% 不可接受 | 环球市场播报(09-14) · 新浪财经 | 09-14 04:39 | ✅ 是(观点) | 2 源同向,属个人估计 | 大概率 |
| C11 | 优必选柳州工业人形机器人超级智慧工厂 09-12 投产:14,000 ㎡、每 10 分钟下线 1 台、年产能超万台,主产 Walker S 与 Cruzr | 新华社(09-13) · 证券时报(09-13) · 腾讯新闻 · FutureX #119(09-14) | 09-12~09-14 | ✅ 是 | 4 源同向(含新华社) | 已确认 |
| C12 | 宇树人形机器人单价两年降约 72%(59.34 万 → 16.64 万元);2026 H1 全球人形出货约 19,100 台(近 3 倍增长),中国厂商份额 >97% | 证券时报(09-13) · Smart Analytics Global · 高盛 · FutureX #119 | 09-13 | ✅ 是 | 3 源同向(出货量为第三方统计) | 大概率 |
| C13 | 具身触觉传感赛道 7 月以来至少 8 笔融资、合计超 25 亿元;帕西尼与一目科技各获 10 亿元 | 第一财经(09-13) · 新浪 · FutureX #119(标注「媒体不完全统计」) | 09-13 | ✅ 是 | 2 源同向,媒体自述为不完全统计 | 大概率 |
| C14 | 现代汽车自研 Atria AI 系统延期两年至 2029 下半年,2028 先上英伟达 Drive L2+ 方案 | The Korea Herald(09-12) · Reuters · 东网(09-13) · FutureX #119 | 09-12~09-13 | ✅ 是 | 4 源同向(含路透) | 已确认 |
| C15 | 上海 AI 实验室发布「书生」物理世界模型 W0(异步双频架构);智元 WITA-Omni Preview 自称登顶 DailyOmni(85.21,八项中六项第一) | 新民晚报(09-13) · 文汇报(09-13) · FutureX #119 | 09-13~09-14 | ✅ 是 | 3 源同向,分数为厂商自报 | 大概率(分数待独立验证) |
| C16 | InfoQ 三组对照测试:同一底层模型,不同 AI 编程工具的 token 消耗相差最多 70 倍,差异主要来自 Agent 框架启动开销与缓存命中率 | InfoQ(09-13) · 中文聚合号 | 09-13 | ✅ 是 | 2 源同向,测试方法未完全公开 | 大概率 |
| C17 | 规模化 agent 的新瓶颈从 token/算力转向磁盘:Vincent Koc 团队每天跑 100–200 个 agent,现缺 scratch space;Uber 工程 VP 称一夜 Codex /goal 会话丢失整个 git worktree | AGI Hunt(09-13) · HN · X | 09-13 | ✅ 是(工程实践议题) | 社区一手 + 聚合号 | 待验证 |
| C18 | Kimi K2.8 Preview 在 Kimi Code 与 Kimi Work 全量上线(09-11 官方),1M 上下文向所有会员开放;月之暗面 8 月 ARR 破 10 亿美元、已递表港交所 | 月之暗面官方(09-11) · 腾讯研究院AI速递(09-14) · 量子位(09-13) | 官方 09-11 / 速递 09-14 | ✅ 是 | 官方一手 + 2 源 | 已确认 |
时效硬核核验说明:本节所有条目的日期均已逐条对照官方一手来源核验。DeepSeek 官网新闻页(deepseek.com/news)当前最新条目为 2026-09-10「DeepSeek V4.1 Flash:更强、更快、更普惠」;V3.2 正式版对应 2025-12-01、V3.2-Exp 为 2025-09-29,均属超窗旧闻,本期不列为新发事件。官网首页横幅、版权年份一律不作为发布日期依据。
| # | 事件 | 时效 | 来源 | 核验 | 置信度 |
|---|---|---|---|---|---|
| D1 | 爆料:DeepSeek 将推「Code 2.0」,参数量 3 万亿以上,设计重点为 Computer Use(电脑控制),发布窗口在 9 月,预计继续开源开放;同时 Pro 系列新品确定为 V4.1 Pro(升级内容未公布)。作为对照:K3 为 2.8 万亿、Qwen3.8 Max 2.4 万亿、DeepSeek V4 Pro 1.6 万亿 | 2026-09-14 02:14(IT时代网)/ 2026-09-14(17173 快科技) | IT时代网 · 17173 · 快科技 | 爆料性质,DeepSeek 官方未发布任何公告;官网新闻页最新仍为 09-10 | 待验证(单源爆料串,无官方一手) |
| D2 | 今日(09-14)12:00 为官方原定的 V4 Pro 路由切换时点——原计划 deepseek-v4-pro 请求全部转由 V4.1 Flash 承接并按 Flash 计费;后因用户需求,官方改为「2026-09-14 之后继续提供 V4 Pro API,计费方式不变」。截至本期截稿(05:30)切换尚未执行,今日为名义上的 D-day | 官方公告 09-09 首发 / 修订落 09-11~09-12;D-day = 2026-09-14 | DeepSeek API Docs《Change Log》官方一手页 · 网易/三易生活(09-13 11:11) · 百度百科「DeepSeek-V4.1」词条 | 官方一手页年份 = 2026 ✅;三源同向 | 已确认 |
| D3 | 招商证券计算机行业周报(09-13)专章覆盖:V4.1 Flash 为全新架构下最小尺寸原生多模态 MoE,激活算力与 KV Cache 需求大幅下降,显著压缩 Agent 场景成本并同步下调 API 定价;公司拟启动科创板 IPO(已聘中信证券);2026 年前 7 个月营收约 4.75 亿元,约为 2025 全年营收的 10 倍 | 2026-09-13 | 招商证券《计算机行业周观察》(刘玉萍/周翔宇) · 新浪财经研报库 | 券商研报,数字可追溯;营收数据为研报口径非公司披露 | 大概率 |
| D4 | 太平洋科技《每日观点&资讯》(09-14) 将 V4.1 Flash 列为当日 AI 资讯要闻:552B MoE / Causal-Encoder-Decoder 非对称结构 / 输入激活 8B、输出激活 16B / 原生多模态视觉 / HBM 需求降至上一代 1/4、SSD 降至 1/8 | 2026-09-14 | 太平洋证券《每日观点&资讯》(2026-09-14) · 同花顺财经 | 券商日报,与 09-10 官方技术口径一致 | 已确认(技术参数)/ 收录时点 大概率 |
| D5 | 三口径榜单同日收录 V4.1 Flash:LiveBench 81.1(总评第 5)/ 每成功任务成本 $0.029(全表最低档)/ Agentic Coding 77.3 全榜第一;AA 智能指数 39.55(高于 V4 Pro 0813 的 36.28)、输出 227.8 tok/s;llm-stats #12(51.8 / $0.24,Agent 分项 41.3) | 2026-09-14 05:33–05:40 实时直采 | livebench.ai · artificialanalysis.ai · llm-stats.com | 三家独立榜单同向收录,矛盾自检通过 | 已确认 |
| D6 | 行业背景对照:智谱 09-13 宣布完成约 50 亿美元融资(约 20 亿美元股份配售 + 约 30 亿美元零息可转债,初始转股价 892.50 港元、较公告前收盘溢价约 12.55%);媒体将其与 DeepSeek 6 月超 500 亿元人民币首轮融资并列,定调大模型行业从「比跑得快」转向「比耐力」(造血能力 / 算力壁垒 / 生态落地) | 2026-09-13 20:55 | 钱江晚报·潮新闻 · 智谱港交所公告 | 非 DeepSeek 原生事件,仅作同赛道对照背景,不计入 DeepSeek 自身动态 | 已确认(智谱)/ 叙事定性 大概率 |
| 事项 | 真实日期 | 剔除理由 |
|---|---|---|
| DeepSeek-V3.2 正式版 / V3.2-Speciale | 2025-12-01 | 年份 ≠ 本期年份;官网横幅为常驻营销内容,不构成发布日期 |
| DeepSeek-V3.2-Exp | 2025-09-29 | 同上 |
| V4.1 Flash 首发 | 2026-09-10 | 已超出 24h 窗口(上期已报) |
| 峰谷定价、App 灰度语音对话(四种音色) | 08-17 / 09-12 | 超窗,仅作背景 |
| 内蒙古乌兰察布 1GW、16 万颗昇腾 950DT | 09-04(彭博首发) | 超窗 |
| 第二轮 500 亿元融资 | 2026-06 | 超窗 |
本期 DeepSeek 小结:真正的当日增量是 D1(Code 2.0 爆料,待验证)与 D2(今日 12:00 为原定切换 D-day,实际已改为继续提供 V4 Pro);D3–D5 是 V4.1 Flash 发布后在券商研报与三家独立榜单上的同日收录与量化确认。V4.1 Flash 在 LiveBench「Agentic Coding」单项以 77.3 分位列全榜第一,同时每成功任务成本 $0.029 处于全表最低档——能力进入第一梯队、成本仍在地板,这是本期最值得注意的结构性变化。
.git/config 让三大编程 Agent 静默执行攻击者代码,沙箱不是边界.git/config 文件即可借助 Git 的合法特性 core.fsmonitor(允许仓库指定一个由 Git 自动执行的程序),让 Claude Code、OpenAI Codex、Cursor 在开发者不打开任何文件、不执行任何命令的情况下拉取并执行攻击者代码。攻击从不触碰沙箱本身——Agent 在沙箱内写文件,机器上另一个受信任的软件稍后读取该文件并按其内容行事。Cursor 获 CVE-2026-48124(3.0.0 修复,约一周);OpenAI 修复 Codex 用时相近;Anthropic 的 Claude Code 用了约 50 天、30 个版本。另有 Claude Code 跨 v2.0.24–v2.1.89 的网络绕过,可让围栏内的代码访问白名单外主机。codex mcp-server(破坏性变更)、新增 worktree 隔离与 Windows 共享后台服务;Gemini CLI 0.59.0 的两个改动全是安全修复(MCP OAuth SSRF、fail-closed 工作区信任)。ANTHROPIC_BASE_URL 的第三方端点用户请确认未卡在 2.1.265–2.1.267;升级 Codex 前先 grep 脚本里的 codex mcp-server。huggingface_hub 静默上报你正在用哪个 coding agenthuggingface_hub Python SDK 会扫描环境变量识别 26 个已知 coding agent(含 Cursor、Copilot、Claude Code 等),并给每一次 Hub API 调用打上 agent/ 形式的 user-agent 遥测;该遥测会通过 transformers、faster-whisper 等下游库隐式传递。可通过 HF_HUB_OFFLINE=1 或按本地路径加载模型来关闭。Hugging Face 将该 agent 注册表文档化为「opt-in 可观测性」,但开发者普遍表示完全不知道自己的工具链正在被上报。HF_HUB_OFFLINE 纳入企业 AI 编码基线配置。agent-dev-team(21 个角色 agent / 4 个资历层级 / 升级协议)、Docket(逐提交记录 agent 试过什么、验证过什么的证据)、RunBoth(同时运行 agent 改写前后的版本以检测行为变化)。生成速度与人类验证速度的鸿沟,正在催生一整个「agent 治理层」。/goal 会话后丢失了整个 git worktree。| # | 线索 | 来源 / 时点 | 为何存疑 | 缺哪一方验证 |
|---|---|---|---|---|
| P1 | DeepSeek 将推 Code 2.0,3 万亿+ 参数,主打 Computer Use,9 月窗口,继续开源 | IT时代网(09-14 02:14) · 17173/快科技 | 纯爆料串,无官方公告、无模型卡、无 GitHub Release;官网新闻页最新仍为 09-10 | 缺 DeepSeek 官方一手确认 |
| P2 | Anthropic / OpenAI / Google 正磋商成立行业主导的 AI 标准机构 | The Information · 财联社(09-14 03:25) | 单一爆料源 + 转载,三方均未公开确认;与 Sacks「监管俘获」指责方向相反 | 缺任一当事方官方声明 |
| P3 | 规模化 agent 的瓶颈转向磁盘;Uber 工程 VP 一夜 Codex /goal 会话丢失整个 git worktree | AGI Hunt(09-13) · X | 个人陈述,无日志或复现;「磁盘瓶颈」未量化 | 缺可复现的工程报告 |
| P4 | 用户质疑 Astra 生成质量退化(同提示词前后对比),OpenAI 称「模型未做任何改动、正在调查」 | 腾讯研究院AI速递(09-14) · X | 对比样本为单用户自述,未排除路由/引擎/skills 变量 | 缺第三方同条件复现 |
| P5 | 智元 WITA-Omni Preview 以 85.21 登顶 DailyOmni(八项中六项第一) | 文汇报(09-13) · FutureX #119 | 厂商自报分数,榜单未见独立维护方核验 | 缺第三方复跑 |
| P6 | 现代 Atria AI 延期消息中「42dot / Park Min-woo」相关组织调整细节 | The Korea Herald(09-12) | 人事细节为媒体转述 | 缺现代汽车官方公告 |
| P7 | 半机械蟑螂废墟搜救:15cm 内注射成功率 95%、全流程 72% | 具身机器人行业动态(09-13) · 昆士兰大学 | 仅在模型与猪肉上验证,距实用数年;非同行评审 | 缺同行评审论文 |
| # | 模型 | 总评 | Reasoning | Coding | Agentic Coding | Math | Data Analysis | Language | IF | 每成功任务成本 |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 Max Effort | 83.4 | 91.7 | 86.4 | 66.1 | 97.0 | 80.3 | 89.5 | 73.0 | $1.212 |
| 2 | Claude Fable 5 Max Effort | 83.0 | 89.7 | 86.0 | 62.2 | 96.0 | 80.5 | 90.7 | 75.8 | $1.439 |
| 3 | GPT-6 Astra Max Effort | 82.2 | 92.7 | 80.4 | 57.3 | 96.8 | 83.0 | 89.4 | 75.6 | $0.736 |
| 4 | Muse Spark 1.3 xHigh | 81.6 | 89.7 | 81.1 | 64.1 | 95.9 | 79.6 | 82.8 | 78.0 | $0.219 |
| 5 | DeepSeek V4.1 Flash Max(开源) | 81.1 | 86.7 | 80.0 | 77.3 | 93.3 | 79.3 | 81.2 | 70.0 | $0.029 |
| 6 | GPT-5.6 Sol Max | 81.0 | 91.7 | 83.9 | 56.2 | 96.2 | 79.8 | 87.7 | 71.8 | $0.515 |
| 7 | GPT-5.5 Thinking xHigh | 80.2 | 89.7 | 82.1 | 54.0 | 95.9 | 81.6 | 87.4 | 70.7 | $0.435 |
| 8 | Claude 5 Opus Thinking Max | 80.1 | 91.2 | 81.4 | 65.2 | 95.7 | 74.6 | 88.7 | 63.8 | $0.699 |
| 9 | Kimi K3(开源) | 79.2 | 90.7 | 81.4 | 62.2 | 84.4 | 78.7 | 85.5 | 71.4 | $0.348 |
| 10 | Gemini 3.7 Flash High | 78.8 | 87.8 | 78.9 | 58.3 | 93.5 | 68.0 | 85.5 | 79.9 | $0.157 |
| 11 | Qwen 3.8 Max(开源) | 78.5 | 88.2 | 72.9 | 64.6 | 91.3 | 78.4 | 79.7 | 74.1 | $0.275 |
| 12 | Grok 4.6 | 78.0 | 90.5 | 76.8 | 57.0 | 92.6 | 73.9 | 83.7 | 71.9 | $0.207 |
| 16 | DeepSeek V4 Pro 0813(开源) | 77.4 | 85.8 | 77.2 | 54.9 | 95.1 | 79.2 | 82.1 | 67.7 | $0.044 |
| 22 | GLM-5.3(开源) | 76.1 | 85.8 | 79.0 | 60.9 | 87.9 | 70.2 | 79.9 | 69.3 | $0.450 |
| 40 | GLM-5.3 Flash(开源) | 71.6 | 77.6 | 79.0 | 56.8 | 81.2 | 76.4 | 77.3 | 52.8 | $0.031 |
| 49 | Grok Build 0.1 | 67.8 | 76.4 | 65.4 | 45.8 | 78.4 | 70.8 | 72.5 | 65.2 | $0.024 |
口径说明:LiveBench 为 7 大类 23 项客观任务、每半年刷新;当前 release 2026-06-25(latest)。成本极差 50.5×($1.212 vs $0.024),而总分极差仅约 23%(83.4 vs 67.8);若只看前 5 名,总分极差仅 2.8%,成本却差 41.8 倍。DeepSeek V4.1 Flash 的 Agentic Coding 77.3 为全榜单项第一(高于 Claude Fable 5.1 的 66.1 达 11.2 分)。
| # | 模型 | 智能指数 | 输出速度 (tok/s) | 上下文 |
|---|---|---|---|---|
| 1 | Claude Fable 5.1 (max with fallback) | 53.37 | 67.1 | 1.0M |
| 2 | GPT-6 Astra (max) | 52.81 | 60.1 | 1.0M |
| 3 | Claude Opus 5 (max) | 50.70 | 52.7 | 1.0M |
| 4 | Claude Fable 5 (with fallback) | 49.70 | 64.9 | 1.0M |
| 5 | Muse Spark 1.3 (max) | 48.17 | 236.7 | 1.0M |
| 6 | GPT-5.6 Sol (max) | 47.06 | 57.9 | 1.0M |
| 7 | GLM-5.3 (max)(开源最佳) | 44.86 | 72.0 | 1.0M |
| 8 | Grok 4.6 (high) | 44.41 | 60.0 | — |
| 9 | Kimi K3 (max) | 43.78 | 36.8 | 1.0M |
| 10 | GPT-5.6 Terra (max) | 42.25 | 113.7 | 1.0M |
| 11 | GLM-5.3-Flash | 41.91 | 108.7 | 1.0M |
| 12 | Gemini 3.8 Flash (high) | 41.19 | 277.5 | 1.0M |
| 13 | Qwen3.8 2.4T A95B | 40.04 | — | 983.6K |
| 14 | DeepSeek V4.1 Flash (max) | 39.55 | 227.8 | 1.0M |
| 15 | GPT-5.6 Luna (max) | 37.50 | 119.7 | 1.0M |
| 16 | DeepSeek V4 Pro 0813 (max) | 36.28 | 77.9 | 1.0M |
| 17 | Qwen3.8 27B (xhigh) | 33.90 | — | — |
| 18 | K2 Horizon 375B A23B | 30.79 | — | 524K |
| 19 | MiniMax-M3 | 29.61 | 109.3 | 1.0M |
| 20 | Inkling | 25.54 | 89.3 | 1.0M |
口径说明:AA 为闭源/开源混合的综合智能指数(含 AA-Briefcase 等智能体化评测),与 LiveBench 不同口径,不可直接比较绝对值。本期关键读数:DeepSeek V4.1 Flash 输出 227.8 tok/s,是同分数段(39–42 分)唯一进入 200+ 的模型;其智能指数 39.55 已超过自家 V4 Pro 0813 的 36.28。头部 Fable 5.1 速度仅 67.1 tok/s,与 V4.1 Flash 相差 3.4 倍。
| # | 模型 | LLM Stats 分 | Reasoning | Coding | Agent | 上下文 | 速度 | 混合价 $/M | 许可 |
|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra | 59.9 | 57.9 | 48.5 | 46.4 | 1.1M | 93 c/s | $11.90 | 闭源 |
| 2 | Claude Fable 5.1 | 55.9 | 53.0 | 35.5 | 41.8 | 1.0M | 80 c/s | $11.90 | 闭源 |
| 3 | GPT-5.6 Sol | 55.0 | 54.1 | 46.0 | 41.5 | 1.1M | 81 c/s | $6.19 | 闭源 |
| 4 | Claude Mythos Preview(未发布) | 54.9 | 55.8 | 44.8 | 36.5 | — | — | — | 闭源 |
| 5 | Claude Opus 5 | 54.9 | 53.9 | 41.9 | 40.0 | 1.0M | 70 c/s | $5.95 | 闭源 |
| 6 | Muse Spark 1.3 | 54.4 | 51.8 | 41.7 | 40.4 | 1.0M | 65 c/s | $0.10 ⚠️ | 闭源 |
| 7 | Claude Fable 5 | 54.3 | 51.8 | 45.7 | 40.5 | 1.0M | 34 c/s | $11.90 | 闭源 |
| 8 | Kimi K3 | 53.1 | 51.8 | 43.3 | 39.5 | 1.0M | 3 c/s | $3.39 | 开源 |
| 9 | GLM-5.3 | 52.8 | 51.9 | 42.8 | 39.6 | 1.0M | 147 c/s | $1.33 | 开源 |
| 10 | DeepSeek-V4-Pro-0813 | 52.1 | 50.1 | 40.7 | 37.9 | 1.0M | 67 c/s | $0.46 | 开源 |
| 11 | Qwen3.8 Max | 51.9 | 50.6 | 39.6 | 37.7 | 1.0M | 125 c/s | $1.81 | 开源 |
| 12 | DeepSeek-V4.1-Flash | 51.8 | 48.9 | 44.4 | 41.3 | 1.0M | — | $0.24 | 开源 |
| 13 | Hy4 preview(腾讯) | 51.0 | 50.7 | 39.9 | 36.8 | — | — | — | 开源 |
| 14 | Claude Opus 4.8 | 50.9 | 50.3 | 41.7 | 35.5 | 1.0M | 59 c/s | $5.95 | 闭源 |
| 15 | GPT-5.6 Terra | 50.8 | 49.2 | 42.2 | 38.2 | 1.1M | 135 c/s | $2.48 | 闭源 |
口径说明:llm-stats 为跨公开基准的 TrueSkill 合成分,混合价按 8 : 1(输入 : 输出)折算每百万 token。⚠️ Muse Spark 1.3 的 $0.10 是 Contributor 档价格(允许 Meta 使用流量训练),标准档为 $1.25/$4.25,折算混合价 $1.583——下文性价比表已按标准档重算,直接用 $0.10 会得出虚高 5 倍以上的结论。
| # | 仓库 | Stars | 语言 | 说明 |
|---|---|---|---|---|
| 1 | openclaw/openclaw | 389.6k | TypeScript | 跨 OS/平台的通用 AI agent |
| 2 | n8n-io/n8n | 204.2k | TypeScript | 原生 AI 能力的工作流自动化 |
| 3 | Significant-Gravitas/AutoGPT | 187.3k | Python | 自主 agent 经典项目 |
| 4 | langgenius/dify | 155.6k | TypeScript | Agentic 工作流 + RAG |
| 5 | langflow-ai/langflow | 154.7k | Python | 可视化 agent 编排 |
| 6 | msitarzewski/agency-agents | 152.1k | Shell | 一整套「AI 代理公司」角色 |
| 7 | open-webui/open-webui | 151.9k | Python | 自托管 AI 界面(Ollama/OpenAI API) |
| 8 | langchain-ai/langchain | 146.2k | Python | Agent 工程平台 |
| 9 | Shubhamsaboo/awesome-llm-apps | 137.9k | Python | 100+ Agent / Skills / RAG 应用 |
| 13 | google-gemini/gemini-cli | 107.0k | TypeScript | 终端 agent |
| 14 | earendil-works/pi | 104.7k | TypeScript | 统一 LLM API + 编码 agent CLI |
| 15 | addyosmani/agent-skills | 94.0k | JavaScript | 生产级 AI 编码 agent 技能包 |
| 16 | thedotmack/claude-mem | 93.8k | TypeScript | 跨会话持久上下文 |
| 17 | vllm-project/vllm | 91.7k | Python | 高吞吐推理引擎 |
| 19 | OpenHands/OpenHands | 87.8k | TypeScript | AI 驱动开发 |
读榜:本期头部关键词是「持久上下文 + 技能包 + 自托管」——claude-mem(跨会话记忆)、agent-skills(生产级技能)、open-webui + vllm(自托管推理)同时在榜,与 A8 的 worktree 隔离、Codex 接 Ollama 共同印证「本地优先 / 长跑型 agent 运行时」成型。值得注意的是 deepseek-harness 本期跌出前 20(前几期长期稳居 #2)。
重要:两个视角衡量的是不同东西。视角 A 衡量单位 token 的能力,视角 B 衡量单位成功任务的真实花费。跨口径合成(用 A 榜单的分数除以 B 榜单的价格)仅可用于看量级,不可作为采购依据。
⚠️ 最易误读的数字:Muse Spark 1.3 若按 llm-stats 展示的 $0.10(Contributor 档)计算,性价比指数会飙到 544,直接跃居第一。但 $0.10 的前提是允许 Meta 用你的流量训练模型,绝大多数生产环境不会接受。按标准档 $1.25/$4.25(混合价 $1.583)重算后为 34.4,跌至第 4。任何只报 $0.10 的性价比榜单都应打问号。
第 1 名需要打折看:Grok Build 0.1 总评仅 67.8(全榜第 49 位),靠极低的单任务成本登顶,属于「便宜但能力明显掉队」,实际可用性待验证。真正有意义的是第 2 名:DeepSeek V4.1 Flash 以 81.1 的总评(全榜第 5)拿到 2796.6 的性价比——它是本表唯一「能力进第一梯队、成本仍在地板」的模型。第 2–7 名全部为开源/开放权重模型。
| 领域 | 事件 / 数据 | 时效 | 来源 | 置信度 |
|---|---|---|---|---|
| 就业结构 | 《2026 国际 AI 安全报告》(英国政府)估算:发达经济体约 60%、新兴经济体约 40% 的岗位可能受 AI 影响;报告主笔 Stephen Clare 称有「提示性证据」显示高度暴露于 AI 的早期职业者更难找到工作 | 2026-09-13 报道 | Al Jazeera(09-13) · 2026 International AI Safety Report | 已确认(报告)/ 就业影响为估算 大概率 |
| 就业结构 | Wipro 称 AI 释放了相当于 20,000 名员工的产能(已转岗),并正在为 10 万余名员工提供高级 AI 技能培训,转向「human-AI operating model」 | 2026-09-13 | Al Jazeera(09-13) · Wipro CTO Sandhya Arun | 大概率(企业自述) |
| 就业结构 | BIS(国际清算银行,2025-09)测量:生成式 AI 带来 10%–65% 的生产力提升与约 20%–50% 的时间节省,集中在编码、咨询与专业写作 | 报告 2025-09,09-13 引用 | BIS · Al Jazeera(09-13) | 已确认 |
| 教育科研 | 25 位菲尔兹奖得主(陶哲轩、Peter Scholze、邓煜等)联名声明,称 AI 公司把解题当基准测试的竞赛式推进正在损害数学科学与共同体;仓促发布的解答来不及规范写作与引用,引发成果归属与剽窃问题,数学家传承链条可能断裂 | 2026-09-13~09-14 | 腾讯研究院AI速递(09-14) · liorpachter 反驳文(09-13) | 大概率(未见声明原文公开链接) |
| 教育科研 | CMU 教授 Zachary Lipton 称「CS 学术界搞坏了这个系统」、或许需要「烧掉重建」;导火索是 09-09 arXiv 单日 447 篇 cs.LG 新上传 | 2026-09-13 | r/MachineLearning 热帖 · AI Weekly(09-13) | 大概率(观点 + 单日 arXiv 数据可查) |
| 医疗健康 | 服贸会亮相国内首款对标国际顶尖水平的诊室听译机器人:六麦阵列 + 自研抗噪技术分离医患对话,实时转写并自动结构化生成电子病历;中国中医科学院广安门医院「广医·岐智大模型 2.0」构建六大场景,提供 7×24 小时中医服务闭环 | 2026-09-13 | 中国青年报(09-13) · 上海证券报(09-13) | 已确认 |
| 政务服务 | 服贸会:金山办公 WPS 365 政务版与 WPS Comate 覆盖公文起草、智能审校、数据报送,AI 从辅助写作延伸至任务执行;建设银行数字人客服「龙知微/龙知远」已上智慧柜员机,客户问题解决率达 98% | 2026-09-13 | 上海证券报(09-13) · 中国青年报(09-13) | 已确认 |
| 数字鸿沟 / 技能普惠 | 湖南省人社厅印发「技兴三湘 一人一技——人工智能专项培训行动」:3 年内上线不少于 100 门课程、举办不少于 1000 场公益培训与实训、补贴性培训 10 万人次、力争带动 30 万人次学 AI;覆盖零基础爱好者、产业工人、创业群体 | 2026-09-13 07:25 | 湖南日报(09-13) · 湖南省人社厅通知 | 已确认 |
| 公共安全 / 风险治理 | AI agent 蜂群利用 PaperCut 两个 CVE(CVE-2026-81578 / CVE-2026-82078),72 小时内攻陷 48 国 395 个组织的 440 个 PaperCut 实例,从约 280 名受害者处收割凭据;攻击基于 OpenAI Codex 与某未具名 DeepSeek 模型 | 2026-09-13 | Silverfort · The Hacker News · BleepingComputer | 大概率(缺 CISA/厂商官方通报) |
| 公共安全 / 风险治理 | 恶意 .git/config 可让 Claude Code / Codex / Cursor 静默执行攻击者代码(详见 A1);Anthropic 修复耗时约 50 天 / 30 个版本 | 2026-09-13 | Accomplish · The Hacker News · BleepingComputer | 已确认 |
| 风险治理 | 两位安全研究员(Joe Benton、Josh Engels)09-12 从 Anthropic / Google DeepMind 离职加入 METR;Benton 呼吁强制披露 RSI 进展、事故/未遂事件、最低安全标准与独立验证,称当前透明度「完全是自愿的」 | 2026-09-12~09-13 | NBC News · Pondero(09-13) · AI Weekly | 已确认 |
| 数字鸿沟 / 能源 | 数据中心扩张引发电力与水资源担忧:Gallup 民调显示 71% 的美国人反对在本地建设 AI 数据中心;犹他州一个拟建数据中心的用电量将超过全州 | 2026-09-13 | Al Jazeera(09-13) · Gallup | 大概率(民调口径) |
本期社会效益的主线是「三重不同步」。
第一重是能力与安全不同步——同一天里,诊室听译机器人在生成病历、建行数字人客服解决 98% 的问题、金山办公在起草公文;而恶意 .git/config 能让三个主流编程 agent 静默执行任意代码,agent 蜂群在 72 小时内攻陷 48 国 395 个组织。AI 进入业务流程的速度,明显快于围栏建设的速度——Amodei 呼吁「放慢能力提升」、Altman 与马斯克附议、三大实验室磋商标准机构,本质上都是对这一落差的反应。
第二重是技能供给与岗位重塑不同步。60%/40% 的岗位暴露度是估算,但「早期职业者更难找到工作」已经有提示性证据——这恰恰是最难自证、也最容易被宏观数据掩盖的部分。湖南「30 万人次学 AI」这类普惠培训的真正价值,不在于教多少人调 API,而在于把 AI 从「高精尖叙事」还原为普通劳动者可掌握的技能;Wipro 把 2 万人产能转岗并培训 10 万人,是企业侧同构的动作。
第三重是学术评价与 AI 产出不同步。25 位菲尔兹奖得主的联名与 Lipton 的「烧掉重建」,指向同一个病灶:当 447 篇论文一天涌入 arXiv、当「解题」被当作基准竞赛,现有的同行评议与署名体系就失去了辨识能力。这不是反 AI,而是反「用产出速度替代理解深度」。
| 维度 | 事件 / 数据 | 时效 | 来源 | 置信度 |
|---|---|---|---|---|
| 价格通缩 | Silicon Data 的 LLM Token 支出指数跌破 1 美元,至 97 美分/百万 token,创历史新低;该指数今年 5 月高点为 2.05 美元,8 月单月大跌 29%,较 5 月高点累计跌幅超 50% | 2026-09-14 | 经济参考报(09-14) · Silicon Data | 已确认(指数)/ 归因分析 大概率 |
| 企业降本 | 微软开始收紧内部 Token 使用管理,设置用量监控并逐步将内部默认工作负载切换至 GPT-5.6 Sol 以降低成本;部分企业 AI 支出已达数十亿美元量级 | 2026-09-14 报道 | 经济参考报(09-14) | 大概率(媒体报道,微软未公告) |
| 产业规模 | 工信部《信息通信行业发展"十五五"规划》:智能算力规模从 2025 年 1,590 EFLOPS 提升至 2030 年 9,800 EFLOPS(五年增长 5 倍以上);先进存力 1,680 EB → 1,700 EB;新建大型超大型算力设施 PUE < 1.2;行业收入 3.8 万亿 → 4.1 万亿 | 规划 09-07 发布 / 09-13 密集解读 | 工信部 · 华夏时报(09-13) · 中国科技投资(09-13) | 已确认 |
| 产业规模 | 截至 2026 年 6 月底,我国智算规模达 2,185 EFLOPS,同比 +177%;存力较 2025 年增长约 11%;生成式 AI 服务备案数量较 2025 年底增长 32% | 2026-09-12(算力大会) | 中国信通院总工何宝宏 · 人民邮电报(09-13) | 已确认 |
| 产业规模 | 2025 年我国算力市场规模 8,351 亿元,同比增长超 30%;中商产业研究院预测 2030 年 AI 算力市场规模超 3 万亿元 | 2026-09-13 | 中国信通院 · 中商产业研究院 | 已确认(2025 实测)/ 预测 大概率 |
| 需求侧 | 中国电信研究院《智能体时代 AI 基础设施发展研究报告(2026)》:预计 2026 年我国 Token 年消耗量达 10 亿亿,2030 年超 3,500 亿亿,年复合增长率接近 12 倍;中国算力平台算力超市注册企业用户突破 1 万家,入驻算力服务商超 200 家,累计沉淀数十亿条监测数据 | 2026-09-13(算力大会闭幕) | 中国电信研究院 · 21世纪经济报道(09-13) · 同花顺(09-13) | 已确认(预测为机构口径) |
| 资本市场 | 智谱 09-13 宣布完成约 50 亿美元融资(约 20 亿美元股份配售 + 约 30 亿美元零息可转债,初始转股价 892.50 港元、较公告前收盘价溢价约 12.55%);距 7 月配售约 40 亿美元仅两个月 | 2026-09-13 | 智谱港交所公告 · 钱江晚报·潮新闻(09-13) | 已确认 |
| 资本市场 | Cognition(Devin)完成超 20 亿美元 E 轮,估值达 480 亿美元(a16z 与 Accel 领投);年化收入从 5 月的 4.92 亿美元增至近 9 亿美元 | 09-08 官宣 / 09-13 二次报道 | 融中财经(09-13) · Cognition | 已确认(融资)/ 收入为公司自述 大概率 |
| 区域/政策 | 国务院常务会议 09-11 研究算力网建设有关工作,指出算力网是 AI 发展的基础支撑,要发挥市场机制促进供需匹配;2026 年算力网和新一代通信网正式列入新型基础设施「六张网」 | 2026-09-11~09-13 | 国务院常务会议 · 21世纪经济报道(09-13) | 已确认 |
| 供应链 | 长电科技 65 亿元定增加码先进封装;本周与华为在三维堆叠芯片量产上持续落地,麒麟 2026 已流片并随秋季新机出货、麒麟 2027 完成流片;高通与三星 2nm 代工谈判陷入僵局,量产推迟至 2027 年 | 2026-09-12~09-13 | 同花顺半导体日报(09-13) · The Bell(09-12) | 大概率 |
本期最反直觉的数据是「量升价跌」。 Token 消耗量在爆发(2026 年预计 10 亿亿、2030 年 3,500 亿亿,CAGR 近 12 倍),但单位价格跌破 1 美元、较 5 月高点腰斩。这与第七节的性价比表是同一件事的宏观镜像:当 DeepSeek V4.1 Flash 把每成功任务成本压到 $0.029、而 Claude Fable 5.1 Max 是 $1.212 时,全市场均价被结构性地拉下来了。Silicon Data 研究主管的判断值得记下:Token 价格下跌意味着供给已相对充沛,足以「满足绝大多数任务的技术需求」。
第二个信号是资本正在从「估值故事」转向「造血能力」。 智谱两个月内两次融资共约 90 亿美元、Cognition 估值 480 亿美元对应近 9 亿美元 ARR——钱仍在涌入,但潮新闻的定调更准确:行业已进入以造血能力、算力壁垒、生态落地为核心的耐力赛。与之对照的是宇树市值从 4,448 亿回撤到不足 2,000 亿:同样在具身赛道,产能与订单能兑现的(优必选柳州工厂投产)在被加仓,只有概念溢价的在被重估。
第三个信号是政策把算力从「产业配套」升格为「国家级新基建」。 国常会专题研究算力网、算力网列入「六张网」、"十五五"规划给出 1,590 → 9,800 EFLOPS 的明确路径,同时要求 PUE < 1.2——量的扩张与质的约束同时写进规划,这意味着未来五年的算力投资不是无序扩张,而是「优结构、强调度、提利用率」。
deepseek.com/news(当前最新条目 = 2026-09-10「V4.1 Flash」),V3.2(2025-12-01)、V3.2-Exp(2025-09-29)已明确列为超窗旧闻。| 榜单 | 衡量什么 | 本期状态 |
|---|---|---|
| LiveBench | 7 类 23 项客观任务,每半年刷新,含每成功任务成本 | release 2026-06-25(latest),官网实时页直采 |
| Artificial Analysis | 综合智能指数(含 agentic/推理/长文档),混合闭源与开源 | 官网实时页 JSON-LD 结构化直采(本期连续第四日成功),20 模型完整分数/速度 |
| llm-stats | 跨公开基准 TrueSkill 合成分 + 实时价/吞吐 | 390 模型,混合价按 8:1(输入:输出)折算 |
三个口径不可直接比较绝对值(评测集、权重、更新频率均不同)。第七节的性价比表为跨口径合成,仅用于看量级,不可作为采购依据。
AI 日报 · 自动化生成 | 生成时间:2026-09-14 05:40(北京时间) | 统计窗口:2026-09-13 05:30 → 2026-09-14 05:30