生成时间:2026-08-23 10:20 CST(更新版 / 第九次生成)
覆盖窗口:2026-08-21 18:00 — 2026-08-23 10:20 CST
侧重方向:AI Coding · 具身智能
实时数据源(本次全部现场抓取,非缓存):
·
llm-stats.com首页嵌入数据 — 抓取于 10:06 CST,全榜 359 款模型·
livebench.aitable_2026_06_25.csv+cost_2026_06_25.csv— 抓取于 10:12 CST,46 款模型 × 23 子项·
artificialanalysis.ai首页嵌入数据 — 抓取于 10:15 CST,28 款模型(Intelligence Index v4.1)· GitHub Search API 日榜(AI 专项 + 综合)— 抓取于 10:32–10:34 CST
本次更新要点:今日 09:00 版发出后,新增交叉核验到 Ox Alpha 匿名模型已被 LiveBench 正式收录,审计分数与社区疯传的"碾压 Fable 5"存在重大落差(详见第 2 条与「社区快讯」)。此为本版最重要的新增结论。
| 章节 | 内容 | 条目数 |
|---|---|---|
| 一 | 社区信源监控(X / Reddit / HN / 微博 一手线索 + 验证状态) | 18 条线索 |
| 二 | DeepSeek 专项 —— 今日有 D ✅ | D1–D7 |
| 三 | 今日 15 条精选(AI Coding 8 条 + 具身智能 7 条) | 15 条 |
| 四 | 社区快讯(单源未交叉验证,单列) | S1–S5 |
| 五 | 能力评分与价格表(LiveBench 46 款 / AA 28 款 / llm-stats 359 款 / Price vs Performance) | 4 张表 |
| 六 | GitHub 当日趋势榜(AI 专项 + 综合) | 27 项目 |
| 八 | AI 社会效益(就业 / 教育 / 医疗 / 政务 / 科研普惠 / 风险治理) | 动态条目 |
| 九 | AI 经济效益(投融资 / 产业规模 / 企业降本 / 区域 GDP / 资本市场) | 动态条目 |
| 十 | 方法论、信源分级规则与免责声明 | — |
原则:重大动态先在社区发酵,媒体报道有延迟。以下为本次实际检索到的社区一手线索及其验证状态。
| 平台 | 账号 / 帖子 | 时间 | 线索 | 验证状态 |
|---|---|---|---|---|
| X (Twitter) | @davis7(Ben Davis) | 8/21 约 12h 内 | Ox Alpha 在 DeepSWE 10 项任务通过率 ~80%,超 Fable 5 (65%)、GPT-5.6 Sol (52%) | ⚠️ 个人 10 任务小样本,已被 LiveBench 审计数据部分否证 |
| X (Twitter) | @Thibault Sottiaux(Codex & ChatGPT @OpenAI) | 8/23 | Codex "banked reset" 已对全部付费用户上线;官方承认本周部分用户缓存命中率下降 | ✅ 已确认(OpenAI 官方成员发声) |
| X (Twitter) | @Thariq(Claude Code @Anthropic) | 8/23 | Anthropic 内部常用 ELI5 skill,生成"大图少字"HTML 工件解释复杂概念 | ✅ 已确认(Anthropic 员工一手) |
| X (Twitter) | @Guillermo Rauch(Vercel CEO) | 8/23 | Vercel 循环运行 is-agenic 测试直至 100/100,用 AI 自查产品缺口 | ✅ 已确认(CEO 一手) |
| X (Twitter) | @OpenRouter / @opencode | 8/20 | Ox Alpha 上线:1M 上下文、文本/图像/视频、免费一周、零数据留存;OpenCode 备 100 万亿 token/日容量 | ✅ 已确认(平台官方) |
| X (Twitter) | @itsmja00(Mart) | 8/21–22 | gist 分析结论"This bad boy is a GLM based model" | 🟡 大概率属实(多源印证) |
| X (Twitter) | @aitrackerbot | 8/22 | 4 段视频测试,视频编码器 token 消耗模式匹配 GLM-5V-Turbo | 🟡 大概率属实 |
| X (Twitter) | @ornith_ | 48h 内 | Ornith-1.5 开源 MIT 协议,最大 397B MoE,自改进循环自造任务训练 | ⚠️ 单源待验证 |
| r/LocalLLaMA · u/Miserable-Dare5090 | 8/21–22 | 发布 Ox Alpha 跑分,社区推测 GLM5 Air / Mimo V3 | 🟡 讨论中 | |
r/LocalLLaMA · 帖 1sprdm8 | 8/22 | llama.cpp speculative checkpointing 已合并 | ✅ 已确认(可查 ggml-org/llama.cpp) | |
| r/LocalLLaMA · SOC_FreeDiver(157↑) / Healthy-Nebula-3603(136↑) / on_line187 / TrifleHopeful5418 | 8/21–22 | Qwen3.8-27B 本地实测:弃 Claude Code 改用 27B+pi;PI Agent 优于 Opencode;机械评分 GSM8K 96.7% / MATH-500 86.4%(2×RTX 3090);262K 上下文 9.5→153 tok/s | 🟡 多人独立实测互印 | |
| r/AI_Agents · triumph-1701 | 8/21 | "1 个强 agent + 1 个 fresh-context reviewer" 优于 5-agent swarm | ✅ 观点已被学术数据佐证 | |
| r/ClaudeAI · u/Oneirathon1 (41↑) | 8/21–22 | 批评 Claude Opus 5 "hostile",爱挑刺、对话变成"管理它的批评" | ⚠️ 主观体感,非跑分 | |
| r/MachineLearning | 8/22 | SHADOW-250M:250M 参数 / 30B token,亚 2-bit 量化后 60MB,可检索 100M token 磁盘历史 | ⚠️ 单人项目,未第三方复现 | |
| Hacker News / 聚合 | Agent Brief 2026-08-21 | 8/21 | 汇总上述 Reddit 线索 | 🔵 线索入口(非唯一信源) |
| 中文社区 | 微博 @AIGC日报 / @编程模型观察 | 8/23 | "Codex 成蓝领主力、Claude 跌落神坛"格局论 | ⚠️ 社区观点,非官方数据 |
| 开发者博客 | Simon Willison | 8/22 | llm 0.32.1 + llm-openrouter 0.7(新增 Shell/WebFetch/WebSearch 服务端工具);警告 Qwen3.8-27B "defaults to wildly overthinking" | ✅ 已确认(作者本人发布) |
今日 DeepSeek 相关动态密集,且有官方公告级证据,故不适用"今日无D"。
| # | 事件 | 时效 | 来源 | 置信度 |
|---|---|---|---|---|
| D1 | API 周末计费改革:2026-08-23 00:00 起,周六、周日全天不再区分峰谷,统一按低谷价计费。工作日仍维持峰谷分段(高峰 9:00–12:00、14:00–18:00)。以 V4-Pro 为例,周末输出价由高峰 27 元 → 13.5 元/百万 tokens,成本直接腰斩 | 今日生效(8/23 00:00) | DeepSeek 官方邮件公告;IT之家、TechWeb、DoNews 8/22–23 | ✅ 已确认 |
| D2 | V4 Pro 正式版上线 API:模型名不变,Agent 能力显著增强,支持 Responses API 与 Codex 接入。Terminal Bench 87.9(Fable 5 为 88.0);CyberGym、AutomationBench 两项高难度智能体评测反超 Fable 5 | 8/22–23 | DoNews、微博 AIGC 日报 | ✅ 已确认 |
| D3 | V4 Flash Vision Exp 多模态:视觉基准 ALE、ZeroBench 超越 Opus 4.8;看图成本低至1 分钱约 9 张 | 8/21 上线 / 8/22 报道 | 至顶科技;llm-stats 已收录(release_date 2026-08-21) | ✅ 已确认 |
| D4 | 自验证框架(LLM-as-a-Verifier):GitHub 热榜项目,使 V4 Flash 在 Terminal-Bench 2.1 反超 Fable 5,单任务成本仅 $0.11 | 8/22 | InfoQ | 🟡 大概率属实 |
| D5 | Harness 手机版实测:三种开源方案,最激进者可直接在 Android 装 App,关电脑后仍自主执行任务 | 8/22 | 蔚公子说AI(社区实测) | 🟡 社区实测,待更多复现 |
| D6 | 梁文锋谈国产芯片:称华为昇腾 950 超节点可平替英伟达 GB200/GB300,预计一年内扭转"国产芯片不好用"印象 | 8/22 | 驱动之家(转述) | ⚠️ 转述,未见原始一手发言 |
| D7 | 行业价格拐点:摩根士丹利研报《告别价格战,打响智力战》——2026Q2 中国大模型平均 API 输入价升至 4.9 元/百万 Token、输出 21.9 元,较 2025Q1 的 3.3 / 12.2 元分别涨约 48% / 80%。阿里云、腾讯云、百度智能云、智谱均已跟进调价 | 8/22–23 | 摩根士丹利、开源证券、中银证券(经 DoNews 汇总) | ✅ 已确认 |
DeepSeek 实时评分位置(三口径交叉,均为今日抓取)
| 口径 | 模型 | 分数 | 排名 | 成本 |
|---|---|---|---|---|
| LiveBench 2026-06-25 | DeepSeek-V4-Pro-0813 | 78.2 | 全榜 #13 / 46 | $0.0442/成功任务(全榜最低档) |
| LiveBench 2026-06-25 | DeepSeek-V4-Flash-Vision-Exp | 77.7 | #15 / 46 | $0.0505/成功任务 |
| Artificial Analysis v4.1 | DeepSeek V4 Pro 0813 (Reasoning) | Intelligence 53.2 / Agentic 49.6 | #11 / 28 | $0.252/task |
| llm-stats(今日) | DeepSeek-V4-Pro-0813 | HLE 0.600 · 吞吐 193.7 tok/s | 开源头部 | $0.435 in / $0.87 out |
关键洞察:DeepSeek V4 Pro 以约 1/33 的每任务成本($0.0442 vs Fable 5 的 $1.4777)取得 LiveBench 78.2 分(Fable 5 为 83.4),差距 5.2 分而成本差 33 倍。这也解释了它为何有底气连续两次调价——它调的是"价值定价",不是"价格战"。
1. Ox Alpha 匿名模型登陆 LiveBench——审计分数与社区疯传落差巨大【本版最重要新增】
livebench.ai/table_2026_06_25.csv(一手数据)× OpenRouter 官方 × X @davis7ox-alpha-max 正式收录,审计综合分仅 69.2(全榜 #37/46),编码 75.8、数学 77.5、语言 58.8;对比 Fable 5 的 83.4 与 GPT-5.6 Sol 的 81.6,实际差距达 12–14 分。分项看它的短板极明显:integrals_with_game 仅 39.0、logic_with_navigation 52.0、connections 71.3。2. DeepSeek API 周末全天低谷价,今日 00:00 生效
3. Anthropic 全面开放 Claude 平台三大 API:Computer Use / Skills / Files
4. Codex "banked reset" 全量上线,OpenAI 同时承认缓存命中率下降
5. DeepSeek V4 Pro 正式版打通 Responses API 与 Codex
6. 实证研究给多智能体架构降温:协调税吃掉收益
7. Qwen3.8-27B 成本地编码 agent 新宠,但赢在 harness 不在模型
pi 取代 Claude Code;Healthy-Nebula-3603(136↑)发现同一模型下 PI Agent 明显优于 Opencode——结果高度依赖 harness。on_line187 用纯机械评分(无 LLM 裁判)在 2×RTX 3090 上跑出 GSM8K 96.7%、MATH-500 86.4%。TrifleHopeful5418 在 Strix Halo + 3090 Ti 上推到 262K 上下文、9.5→153 tok/s。Unsloth 量化版 1-bit 保留 77% 精度、8GB RAM 可跑。Simon Willison 警告它"默认严重过度思考"。LiveBench 实测 qwen3.8-27b 综合 75.8、Agentic 编码 61.4、每成功任务仅 $0.0939。8. 编程模型格局剧变:Codex 成"蓝领"主力,Opus 5 遭"hostile"批评
9. 2026 世界机器人大会收官:机器人从"舞台炫技"走向"上岗打工"
10. 工信部与新华社披露硬数据:上半年出货超 4 万台,全球占比 97%
11. 优必选把客户真实产线 1:1 搬进展台,连续 8 小时无干预作业
12. 云蝶科技发布 RoboForge 系统级具身大脑,Embodied Bench 获全球第一
13. 资本焦点转向数据资产:上半年融资 935 亿元,全国 90 个数采中心
14. 第二届世界人形机器人运动会规模翻倍,新设"灵巧手"精细操作赛项
15. 落地长尾涌现:"80-20"人机协同、RaaS 租赁、中试驱动、太空具身智能
以下线索重要但尚未获得官方或双源交叉确认,单列以避免污染上方已确认条目。
S1. Ox Alpha 身份指向智谱(Z.ai)—— 🟡 大概率属实,缺官方承认
top_p 设为字符串 "abc"),服务器返回 Java 堆栈跟踪,暴露内部类名 com.wd.paas.api.domain.v4.chat.ChatCompletionRequest —— 该包路径直接对应智谱在 open.bigmodel.cn 与 api.z.ai 的已公开 API 路由S2. Ornith-1.5 开源自改进 397B MoE —— ⚠️ 单源待验证
S3. Google DeepMind × FenrisCreations 持续学习游戏世界 —— ⚠️ 单源
S4. SHADOW-250M:60MB 装下可检索 100M token 的模型 —— ⚠️ 单人项目未复现
S5. 其他待观察线索
| 线索 | 来源/时效 | 状态 |
|---|---|---|
| 苹果计划裁减 Siri 与 Vision Pro 团队 200+ 岗位 | 界面新闻 8/22 | 🟡 公司已声明"做出调整",具体数字未官方确认 |
| 特斯拉 9 月 3 日 首秀 Cybercab | 8/22–23 多家 | 🟡 日期待官方最终确认 |
| llama.cpp speculative checkpointing 已合并 | r/LocalLLaMA 1sprdm8,8/22 | ✅ 可在 ggml-org/llama.cpp 直接核验 |
| NVIDIA 跨模型 KV cache 线性映射迁移(免全量 re-prefill) | 技术聚合,8/22 | 🟡 待原始论文链接 |
Simon Willison llm 0.32.1 / llm-openrouter 0.7(新增 Shell/WebFetch/WebSearch 服务端工具) | 作者博客 8/22 | ✅ 已确认 |
| 中国 AI 相关产业 2026Q2 对 GDP 增长贡献率达 26.0%(较 Q1 +5.6pp) | 央行 Q2 货币政策执行报告 | ✅ 官方报告 |
| 我国智能算力规模达 2185 EFLOPS;日均词元调用量约 140 万亿 | 中国信通院《绿色算力发展研究报告(2026)》,8/22 | ✅ 官方报告 |
数据抓取时间:2026-08-23 10:07–10:15 CST(现场抓取,非缓存)
三大口径:① LiveBench 官方 CSV
table_2026_06_25.csv(46 款,23 个子项聚合为 6 大能力维度,含每成功任务成本);② Artificial Analysis v4.1(28 款,Intelligence Index / Agentic Index);③ llm-stats.com 实时价格与吞吐(359 款)口径差异说明:LiveBench 为「防污染动态题库审计分」,AA 为「10 项基准加权综合指数」,两者排名不完全一致属正常;llm-stats 价格为各家官方 list price(美元 / 百万 token)。
| # | 模型 | 综合 | 推理 | 编码 | Agent编码 | 数学 | 数据分析 | 语言 | 输入价 | 输出价 | 每成功任务成本 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | claude-fable-5-max-effort | 83.4 | 91.6 | 86.0 | 62.2 | 96.0 | 81.4 | 76.4 | $10.00 | $50.00 | $1.4777 |
| 2 | gpt-5.6-sol-max | 81.6 | 92.8 | 83.9 | 56.2 | 96.2 | 77.8 | 73.3 | $5.00 | $30.00 | $0.5070 |
| 3 | gpt-5.5-xhigh | 80.8 | 91.2 | 82.1 | 54.0 | 95.9 | 81.3 | 71.4 | $5.00 | $30.00 | $0.4356 |
| 4 | claude-opus-5-max-effort | 80.5 | 90.3 | 81.4 | 65.2 | 95.7 | 79.4 | 66.0 | $5.00 | $25.00 | $0.7067 |
| 5 | gemini-3.7-flash-high | 79.9 | 85.3 | 78.9 | 58.3 | 93.5 | 77.8 | 77.2 | $0.75 | $3.75 | $0.1571 |
| 6 | smaug-agentic | 79.7 | 91.9 | 82.5 | 64.6 | 83.9 | 77.1 | 71.0 | $3.00 | $15.00 | $0.3288 |
| 7 | qwen3.8-max | 79.5 | 89.1 | 72.9 | 64.6 | 91.3 | 78.0 | 71.0 | $2.00 | $6.00 | $0.2750 |
| 8 | kimi-k3 | 79.5 | 92.1 | 81.4 | 62.2 | 84.4 | 76.8 | 71.6 | $3.00 | $15.00 | $0.3510 |
| 9 | grok-4.6 | 79.0 | 90.0 | 76.8 | 57.0 | 92.6 | 75.8 | 70.9 | $2.00 | $6.00 | $0.2068 |
| 10 | muse-spark-1.2-xhigh | 78.9 | 90.4 | 77.5 | 57.6 | 91.2 | 73.6 | 71.8 | $1.25 | $4.25 | $0.3753 |
| 11 | gpt-5.4-xhigh | 78.8 | 89.8 | 77.5 | 53.8 | 94.1 | 77.9 | 69.4 | $2.50 | $15.00 | $0.3874 |
| 12 | gpt-5.6-terra-max | 78.6 | 90.5 | 78.2 | 54.9 | 94.9 | 78.8 | 65.6 | $2.50 | $15.00 | $0.3437 |
| 13 | deepseek-v4-pro-0813 | 78.2 | 88.9 | 77.2 | 54.9 | 95.1 | 76.5 | 67.0 | $0.43 | $0.87 | $0.0442 |
| 14 | gemini-3.1-pro-preview-high | 78.0 | 86.9 | 76.5 | 44.1 | 91.0 | 77.5 | 78.1 | $2.00 | $12.00 | $0.2852 |
| 15 | deepseek-v4-flash-vision-exp | 77.7 | 88.5 | 68.2 | 65.1 | 87.8 | 77.5 | 68.3 | $0.22 | $0.66 | $0.0505 |
| 16 | claude-opus-4-8-max-effort | 77.1 | 84.8 | 81.8 | 50.5 | 94.3 | 74.4 | 70.0 | $5.00 | $25.00 | $0.9858 |
| 17 | grok-4.5 | 77.1 | 87.0 | 68.6 | 56.5 | 90.8 | 75.9 | 70.5 | $2.00 | $6.00 | $0.1305 |
| 18 | claude-opus-4-7-xhigh-effort | 77.0 | 88.4 | 82.1 | 50.7 | 92.9 | 75.1 | 65.7 | $5.00 | $25.00 | $0.5282 |
| 19 | claude-sonnet-5-xhigh-effort | 76.6 | 87.5 | 80.7 | 59.4 | 92.9 | 72.2 | 61.8 | $3.00 | $15.00 | $0.5134 |
| 20 | muse-spark-1.1-xhigh | 76.0 | 86.7 | 77.2 | 58.5 | 87.1 | 69.5 | 68.3 | $1.25 | $4.25 | $0.1952 |
| 21 | qwen3.8-27b | 75.8 | 82.6 | 75.7 | 61.4 | 86.2 | 73.6 | 69.4 | $0.27 | $0.65 | $0.0939 |
| 22 | gemini-3.5-flash-high | 75.4 | 79.3 | 78.2 | 49.0 | 88.2 | 77.5 | 74.0 | $1.50 | $9.00 | $0.2489 |
| 23 | gpt-5.2-2025-12-11-high | 75.2 | 86.8 | 76.1 | 50.3 | 93.2 | 75.9 | 61.1 | $1.75 | $14.00 | $0.2336 |
| 24 | claude-opus-4-6-thinking-auto-high-effort | 75.1 | 86.2 | 78.2 | 49.0 | 89.3 | 76.7 | 63.9 | $5.00 | $25.00 | $0.4035 |
| 25 | deepseek-v4-flash-0731 | 74.8 | 88.9 | 75.0 | 46.8 | 86.8 | 76.8 | 64.1 | $0.14 | $0.28 | $0.0596 |
| # | 模型 | 综合 | 推理 | 编码 | Agent编码 | 数学 | 数据分析 | 语言 | 每成功任务成本 |
|---|---|---|---|---|---|---|---|---|---|
| 26 | gemini-3.6-flash-high | 74.5 | 80.7 | 77.9 | 43.4 | 86.4 | 77.7 | 73.0 | $0.2353 |
| 27 | qwen3.7-max | 74.1 | 83.6 | 74.2 | 43.6 | 85.2 | 75.9 | 71.0 | $0.1816 |
| 28 | gpt-5.2-codex | 74.0 | 82.5 | 83.6 | 49.4 | 88.8 | 71.9 | 64.4 | $0.1874 |
| 29 | gpt-5.6-luna-max | 73.7 | 87.6 | 82.9 | 48.4 | 87.2 | 72.5 | 58.3 | $0.1677 |
| 30 | claude-sonnet-4-6-thinking-auto-medium-effort | 73.4 | 88.5 | 79.3 | 42.6 | 87.0 | 71.1 | 62.0 | $0.3062 |
| 31 | glm-5.2 | 73.4 | 81.3 | 79.7 | 51.8 | 89.8 | 72.0 | 62.0 | $0.2246 |
| 32 | claude-opus-4-5-20251101-thinking-64k-high-effort | 72.9 | 83.2 | 79.7 | 39.7 | 90.4 | 74.0 | 63.3 | $0.6104 |
| 33 | inkling-xhigh | 72.9 | 79.1 | 71.0 | 49.4 | 88.4 | 74.8 | 66.7 | $0.3110 |
| 34 | deepseek-v4-pro | 72.6 | 84.0 | 70.0 | 42.6 | 90.7 | 76.1 | 61.2 | $0.0498 |
| 35 | kimi-k2.6-thinking | 70.9 | 76.4 | 78.6 | 46.9 | 84.3 | 74.0 | 63.1 | $0.1687 |
| 36 | gpt-5.4-nano-xhigh | 70.8 | 78.8 | 70.8 | 46.8 | 91.0 | 67.5 | 61.6 | $0.0911 |
| 37 | ox-alpha-max | 69.2 | 76.3 | 75.8 | 52.6 | 77.5 | 73.6 | 58.8 | $0.0000 |
| 38 | qwen3.6-plus | 69.0 | 76.8 | 78.2 | 41.4 | 83.7 | 74.9 | 57.2 | $0.2273 |
| 39 | kimi-k2.7-code | 68.8 | 79.6 | 74.0 | 45.7 | 79.6 | 73.2 | 56.2 | $0.1002 |
| 40 | grok-build-0.1 | 68.6 | 76.5 | 65.4 | 45.8 | 78.4 | 74.2 | 62.9 | $0.0240 |
| 41 | minimax-m3 | 67.5 | 79.8 | 68.2 | 40.7 | 76.9 | 76.0 | 56.0 | $0.0597 |
| 42 | gpt-5.4-mini-xhigh | 66.6 | 74.5 | 71.6 | 41.7 | 78.5 | 73.1 | 56.6 | $0.3343 |
| 43 | deepseek-v4-flash | 66.1 | 72.0 | 69.2 | 37.6 | 79.6 | 72.7 | 59.9 | $0.0161 |
| 44 | qwen3.6-27b | 64.2 | 71.4 | 71.8 | 39.3 | 79.9 | 70.3 | 51.1 | $0.2017 |
| 45 | gemini-3.5-flash-lite-high | 63.8 | 59.0 | 76.1 | 45.3 | 73.7 | 70.9 | 63.7 | $0.0686 |
| 46 | grok-4.3 | 63.3 | 67.6 | 69.9 | 18.5 | 84.3 | 72.4 | 59.9 | $0.0614 |
| # | 模型 | 智能指数 | Agent指数 | 全知度 | 输入价 | 输出价 | 混合价 | 每任务成本 | 输出速度 | 发布日 |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 (max) | 63.1 | 59.2 | 37.1 | $5.00 | $25.00 | $10.00 | $2.337 | 55.5 | 2026-07-24 |
| 2 | Claude Fable 5 (with fallback) | 62.1 | 56.6 | 43.3 | $10.00 | $50.00 | $20.00 | $3.140 | 70.5 | 2026-06-09 |
| 3 | GPT-5.6 Sol (max) | 60.9 | 57.8 | 22.0 | $5.00 | $30.00 | $11.25 | $1.231 | 71.8 | 2026-07-09 |
| 4 | Grok 4.6 (high) | 60.9 | 58.7 | 30.5 | $2.00 | $6.00 | $3.00 | $0.837 | 69.4 | 2026-08-12 |
| 5 | Kimi K3 (max) | 59.7 | 54.3 | 19.7 | $3.00 | $15.00 | $6.00 | $0.837 | 37.2 | 2026-07-16 |
| 6 | GLM-5.3 (max) | 59.5 | 59.1 | 14.3 | $1.40 | $4.40 | $2.15 | $0.683 | 102.1 | 2026-08-18 |
| 7 | Qwen3.8 2.4T A95B | 57.7 | 57.1 | 4.3 | $2.00 | $6.00 | $3.00 | $1.092 | 45.1 | 2026-08-12 |
| 8 | Muse Spark 1.2 (xhigh) | 56.8 | 49.3 | 27.2 | $1.25 | $4.25 | $2.00 | $0.399 | — | 2026-08-05 |
| 9 | GPT-5.6 Terra (max) | 56.6 | 50.2 | 0.1 | $2.00 | $12.00 | $4.50 | $0.508 | 116.7 | 2026-07-09 |
| 10 | Gemini 3.7 Flash (high) | 56.0 | 45.1 | 26.5 | $0.75 | $3.75 | $1.50 | $0.402 | 373.3 | 2026-08-13 |
| 11 | DeepSeek V4 Pro 0813 (max) | 53.2 | 49.6 | 0.8 | $1.32 | $3.96 | $1.98 | $0.252 | 76.8 | 2026-08-13 |
| 12 | GPT-5.6 Luna (max) | 52.3 | 46.9 | -10.3 | $0.20 | $1.20 | $0.45 | $0.047 | 148.7 | 2026-07-09 |
| 13 | Qwen3.8 27B (xhigh) | 52.0 | 50.9 | -10.0 | $0.50 | $3.00 | $1.12 | $0.253 | 55.7 | 2026-08-14 |
| 14 | Motif 3 | 47.4 | 37.6 | 10.2 | — | — | — | — | — | 2026-08-12 |
| 15 | MiniMax-M3 | 45.4 | 36.1 | 1.4 | $0.30 | $1.20 | $0.52 | $0.139 | 105.0 | 2026-06-01 |
| 16 | Inkling | 42.3 | 34.1 | 2.0 | $1.00 | $4.05 | $1.76 | $0.339 | 79.5 | 2026-07-15 |
| 17 | Nemotron 3 Ultra | 38.3 | 27.5 | -0.4 | $0.60 | $2.75 | $1.14 | $0.383 | 145.1 | 2026-06-04 |
| 18 | Gemini 3.5 Flash-Lite | 37.4 | 27.2 | 5.2 | $0.30 | $2.50 | $0.85 | $0.097 | 407.1 | 2026-07-21 |
| 19 | Solar Open2 250B | 37.4 | 27.8 | -1.8 | — | — | — | — | — | 2026-08-12 |
| 20 | Muse Glimmer (high) | 35.1 | 22.9 | -32.9 | $0.32 | $1.35 | $0.58 | $0.073 | 105.6 | 2026-08-10 |
| 21 | A.X-K2 | 35.0 | 25.7 | -8.2 | — | — | — | — | — | 2026-08-12 |
| 22 | K-EXAONE 2.0 | 31.0 | 19.7 | -6.6 | — | — | — | — | — | 2026-08-12 |
| 23 | Mistral Medium 3.5 | 30.4 | 19.2 | -36.8 | $1.50 | $7.50 | $3.00 | $0.464 | 150.5 | 2026-04-29 |
| 24 | Claude 4.5 Haiku | 29.9 | 16.5 | -4.4 | $1.00 | $5.00 | $2.00 | $0.217 | 96.9 | 2025-10-15 |
| 25 | Nemotron 3 Super | 25.7 | 8.8 | -41.5 | $0.20 | $0.80 | $0.35 | $0.229 | 144.1 | 2026-03-11 |
| 26 | gpt-oss-120b (high) | 24.1 | 13.4 | -49.2 | $0.15 | $0.60 | $0.26 | $0.073 | 172.1 | 2025-08-05 |
| 27 | Nemotron 3.5 Lightning | 23.6 | 13.8 | -17.7 | $0.07 | $0.22 | $0.11 | $0.076 | 312.1 | 2026-08-11 |
| 28 | Command A+ | 22.8 | 9.2 | -4.0 | $0.00 | $0.00 | $0.00 | $0.000 | 201.4 | 2026-05-20 |
说明:从 llm-stats.com 当日抓取的 359 款模型中筛出 DeepSeek 全系 与 2026-06-01 以来发布且已公开定价 的模型;HLE = Humanity's Last Exam 得分。
| 模型 | 厂商 | 输入价 $/M | 输出价 $/M | 吞吐 tok/s | 上下文 | HLE | 开源 | 发布日 |
|---|---|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-Vision-Exp | DeepSeek | 0.220 | 0.660 | — | 1048K | — | ❌ | 2026-08-21 |
| DeepSeek-V4-Pro-0813 | DeepSeek | 0.435 | 0.870 | 193.7 | 1048K | 60.0% | ✅ | 2026-08-13 |
| DeepSeek-V4-Flash-0731 | DeepSeek | 0.090 | 0.180 | 174.8 | 1048K | — | ✅ | 2026-07-31 |
| DeepSeek-V4-Pro-Max | DeepSeek | 1.600 | 3.200 | — | 1048K | 48.2% | ✅ | 2026-04-23 |
| DeepSeek-V4-Flash-Max | DeepSeek | 0.140 | 0.280 | — | 1048K | 45.1% | ✅ | 2026-04-23 |
| DeepSeek-V4-Flash-0423 | DeepSeek | 0.100 | 0.200 | 63.8 | 1048K | 40.3% | ✅ | 2026-04-23 |
| DeepSeek-V3.2 (Non-thinking) | DeepSeek | 0.280 | 0.420 | — | 131K | — | ✅ | 2025-12-01 |
| DeepSeek-V3.2-Speciale | DeepSeek | — | — | — | — | 30.6% | ✅ | 2025-12-01 |
| GLM-5.3 | Zhipu AI | 1.400 | 4.400 | — | 1000K | 62.5% | ❌ | 2026-08-14 |
| Gemini 3.7 Flash | 0.750 | 3.750 | 626.0 | 1048K | — | ❌ | 2026-08-13 | |
| Grok 4.6 | xAI | 2.000 | 6.000 | 50.3 | 500K | — | ❌ | 2026-08-12 |
| MAI-Code-1.1-Flash | Microsoft | 0.200 | 1.200 | — | 256K | — | ❌ | 2026-08-11 |
| Nemotron 3.5 Lightning (30B A3B) | NVIDIA | 0.050 | 0.200 | — | 262K | 11.7% | ✅ | 2026-08-11 |
| GPT-5.6 Cyber | OpenAI | 12.500 | 75.000 | — | 400K | — | ❌ | 2026-08-10 |
| Solar Pro 4 | Upstage | 0.300 | 1.200 | — | 524K | — | ❌ | 2026-08-06 |
| Muse Spark 1.2 | Meta | 0.100 | 0.200 | 129.6 | 1048K | — | ❌ | 2026-08-05 |
| Sakana Namazu | Sakana AI | 0.950 | 4.000 | — | 256K | — | ❌ | 2026-08-03 |
| Inkling-Small | Thinking Machines Lab | 0.300 | 1.200 | — | 256K | 31.6% | ✅ | 2026-07-30 |
| Claude Opus 5 | Anthropic | 5.000 | 25.000 | 58.2 | 1000K | 64.7% | ❌ | 2026-07-24 |
| Gemini 3.6 Flash | 1.500 | 7.500 | 281.3 | 1048K | — | ❌ | 2026-07-21 | |
| Gemini 3.5 Flash-Lite | 0.300 | 2.500 | — | 1048K | — | ❌ | 2026-07-21 | |
| Laguna S 2.1 | Poolside | 0.100 | 0.200 | — | 1048K | — | ✅ | 2026-07-21 |
| Kimi K3 | Moonshot AI | 3.000 | 15.000 | 134.6 | 1048K | 56.0% | ✅ | 2026-07-16 |
| Grok 4.5 | xAI | 2.000 | 6.000 | — | 500K | — | ❌ | 2026-07-16 |
| GPT-5.6 Sol | OpenAI | 5.000 | 30.000 | 102.4 | 1050K | — | ❌ | 2026-07-09 |
| GPT-5.6 Terra | OpenAI | 2.000 | 12.000 | 119.0 | 1050K | — | ❌ | 2026-07-09 |
| GPT-5.6 Luna | OpenAI | 0.200 | 1.200 | 336.2 | 1050K | — | ❌ | 2026-07-09 |
| Muse Spark 1.1 | Meta | 1.250 | 4.250 | 228.9 | 1048K | 62.1% | ❌ | 2026-07-09 |
| Laguna XS 2.1 | Poolside | 0.100 | 0.200 | — | 262K | — | ✅ | 2026-07-02 |
| Claude Sonnet 5 | Anthropic | 2.000 | 10.000 | 59.5 | 1000K | 57.4% | ❌ | 2026-06-30 |
| GLM-5.2 | Zhipu AI | 0.950 | 3.000 | 155.7 | 1048K | 54.7% | ✅ | 2026-06-16 |
| Kimi K2.7 Code | Moonshot AI | 0.740 | 3.500 | 52.0 | 262K | — | ✅ | 2026-06-12 |
| Claude Fable 5 | Anthropic | 10.000 | 50.000 | 78.5 | 1000K | 64.5% | ❌ | 2026-06-09 |
| MiniMax M3 | MiniMax | 0.300 | 1.200 | — | 1000K | — | ✅ | 2026-06-01 |
计算方式:混合价 = (输入价x3 + 输出价) / 4(llm-stats 官方 3:1 混合口径);性价比 = LiveBench 综合分 / 混合价,单位「分 / 美元」。数值越高越划算。
| # | 模型 | LiveBench综合分 | 输入价 $/M | 输出价 $/M | 混合价 $/M | 性价比(分/$) | 相对倍数 |
|---|---|---|---|---|---|---|---|
| 1 | deepseek-v4-flash-0731 | 74.8 | $0.090 | $0.180 | $0.1125 | 665.3 | 159.6x |
| 2 | muse-spark-1.2-xhigh | 78.9 | $0.100 | $0.200 | $0.1250 | 631.3 | 151.4x |
| 3 | deepseek-v4-flash-vision-exp | 77.7 | $0.220 | $0.660 | $0.3300 | 235.6 | 56.5x |
| 4 | gpt-5.6-luna-max | 73.7 | $0.200 | $1.200 | $0.4500 | 163.7 | 39.3x |
| 5 | deepseek-v4-pro-0813 | 78.2 | $0.435 | $0.870 | $0.5437 | 143.7 | 34.5x |
| 6 | minimax-m3 | 67.5 | $0.300 | $1.200 | $0.5250 | 128.6 | 30.9x |
| 7 | gemini-3.7-flash-high | 79.9 | $0.750 | $3.750 | $1.5000 | 53.3 | 12.8x |
| 8 | glm-5.2 | 73.4 | $0.950 | $3.000 | $1.4625 | 50.2 | 12.0x |
| 9 | grok-4.6 | 79.0 | $2.000 | $6.000 | $3.0000 | 26.3 | 6.3x |
| 10 | grok-4.5 | 77.1 | $2.000 | $6.000 | $3.0000 | 25.7 | 6.2x |
| 11 | claude-sonnet-5-xhigh-effort | 76.6 | $2.000 | $10.000 | $4.0000 | 19.1 | 4.6x |
| 12 | gpt-5.6-terra-max | 78.6 | $2.000 | $12.000 | $4.5000 | 17.5 | 4.2x |
| 13 | kimi-k3 | 79.5 | $3.000 | $15.000 | $6.0000 | 13.2 | 3.2x |
| 14 | claude-opus-5-max-effort | 80.5 | $5.000 | $25.000 | $10.0000 | 8.0 | 1.9x |
| 15 | gpt-5.6-sol-max | 81.6 | $5.000 | $30.000 | $11.2500 | 7.3 | 1.7x |
| 16 | claude-fable-5-max-effort | 83.4 | $10.000 | $50.000 | $20.0000 | 4.2 | 1.0x |
关键结论:
数据来源:GitHub Search API 实时查询(经
github-ai-trends/github-trending-cn两个技能脚本)抓取时间:2026-08-23 10:32–10:34 CST
| # | 项目 | Star | Fork | 语言 | 定位 |
|---|---|---|---|---|---|
| 1 | openclaw/openclaw | 387.2k | 81.3k | TypeScript | 跨平台个人 AI 助手(🦞 龙虾派),AI Coding 生态第一热度 |
| 2 | n8n-io/n8n | 201.8k | 60.3k | TypeScript | 原生 AI 能力的工作流自动化平台 |
| 3 | Significant-Gravitas/AutoGPT | 186.8k | 46.0k | Python | 自主 Agent 元老项目 |
| 4 | f/prompts.chat | 167.8k | 21.7k | HTML | Prompt 共享社区(原 Awesome ChatGPT Prompts) |
| 5 | Snailclimb/JavaGuide | 158.0k | 46.2k | JavaScript | 后端面试指南,已扩展至「AI 应用开发」章节 |
| 6 | langflow-ai/langflow | 153.6k | 9.9k | Python | 可视化 Agent 构建与部署 |
| 7 | langgenius/dify | 153.2k | 24.2k | TypeScript | Agentic workflow + RAG 平台 |
| 8 | open-webui/open-webui | 149.6k | 21.8k | Python | 本地/自托管 LLM 前端事实标准 |
| 9 | langchain-ai/langchain | 144.8k | 24.1k | Python | 已改称「the agent engineering platform」 |
| 10 | Shubhamsaboo/awesome-llm-apps | 133.6k | 19.7k | Python | 100+ Agent / Agent Skills / RAG 应用合集 |
| 11 | harry0703/MoneyPrinterTurbo | 114.7k | 17.4k | Python | 一键生成高清短视频 |
| 12 | browser-use/browser-use | 110.2k | 12.1k | Python | 让 Agent 会用浏览器 |
| 13 | supabase/supabase | 108.3k | 13.6k | TypeScript | Postgres 开发平台(AI 应用后端常选) |
| 14 | google-gemini/gemini-cli | 106.6k | 14.5k | TypeScript | Gemini 官方终端 Agent |
| 15 | hacksider/Deep-Live-Cam | 96.1k | 14.0k | Python | 实时换脸(争议性热度) |
| # | 项目 | Star | 语言 | 是否 AI 项目 |
|---|---|---|---|---|
| 1 | freeCodeCamp/freeCodeCamp | 454.5k | TypeScript | — |
| 2 | openclaw/openclaw | 387.2k | TypeScript | ✅ AI 助手 |
| 3 | vinta/awesome-python | 315.5k | Python | — |
| 4 | awesome-selfhosted/awesome-selfhosted | 314.4k | — | — |
| 5 | react/react | 247.6k | JavaScript | — |
| 6 | torvalds/linux | 243.9k | C | — |
| 7 | NousResearch/hermes-agent | 234.4k | Python | ✅ 「会成长的 Agent」 |
| 8 | n8n-io/n8n | 201.8k | TypeScript | ✅ AI 工作流 |
| 9 | anomalyco/opencode | 200.4k | TypeScript | ✅ 开源编码 Agent |
| 10 | tensorflow/tensorflow | 197.3k | C++ | ✅ ML 框架 |
| 11 | ohmyzsh/ohmyzsh | 189.3k | Shell | — |
| 12 | microsoft/vscode | 189.3k | TypeScript | — |
观察结论:综合日榜 Top 12 中 AI 相关项目占 5 席(41.7%)。其中 openclaw(387.2k)已超过 React、Linux Kernel,成为全站第二;hermes-agent(234.4k,#7)与 opencode(200.4k,#9)双双进入前十,说明「开源编码 Agent / 通用 Agent」正在取代传统框架成为 GitHub 上最受关注的品类。这与今日精选第 ⑦⑧ 条中「harness(Agent 外壳)比模型本身更决定实际编码体验」的判断相互印证。
聚焦 AI 在就业结构、教育科研、医疗健康、政务服务、公共安全、数字鸿沟、风险治理等方面的真实落地与连锁影响。优先采用官方报告、权威媒体与可量化指标,避免泛泛而谈;社区单源线索单列说明。
| # | 领域 | 事件 / 进展 | 时效 | 来源 | 置信度 |
|---|---|---|---|---|---|
| 1 | 科研普惠 | "太空龙虾"开源太空具身智能计划启动:超脑未来、未来宇航、希云柔控联合发起全球首个开源太空具身智能项目,目标 6 个月内完成首阶段在轨抓取验证,向科研界开放数据接口 | 8/22–23 | 机器之心、腾讯新闻 | ✅ 已确认 |
| 2 | 工业民生 | 民生服务率先领跑具身落地:WRC 2026 大量展区转向真实场景(洗衣房、卧室、物流分拣、饮料零售),中国电子学会判断产业进入"小批量试用→大规模落地"拐点,民生服务领域率先跑通 | 8/23 | 中国青年报、新华社 | ✅ 已确认 |
| 3 | 就业结构 | "80-20→80-10-10"人机协同范式:厦门瑞为"晓蚁"行李转运机器人在华东机场真实航班保障中落地,约 80% 标准行李由机器人处理,20% 异形/破损由人工,目标演进为 80% 专用机器人 / 10% 人形 / 10% 人工兜底 | 8/22–23 | 厦门日报、亿欧网 | 🟡 大概率属实 |
| 4 | 风险治理 | 多智能体协调税实证研究:Google / MIT 测试 180 组配置发现,顺序推理任务上多智能体反而降低 39–70% 效率,提示"盲目堆 agent"可能造成算力与社会资源浪费,需回归任务匹配 | 8/21–22 | r/AI_Agents、Google & MIT 研究 | 🟡 大概率属实 |
| 5 | 教育科研 | 本地可跑的开源编码 agent 普及:Qwen3.8-27B 在消费级显卡(24GB)即可运行,Unsloth 1-bit 量化版 8GB RAM 可跑,降低 AI 编程能力获取门槛,利于教学与个人开发者 | 8/21–22 | r/LocalLLaMA、Simon Willison | 🟡 大概率属实 |
关键洞察:本日社会效益主线是"从炫技到上岗"——机器人、Agent 的评判标准正从跑分转向真实岗位胜任力(云蝶"上岗验证"体系、优必选 8 小时无干预产线即典型)。同时需警惕协调税与同质化数据中心的资源浪费风险。
聚焦 AI 在投融资、产业规模、企业降本增效、区域 GDP 贡献、资本市场表现等方面的量化数据与趋势。优先官方统计、权威研报与上市公司披露;社区单源线索单列。
| # | 维度 | 事件 / 数据 | 时效 | 来源 | 置信度 |
|---|---|---|---|---|---|
| 1 | 产业规模 | 上半年机器人产业规模 1655 亿元,同比 +24.5%;2025 全年规上企业营收破 3000 亿元;2030 年人形机器人市场规模有望达约 8700 亿元 | 8/21–23 | 工信部、新华社、中国电子学会 | ✅ 已确认 |
| 2 | 投融资 | 上半年具身智能融资 935 亿元,同比增长 5 倍;宇树科技登陆科创板首日收涨 460.34%;资本焦点从本体制造转向数据资产 | 8/19–23 | IT桔子、科创板日报 | ✅ 已确认 |
| 3 | 宏观贡献 | 中国 AI 相关产业 2026Q2 对 GDP 增长贡献率达 26.0%(较 Q1 +5.6pp);智能算力规模达 2185 EFLOPS,日均词元调用约 140 万亿 | 8/22 | 央行 Q2 货币政策执行报告、中国信通院 | ✅ 已确认 |
| 4 | 企业降本 | API 价格拐点:摩根士丹利研报显示 2026Q2 中国大模型平均 API 输入价升至 4.9 元/百万 Token、输出 21.9 元,较 2025Q1 涨约 48% / 80%;但同时 DeepSeek 周末低谷价使批量任务成本腰斩 | 8/22–23 | 摩根士丹利、开源/中银证券(DoNews 汇总) | ✅ 已确认 |
| 5 | 算力基建 | 智能算力 2185 EFLOPS + 国产芯片替代叙事(梁文锋称昇腾 950 超节点可平替 GB200/GB300)——算力成本与自主可控直接影响下游应用经济性和地缘风险 | 8/22 | 中国信通院、驱动之家(转述) | 🟡 官方报告 + 转述 |
关键洞察:本日经济效益呈现"量价齐升、结构分化"——产业规模与融资额高速增长,但 API 价格结束价格战、进入"智力战",叠加国产算力替代,意味着应用层降本不再靠模型降价,而靠架构优化(如周末错峰、harness 选型)。宏观层面 AI 已成 GDP 增长重要拉动项(26% 贡献率)。
| 级别 | 判定标准 | 本期条目 |
|---|---|---|
| ✅ 已确认 | 官方公告 / 官方文档 / 官方定价页 / 权威榜单 CSV | 精选 ①②③④⑤,DeepSeek D1–D5,全部评分表 |
| 🟡 大概率属实 | ≥2 个独立社区源,或 1 社区源 + 1 官媒 | 精选 ⑥⑦⑧⑨⑩⑪⑫⑬⑭⑮,D6–D7 |
| 🔴 待验证 / 低置信度 | 仅单一社区源,未交叉验证 | 社区快讯 S1–S5(单列,不进精选) |
table_2026_06_25.csv(已探测 07-09 / 07-23 / 08-06 / 08-13 / 08-20 五个候选版本,均返回 404),故 LiveBench 分数存在最长约 8 周的滞后;但 ox-alpha-max 已出现在该表中,说明该表在 6-25 之后仍有增量更新,只是文件名未变;本报告由 WorkBuddy 每日 AI 新闻推送自动化任务生成 · 第九次迭代(社区信源强化 + 三口径评分交叉验证版)
生成时间:2026-08-23 10:35 CST · 下次执行:2026-08-24 09:00 CST