判断:DeepSeek 把"性价比"沉淀为定价权与战略腾挪空间;V4.1/V4.2 稳定性、V5 是否如期、峰谷后调用量回落,是后续三大观察点。
| 模型 | 开源 | Overall | Reasoning | Coding | Agentic | Math | Data | Lang | Instr | 每任务成本 |
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Fable 5 (Max) | 否 | 83.0 | 89.7 | 86.0 | 62.2 | 96.0 | 80.5 | 90.7 | 75.8 | $1.439 |
| GPT-5.6 Sol (Max) | 否 | 81.0 | 91.7 | 83.9 | 56.2 | 96.2 | 79.8 | 87.7 | 71.8 | $0.515 |
| GPT-5.5 Thinking (xHigh) | 否 | 80.2 | 89.7 | 82.1 | 54.0 | 95.9 | 81.6 | 87.4 | 70.7 | $0.435 |
| Claude 5 Opus (Max) | 否 | 80.1 | 91.2 | 81.4 | 65.2 | 95.7 | 74.6 | 88.7 | 63.8 | $0.699 |
| Kimi K3 | 是 | 79.2 | 90.7 | 81.4 | 62.2 | 84.4 | 78.7 | 85.5 | 71.4 | $0.348 |
| Qwen 3.8 Max | 是 | 78.5 | 88.2 | 72.9 | 64.6 | 91.3 | 78.4 | 79.7 | 74.1 | $0.275 |
| Grok 4.6 | 否 | 78.0 | 90.5 | 76.8 | 57.0 | 92.6 | 73.9 | 83.7 | 71.9 | $0.207 |
| GPT-5.6 Terra (Max) | 否 | 77.9 | 90.6 | 78.2 | 54.9 | 94.9 | 79.3 | 82.9 | 64.6 | $0.352 |
| DeepSeek V4 Pro 0813 | 是 | 77.4 | 85.8 | 77.2 | 54.9 | 95.1 | 79.2 | 82.1 | 67.7 | $0.044 |
| Claude Sonnet 5 (xHigh) | 否 | 76.0 | 88.7 | 80.7 | 59.4 | 92.9 | 71.7 | 75.0 | 63.9 | $0.505 |
| DeepSeek V4 Flash 0731 | 是 | 74.2 | 86.6 | 75.0 | 46.8 | 86.8 | 79.3 | 79.2 | 65.5 | $0.060 |
| GLM-5.2 | 是 | 73.2 | 78.6 | 79.7 | 51.8 | 89.8 | 73.7 | 76.2 | 62.3 | $0.225 |
表 A · LiveBench 2026-06-25 release(越高越好)。Qwen3.8-27B 为新开源 27B 稠密模型,官方自测 SWE-bench Pro 61.7 / Terminal-Bench 2.1 73.0,尚未入榜。
| 排名 | 模型 | 开源 | LLM Stats | Reasoning | Coding | Agent | 参数 | 上下文 | 速度 | $/M |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | 否 | 57.4 | 56.9 | 50.6 | 44.4 | 2,134B | 1.1M | 87c/s | $7.78 |
| 2 | Claude Opus 5 | 否 | 56.3 | 55.4 | 42.7 | 41.5 | 2,668B | 1.0M | 68c/s | $7.22 |
| 3 | Claude Fable 5 | 否 | 56.1 | 53.7 | 48.8 | 42.8 | 2,003B | 1.0M | 96c/s | $14.44 |
| 5 | Kimi K3 | 是 | 54.9 | 53.9 | 45.9 | 41.6 | 1,816B | 1.0M | 96c/s | $4.33 |
| 7 | DeepSeek V4 Pro 0813 | 是 | 54.2 | 52.2 | 43.3 | 40.3 | 1.6T | 1.0M | 191c/s | $0.48 |
| 8 | Qwen3.8 Max | 是 | 53.3 | 52.0 | 42.3 | 40.0 | 2.4T | — | — | — |
| 9 | GPT-5.6 Terra | 否 | 52.9 | 51.2 | 46.3 | 40.8 | 1,185B | 1.1M | 113c/s | $3.11 |
| 12 | Gemini 3.7 Flash | 否 | 51.2 | 50.1 | 38.6 | 36.0 | — | 1.0M | 443c/s | $1.08 |
| 13 | Claude Sonnet 5 | 否 | 49.6 | 49.1 | 40.1 | 34.0 | 1,588B | 1.0M | 45c/s | $2.89 |
| 15 | Grok 4.5 | 否 | 47.5 | 45.8 | 39.4 | 34.1 | 1,498B | 500K | 62c/s | $2.44 |
表 B · llm-stats.com 综合分(2026-08-19 实时,全榜 358 模型)。Claude Mythos Preview 标注 UNRELEASED;GLM-5.3 / Qwen3.8 Max 未列公开 $/M。
| 模型 | 综合价 $/M | 提供商 | 开源 |
|---|---|---|---|
| Claude Fable 5 | $14.44 | Anthropic | 否 |
| GPT-5.6 Sol / GPT-5.5 | $7.78 | OpenAI | 否 |
| Claude Opus 5 / 4.8 | $7.22 | Anthropic | 否 |
| Kimi K3 | $4.33 | Moonshot | 是 |
| GPT-5.6 Terra | $3.11 | OpenAI | 否 |
| Claude Sonnet 5 | $2.89 | Anthropic | 否 |
| Grok 4.5 | $2.44 | xAI | 否 |
| Muse Spark 1.1 | $1.58 | Meta | 否 |
| Gemini 3.7 Flash | $1.08 | 否 | |
| DeepSeek V4 Pro 0813 | $0.48 | DeepSeek | 是 |
| DeepSeek V4 Flash | $0.02~0.06 | DeepSeek | 是 |
表 C · 综合价(llm-stats 实时,$/M)。
| 模型 / 档位 | 缓存命中输入 | 缓存未命中输入 | 输出 | 涨幅(输出) |
|---|---|---|---|---|
| V4 Pro 高峰 | 0.30 元 | 9.00 元 | 27.00 元 | +350% |
| V4 Pro 空闲 | 0.15 元 | 4.50 元 | 13.50 元 | +125% |
| V4 Flash 高峰 | 0.10 元 | 3.00 元 | 9.00 元 | +350% |
| V4 Flash 空闲 | 0.05 元 | 1.50 元 | 4.50 元 | +125% |
表 D · DeepSeek 峰谷定价(2026-08-17 生效,元/百万 token,来源:官方公告)。英文 docs 峰值档:V4 Pro 输出 $3.96/M、V4 Flash 输出 $1.32/M。
条形长度按性价比等比缩放(最大值 112.9 为满格)。数据来源:llm-stats.com 全榜 358 模型。
解读:DeepSeek V4 Pro 以 54.2 分 / $0.48 拿下约 113 分/美元,断崖领先;闭源顶配仅 3.9–7.8 分/美元。Qwen3.8 Max、GLM-5.3 未列公开 $/M,性价比待补。
AI Coding:本周"安全与脚手架"双主线——OpenAI 因能力越界首暂停 Astra 训练、Wiz 自主红队攻破 Snowflake CI/CD;StateM 用 Harness Scaling 证明不换权重也能大幅提分、Cursor 用 Origin 把战场扩到代码托管、Qwen3.8-27B 把开源编码主力压到 27B 可本地跑。铁律:按任务挑工具、默认小/快档、留人工审查、给 AI 代码上同等安全扫描。
具身智能:资本与场景双轮——宇树 8/19 上市 + "超人"破纪录、WRC 开幕(PelicanUnify / 银河通用首发)、LG×NVIDIA 共研、梅卡曼德冲 IPO、小米双冠、人才认证落地;量产与资本化窗口全面打开,但硬件成本/可靠性、跨场景通用智能、盈利兑现仍是四重挑战。DeepSeek 战配宇树,大模型—机器人资本协同落地。
价格与商业:国产大模型从低价内卷转向峰谷/分层定价(DeepSeek 领涨、Kimi/GLM/混元跟进),进入"价值定价 2.0";DeepSeek 以定价权 + 集中算力研发更强模型,开源模型持续施压闭源旗舰。