V4 系列 API 启用峰谷分时计价。V4 Pro 输出由 6 元涨至高峰 27 元(+350%)、缓存命中输入涨至 0.3 元(+1100%);高峰 9:00–12:00、14:00–18:00,空闲半价。App/网页端免费不受影响。
Codex 中 GPT-5.6 Sol 的 100 万 Token 窗口不再仅限 API 密钥,Plus/Pro 可手动启用约 105 万 Token,适合大库重构与长会话;但额度消耗更快。
基于 Responses API 的长运行 Agent 范式:持久推理、压缩上下文、跨 Agent 委派、确定性工具移入代码。实测 ARC-AGI-3 提升且少用约 6× 输出 token。
Cursor 交易 8/14 关闭、并入 SpaceXAI;8/12 Grok 4.6 发布当天下午即入 Cursor 模型选择器,与 Opus 5、GPT-5.6 并列。SpaceX 拟结合算力与产品经验训更强更省的模型。
Firetiger 团队加入 Cursor,其 agents 监控发布、捕捉回归、排查事故,并把结论回传 coding agents,打通"写代码→上线→运维"闭环。
同提示词生产级对比:Claude Code 用 5.5h、约 800 美元完成 Typeform 替代品;Codex 用 61h、约 3000 美元。前者简洁稳定,后者功能深但残留 Bug。
周下载 1.27 亿的 keyv 等包维护者账号被劫持,注入窃密蠕虫,波及 868 包、1381 版本、月安装约 20 亿。恶意代码向 .claude/settings.json 注入 SessionStart hook、向 .vscode 注入任务,一开目录即触发。
GLM-5.3 基座权重不变、全靠后训练 Scaling,编程能力提升约 50%,Terminal-Bench 3.0 开源第一;即日上线 ZCode/AutoClaw,权重两周后开源。
宇树人形机器人跳高 2 米(超人类 1.8 米纪录)、跑 12.66 m/s(超人类上限);研发周期仅三月。8/19 登陆科创板,发行价 150.80 元/股、市值约 610 亿元,中签率 0.0181% 创最难纪录。
Lumos MOS2 双臂 50kg、22 自由度、全向底盘、双六维力、双激光雷达;配套 NexCore 技能闭环(建任务→接数据→训练→验证→部署),线束过 500 万次耐久。
首款自研人形"小迪"8 月内于郑州门店亮相;身高 1.61m、重 58.5kg,支持 6 方言 + 6 外语互译,可抓约 1kg 物体。受美国 FCC 新规约束,赴美或受限。
Robotics 2 把视觉/语言转全身动作;ER 2 做长时序规划与多机协作;On-Device 2 本地运行、少于 200 条示例数小时适配新本体。
WITA-Omni 用 Thinker-Talker-Actor 统一多模态推理,语音/动作/表情并列输出;τ0-VLA 用"慢思考—快执行"分层,预训练用 4 万+ 小时真机交互。智元启动赴港、第 15000 台下线。
申亚京团队将带"神经"的软皮肤嵌入硬机械臂,实现全臂高分辨率触觉 + 高精度运动;配套"感知—驱动"一体化算法,碰一下即理解意图并调动作。
6 项国标覆盖大模型、科学智能、AI 安全、具身智能等,落实四部门《百项国标建设专项行动》。
判断:调用量登顶后敢于涨价 = "性价比"已沉淀为定价权;后续看峰谷后调用量是否回落、Harness 能否成事实标准、二轮融资是否按期签约。
LiveBench = 2026-06-25 release(无污染、23 项客观任务);llm-stats = 实时综合分(公开基准 + 实时 API 指标)。量纲不同,不可直接相减。
| 模型 | 开源 | Overall | Reasoning | Coding | Agentic | Math | Data | Lang | Instr. | $/任务 |
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Fable 5 (Max) | 否 | 83.0 | 89.7 | 86.0 | 62.2 | 96.0 | 80.5 | 90.7 | 75.8 | $1.439 |
| GPT-5.6 Sol (Max) | 否 | 81.0 | 91.7 | 83.9 | 56.2 | 96.2 | 79.8 | 87.7 | 71.8 | $0.515 |
| GPT-5.5 Thinking | 否 | 80.2 | 89.7 | 82.1 | 54.0 | 95.9 | 81.6 | 87.4 | 70.7 | $0.435 |
| Claude 5 Opus (Max) | 否 | 80.1 | 91.2 | 81.4 | 65.2 | 95.7 | 74.6 | 88.7 | 63.8 | $0.699 |
| Smaug-Agentic | 是 | 79.5 | 90.3 | 82.5 | 64.6 | 83.9 | 79.9 | 84.4 | 71.0 | $0.329 |
| Kimi K3 | 是 | 79.2 | 90.7 | 81.4 | 62.2 | 84.4 | 78.7 | 85.5 | 71.4 | $0.348 |
| Gemini 3.7 Flash | 否 | 78.8 | 87.8 | 78.9 | 58.3 | 93.5 | 68.0 | 85.5 | 79.9 | $0.157 |
| Qwen 3.8 Max | 是 | 78.5 | 88.2 | 72.9 | 64.6 | 91.3 | 78.4 | 79.7 | 74.1 | $0.275 |
| Grok 4.6 | 否 | 78.0 | 90.5 | 76.8 | 57.0 | 92.6 | 73.9 | 83.7 | 71.9 | $0.207 |
| GPT-5.6 Terra | 否 | 77.9 | 90.6 | 78.2 | 54.9 | 94.9 | 79.3 | 82.9 | 64.6 | $0.352 |
| DeepSeek V4 Pro 0813 | 是 | 77.4 | 85.8 | 77.2 | 54.9 | 95.1 | 79.2 | 82.1 | 67.7 | $0.044 |
| Gemini 3.1 Pro | 否 | 77.0 | 84.0 | 76.5 | 44.1 | 91.0 | 78.5 | 85.4 | 79.1 | $0.286 |
| Claude Sonnet 5 | 否 | 76.0 | 88.7 | 80.7 | 59.4 | 92.9 | 71.7 | 75.0 | 63.9 | $0.505 |
| DeepSeek V4 Flash | 是 | 74.2 | 86.6 | 75.0 | 46.8 | 86.8 | 79.3 | 79.2 | 65.5 | $0.060 |
| GLM-5.2 | 是 | 73.2 | 78.6 | 79.7 | 51.8 | 89.8 | 73.7 | 76.2 | 62.3 | $0.225 |
| 排名 | 模型 | 开源 | LLM Stats | Reason | Coding | Agent | 参数 | 上下文 | 速度 | $/M |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | 否 | 57.4 | 56.9 | 50.6 | 44.4 | 2,134B | 1.1M | 87c/s | $7.78 |
| 2 | Claude Opus 5 | 否 | 56.3 | 55.4 | 42.7 | 41.5 | 2,668B | 1.0M | 53c/s | $7.22 |
| 3 | Claude Fable 5 | 否 | 56.1 | 53.7 | 48.8 | 42.8 | 2,003B | 1.0M | 111c/s | $14.44 |
| 5 | Kimi K3 | 是 | 54.9 | 53.9 | 45.9 | 41.6 | 2.8T | 1.0M | 71c/s | $4.33 |
| 6 | GLM-5.3 (NEW) | 否 | 54.7 | 54.9 | 45.4 | 41.8 | 753B | — | — | — |
| 7 | DeepSeek V4 Pro 0813 | 是 | 54.2 | 52.2 | 43.3 | 40.3 | 1.6T | 1.0M | 194c/s | $0.48 |
| 8 | Qwen 3.8 Max | 是 | 53.3 | 52.0 | 42.3 | 40.0 | 2.4T | — | — | — |
| 9 | GPT-5.6 Terra | 否 | 52.9 | 51.2 | 46.3 | 40.8 | 1,185B | 1.1M | 112c/s | $3.11 |
| 12 | Gemini 3.7 Flash | 否 | 51.2 | 50.1 | 38.6 | 36.0 | — | 1.0M | 444c/s | $1.08 |
| 13 | Claude Sonnet 5 | 否 | 49.6 | 49.1 | 40.1 | 34.0 | 1,588B | 1.0M | 46c/s | $2.89 |
| 15 | Grok 4.5 | 否 | 47.5 | 45.8 | 39.4 | 34.1 | 1,498B | 500K | 37c/s | $2.44 |
Artificial Analysis Intelligence Index v4.1.1(8/12–8/17)亦将 DeepSeek V4 Pro 0813、Grok 4.6、Qwen3.8 纳入评估;其 Pareto 前沿显示 Grok 4.6 成本效率领先、Gemini 3.7 Flash 位于"智能—时延"前沿(概览页未列具体分值)。
| 模型 | 综合价 $/M | 提供商 | 开源 |
|---|---|---|---|
| Claude Fable 5 | $14.44 | Anthropic | 否 |
| GPT-5.6 Sol | $7.78 | OpenAI | 否 |
| Claude Opus 5 / 4.8 | $7.22 | Anthropic | 否 |
| Kimi K3 | $4.33 | Moonshot | 是 |
| GPT-5.6 Terra | $3.11 | OpenAI | 否 |
| Claude Sonnet 5 | $2.89 | Anthropic | 否 |
| Grok 4.5 | $2.44 | xAI | 否 |
| Muse Spark 1.1 | $1.58 | Meta | 否 |
| Gemini 3.7 Flash | $1.08 | 否 | |
| DeepSeek V4 Pro 0813 | $0.48 | DeepSeek | 是 |
| DeepSeek V4 Flash | $0.02~0.06 | DeepSeek | 是 |
| 模型 / 档位 | 缓存命中输入 | 缓存未命中输入 | 输出 | 输出涨幅 |
|---|---|---|---|---|
| V4 Pro 高峰 | 0.30 | 9.00 | 27.00 | +350% |
| V4 Pro 空闲 | 0.15 | 4.50 | 13.50 | +125% |
| V4 Flash 高峰 | 0.10 | 3.00 | 9.00 | +350% |
| V4 Flash 空闲 | 0.05 | 1.50 | 4.50 | +125% |
涨价前:V4 Pro 输出 6 元、缓存命中输入 0.025 元;V4 Flash 输出 2 元。高峰 = 工作日 9:00–12:00、14:00–18:00,空闲为其余时间及周末(高峰一半价)。
性价比 = LLM Stats Score ÷ 综合价($/M),数值越高越"值"。按综合价升序。
| 模型 | 性能(LLM Stats) | 价格 $/M | 性价比(分/美元) | 开源 |
|---|---|---|---|---|
| DeepSeek V4 Pro 0813 | 54.2 | 0.48 | 112.9 | 是 |
| Gemini 3.7 Flash | 51.2 | 1.08 | 47.4 | 否 |
| Muse Spark 1.1 | 51.8 | 1.58 | 32.8 | 否 |
| Grok 4.5 | 47.5 | 2.44 | 19.5 | 否 |
| Claude Sonnet 5 | 49.6 | 2.89 | 17.2 | 否 |
| GPT-5.6 Terra | 52.9 | 3.11 | 17.0 | 否 |
| Kimi K3 | 54.9 | 4.33 | 12.7 | 是 |
| Claude Opus 5 | 56.3 | 7.22 | 7.8 | 否 |
| GPT-5.6 Sol | 57.4 | 7.78 | 7.4 | 否 |
| Claude Fable 5 | 56.1 | 14.44 | 3.9 | 否 |
Qwen3.8 Max、GLM-5.3 未列公开 $/M(多为平台/企业私有部署),性价比待补。DeepSeek V4 Pro 以 54.2 分 / $0.48 拿下全场最高性价比,断崖领先闭源旗舰。