AI 日报 · 2026-08-18

聚焦方向:AI Coding(智能体编程)具身智能(Embodied AI) | 数据截至 2026-08-18
15 条精选(8 编码 + 7 具身) DeepSeek:今日有 D ✅ 双口径评分:LiveBench + llm-stats 含 llm-stats Price vs Performance

一、今日精选 15 条(AI Coding + 具身智能)

AI Coding · 定价时效 08-17

DeepSeek V4 Pro 峰谷定价 8/17 生效,国产模型首破"价格战"

来源:IT之家 / 界面新闻 / 新浪科技 / DeepSeek 官方

V4 系列 API 启用峰谷分时计价。V4 Pro 输出由 6 元涨至高峰 27 元(+350%)、缓存命中输入涨至 0.3 元(+1100%);高峰 9:00–12:00、14:00–18:00,空闲半价。App/网页端免费不受影响。

关注:国产头部模型首次系统性涨价,Agent 工程进入"算账过日子"——靠错峰、提缓存命中率、分级用 Flash 对冲成本。
AI Coding · 上下文时效 08-17

Codex 向 ChatGPT 账号开放百万 Token 上下文

来源:IT之家 / aicatchup.com(OpenAI 工程师 Tibo 官宣)

Codex 中 GPT-5.6 Sol 的 100 万 Token 窗口不再仅限 API 密钥,Plus/Pro 可手动启用约 105 万 Token,适合大库重构与长会话;但额度消耗更快。

关注:长上下文从 API 特权下沉到订阅用户,长链路任务门槛降低;"默认不开、按需开"成新纪律。
AI Coding · 架构时效 08-17

GPT-5.6 Builder's Guide:长时 Agent 范式让 ARC-AGI-3 13.3%→38.3%

来源:aicatchup.com / OpenAI 官方

基于 Responses API 的长运行 Agent 范式:持久推理、压缩上下文、跨 Agent 委派、确定性工具移入代码。实测 ARC-AGI-3 提升且少用约 6× 输出 token。

关注:把"Agent 怎么写才省又强"从玄学变范式,对自主编码/运维智能体直接可用。
AI Coding · 生态时效 08-12~14

Cursor 被 SpaceX 收购完成,Grok 4.6 进驻编辑器

来源:aicatchup.com / dreaming.press

Cursor 交易 8/14 关闭、并入 SpaceXAI;8/12 Grok 4.6 发布当天下午即入 Cursor 模型选择器,与 Opus 5、GPT-5.6 并列。SpaceX 拟结合算力与产品经验训更强更省的模型。

关注:编码 IDE 被算力巨头收编,模型层×编辑器层融合;多模型自由切换成 IDE 标配。
AI Coding · 生产化时效 08-16

Cursor 收购 Firetiger:coding agents 接上生产运维

来源:aicatchup.com / Cursor 官方

Firetiger 团队加入 Cursor,其 agents 监控发布、捕捉回归、排查事故,并把结论回传 coding agents,打通"写代码→上线→运维"闭环。

关注:编码智能体从"改代码"延伸到"对线上结果负责",价值闭环覆盖软件全生命周期。
AI Coding · 选型时效 08-17

Claude Code vs Codex 实测:快 10 倍、成本低 75%

来源:ZAKER 科技 / vibe coding 日报

同提示词生产级对比:Claude Code 用 5.5h、约 800 美元完成 Typeform 替代品;Codex 用 61h、约 3000 美元。前者简洁稳定,后者功能深但残留 Bug。

关注:真实项目里"协作姿势"决定性价比——重效率选 Claude Code,重隔离选 Codex。
AI Coding · 安全时效 08-04

npm 供应链攻击:keyv 账号被劫持,蠕虫借 Claude Code / VS Code hooks

来源:note.com / Aikido 统计

周下载 1.27 亿的 keyv 等包维护者账号被劫持,注入窃密蠕虫,波及 868 包、1381 版本、月安装约 20 亿。恶意代码向 .claude/settings.json 注入 SessionStart hook、向 .vscode 注入任务,一开目录即触发。

关注:AI 编程"信任工作区即执行"成攻击面;陌生仓库设信任、审 hooks 是 Agent 时代安全必修课。
AI Coding · 国产时效 08-17~18

智谱 GLM-5.3:纯后训练驱动,编程 +50%、Terminal-Bench 3.0 开源第一

来源:智谱 AI 官方 / AI 早间速递

GLM-5.3 基座权重不变、全靠后训练 Scaling,编程能力提升约 50%,Terminal-Bench 3.0 开源第一;即日上线 ZCode/AutoClaw,权重两周后开源。

关注:证明"不堆参数、靠后训练"也能拉高编码力,给国产编码模型新范式。
具身 · 人形时效 08-17/19

宇树"超人" HUMAN-X1:跳高 2 米、跑速超人类,科创板 IPO

来源:TechWeb / 新浪科技 / 高盛研报

宇树人形机器人跳高 2 米(超人类 1.8 米纪录)、跑 12.66 m/s(超人类上限);研发周期仅三月。8/19 登陆科创板,发行价 150.80 元/股、市值约 610 亿元,中签率 0.0181% 创最难纪录。

关注:运动能力破人类极限 + 资本登陆,高盛预计 2027 年全球出货 7.6 万台。
具身 · 工业时效 08-14

鹿明 MOS2:双臂负载 50kg 的重载轮臂式 AI Worker

来源:腾讯新闻

Lumos MOS2 双臂 50kg、22 自由度、全向底盘、双六维力、双激光雷达;配套 NexCore 技能闭环(建任务→接数据→训练→验证→部署),线束过 500 万次耐久。

关注:具身智能从样机走向产线换型频繁的重载场景,能力栈更完整。
具身 · 车企时效 08-05

比亚迪"小迪"人形机器人 8 月首秀

来源:note.com / BYD 官方

首款自研人形"小迪"8 月内于郑州门店亮相;身高 1.61m、重 58.5kg,支持 6 方言 + 6 外语互译,可抓约 1kg 物体。受美国 FCC 新规约束,赴美或受限。

关注:非机器人企业把自研人形送进线下零售,具身入口从工厂扩到消费场。
具身 · 大脑时效 08 月

Google DeepMind:Gemini Robotics 2 / ER 2 / On-Device 2

来源:国泰海通晨会纪要 / 智东西

Robotics 2 把视觉/语言转全身动作;ER 2 做长时序规划与多机协作;On-Device 2 本地运行、少于 200 条示例数小时适配新本体。

关注:机器人"大脑"通用化 + 本地化 + 少样本适配,降低本体绑定成本。
具身 · VLA时效 08 月

智元 WITA-Omni Preview + τ0-VLA,启动赴港上市

来源:国泰海通晨会纪要 / 同花顺

WITA-Omni 用 Thinker-Talker-Actor 统一多模态推理,语音/动作/表情并列输出;τ0-VLA 用"慢思考—快执行"分层,预训练用 4 万+ 小时真机交互。智元启动赴港、第 15000 台下线。

关注:国产具身大脑快速追赶,且资本化提速。
具身 · 触觉时效 08-04

港科大 EmArm:亚毫米级触觉"共生皮肤"机械臂

来源:DeepTech 深科技 / 文汇报

申亚京团队将带"神经"的软皮肤嵌入硬机械臂,实现全臂高分辨率触觉 + 高精度运动;配套"感知—驱动"一体化算法,碰一下即理解意图并调动作。

关注:补上"触觉思考"短板,从"看得见"到"摸得准、反应快"。
具身 · 标准时效 08-17~18

上海 AI 实验室牵头 6 项国家标准立项(含具身智能、AI 安全)

来源:上海人工智能实验室 / 文汇报

6 项国标覆盖大模型、科学智能、AI 安全、具身智能等,落实四部门《百项国标建设专项行动》。

关注:具身智能首进国家标准框架,为规模化落地提供合规基线。

二、DeepSeek 专区

今日有 D ✅ 8/17 峰谷定价生效后 DeepSeek 仍是行业头条

判断:调用量登顶后敢于涨价 = "性价比"已沉淀为定价权;后续看峰谷后调用量是否回落、Harness 能否成事实标准、二轮融资是否按期签约。

三、截至 2026-08-18 主流模型能力评分(双口径)

LiveBench = 2026-06-25 release(无污染、23 项客观任务);llm-stats = 实时综合分(公开基准 + 实时 API 指标)。量纲不同,不可直接相减。

表 A · LiveBench(分数越高越好)

模型开源OverallReasoningCodingAgenticMathDataLangInstr.$/任务
Claude Fable 5 (Max)83.089.786.062.296.080.590.775.8$1.439
GPT-5.6 Sol (Max)81.091.783.956.296.279.887.771.8$0.515
GPT-5.5 Thinking80.289.782.154.095.981.687.470.7$0.435
Claude 5 Opus (Max)80.191.281.465.295.774.688.763.8$0.699
Smaug-Agentic79.590.382.564.683.979.984.471.0$0.329
Kimi K379.290.781.462.284.478.785.571.4$0.348
Gemini 3.7 Flash78.887.878.958.393.568.085.579.9$0.157
Qwen 3.8 Max78.588.272.964.691.378.479.774.1$0.275
Grok 4.678.090.576.857.092.673.983.771.9$0.207
GPT-5.6 Terra77.990.678.254.994.979.382.964.6$0.352
DeepSeek V4 Pro 081377.485.877.254.995.179.282.167.7$0.044
Gemini 3.1 Pro77.084.076.544.191.078.585.479.1$0.286
Claude Sonnet 576.088.780.759.492.971.775.063.9$0.505
DeepSeek V4 Flash74.286.675.046.886.879.379.265.5$0.060
GLM-5.273.278.679.751.889.873.776.262.3$0.225

表 B · llm-stats.com 综合分(2026-08-18 实时)

排名模型开源LLM StatsReasonCodingAgent参数上下文速度$/M
1GPT-5.6 Sol57.456.950.644.42,134B1.1M87c/s$7.78
2Claude Opus 556.355.442.741.52,668B1.0M53c/s$7.22
3Claude Fable 556.153.748.842.82,003B1.0M111c/s$14.44
5Kimi K354.953.945.941.62.8T1.0M71c/s$4.33
6GLM-5.3 (NEW)54.754.945.441.8753B
7DeepSeek V4 Pro 081354.252.243.340.31.6T1.0M194c/s$0.48
8Qwen 3.8 Max53.352.042.340.02.4T
9GPT-5.6 Terra52.951.246.340.81,185B1.1M112c/s$3.11
12Gemini 3.7 Flash51.250.138.636.01.0M444c/s$1.08
13Claude Sonnet 549.649.140.134.01,588B1.0M46c/s$2.89
15Grok 4.547.545.839.434.11,498B500K37c/s$2.44

Artificial Analysis Intelligence Index v4.1.1(8/12–8/17)亦将 DeepSeek V4 Pro 0813、Grok 4.6、Qwen3.8 纳入评估;其 Pareto 前沿显示 Grok 4.6 成本效率领先、Gemini 3.7 Flash 位于"智能—时延"前沿(概览页未列具体分值)。

四、截至 2026-08-18 主流模型 API 价格表

表 C · 综合价($/M,llm-stats 实时)

模型综合价 $/M提供商开源
Claude Fable 5$14.44Anthropic
GPT-5.6 Sol$7.78OpenAI
Claude Opus 5 / 4.8$7.22Anthropic
Kimi K3$4.33Moonshot
GPT-5.6 Terra$3.11OpenAI
Claude Sonnet 5$2.89Anthropic
Grok 4.5$2.44xAI
Muse Spark 1.1$1.58Meta
Gemini 3.7 Flash$1.08Google
DeepSeek V4 Pro 0813$0.48DeepSeek
DeepSeek V4 Flash$0.02~0.06DeepSeek

表 D · DeepSeek 峰谷定价明细(元/百万 token · 8/17 00:00 生效)

模型 / 档位缓存命中输入缓存未命中输入输出输出涨幅
V4 Pro 高峰0.309.0027.00+350%
V4 Pro 空闲0.154.5013.50+125%
V4 Flash 高峰0.103.009.00+350%
V4 Flash 空闲0.051.504.50+125%

涨价前:V4 Pro 输出 6 元、缓存命中输入 0.025 元;V4 Flash 输出 2 元。高峰 = 工作日 9:00–12:00、14:00–18:00,空闲为其余时间及周末(高峰一半价)。

五、llm-stats Price vs Performance(当日抓取 · 2026-08-18)

性价比 = LLM Stats Score ÷ 综合价($/M),数值越高越"值"。按综合价升序。

DeepSeek V4 Pro 0813112.9
Gemini 3.7 Flash47.4
Muse Spark 1.132.8
Grok 4.519.5
Claude Sonnet 517.2
GPT-5.6 Terra17.0
Kimi K312.7
Claude Opus 57.8
GPT-5.6 Sol7.4
Claude Fable 53.9
模型性能(LLM Stats)价格 $/M性价比(分/美元)开源
DeepSeek V4 Pro 081354.20.48112.9
Gemini 3.7 Flash51.21.0847.4
Muse Spark 1.151.81.5832.8
Grok 4.547.52.4419.5
Claude Sonnet 549.62.8917.2
GPT-5.6 Terra52.93.1117.0
Kimi K354.94.3312.7
Claude Opus 556.37.227.8
GPT-5.6 Sol57.47.787.4
Claude Fable 556.114.443.9

Qwen3.8 Max、GLM-5.3 未列公开 $/M(多为平台/企业私有部署),性价比待补。DeepSeek V4 Pro 以 54.2 分 / $0.48 拿下全场最高性价比,断崖领先闭源旗舰。

六、一句话趋势