AI 日报 · 2026-08-30(周日)

聚焦方向:AI Coding(AI 编程)× 具身智能

生成时间:2026-08-30 07:30 (GMT+8)

今日结论速览:DeepSeek 今日有 D ✅(V3.2 正式版把"思考"融进工具调用 + V4-Pro 正式版 + 二轮融资落地);AI Coding 侧最大变量是 OpenAI 11/12 对 Cursor 断供Codex 额度机制大修回血 10%–50%;具身智能侧最大变量是 小鹏机器人 9 亿美元首轮融资(刷新国内单轮纪录)与 上半年赛道融资 934.74 亿元、同比 5 倍

口径说明:每条均标注「时效」与「来源」。时效分 当日近 2 日本周;来源给出可核验主体。字幕类内容标注"字幕由平台自动生成"。


目录

章节内容条目数
社区信源监控(一手线索,快于媒体)3 个信源
DeepSeek 专项 —— 今日有 D ✅6 条
今日 15 条精选(AI Coding 8 + 具身智能 7)15 条
社区快讯(待验证 / 低置信度)6 条
能力评分与价格表(三口径交叉验证)3 张表 + 性价比
GitHub 当日趋势榜日榜 + 周榜
AI 社会效益5 条
AI 经济效益6 条
方法论与免责声明

一、社区信源监控(今日一手线索,快于媒体)

本节来自三个长期跟踪的社区信源。社区口播往往比媒体稿早 6–24 小时,但置信度低于官方渠道,因此本节只做"线索"用途,凡进入第三章「15 条精选」的内容均已用官方或权威媒体二次核验。

信源状态一览

信源最新内容类型字幕可用性时效
黑鸦HeyaAI 晚报 0829:OpenAI 封杀 Cursor 断供资讯类✅ 已采集 34 行近 2 日
Icyの狼[狼狼快报] Hy4 preview 发布,略胜 K3资讯类标题级近 2 日
无机酸-_-GLM 5.3 Flash 六项测试个人评测作品⚠️ 未开启字幕近 2 日

1.1 黑鸦Heya —— AI 晚报 0829(资讯类,字幕由平台自动生成)

从口播正文里提取到的七条实质信息(已做同音字校正,例如 "cloud" → Claude、"codex" 保留原名):

  1. OpenAI 宣布计划于 11 月 12 日终止向 Cursor 提供模型——这是本轮 AI Coding 生态最大的结构性变化。
  2. 触发原因是"控制权变更"条款:Cursor 被收购后,双方合同中的控制权变更条款被激活,OpenAI 据此认定无法确信对方继续遵守服务条款。
  3. OpenAI 模型仅占 Cursor 约 5% 的用户流量——这是 Cursor 方面的口径,意在说明冲击可控。
  4. Anthropic 联合创始人表态将继续增加 Claude 在 Cursor 中的算力支持——竞对趁势加注,生态站位清晰。
  5. Codex 负责人 Tibo 发出 "hold on to your codex" 的暗示,随后即出现额度重置动作(已由官方推文侧证,见 3.2)。
  6. 可通过 CLI proxy API 在 Cursor 中继续使用 Codex 订阅——社区层面的迁移路径,非官方支持方案。
  7. 提到有厂商推出用于"评估和改进其他 Skill"的 Skill——反映 Agent Skill 生态开始出现"元工具"层。

来源:B 站 UP 主「黑鸦Heya」AI 晚报 0829(BV1ZV4y6xE75),字幕由平台自动生成,本节为要点摘录与同音字校正后的转述。

时效:近 2 日。置信度🟡 大概率属实(第 1、2、3、5 条已由官方/权威媒体交叉验证,见第三章)。

1.2 Icyの狼 —— Hy4 preview 发布,略胜 K3

1.3 无机酸-_- —— GLM 5.3 Flash 六项测试


二、DeepSeek 专项 —— 今日有 D ✅(非"今日无D")

今日 DeepSeek 侧信息密度很高,不适用"今日无D"。共 6 条。

D1 · DeepSeek-V3.2 正式版发布:首个把"思考"融进工具调用的模型

D2 · DeepSeek-V3.2-Speciale:竞赛数学特化版

D3 · DeepSeek-V4-Pro 正式版发布:Agent 能力大幅提升,支持 Responses API 与 Codex 接入

D4 · V4-Pro-0813 在三口径榜单同时进入第一梯队,且价格是同档最低之一

D5 · 二轮融资签约与 IPO 准备

D6 · DSH 开源两周后评价两极分化


三、今日 15 条精选

甲组 · AI Coding(8 条)

1. OpenAI 将于 11 月 12 日终止向 Cursor 供应模型

2. OpenAI 大修 Codex 用量计算机制,同额度实际可用量提升 10%–50%

3. Claude Code v2.1.251:模型切换钩子 + 支出可见性

4. GitHub Copilot 确认 8 月 31 日下线六款模型

5. Cursor 云端 Agent 取消 GitHub 绑定要求,并打通浏览器预览与一键发布

6. 腾讯混元开源 Hy4 preview,押注 Coding Agent

7. 智谱开源 GLM-5.3 权重,AA 智能指数 60 分居开源第一

8. 华为与港中文开源 Lego-RL:不改 harness 即可给 Coding Agent 接强化学习

乙组 · 具身智能(7 条)

9. 小鹏机器人首轮融资超 9 亿美元,投后估值超 63 亿美元,刷新国内纪录

10. Sharpa 累计融资超 45 亿元,估值超 200 亿元;DQ 机器人餐厅零改造落地

11. 上半年国内具身智能融资 934.74 亿元、同比增 5 倍,发改委同步警示"防止盲目跟风"

12. 蚂蚁灵波开源 LingBot-VLA 2.0:一套模型驯服 20 种机器人构型

13. 第二届世界人形机器人运动会收官:天工 Ultra 百米 8 秒 64,智元量产机双榜第一

14. 浙大 TAMP-Nav:视觉大模型只输出像素点指路,宇树 Go2 零样本真机成功率 60%

15. 数据供给侧两个反向信号:训练场超 70 家启用,但北京首个人形机器人数据训练中心停运


四、社区快讯(待验证 / 低置信度)

以下条目来自社区讨论或单一信源,尚未获得官方或多方核验,仅作趋势参考,不建议作为决策依据。

#内容来源类型时效置信度
Q1美国拟出台远程算力出口管制草案,DeepSeek 被列为目标之一媒体报道,草案未定稿本周🔴 待验证
Q2Anthropic 二季度营收约 115 亿美元,反超 OpenAI财经媒体,双方均未正式披露本周🔴 待验证
Q3OpenAI 发布 38 页"蜂群越狱"安全报告社区流传,官方渠道未见完整文本本周🔴 待验证
Q4美国法院裁定五角大楼将 Anthropic 列入黑名单的做法非法媒体报道,判决文书未公开核验本周🔴 待验证
Q5长鑫 LPDDR6 进入量产产业链消息本周🟡 大概率属实
Q6Kimi 冲刺港股 IPO财经媒体本周🟡 大概率属实

另有若干社区口播提到"某厂商推出用于评估和改进其他 Skill 的 Skill"(见 1.1 第 7 条),指向 Agent Skill 生态的"元工具"层开始形成,但具体产品与厂商未获核验,暂不单列。


五、截至今日 AI 多项能力评分表(三口径交叉验证)

三个口径的方法论差异很大,不可直接横向比较分值,只能各自看排序:

5.1 口径 A · LiveBench 聚合榜(Top 20 / 共 49 款,本地计算)

#模型综合推理编程Agent编程数学数据分析语言指令跟随
1claude-fable-5-max83.091.286.062.295.681.489.075.8
2gpt-5.6-sol-max81.092.883.956.294.977.889.571.8
3claude-opus-5-max80.389.981.465.295.379.487.063.8
4gpt-5.5-xhigh80.291.182.154.094.881.387.070.7
5smaug-agentic79.983.982.564.694.677.185.571.0
6kimi-k379.684.481.462.294.676.886.371.4
7gemini-3.7-flash-high79.583.378.958.395.377.883.279.9
8qwen3.8-max78.286.872.964.694.778.076.574.1
9grok-4.678.287.576.857.095.175.883.571.9
10gpt-5.4-xhigh77.988.677.553.894.577.983.070.2
11muse-spark-1.2-xhigh77.788.977.557.691.373.680.974.3
12gpt-5.6-terra-max77.790.978.254.994.978.881.364.6
13gemini-3.1-pro-preview77.583.276.544.195.477.587.179.1
14deepseek-v4-pro-081377.487.977.254.995.476.582.167.7
15claude-opus-4-8-max76.983.181.850.596.174.480.572.0
16deepseek-v4-flash-vision-exp76.784.668.265.191.777.578.571.0
17glm-5.376.680.879.060.994.274.177.869.3
18qwen3.8-flash-next76.480.772.661.694.875.073.077.1
19claude-opus-4-7-xhigh76.387.082.150.795.875.176.966.7
20grok-4.576.283.768.656.595.175.982.271.5

编程类单项拔尖(不看总分)claude-fable-5-max 编程 86.0 为全场最高;gpt-5.6-luna-maxgpt-5.2-codex 编程分分别为 82.9 / 83.6,但总分被指令跟随拖到 32、29 位——编程专精模型在综合榜上会显得吃亏,选型时应看单项。

Agent 编程是全场最弱环节:49 款模型里最高仅 claude-opus-5-max 的 65.2,中位数约 54,grok-4.3 低至 18.5。这一列的绝对水平远低于其他六类,说明多语言 Agent 化编程仍是明确的能力洼地

展开:GLM-5.3-Flash / 开源模型在 LiveBench 的位置
#模型综合编程Agent编程备注
14deepseek-v4-pro-081377.477.254.9开源最高
17glm-5.376.679.060.9今日开源权重
18qwen3.8-flash-next76.472.661.6开源
23qwen3.8-27b75.575.761.4开源小尺寸
36glm-5.3-flash72.379.056.8编程 79.0 与 GLM-5.3 持平,价格仅 $0.19
37deepseek-v4-pro72.070.042.6前代
40kimi-k2.7-code69.974.045.7编程特化

关键发现glm-5.3-flash编程分 79.0 与旗舰 glm-5.3 完全持平,总分差距主要来自指令跟随(52.8 vs 69.3)与推理。若任务是纯编程且 prompt 结构稳定,Flash 版是极高性价比的选择。

5.2 口径 B · Artificial Analysis 智能指数(Top 24 / 共 250+ 款)

#模型厂商智能指数吞吐(t/s)首字延迟(s)每任务成本
1Claude Opus 5 (max)Anthropic635659.51$2.34
1Claude Opus 5 (xhigh)Anthropic635426.68$1.80
3Claude Fable 5Anthropic626292.73$3.14
4Claude Opus 5 (high)Anthropic615420.31$1.23
4GPT-5.6 Sol (max)OpenAI6175153.94$0.95
4Grok 4.6 (high)SpaceXAI615942.59$0.94
7Grok 4.6 (xhigh)SpaceXAI605839.75$1.23
7Kimi K3 (max)Kimi60394.03$0.84
7GLM-5.3 (max)Z AI60671.63$0.68
10GPT-5.6 Sol (xhigh)OpenAI597952.39$0.63
10Grok 4.6 (medium)SpaceXAI595933.90$0.78
10Claude Opus 5 (medium)Anthropic59524.19$0.72
13Qwen3.8 MaxAlibaba58252.57$0.91
13Qwen3.8 2.4T A95BAlibaba58282.54$0.81
15GLM-5.3-FlashZ AI57491.50$0.09
15GPT-5.6 Sol (high)OpenAI577320.01$0.43
15Muse Spark 1.2 (xhigh)Meta57$0.40
15GPT-5.6 Terra (max)OpenAI57110143.38$0.53
19Gemini 3.7 Flash (high)Google563309.35$0.40
19Qwen3.8-Flash-NextAlibaba56802.79$0.10
19Grok 4.5 (high)SpaceXAI565314.51$0.43
23Claude Sonnet 5 (max)Anthropic5586207.94$1.72
24DeepSeek V4 Pro 0813 (max)DeepSeek53721.62$0.27
24Gemini 3.7 Flash (medium)Google533324.71$0.26

三个值得注意的读数

  1. GLM-5.3 以 60 分并列第 7,是开源模型最高位,且首字延迟仅 1.63 秒——在同档模型里延迟优势巨大(Claude Opus 5 max 为 59.51 秒,GPT-5.6 Sol max 为 153.94 秒)。
  2. GLM-5.3-Flash 57 分 / 每任务 $0.09,与 GPT-5.6 Sol (high) 同分但成本约为其 1/5。
  3. 国产模型延迟集体占优:GLM 系 1.5–1.6 秒、DeepSeek 系 1.28–1.65 秒、Qwen 系 2.5–2.8 秒,而 Claude / GPT 顶配档普遍在数十秒到 200 秒量级(高 effort 档位的思考开销)。交互式编程场景延迟权重远高于分数,这一列不该被忽略。

5.3 口径 C · llm-stats 综合分 + 混合价(Top 15 / 共 362 款)

#模型综合分混合价/M吞吐开源标记
1GPT-5.6 Sol57.2$7.7890 c/s
2Claude Opus 556.2$7.2266 c/s
3Claude Mythos Preview55.9未发布
4Claude Fable 555.9$14.44107 c/s最贵
5Kimi K354.7$4.3380 c/s
6GLM-5.354.2$1.73
7DeepSeek-V4-Pro-081354.1$0.48144 c/s吞吐最高
8Qwen3.8 Max53.0$2.02
9GPT-5.6 Terra52.6$3.11
10Claude Opus 4.851.7
11GLM-5.3-Flash51.6$0.19NEW
12Muse Spark 1.151.0$1.58
13Gemini 3.7 Flash50.9$1.08136 c/s
14Qwen3.8-Flash-Next50.5NEW
15Claude Sonnet 549.3$2.89

前 15 名中开源模型占 5 席(Kimi K3、GLM-5.3、DeepSeek-V4-Pro-0813、GLM-5.3-Flash、Qwen3.8-Flash-Next),且这 5 席全部由中国团队贡献

5.4 性价比表(Price vs Performance)

计算方式:LiveBench 聚合总分 ÷ llm-stats 混合价($/M token)。数值越高越划算;末列为归一化占比(以榜首为 100%)。

GLM-5.3-Flash
380.5
72.3 / $0.19
DeepSeek-V4-Pro-0813
161.3
77.4 / $0.48
Gemini 3.7 Flash
73.6
79.5 / $1.08
Muse Spark 1.1
47.7
75.4 / $1.58
GLM-5.3
44.3
76.6 / $1.73
Qwen3.8 Max
38.7
78.2 / $2.02
Claude Sonnet 5
26.3
75.9 / $2.89
GPT-5.6 Terra
25.0
77.7 / $3.11
Kimi K3
18.4
79.6 / $4.33
Claude Opus 5
11.1
80.3 / $7.22
GPT-5.6 Sol
10.4
81.0 / $7.78
Claude Fable 5
5.7
83.0 / $14.44

结论


六、GitHub 当日趋势榜(开源生态风向标)

6.1 日榜要点(2026-08-30)

位次项目Star 量级方向
#3openclaw388kAgent 运行时
#5obra/superpowers279kAI Skill 生态
#8affaan-m/ECC244kAgent harness
#9NousResearch/hermes-agent238kAgent 框架
#11n8n工作流自动化
#12anomalyco/opencode202k编程 Agent

6.2 周榜要点

位次项目方向
#4openclawAgent 运行时
#8obra/superpowersAI Skill 生态

6.3 解读

日榜前 12 位里有 5 个是 Agent 基础设施项目(openclaw、ECC、hermes-agent、opencode,加上 Skill 生态的 superpowers),这个密度是近期最高的。三点观察:

  1. 热度重心从"模型"转向"跑模型的壳"。榜单上没有模型仓库占据高位,占位的全是 harness、运行时、Skill 管理这类中间层——这与第三章第 8 条(Lego-RL 解耦 harness 与 RL 训练)指向同一件事:Agent 执行层正在标准化,成为独立的竞争战场
  2. Skill 生态出现"元工具"层。obra/superpowers 以 279k star 稳居日榜第 5、周榜第 8,配合社区口播提到的"用于评估和改进其他 Skill 的 Skill",说明 Skill 已经多到需要工具来治理 Skill 本身。
  3. openclaw 日榜 #3 / 周榜 #4,是唯一双榜高位项目,388k star 量级,热度具备持续性而非单日脉冲。

来源:GitHub Search API 实时抓取(日榜 / 周榜双周期)。时效:当日。置信度✅ 已确认(Star 量级为抓取时快照,随时变动)。


八、AI 社会效益(对社会运行与公共福祉的影响)

8.1 具身智能进入消费补贴目录:江苏首次将机器人纳入以旧换新

8 月 28 日江苏省发改委、财政厅、商务厅联合发布通告,具身智能机器人(含人形机器人、外骨骼助力机器人、机器狗)首次被纳入消费品以旧换新补贴范围,补贴品类从原有智能家居扩展为十大类智能产品。消费者在享受商家优惠后,政府按最终销售价格 15% 给予补贴,每人每细分品类可补 1 件,每件不超过 1500 元。政策自 8 月 29 日实施至 2026 年 12 月 31 日,限额管理、用完即止;新增商品须有统一国标 13 位商品编码。

意义:这是具身智能第一次以"消费品"身份进入公共财政补贴目录,标志其从产业投资标的转向家庭可购商品。江苏是全国首个推出地方自主品类补贴的省份,示范效应值得跟踪。

来源:江苏省三部门联合通告 / 新华日报。时效:当日生效。置信度✅ 已确认

8.2 养老照护成为具身智能最明确的社会需求出口

2026 数博会上,上海理工大学机器智能研究院执行院长、卓益得机器人创始人李清都表示,研发仿生机器人的初衷就是聚焦"近人服务"、重点做好养老照护,并给出务实路径:养老机器人可先切入下棋、健康监测等高成功率场景来释放护工精力,而非一上来就做全流程照护。他同时提出机器人进家庭必须守好三道安全关——物理防伤人、信息防泄露、AI 触觉防损,并强调关键是建立人与机器人之间的信任关系而非急于追求销量。

意义:把"高成功率场景优先"和"三道安全关"讲清楚,比宣传参数更有公共价值。老龄化是具身智能最刚性的社会需求,但也是容错率最低的场景。

来源:2026 中国国际大数据产业博览会 / 澳门日报(中新社)。时效:当日。置信度✅ 已确认

8.3 情感陪伴机器人进入家庭引发伦理关注,监管已划定红线

优必选情感陪伴机器人已售出 1.3 万台并走进家庭,引发伦理担忧。网信办等五部门出台《人工智能拟人化互动服务管理暂行办法》划定红线,企业正参与伦理标准制定;违规出海欧盟最高可罚 3500 万欧元。律师建议企业做好内部审查与隐私数据本地化。

意义:拟人化交互是 AI 与社会摩擦最直接的界面。监管在装机量刚过万台时就介入,节奏上快于多数技术周期。

来源:网信办等五部门规章 / 行业报道。时效:本周。置信度🟡 大概率属实(办法已出台,罚则口径为报道引述)。

8.4 高危场景替代人工,是具身智能当下最扎实的社会价值

数博会现场展示的场景很具代表性:南方电网机器狗负重 200 公斤、爬坡 60 度,替代人工进入高危复杂环境作业;四足巡检机器人自主上下楼梯、穿越障碍;具身智能白酒检测机器人数秒完成基酒液位高精度计量。此外云深处、宇树等企业的四足与轮腿机器人已参与灾害侦察与物资投送,应急管理部出台指导意见并设立 6 个攻关方向——但受限于环境适应性、硬件短板与高成本,尚未大规模普及,距离像无人机一样成为救灾标配还需完善标准与生态。

意义:相比家庭陪伴,高危环境替代的社会效益更明确、伦理争议更小、付费方更清晰。这是当前最不需要讲故事的落地方向。

来源:2026 数博会 / 应急管理部指导意见 / 澳门日报。时效:当日 + 本周。置信度✅ 已确认

8.5 训练数据合规指引发布,为数据供给立规

《人工智能训练数据合规使用指引》发布,为训练数据的来源、授权与使用边界提供操作依据。结合第三章第 15 条提到的"实验室遥操转真实场景遥操"趋势——真实场景采集会大量涉及第一视角行为数据与场所信息,合规框架的及时到位直接决定这条数据路线能不能走通

来源:相关主管部门发布。时效:本周。置信度🟡 大概率属实(指引已发布,细则适用范围待实践检验)。


九、AI 经济效益(产业价值与资本动向)

9.1 具身智能上半年融资 934.74 亿元,同比 5 倍,但资本已开始挤泡沫

正面数据:2026 上半年国内具身智能融资 934.74 亿元(同比 +5 倍),融资事件 322 笔(同比 +137%);7 月工业机器人产量增长 30.2%;全球人形机器人上半年出货 2.2 万台,智元以 9700 台居首。

反向信号:受限于泛化能力不足与量产成本,宇树等头部企业股价回落,行业正从概念炒作转向真实场景落地——资本市场正在挤出泡沫,企业得先搞定专用场景再谈通用。

判断:融资额与出货量同步高增,说明这一轮不是纯故事驱动;但股价回落与发改委警示同时出现,意味着估值已经跑在交付能力前面。观察指标应从"融了多少"转向"单台交付成本与真实场景成功率"。

来源:IT 桔子 / 行业出货统计 / 深圳特区报。时效:本周。置信度✅ 已确认

9.2 机器人企业"一边融资一边投资",抢的是"数据喂模型、模型控本体"闭环

机器人主机厂亲自下场投资已成行业普遍现象,数据与模型是重点投资赛道。智元已投资至少 10 家具身智能产业链企业,覆盖核心零部件、具身全模态世界模型、场景化解决方案。深圳的乐聚、众擎、智平方均在加速对外投资——乐聚投了人形机器人基础模型公司德塔智能、具身智能模型研发商旋玑智能,以及灵巧手、关节等核心部件企业,加上物流、商服场景伙伴。乐聚助理副总裁曹雨的表述很直接:采用"自研+投资+合作"模式,投模型公司"核心是想把'大脑'和'身体'真正捏在一起",目标是搭建从芯片到模型再到行业落地的闭环生态。

判断:专家观点是谁先建成"数据喂模型、模型控本体"的生态闭环,谁就在未来的成本战和溢价战中掌握定价权。成长期企业就开始产业链整合,反映的是竞争烈度而非财力充裕。

来源:深圳特区报 / 企业公开表态。时效:本周。置信度✅ 已确认

9.3 车企集体跨界:小鹏领跑,比亚迪、奇瑞、蔚来、零跑跟进

小鹏机器人 9 亿美元首轮融资、63 亿美元估值领跑;奇瑞旗下机器人业务 AiMOGA 据报道正在准备 IPO比亚迪已发布人形机器人"小迪";长安、广汽、理想、上汽、赛力斯均在探索人形机器人;蔚来投资具身智能公司,零跑确认布局机器人业务。逻辑很清楚——汽车行业利润率日益收窄,制造能力、供应链与自动驾驶技术栈可直接复用到人形机器人。

判断:车企的优势是硬件与规模化量产,短板是 AI 侧。小鹏用 3 颗自研图灵芯片 + 端侧基座模型的路线,是目前车企阵营里对 AI 侧押注最重的一家。

来源:小鹏公告 / 多家外媒 / 融中财经。时效:近 2 日。置信度✅ 已确认(小鹏、Sharpa 数据)/🟡(奇瑞 IPO 准备为报道口径)。

9.4 密集融资与上市窗口:外骨骼、家庭机器人、灵巧手、谐波减速器全线推进

9.5 AI Coding 侧:模型供货关系成为商业变量,成本效率被重新定价

两件事叠加看很有意思:OpenAI 断供 Cursor(11/12 生效)说明模型供货已从纯商业采购变成带控制权条款的战略关系;而 Codex 修复 8 类额度虚耗 bug 后同额度可用量提升 10%–50%,说明此前用户为 Agent 的工程缺陷买了单——个别案例中单个 bug 就吃掉每周额度的 15%–70%。同时 GitHub Copilot 8 月 31 日下线 6 款模型,进一步收敛可选模型池。

判断:AI Coding 的成本结构正在被重新定价。对企业采购方,"能力/价格"之外要加两个维度:供货关系稳定性(会不会被断供)与 token 效率(同样额度实际能干多少活)。第五章的性价比表只回答了第一个维度。

来源:OpenAI 公告 / Codex 官方推文 / GitHub Changelog。时效:当日 + 近 2 日。置信度✅ 已确认

9.6 开源模型正在改变编程模型的成本曲线

llm-stats 前 15 名中开源占 5 席且全部来自中国团队;GLM-5.3 在 AA 口径以 60 分并列第 7、开源第一;GLM-5.3-Flash 以 Opus 4.8 约 1/40 的定价跑通十万张国产芯片集群,性价比是本期榜首(380.5,第 2 名的 2.4 倍)。DeepSeek-V4-Pro-0813 以 $0.48/M 的价格给到 LiveBench 77.4 分与 144 c/s 的全场最高吞吐。

判断能力差 13%、价格差 76 倍这个结构(见 5.4)意味着大量编程工作负载的经济最优解已经不在闭源旗舰。闭源溢价的合理性正在收缩到"长程复杂 Agent 任务"这一个狭窄区间——而这恰好是 LiveBench Agent 编程列全场最弱(中位数约 54)的能力洼地。

来源:livebench.ai / artificialanalysis.ai / llm-stats.com / 智谱官方。时效:当日。置信度✅ 已确认(榜单数据)/🟡("1/40 定价""十万张集群"为厂商口径)。


十、方法论与免责声明

10.1 信源分层与置信度标记

标记含义判定标准
✅ 已确认官方渠道发布,或 ≥2 个独立权威来源一致可作为决策依据
🟡 大概率属实单一权威来源,或官方事实明确但细节为媒体口径需自行核验细节
🔴 待验证社区流传 / 单一非权威来源 / 文书未公开仅作趋势参考

社区信源(第一章)用于抢时间,其内容凡进入第三章「15 条精选」的,均已用官方或权威媒体二次核验;未能核验的降级至第四章「社区快讯」。

10.2 B 站字幕采集口径

10.3 评分表口径与本地计算说明

10.4 覆盖范围与已知缺口

10.5 免责声明


AI 日报 · 2026-08-30 · 聚焦 AI Coding × 具身智能 · 共 15 条精选 + 6 条 DeepSeek 专项 + 6 条社区快讯