AI 日报 · 2026-08-31(周一)

聚焦方向:AI Coding(AI 编程)× 具身智能

生成时间:2026-08-31 07:30 (GMT+8)

今日结论速览:DeepSeek 今日有 D ✅(DSH 开源登 GitHub 日榜 #11、V4-Flash 多模态版上线 Gateway、乌兰察布建 1 吉瓦数据中心);AI Coding 侧最大变量是 OpenAI 新模型 Astra 内测曝光(社区信源交叉印证)与 8/31「模型与价格大日」(Sonnet 5 重定价 + GPT-5.4/Kimi K2.5 退役 + Copilot 下线 6 款);具身智能侧最大变量是 优必选半年报营收 12.69 亿、人形机器人销量 921 台宇树上市 4 天市值蒸发约 2000 亿被 Figure 反超

口径说明:每条均标注「时效」与「来源」。时效分 当日近 2 日本周;来源给出可核验主体。字幕类内容标注"字幕由平台自动生成"。

实时数据源:① 多引擎新闻检索 + Exa(中英文媒体/社区);② GitHub Search API(日榜/周榜双周期);③ livebench.ai 原始 CSV(本地聚合七类)、artificialanalysis.ai(Intelligence Index v4.1.1)、llm-stats.com(实时价/吞吐);④ B 站 UP 主字幕口径:黑鸦Heya(1 个视频 / 15 行)、Icyの狼(24h 无新视频)、无机酸-_-(24h 更新但为个人作品未开字幕)。


目录

章节内容条目数
社区信源监控(一手线索,快于媒体)3 个信源
DeepSeek 专项 —— 今日有 D ✅6 条
今日 15 条精选(AI Coding 8 + 具身智能 7)15 条
社区快讯(待验证 / 低置信度)6 条
能力评分与价格表(三口径交叉验证)3 张表 + 性价比
GitHub 当日趋势榜日榜 + 周榜
AI 社会效益6 条
AI 经济效益6 条
方法论与免责声明

一、社区信源监控(今日一手线索,快于媒体)

本节来自三个长期跟踪的社区信源。社区口播往往比媒体稿早 6–24 小时,但置信度低于官方渠道,因此本节只做"线索"用途,凡进入第三章「15 条精选」的内容均已用官方或权威媒体二次核验。

信源状态一览(含字幕提炼要点)

信源最新内容类型字幕字幕提炼要点时效
黑鸦HeyaAI 晚报 0830(BV1A8tH6gEd5)资讯类✅ 已采集 15 行ASTRA 早期访问机制、内部检查点生成像素城堡/网页前端、官方零确认+发布窗口当日(约 12h 前)
Icyの狼24h 内无新视频(最新至 08-28)✖ 无更新当日
无机酸-_-24h 有更新但均为个人评测作品个人作品✖ 未开启字幕当日

1.1 黑鸦Heya —— AI 晚报 0830(资讯类,字幕由平台自动生成)

从口播正文里提取到的实质信息(已做同音字校正,例如 "deep sick" → DeepSeek、"cloud" → Claude、"open route" → OpenRouter),其中标题层看不到的增量(字幕提炼要点)包括:

  1. ASTRA 早期访问机制:开发者实测 Max 模式下零样本一次生成 3D 等距地图与交互网页,核心突破为端到端多智能体编排、超长程任务保持、持久化推理与即时自我纠错。
  2. 内部检查点生成像素城堡 / 网页前端:口播提到模型可在生成过程中反复验证并保持设计语言一致,说明其"自我纠错"已落到产物层面。
  3. 官方零确认 + 发布窗口:社区口径指向 9 月初(约 9/3)前后正式发布,与同期升级的 Fable 5.1 正面竞争;该窗口为媒体推测,官方尚未官宣。
  4. OpenAI 终止向 Cursor 供模细节:SpaceX 以 600 亿美元收购 Cursor 母公司交割完成后,15 天触发"控制权变更"条款,新模型(含 Astra)不再提供,缓冲期后开发者只能自带 API Key。
  5. Anthropic 曾对拟被 OpenAI 收购的 Windsurf 限流:底层模型 API 中立性正被上下游竞争关系取代。

来源:B 站 UP 主「黑鸦Heya」AI 晚报 0830(BV1A8tH6gEd5),字幕由平台自动生成,本节为要点摘录与同音字校正后的转述。

时效:当日(约 12h 前)。置信度🟡 大概率属实(ASTRA 发布窗口与早期访问机制为口播线索,已由腾讯研究院 8/31 AI 速递同步披露;控制权变更条款已由官方/权威媒体交叉验证,见第三章)。

1.2 Icyの狼 —— 24h 内无新视频

1.3 无机酸-_- —— 24h 有更新但为个人评测作品,未开字幕

社区交叉验证:黑鸦Heya 字幕补足了媒体尚未完全覆盖的增量——ASTRA 的"早期访问机制"与"检查点生成像素城堡/网页前端"这类产物级细节,以及"官方零确认 + 9 月初发布窗口"的时间线索,已被腾讯研究院 8/31 AI 速递在第三章第 1 条同步印证,构成「社区先报 + 媒体后证」的典型闭环。


二、DeepSeek 专项 —— 今日有 D ✅(非"今日无D")

过去 24 小时(8/30–8/31)DeepSeek 侧信息密度高,不适用"今日无D"。共 6 条,其中 8/30 的多条动态(乌兰察布数据中心、足球赛事预测、涨价后评测、新规)距生成时点不足 24 小时,且 DSH 开源仍在 GitHub 持续冲榜。

D1 · DeepSeek-Harness(DSH)开源:"一切皆插件"的 Agent 范式,登 GitHub 日榜 #11

D2 · DeepSeek V4-Flash 多模态(视觉)版本上线 LLM Gateway 聚合器

D3 · DeepSeek 赴乌兰察布建 1 吉瓦级 AI 数据中心

D4 · DeepSeek 云端涨价后实战效果仍优于 Qwen 27B

D5 · 6 月获 500 亿融资 + 足球赛事预测应用露出

D6 · 国内新规针对 DeepSeek 等 AI 企业,监管走势引关注


三、今日 15 条精选

甲组 · AI Coding(8 条)

1. OpenAI 新模型 Astra 内测曝光:零样本生成 3D 地图与交互网页

2. OpenAI 终止向 Cursor 供应模型,11/12 起生效(SpaceX 收购交割触发)

3. Claude Code 桌面端打通终端会话:/resume 跨端续接 + /rewind 回退

4. 大厂 Agent 组织变阵:Agent 站上 C 位

5. OpenRouter 被 Stripe 以 75 亿美元收购:模型中立路由成战略资产

6. 阿里 Qwen3.8-Flash 把 API 压至 1 元/百万 Token

7. 8 月 31 日"模型与价格大日":Sonnet 5 重定价 + GPT-5.4/Kimi K2.5 退役 + Copilot 下线 6 款

8. 蚂蚁 Agentar 生态版:把服务"Skill 化"

乙组 · 具身智能(7 条)

9. 小鹏机器人首轮融资超 9 亿美元,63 亿美元估值,刷新国内纪录

10. 优必选 2026 上半年营收 12.69 亿,人形机器人销量 921 台

11. 宇树上市 4 天市值蒸发约 2000 亿,被 Figure 反超

12. Figure 推出 Index 数据集(1600 万段视频),预告消费级 Home Robot

13. 智元携手长隆打造全球首个具身智能主题乐园,出货 9700 台登顶全球

14. Anthropic Model Hardware Standard:让 AI 操控实体设备

15. 灵巧手价格战:均价从 5 万降至万元以内,触觉成量产标配


四、社区快讯(待验证 / 低置信度)

以下条目来自社区讨论或单一信源,尚未获得官方或多方核验,仅作趋势参考,不建议作为决策依据。

#内容来源类型时效置信度
Q1OpenAI Astra 发布窗口约 9/3 为媒体推测,官方未官宣,具体能力以正式发布为准媒体披露 + 社区口播,官方未确认当日🔴 待验证
Q2美国拟出台远程算力出口管制草案,DeepSeek 被列为目标之一媒体报道,草案未定稿本周🔴 待验证
Q3Anthropic 二季度营收约 115 亿美元,反超 OpenAI财经媒体,双方均未正式披露本周🔴 待验证
Q4Kimi 冲刺港股 IPO财经媒体本周🟡 大概率属实
Q5长鑫 LPDDR6 进入量产产业链消息本周🟡 大概率属实
Q61X Technologies 洽谈新一轮融资,估值目标约 100 亿美元(海外传闻)海外行业媒体,以官方确认为准本周🔴 待验证

另有社区口播提到"某厂商推出用于评估和改进其他 Skill 的 Skill"(见 1.1 第 5 条),指向 Agent Skill 生态的"元工具"层开始形成,但具体产品与厂商未获核验,暂不单列。


五、截至今日 AI 多项能力评分表(三口径交叉验证)

三个口径的方法论差异很大,不可直接横向比较分值,只能各自看排序:

5.1 口径 A · LiveBench 聚合榜(Top 20 / 共 49 款,本地计算)

#模型综合推理编程Agent编程数学数据分析语言指令跟随
1claude-fable-5-max83.091.286.062.295.681.489.075.8
2gpt-5.6-sol-max81.092.883.956.294.977.889.571.8
3claude-opus-5-max80.389.981.465.295.379.487.063.8
4gpt-5.5-xhigh80.291.182.154.094.881.387.070.7
5smaug-agentic79.983.982.564.694.677.185.571.0
6kimi-k379.684.481.462.294.676.886.371.4
7gemini-3.7-flash-high79.583.378.958.395.377.883.279.9
8qwen3.8-max78.286.872.964.694.778.076.574.1
9grok-4.678.287.576.857.095.175.883.571.9
10gpt-5.4-xhigh77.988.677.553.894.577.983.070.2
11muse-spark-1.2-xhigh77.788.977.557.691.373.680.974.3
12gpt-5.6-terra-max77.790.978.254.994.978.881.364.6
13gemini-3.1-pro-preview77.583.276.544.195.477.587.179.1
14deepseek-v4-pro-081377.487.977.254.995.476.582.167.7
15claude-opus-4-8-max76.983.181.850.596.174.480.572.0
16deepseek-v4-flash-vision-exp76.784.668.265.191.777.578.571.0
17glm-5.376.680.879.060.994.274.177.869.3
18qwen3.8-flash-next76.480.772.661.694.875.073.077.1
19claude-opus-4-7-xhigh76.387.082.150.795.875.176.966.7
20grok-4.576.283.768.656.595.175.982.271.5

编程类单项拔尖(不看总分)claude-fable-5-max 编程 86.0 为全场最高;gpt-5.6-luna-maxgpt-5.2-codex 编程分分别为 82.9 / 83.6,但总分被指令跟随拖到 32、29 位——编程专精模型在综合榜上会显得吃亏,选型时应看单项。

Agent 编程是全场最弱环节:49 款模型里最高仅 claude-opus-5-max 的 65.2,中位数约 54,grok-4.3 低至 18.5。这一列的绝对水平远低于其他六类,说明多语言 Agent 化编程仍是明确的能力洼地。值得注意:deepseek-v4-flash-vision-exp(#16)的 Agent 编程达 65.1,是多模态模型中罕见的 Agent 编程高分,呼应第二章 D2 的"多模态 + Agent"路线。

展开:GLM-5.3-Flash / 开源模型在 LiveBench 的位置
#模型综合编程Agent编程备注
14deepseek-v4-pro-081377.477.254.9开源最高
17glm-5.376.679.060.9开源第一梯队
18qwen3.8-flash-next76.472.661.6开源
23qwen3.8-27b75.575.761.4开源小尺寸
36glm-5.3-flash72.379.056.8编程 79.0 与 GLM-5.3 持平,价格仅 $0.19
37deepseek-v4-pro72.070.042.6前代
40kimi-k2.7-code69.974.045.7编程特化

关键发现glm-5.3-flash编程分 79.0 与旗舰 glm-5.3 完全持平,总分差距主要来自指令跟随(52.8 vs 69.3)与推理。若任务是纯编程且 prompt 结构稳定,Flash 版是极高性价比的选择。

5.2 口径 B · Artificial Analysis 智能指数(Top 24 / 共 250+ 款)

#模型厂商智能指数吞吐(t/s)首字延迟(s)每任务成本
1Claude Opus 5 (max)Anthropic635659.51$2.34
1Claude Opus 5 (xhigh)Anthropic635426.68$1.80
3Claude Fable 5Anthropic626292.73$3.14
4Claude Opus 5 (high)Anthropic615420.31$1.23
4GPT-5.6 Sol (max)OpenAI6175153.94$0.95
4Grok 4.6 (high)SpaceXAI615942.59$0.94
7Grok 4.6 (xhigh)SpaceXAI605839.75$1.23
7Kimi K3 (max)Kimi60394.03$0.84
7GLM-5.3 (max)Z AI60671.63$0.68
10GPT-5.6 Sol (xhigh)OpenAI597952.39$0.63
10Grok 4.6 (medium)SpaceXAI595933.90$0.78
10Claude Opus 5 (medium)Anthropic59524.19$0.72
13Qwen3.8 MaxAlibaba58252.57$0.91
13Qwen3.8 2.4T A95BAlibaba58282.54$0.81
15GLM-5.3-FlashZ AI57491.50$0.09
15GPT-5.6 Sol (high)OpenAI577320.01$0.43
15Muse Spark 1.2 (xhigh)Meta57$0.40
15GPT-5.6 Terra (max)OpenAI57110143.38$0.53
19Gemini 3.7 Flash (high)Google563309.35$0.40
19Qwen3.8-Flash-NextAlibaba56802.79$0.10
19Grok 4.5 (high)SpaceXAI565314.51$0.43
23Claude Sonnet 5 (max)Anthropic5586207.94$1.72
24DeepSeek V4 Pro 0813 (max)DeepSeek53721.62$0.27
24Gemini 3.7 Flash (medium)Google533324.71$0.26

三个值得注意的读数

  1. GLM-5.3 以 60 分并列第 7,是开源模型最高位,且首字延迟仅 1.63 秒——在同档模型里延迟优势巨大(Claude Opus 5 max 为 59.51 秒,GPT-5.6 Sol max 为 153.94 秒)。
  2. GLM-5.3-Flash 57 分 / 每任务 $0.09,与 GPT-5.6 Sol (high) 同分但成本约为其 1/5。
  3. 国产模型延迟集体占优:GLM 系 1.5–1.6 秒、DeepSeek 系 1.28–1.65 秒、Qwen 系 2.5–2.8 秒,而 Claude / GPT 顶配档普遍在数十秒到 200 秒量级(高 effort 档位的思考开销)。交互式编程场景延迟权重远高于分数,这一列不该被忽略。

5.3 口径 C · llm-stats 综合分 + 混合价(Top 15 / 共 362 款)

#模型综合分混合价/M吞吐开源标记
1GPT-5.6 Sol57.2$7.7890 c/s
2Claude Opus 556.2$7.2266 c/s
3Claude Mythos Preview55.9未发布
4Claude Fable 555.9$14.44107 c/s最贵
5Kimi K354.7$4.3380 c/s
6GLM-5.354.2$1.7369 c/s
7DeepSeek-V4-Pro-081354.1$0.48124 c/s吞吐最高
8Qwen3.8 Max53.0$2.0263 c/s
9GPT-5.6 Terra52.6$3.11117 c/s
10Claude Opus 4.851.7$7.2257 c/s
11GLM-5.3-Flash51.6$0.19NEW
12Muse Spark 1.151.0$1.58140 c/s
13Gemini 3.7 Flash50.9$1.08158 c/s
14Qwen3.8-Flash-Next50.5NEW
15Claude Sonnet 549.3$2.8980 c/s

前 15 名中开源模型占 5 席(Kimi K3、GLM-5.3、DeepSeek-V4-Pro-0813、GLM-5.3-Flash、Qwen3.8-Flash-Next),且这 5 席全部由中国团队贡献

5.4 性价比表(Price vs Performance)

计算方式:LiveBench 聚合总分 ÷ llm-stats 混合价($/M token)。数值越高越划算;末列为归一化占比(以榜首为 100%)。

GLM-5.3-Flash
380.5
72.3 / $0.19
DeepSeek-V4-Pro-0813
161.3
77.4 / $0.48
Gemini 3.7 Flash
73.6
79.5 / $1.08
Muse Spark 1.1
47.7
75.4 / $1.58
GLM-5.3
44.3
76.6 / $1.73
Qwen3.8 Max
38.7
78.2 / $2.02
Claude Sonnet 5
26.3
75.9 / $2.89
GPT-5.6 Terra
25.0
77.7 / $3.11
Kimi K3
18.4
79.6 / $4.33
Claude Opus 5
11.1
80.3 / $7.22
GPT-5.6 Sol
10.4
81.0 / $7.78
Claude Fable 5
5.7
83.0 / $14.44

结论


六、GitHub 当日趋势榜(开源生态风向标)

6.1 日榜要点(2026-08-31)

位次项目Star 量级方向
#4openclaw388.1kAgent 运行时
#6obra/superpowers279.7kAI Skill 生态
#8affaan-m/ECC244.7kAgent harness
#9NousResearch/hermes-agent238.5kAgent 框架
#11deepseek-ai/deepseek-harness204.7kDeepSeek Agent 框架("Everything is a Plugin")
#13anomalyco/opencode202.6k编程 Agent

6.2 周榜要点

位次项目方向
#4openclawAgent 运行时
#8obra/superpowersAI Skill 生态

6.3 解读

日榜前 15 位里有 6 个是 Agent 基础设施项目(openclaw、ECC、hermes-agent、opencode,加上 Skill 生态的 superpowers,以及本期新晋冲入 #11 的 deepseek-ai/deepseek-harness),这个密度是近期最高的。三点观察:

  1. 热度重心从"模型"转向"跑模型的壳"。榜单上没有模型仓库占据高位,占位的全是 harness、运行时、Skill 管理这类中间层——这与第三章第 8 条(蚂蚁 Agentar 把服务 Skill 化)指向同一件事:Agent 执行层正在标准化,成为独立的竞争战场
  2. Skill 生态出现"元工具"层。obra/superpowers 以 279.7k star 稳居日榜第 6、周榜第 8,配合社区口播提到的"用于评估和改进其他 Skill 的 Skill",说明 Skill 已经多到需要工具来治理 Skill 本身。
  3. deepseek-harness 新晋日榜 #11(204.7k),是本期最大变量之一——DeepSeek 用"一切皆插件"的 Harness 工程化切入 Agent 执行层,与第二章 D1 形成"模型 + Harness = Agent"的闭环叙事;openclaw 日榜 #4 / 周榜 #4,是唯一双榜高位项目,388k star 量级,热度具备持续性。

来源:GitHub Search API 实时抓取(日榜 / 周榜双周期,2026-08-31)。时效:当日。置信度✅ 已确认(Star 量级为抓取时快照,随时变动)。


八、AI 社会效益(对社会运行与公共福祉的影响)

8.1 具身智能进入消费补贴目录:江苏首次将机器人纳入以旧换新

8 月 28 日江苏省发改委、财政厅、商务厅联合发布通告,具身智能机器人(含人形机器人、外骨骼助力机器人、机器狗)首次被纳入消费品以旧换新补贴范围,补贴品类从原有智能家居扩展为十大类智能产品。消费者在享受商家优惠后,政府按最终销售价格 15% 给予补贴,每人每细分品类可补 1 件,每件不超过 1500 元。政策自 8 月 29 日实施至 2026 年 12 月 31 日,限额管理、用完即止;新增商品须有统一国标 13 位商品编码。

意义:这是具身智能第一次以"消费品"身份进入公共财政补贴目录,标志其从产业投资标的转向家庭可购商品。江苏是全国首个推出地方自主品类补贴的省份,示范效应值得跟踪。

来源:江苏省三部门联合通告 / 新华日报。时效:本周(8/29 生效)。置信度✅ 已确认

8.2 养老照护成为具身智能最明确的社会需求出口

2026 数博会上,上海理工大学机器智能研究院执行院长、卓益得机器人创始人李清都表示,研发仿生机器人的初衷就是聚焦"近人服务"、重点做好养老照护,并给出务实路径:养老机器人可先切入下棋、健康监测等高成功率场景来释放护工精力,而非一上来就做全流程照护。他同时提出机器人进家庭必须守好三道安全关——物理防伤人、信息防泄露、AI 触觉防损,并强调关键是建立人与机器人之间的信任关系而非急于追求销量。

意义:把"高成功率场景优先"和"三道安全关"讲清楚,比宣传参数更有公共价值。老龄化是具身智能最刚性的社会需求,但也是容错率最低的场景。

来源:2026 中国国际大数据产业博览会 / 澳门日报(中新社)。时效:本周。置信度✅ 已确认

8.3 情感陪伴机器人进入家庭引发伦理关注,监管已划定红线

优必选情感陪伴机器人已售出 1.3 万台并走进家庭,引发伦理担忧。网信办等五部门出台《人工智能拟人化互动服务管理暂行办法》划定红线,企业正参与伦理标准制定;违规出海欧盟最高可罚 3500 万欧元。律师建议企业做好内部审查与隐私数据本地化。

意义:拟人化交互是 AI 与社会摩擦最直接的界面。监管在装机量刚过万台时就介入,节奏上快于多数技术周期。

来源:网信办等五部门规章 / 行业报道。时效:本周。置信度🟡 大概率属实(办法已出台,罚则口径为报道引述)。

8.4 高危场景替代人工,是具身智能当下最扎实的社会价值

数博会现场展示的场景很具代表性:南方电网机器狗负重 200 公斤、爬坡 60 度,替代人工进入高危复杂环境作业;四足巡检机器人自主上下楼梯、穿越障碍;具身智能白酒检测机器人数秒完成基酒液位高精度计量。此外云深处、宇树等企业的四足与轮腿机器人已参与灾害侦察与物资投送,应急管理部出台指导意见并设立 6 个攻关方向——但受限于环境适应性、硬件短板与高成本,尚未大规模普及,距离像无人机一样成为救灾标配还需完善标准与生态。

意义:相比家庭陪伴,高危环境替代的社会效益更明确、伦理争议更小、付费方更清晰。这是当前最不需要讲故事的落地方向。

来源:2026 数博会 / 应急管理部指导意见 / 澳门日报。时效:本周。置信度✅ 已确认

8.5 训练数据合规指引发布,为数据供给立规

《人工智能训练数据合规使用指引》发布,为训练数据的来源、授权与使用边界提供操作依据。结合第三章第 15 条提到的"实验室遥操转真实场景遥操"趋势——真实场景采集会大量涉及第一视角行为数据与场所信息,合规框架的及时到位直接决定这条数据路线能不能走通

来源:相关主管部门发布。时效:本周。置信度🟡 大概率属实(指引已发布,细则适用范围待实践检验)。

8.6 AI 进课堂:教育科研社会效益的新增量

Anthropic 推出 Claude for Teachers / Claude for Education,并发布教育场景专用连接与校园项目;OpenAI 同步将 ChatGPT for Teachers 推广至 55 个美国学区、覆盖超 10 万名教育者。与此同时 Anthropic 设立 500 万美元基金资助 AI 对使用者幸福感影响的独立研究,并发布 Anthropic Economic Index 追踪 AI 在各类职业任务中的真实渗透。

意义:教育是从"消费级玩具"到"生产性基础设施"的关键入口。当头部模型厂同时把教师端工具、校园覆盖、影响研究三件事打包推进,AI 对人力资本的长期塑造开始有可观测指标。但"AI 依赖导致认知外包"的副作用也需同步研究。

来源:Anthropic 官方 / OpenAI 官方 / suncoastais(2026-08 下旬)。时效:本周。置信度✅ 已确认(官方发布)。


九、AI 经济效益(产业价值与资本动向)

9.1 具身智能上半年融资 934.74 亿元,同比 5 倍,但资本已开始挤泡沫

正面数据:2026 上半年国内具身智能融资 934.74 亿元(同比 +5 倍),融资事件 322 笔(同比 +137%);7 月工业机器人产量增长 30.2%;全球人形机器人上半年出货 2.2 万台,智元以 9700 台居首。

反向信号:受限于泛化能力不足与量产成本,宇树等头部企业股价回落(上市 4 天市值蒸发约 2000 亿),行业正从概念炒作转向真实场景落地——资本市场正在挤出泡沫,企业得先搞定专用场景再谈通用。

判断:融资额与出货量同步高增,说明这一轮不是纯故事驱动;但股价回落与估值重定价同时出现,意味着估值已经跑在交付能力前面。观察指标应从"融了多少"转向"单台交付成本与真实场景成功率"。

来源:IT 桔子 / 行业出货统计 / 深圳特区报 / 东方财富。时效:本周。置信度✅ 已确认

9.2 机器人企业"一边融资一边投资",抢的是"数据喂模型、模型控本体"闭环

机器人主机厂亲自下场投资已成行业普遍现象,数据与模型是重点投资赛道。智元已投资至少 10 家具身智能产业链企业,覆盖核心零部件、具身全模态世界模型、场景化解决方案。深圳的乐聚、众擎、智平方均在加速对外投资——乐聚投了人形机器人基础模型公司德塔智能、具身智能模型研发商旋玑智能,以及灵巧手、关节等核心部件企业,加上物流、商服场景伙伴。

判断:专家观点是谁先建成"数据喂模型、模型控本体"的生态闭环,谁就在未来的成本战和溢价战中掌握定价权。成长期企业就开始产业链整合,反映的是竞争烈度而非财力充裕。

来源:深圳特区报 / 企业公开表态。时效:本周。置信度✅ 已确认

9.3 车企集体跨界:小鹏领跑,蔚来、零跑、广汽、一汽跟进

小鹏机器人 9 亿美元首轮融资、63 亿美元估值领跑;奇瑞旗下机器人业务 AiMOGA 据报道正在准备 IPO比亚迪已发布人形机器人"小迪";长安、广汽、理想、上汽、赛力斯均在探索人形机器人;蔚来投资具身智能公司(任少卿创立的物理 AI 基础模型公司,估值独角兽级),零跑确认布局机器人业务,中国一汽将突破具身智能机器人技术列为十大重点技术任务之一。

判断:车企的优势是硬件与规模化量产,短板是 AI 侧。小鹏用 3 颗自研图灵芯片 + 端侧基座模型的路线,是目前车企阵营里对 AI 侧押注最重的一家;而蔚来以"基础模型公司"切入,则说明车企的边界正在从"造本体"延伸到"造大脑"。

来源:小鹏公告 / 多家外媒 / 融中财经 / RoboRadar。时效:本周。置信度✅ 已确认(小鹏数据)/🟡(奇瑞 IPO 准备、蔚来标的为报道口径)。

9.4 密集融资与上市窗口:外骨骼、家庭机器人、灵巧手、谐波减速器全线推进

9.5 AI Coding 侧:模型供货关系与价格成为商业变量,成本效率被重新定价

两件事叠加看很有意思:OpenAI 断供 Cursor(11/12 生效)说明模型供货已从纯商业采购变成带控制权条款的战略关系;而 8/31「模型与价格大日」(Sonnet 5 重定价 + GPT-5.4/Kimi K2.5 退役 + Copilot 下线 6 款)进一步收敛可选模型池并抬高存量成本。同时 OpenRouter 被 Stripe 以 75 亿美元收购,模型路由层的资本背景生变。

判断:AI Coding 的成本结构正在被重新定价。对企业采购方,"能力/价格"之外要加两个维度:供货关系稳定性(会不会被断供)与 token 效率(同样额度实际能干多少活)。第五章的性价比表只回答了第一个维度。

来源:OpenAI 公告 / GitHub Changelog / headsupai / 各厂商官方。时效:当日 + 本周。置信度✅ 已确认

9.6 开源模型正在改变编程模型的成本曲线

llm-stats 前 15 名中开源占 5 席且全部来自中国团队;GLM-5.3 在 AA 口径以 60 分并列第 7、开源第一;GLM-5.3-Flash 以 Opus 4.8 约 1/40 的定价跑通十万张国产芯片集群,性价比是本期榜首(380.5,第 2 名的 2.4 倍)。DeepSeek-V4-Pro-0813 以 $0.48/M 的价格给到 LiveBench 77.4 分与 124 c/s 的高吞吐;阿里 Qwen3.8-Flash 再把 API 压到 1 元/百万 Token

判断能力差 13%、价格差 76 倍这个结构(见 5.4)意味着大量编程工作负载的经济最优解已经不在闭源旗舰。闭源溢价的合理性正在收缩到"长程复杂 Agent 任务"这一个狭窄区间——而这恰好是 LiveBench Agent 编程列全场最弱(中位数约 54)的能力洼地。

来源:livebench.ai / artificialanalysis.ai / llm-stats.com / 智谱官方 / 阿里官方。时效:当日。置信度✅ 已确认(榜单数据)/🟡("1/40 定价""十万张集群"为厂商口径)。


十、方法论与免责声明

10.1 信源分层与置信度标记

标记含义判定标准
✅ 已确认官方渠道发布,或 ≥2 个独立权威来源一致可作为决策依据
🟡 大概率属实单一权威来源,或官方事实明确但细节为媒体口径需自行核验细节
🔴 待验证社区流传 / 单一非权威来源 / 文书未公开仅作趋势参考

社区信源(第一章)用于抢时间,其内容凡进入第三章「15 条精选」的,均已用官方或权威媒体二次核验;未能核验的降级至第四章「社区快讯」。

10.2 B 站字幕采集口径

10.3 评分表口径与本地计算说明

10.4 覆盖范围与已知缺口

10.5 免责声明


AI 日报 · 2026-08-31 · 聚焦 AI Coding × 具身智能 · 共 15 条精选 + 6 条 DeepSeek 专项 + 6 条社区快讯