聚焦方向:AI Coding(AI 编程)× 具身智能
生成时间:2026-09-01 07:30 (GMT+8)
今日结论速览:DeepSeek 今日有 D ✅(V4-Flash-Vision-Exp 多模态权重开源、拟募资 74 亿美元 / 估值 740 亿美元冲击 2027 科创板 IPO);AI Coding 侧最大变量是 xAI 发布 Grok Code Fast 1 编程模型并限时免费接入主流 IDE(Cursor/Copilot/Cline 等)与 OpenAI 内测 Codex「持久模式」(最长连续 25 小时自主编程);具身智能侧最大变量是 第二届世界人形机器人运动会闭幕并开放全量数据集(2500+ 小时) 与 工信部"十五五"将具身智能列入 6 大未来产业。
口径说明:每条均标注「时效」与「来源」。时效分
当日/近 2 日/本周;来源给出可核验主体。字幕类内容标注"字幕由平台自动生成"。实时数据源:① 多引擎新闻检索 + Exa(中英文媒体/社区);② GitHub Search API(日榜/周榜双周期,2026-09-01 07:34 抓取);③ livebench.ai(2026-06-25 发布实时榜,含每成功任务成本)、artificialanalysis.ai(Intelligence Index v4.1.1,页面最后更新 8/30)、llm-stats.com(2026-09-01 实时榜,368 模型);④ B 站 UP 主字幕口径:黑鸦Heya(1 个视频 / 32 行字幕已提取)、Icyの狼(24h 有更新含资讯类《[狼狼快报] V4-Flash-Vision 实验版开源》)、无机酸-_-(24h 更新为个人测评作品,未引用结论)。
| 章节 | 内容 | 条目数 |
|---|---|---|
| 一 | 社区信源监控(一手线索,快于媒体) | 3 个信源 |
| 二 | DeepSeek 专项 —— 今日有 D ✅ | 6 条 |
| 三 | 今日 15 条精选(AI Coding 8 + 具身智能 7) | 15 条 |
| 四 | 社区快讯(待验证 / 低置信度) | 7 条 |
| 五 | 能力评分与价格表(三口径交叉验证) | 3 张表 + 性价比 |
| 六 | GitHub 当日趋势榜 | 日榜 + 周榜 |
| 八 | AI 社会效益 | 6 条 |
| 九 | AI 经济效益 | 6 条 |
| 十 | 方法论与免责声明 | — |
本节来自三个长期跟踪的社区信源。社区口播往往比媒体稿早 6–24 小时,但置信度低于官方渠道,因此本节只做"线索"用途,凡进入第三章「15 条精选」的内容均已用官方或权威媒体二次核验。
信源状态一览(含字幕提炼要点)
| 信源 | 最新内容 | 类型 | 字幕 | 字幕提炼要点 | 时效 |
|---|---|---|---|---|---|
| 黑鸦Heya | AI日报0831(BV1k1t86FELv) | 资讯类 | ✅ 已采集 32 行 | DeepSeek V4-Flash-Vision-Exp 权重开源(MIT)、Claude $200 Max「20倍用量」仅限 5 小时窗口、Codex/Tibo 澄清、智谱 GLM coding plan 额度 9/1 自动按 150% 延续、OpenCode 2.0(16000+ PR)、Hy4 preview 调用激增排队已扩容 | 当日(约 12h 前) |
| Icyの狼 | [狼狼快报] V4-Flash-Vision 实验版开源(BV1AUt86cEoD) | 资讯类 | ✖ 未提取 | 标题印证 DeepSeek 多模态开源 +「期待第三方部署」;另有 7h 前 2 条(ds0831 灰测、生日个人向) | 当日(约 12h 前) |
| 无机酸-_- | DSV4FVE/OpenCode Go 测评(BV1aDth62EJ1) | 个人测评作品 | ✖ 未开启字幕 | — | 当日(约 7h 前) |
从口播正文里提取到的实质信息(已做同音字校正,例如 "deep sick" → DeepSeek、"智浦" → 智谱、"open call or" → OpenCode、"z code" → ZCode),其中标题层看不到的增量(字幕提炼要点)包括:
来源:B 站 UP 主「黑鸦Heya」AI日报0831(BV1k1t86FELv),字幕由平台自动生成,本节为要点摘录与同音字校正后的转述。
时效:当日(约 12h 前)。置信度:🟡 大概率属实(DeepSeek 多模态开源与 Hy4 preview 已由多源官媒交叉验证;Claude 套餐口径为口播线索,Anthropic 未专门回应,见第四章 Q1)。
社区交叉验证:黑鸦Heya 与 Icyの狼两个独立社区信源同日发出"DeepSeek V4-Flash-Vision-Exp 开源"资讯,叠加网易/智东西/腾讯研究院等多家官媒口径,构成「社区先报 + 媒体后证」的强闭环,是第二章判定今日有 D 的核心依据;黑鸦Heya 字幕另补足了 Claude 套餐口径争议、智谱 GLM coding plan、OpenCode 2.0 等媒体尚未集中覆盖的增量。
过去 24 小时(8/31–9/1)DeepSeek 侧信息密度高,不适用"今日无D"。核心事件为 V4-Flash-Vision-Exp 多模态权重开源(8/31 放权重、9/1 凌晨全网深度解读持续发酵),并有 74 亿美元融资 / 740 亿估值 / 2027 科创板 IPO 的重磅配套消息。
以下条目来自社区讨论或单一信源,尚未获得官方或多方核验,仅作趋势参考,不建议作为决策依据。
| # | 内容 | 来源类型 | 时效 | 置信度 |
|---|---|---|---|---|
| Q1 | Anthropic Claude $200 Max 套餐"20 倍用量"仅适用于 5 小时窗口、周限额约 $100 套餐 2 倍,官方未专门回应;Codex/Tibo 澄清 Codex 无此限制 | B 站字幕线索 + 社区讨论,Anthropic 未回应 | 当日 | 🔴 待验证 |
| Q2 | OpenCode/OpenCode Go 2.0 更新:史上最大规模,超 16000 个 PR,覆盖安装/记忆/浏览器/安全 | B 站字幕线索 + 社区 | 当日 | 🟡 大概率属实 |
| Q3 | 智谱 GLM coding plan 生效,ZCode 额度(原定 9/1 到期)自动按 150% 延续 | B 站字幕线索 + 用户群 | 当日 | 🟡 大概率属实 |
| Q4 | 美国拟出台远程算力出口管制草案,DeepSeek 被列为目标之一 | 媒体报道,草案未定稿 | 本周 | 🔴 待验证 |
| Q5 | Kimi 冲刺港股 IPO | 财经媒体 | 本周 | 🟡 大概率属实 |
| Q6 | 长鑫 LPDDR6 进入量产 | 产业链消息 | 本周 | 🟡 大概率属实 |
| Q7 | 腾讯 Hy4 preview 调用激增导致排队,官方称已扩容 | B 站字幕线索 + 官方动态 | 当日 | 🟡 大概率属实 |
另有社区口播提到的"某厂商推出用于评估和改进其他 Skill 的 Skill"(见上期),本期未获新核验,暂不单列。
三个口径的方法论差异很大,不可直接横向比较分值,只能各自看排序:
| # | 模型 | 综合 | 推理 | 编程 | Agent编程 | 数学 | 数据分析 | 语言 | 指令跟随 | 每成功任务成本 |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Max | 83.0 | 89.7 | 86.0 | 62.2 | 96.0 | 80.5 | 90.7 | 75.8 | $1.439 |
| 2 | GPT-5.6 Sol Max | 81.0 | 91.7 | 83.9 | 56.2 | 96.2 | 79.8 | 87.7 | 71.8 | $0.515 |
| 3 | GPT-5.5 Thinking xHigh | 80.2 | 89.7 | 82.1 | 54.0 | 95.9 | 81.6 | 87.4 | 70.7 | $0.435 |
| 4 | Claude 5 Opus Thinking Max | 80.1 | 91.2 | 81.4 | 65.2 | 95.7 | 74.6 | 88.7 | 63.8 | $0.699 |
| 5 | Kimi K3 (开源) | 79.2 | 90.7 | 81.4 | 62.2 | 84.4 | 78.7 | 85.5 | 71.4 | $0.348 |
| 6 | Gemini 3.7 Flash High | 78.8 | 87.8 | 78.9 | 58.3 | 93.5 | 68.0 | 85.5 | 79.9 | $0.157 |
| 7 | Qwen 3.8 Max (开源) | 78.5 | 88.2 | 72.9 | 64.6 | 91.3 | 78.4 | 79.7 | 74.1 | $0.275 |
| 8 | Grok 4.6 | 78.0 | 90.5 | 76.8 | 57.0 | 92.6 | 73.9 | 83.7 | 71.9 | $0.207 |
| 9 | GPT-5.4 Thinking xHigh | 78.0 | 88.1 | 77.5 | 53.8 | 94.1 | 79.3 | 82.6 | 70.2 | $0.387 |
| 10 | Muse Spark 1.2 xHigh | 78.0 | 90.0 | 77.5 | 57.6 | 91.2 | 76.5 | 78.6 | 74.3 | $0.375 |
| 11 | GPT-5.6 Terra Max | 77.9 | 90.6 | 78.2 | 54.9 | 94.9 | 79.3 | 82.9 | 64.6 | $0.352 |
| 12 | DeepSeek V4 Pro 0813 (开源) | 77.4 | 85.8 | 77.2 | 54.9 | 95.1 | 79.2 | 82.1 | 67.7 | $0.044 |
| 13 | Gemini 3.1 Pro Preview High | 77.0 | 84.0 | 76.5 | 44.1 | 91.0 | 78.5 | 85.4 | 79.1 | $0.286 |
| 14 | DeepSeek V4 Flash Vision Exp (开源) | 76.8 | 85.4 | 68.2 | 65.1 | 87.8 | 79.5 | 80.4 | 71.0 | $0.051 |
| 15 | Claude 4.7 Opus Thinking xHigh | 76.5 | 87.2 | 82.1 | 50.7 | 92.9 | 78.3 | 77.9 | 66.7 | $0.528 |
| 16 | Claude 4.8 Opus Thinking Max | 76.2 | 89.2 | 81.8 | 50.5 | 94.3 | 66.0 | 79.7 | 72.0 | $0.983 |
| 17 | Qwen 3.8 Flash Next (开源) | 76.2 | 87.4 | 72.6 | 61.6 | 85.8 | 74.2 | 74.6 | 77.1 | $0.042 |
| 18 | GLM-5.3 (开源) | 76.1 | 85.8 | 79.0 | 60.9 | 87.9 | 70.2 | 79.9 | 69.3 | $0.450 |
| 19 | Claude Sonnet 5 xHigh | 76.0 | 88.7 | 80.7 | 59.4 | 92.9 | 71.7 | 75.0 | 63.9 | $0.505 |
| 20 | Grok 4.5 | 75.8 | 87.2 | 68.6 | 56.5 | 90.8 | 73.0 | 82.8 | 71.5 | $0.131 |
编程类单项拔尖(不看总分):Claude Fable 5 Max 编程 86.0 为全场最高;DeepSeek V4 Flash Vision Exp(#14)Agent 编程 65.1 是多模态模型中罕见的 Agent 编程高分,呼应第二章 D1 的"多模态 + Agent"路线。DeepSeek V4 Pro 0813 每成功任务成本 $0.044、V4 Flash Vision Exp $0.051,分别为榜首 Claude Fable 5($1.439)的 1/33 与 1/28——成本维度断层领先。Agent 编程是全场最弱环节:50 款里最高仅 Claude 5 Opus Thinking Max 的 65.2,中位数约 54,说明多语言 Agent 化编程仍是明确的能力洼地。
| # | 模型 | 综合 | 编程 | Agent编程 | 每成功任务成本 | 备注 |
|---|---|---|---|---|---|---|
| 12 | DeepSeek V4 Pro 0813 | 77.4 | 77.2 | 54.9 | $0.044 | 开源最高,成本极低 |
| 14 | DeepSeek V4 Flash Vision Exp | 76.8 | 68.2 | 65.1 | $0.051 | 多模态 Agent 编程拔尖 |
| 18 | GLM-5.3 | 76.1 | 79.0 | 60.9 | $0.450 | 开源第一梯队 |
| 17 | Qwen 3.8 Flash Next | 76.2 | 72.6 | 61.6 | $0.042 | 开源小尺寸 |
| 5 | Kimi K3 | 79.2 | 81.4 | 62.2 | $0.348 | 开源综合最高 |
| 7 | Qwen 3.8 Max | 78.5 | 72.9 | 64.6 | $0.275 | 开源 |
| 21 | GLM-5.3 Flash | 71.6 | 79.0 | 56.8 | $0.031 | 编程 79.0 与旗舰持平,成本全场最低 |
关键发现:GLM-5.3-Flash 的编程分 79.0 与旗舰 GLM-5.3 完全持平,但每成功任务成本仅 $0.031(全场最低),是纯编程任务的极高性价比选择。
| # | 模型 | 厂商 | 智能指数 | 吞吐(t/s) | 首字延迟(s) | 每任务成本 |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 (max) | Anthropic | 63 | 56 | 59.51 | $2.34 |
| 1 | Claude Opus 5 (xhigh) | Anthropic | 63 | 54 | 26.68 | $1.80 |
| 3 | Claude Fable 5 | Anthropic | 62 | 62 | 92.73 | $3.14 |
| 4 | Claude Opus 5 (high) | Anthropic | 61 | 54 | 20.31 | $1.23 |
| 4 | GPT-5.6 Sol (max) | OpenAI | 61 | 75 | 153.94 | $0.95 |
| 4 | Grok 4.6 (high) | SpaceXAI | 61 | 59 | 42.59 | $0.94 |
| 7 | Grok 4.6 (xhigh) | SpaceXAI | 60 | 58 | 39.75 | $1.23 |
| 7 | Kimi K3 (max) | Kimi | 60 | 39 | 4.03 | $0.84 |
| 7 | GLM-5.3 (max) | Z AI | 60 | 67 | 1.63 | $0.68 |
| 10 | GPT-5.6 Sol (xhigh) | OpenAI | 59 | 79 | 52.39 | $0.63 |
| 10 | Grok 4.6 (medium) | SpaceXAI | 59 | 59 | 33.90 | $0.78 |
| 10 | Claude Opus 5 (medium) | Anthropic | 59 | 52 | 4.19 | $0.72 |
| 13 | Qwen3.8 Max | Alibaba | 58 | 25 | 2.57 | $0.91 |
| 13 | Qwen3.8 2.4T A95B | Alibaba | 58 | 28 | 2.54 | $0.81 |
| 15 | GLM-5.3-Flash | Z AI | 57 | 49 | 1.50 | $0.09 |
| 15 | GPT-5.6 Sol (high) | OpenAI | 57 | 73 | 20.01 | $0.43 |
| 15 | Muse Spark 1.2 (xhigh) | Meta | 57 | — | — | $0.40 |
| 15 | GPT-5.6 Terra (max) | OpenAI | 57 | 110 | 143.38 | $0.53 |
| 19 | Gemini 3.7 Flash (high) | 56 | 330 | 9.35 | $0.40 | |
| 19 | Qwen3.8-Flash-Next | Alibaba | 56 | 80 | 2.79 | $0.10 |
| 19 | Grok 4.5 (high) | SpaceXAI | 56 | 53 | 14.51 | $0.43 |
| 23 | Claude Sonnet 5 (max) | Anthropic | 55 | 86 | 207.94 | $1.72 |
| 24 | DeepSeek V4 Pro 0813 (max) | DeepSeek | 53 | 72 | 1.62 | $0.27 |
| 24 | Gemini 3.7 Flash (medium) | 53 | 332 | 4.71 | $0.26 |
三个值得注意的读数:
| # | 模型 | 综合分 | 混合价/M | 吞吐 | 开源 | 标记 |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | 56.8 | $7.78 | 101 c/s | — | |
| 2 | Claude Opus 5 | 55.8 | $7.22 | 64 c/s | — | |
| 3 | Claude Mythos Preview | 55.7 | — | — | — | 未发布 |
| 4 | Claude Fable 5 | 55.3 | $14.44 | 101 c/s | — | 最贵 |
| 5 | Kimi K3 | 54.6 | $4.33 | 98 c/s | ✅ | |
| 6 | GLM-5.3 | 54.2 | $1.73 | 69 c/s | ✅ | |
| 7 | DeepSeek-V4-Pro-0813 | 52.9 | $0.48 | 122 c/s | ✅ | 吞吐最高 |
| 8 | Qwen3.8 Max | 52.7 | $2.02 | 64 c/s | ✅ | |
| 9 | GPT-5.6 Terra | 52.2 | $3.11 | 116 c/s | — | |
| 10 | Hy4 preview | 51.5 | — | — | ✅ | NEW |
| 11 | Claude Opus 4.8 | 51.5 | $7.22 | 46 c/s | — | |
| 12 | GLM-5.3-Flash | 51.1 | $0.19 | 85 c/s | ✅ | NEW |
| 13 | Gemini 3.7 Flash | 50.5 | $1.08 | 121 c/s | — | |
| 14 | Muse Spark 1.1 | 50.3 | $1.58 | 256 c/s | — | |
| 15 | Qwen3.8-Flash-Next | 49.7 | — | — | ✅ | NEW |
前 15 名中开源模型占 5 席(Kimi K3、GLM-5.3、DeepSeek-V4-Pro-0813、GLM-5.3-Flash、Qwen3.8-Flash-Next),且全部来自中国团队;本期新增 Hy4 preview(腾讯)与两款 Flash 模型。
计算方式:LiveBench 综合总分 ÷ llm-stats 混合价($/M token)。数值越高越划算;末列为归一化占比(以榜首为 100%)。
结论:
| 位次 | 项目 | 方向 |
|---|---|---|
| #4 | openclaw | Agent 运行时 |
| #7 | obra/superpowers | AI Skill 生态 |
| #10 | affaan-m/ECC | Agent harness |
| #11 | NousResearch/hermes-agent | Agent 框架 |
| #13 | deepseek-ai/deepseek-harness | DeepSeek Agent 框架("Everything is a Plugin") |
| #15 | anomalyco/opencode | 编程 Agent |
| 位次 | 项目 | 方向 |
|---|---|---|
| #4 | openclaw | Agent 运行时 |
| #8 | obra/superpowers | AI Skill 生态 |
| #11 | affaan-m/ECC | Agent harness |
| #12 | mattpocock/skills | AI Skill 教程 |
| #13 | NousResearch/hermes-agent | Agent 框架 |
| #15 | deepseek-ai/deepseek-harness | DeepSeek Agent 框架 |
日榜前 15 里有 6 个是 Agent / AI 基础设施项目(openclaw、superpowers、ECC、hermes-agent、opencode,加上本期 #13 的 deepseek-ai/deepseek-harness),密度与上周持平,仍是近期高位。三点观察:
来源:GitHub Search API 实时抓取(日榜 / 周榜双周期,2026-09-01 07:34)。时效:当日。置信度:✅ 已确认(Star 量级为抓取时快照,随时变动)。
8 月 28 日江苏省发改委、财政厅、商务厅联合发布通告,具身智能机器人(含人形机器人、外骨骼助力机器人、机器狗)首次被纳入消费品以旧换新补贴范围,补贴品类从原有智能家居扩展为十大类智能产品。消费者在享受商家优惠后,政府按最终销售价格 15% 给予补贴,每人每细分品类可补 1 件,每件不超过 1500 元。政策自 8 月 29 日实施至 2026 年 12 月 31 日。
意义:具身智能第一次以"消费品"身份进入公共财政补贴目录,标志其从产业投资标的转向家庭可购商品。江苏是全国首个推出地方自主品类补贴的省份,示范效应值得跟踪。
来源:江苏省三部门联合通告 / 新华日报。时效:本周(8/29 生效)。置信度:✅ 已确认。
2026 数博会上,上海理工大学机器智能研究院执行院长、卓益得机器人创始人李清都表示,研发仿生机器人的初衷就是聚焦"近人服务"、重点做好养老照护,并给出务实路径:养老机器人可先切入下棋、健康监测等高成功率场景来释放护工精力。他同时提出机器人进家庭必须守好三道安全关——物理防伤人、信息防泄露、AI 触觉防损。
意义:把"高成功率场景优先"和"三道安全关"讲清楚,比宣传参数更有公共价值。老龄化是具身智能最刚性的社会需求,也是容错率最低的场景。
来源:2026 中国国际大数据产业博览会 / 澳门日报(中新社)。时效:本周。置信度:✅ 已确认。
优必选情感陪伴机器人已售出 1.3 万台并走进家庭,引发伦理担忧。网信办等五部门出台《人工智能拟人化互动服务管理暂行办法》划定红线,企业正参与伦理标准制定;违规出海欧盟最高可罚 3500 万欧元。
意义:拟人化交互是 AI 与社会摩擦最直接的界面。监管在装机量刚过万台时就介入,节奏快于多数技术周期。
来源:网信办等五部门规章 / 行业报道。时效:本周。置信度:🟡 大概率属实(办法已出台,罚则口径为报道引述)。
数博会现场展示:南方电网机器狗负重 200 公斤、爬坡 60 度,替代人工进入高危复杂环境作业;四足巡检机器人自主上下楼梯、穿越障碍;具身智能白酒检测机器人数秒完成基酒液位高精度计量。云深处、宇树等企业的四足与轮腿机器人已参与灾害侦察与物资投送,应急管理部出台指导意见并设立 6 个攻关方向。
意义:相比家庭陪伴,高危环境替代的社会效益更明确、伦理争议更小、付费方更清晰。这是当前最不需要讲故事的落地方向。
来源:2026 数博会 / 应急管理部指导意见 / 澳门日报。时效:本周。置信度:✅ 已确认。
《人工智能训练数据合规使用指引》发布,为训练数据的来源、授权与使用边界提供操作依据。结合第三章第 9 条提到的"真实场景数据集开放"趋势——真实场景采集会大量涉及第一视角行为数据与场所信息,合规框架的及时到位直接决定这条数据路线能不能走通。
来源:相关主管部门发布。时效:本周。置信度:🟡 大概率属实(指引已发布,细则适用范围待实践检验)。
Anthropic 推出 Claude for Teachers / Claude for Education,并发布教育场景专用连接与校园项目;OpenAI 同步将 ChatGPT for Teachers 推广至 55 个美国学区、覆盖超 10 万名教育者。Anthropic 设立 500 万美元基金资助 AI 对使用者幸福感影响的独立研究,并发布 Anthropic Economic Index 追踪 AI 在各类职业任务中的真实渗透。
意义:教育是从"消费级玩具"到"生产性基础设施"的关键入口。当头部模型厂同时把教师端工具、校园覆盖、影响研究三件事打包推进,AI 对人力资本的长期塑造开始有可观测指标。
来源:Anthropic 官方 / OpenAI 官方(2026-08 下旬)。时效:本周。置信度:✅ 已确认(官方发布)。
正面数据:2026 上半年国内具身智能融资 934.74 亿元(同比 +5 倍),融资事件 322 笔(同比 +137%);7 月工业机器人产量增长 30.2%;全球人形机器人上半年出货 2.2 万台。
反向信号:受限于泛化能力不足与量产成本,头部企业股价回落(宇树上市 4 天市值蒸发约 2000 亿),行业正从概念炒作转向真实场景落地。
判断:融资额与出货量同步高增,说明这一轮不是纯故事驱动;但股价回落与估值重定价同时出现,意味着估值已经跑在交付能力前面。观察指标应从"融了多少"转向"单台交付成本与真实场景成功率"。
来源:IT 桔子 / 行业出货统计 / 深圳特区报 / 东方财富。时效:本周。置信度:✅ 已确认。
机器人主机厂亲自下场投资已成行业普遍现象,数据与模型是重点投资赛道。智元已投资至少 10 家具身智能产业链企业;深圳的乐聚、众擎、智平方均在加速对外投资。
判断:专家观点是谁先建成"数据喂模型、模型控本体"的生态闭环,谁就在未来的成本战和溢价战中掌握定价权。
来源:深圳特区报 / 企业公开表态。时效:本周。置信度:✅ 已确认。
小鹏机器人 9 亿美元首轮融资、63 亿美元估值领跑;奇瑞旗下机器人业务 AiMOGA 据报道准备 IPO;比亚迪已发布人形机器人"小迪";长安、广汽、理想、上汽、赛力斯均在探索人形机器人;蔚来投资具身智能公司(任少卿创立的物理 AI 基础模型公司),零跑确认布局机器人业务,中国一汽将突破具身智能机器人技术列为十大重点技术任务之一。
判断:车企优势在硬件与规模化量产,短板在 AI 侧。小鹏用自研图灵芯片 + 端侧基座模型的路线,是目前车企阵营里对 AI 侧押注最重的一家。
来源:小鹏公告 / 多家外媒 / 融中财经 / RoboRadar。时效:本周。置信度:✅ 已确认(小鹏数据)/🟡(奇瑞 IPO、蔚来标的为报道口径)。
两件事叠加看:OpenAI 断供 Cursor(11/12 生效)说明模型供货已从纯商业采购变成带控制权条款的战略关系;而 xAI Grok Code Fast 1 限时免费接入主流 IDE(第三章第 1 条)进一步压低编程模型使用成本。同时 DeepSeek 拟募资 74 亿美元 / 估值 740 亿美元(第二章 D2)显示头部国产模型公司的资本化加速。
判断:AI Coding 成本结构正在被重新定价。对企业采购方,"能力/价格"之外要加两个维度:供货关系稳定性(会不会被断供)与 token 效率(同样额度实际能干多少活)。
来源:OpenAI 公告 / 各厂商官方 / xAI 官方 / 媒体。时效:当日 + 本周。置信度:✅ 已确认。
llm-stats 前 15 名中开源占 5 席且全部来自中国团队;GLM-5.3 在 AA 口径以 60 分并列第 7、开源第一;GLM-5.3-Flash 以 Opus 4.8 约 1/40 的定价跑通;DeepSeek-V4-Pro-0813 以 $0.48/M 给到 LiveBench 77.4 分与 122 c/s 高吞吐、每成功任务成本仅 $0.044;腾讯 Hy4 preview 新晋榜单(第九章 9.5 印证其需求热度)。
判断:能力差 14%、价格差 76 倍这个结构(见 5.4)意味着大量编程工作负载的经济最优解已不在闭源旗舰。闭源溢价的合理性正在收缩到"长程复杂 Agent 任务"这一个狭窄区间——而这恰好是 LiveBench Agent 编程列全场最弱(中位数约 54)的能力洼地。
来源:livebench.ai / artificialanalysis.ai / llm-stats.com / 智谱官方 / 腾讯官方。时效:当日。置信度:✅ 已确认(榜单数据)/🟡("1/40 定价"为厂商口径)。
| 标记 | 含义 | 判定标准 |
|---|---|---|
| ✅ 已确认 | 官方渠道发布,或 ≥2 个独立权威来源一致 | 可作为决策依据 |
| 🟡 大概率属实 | 单一权威来源,或官方事实明确但细节为媒体口径 | 需自行核验细节 |
| 🔴 待验证 | 社区流传 / 单一非权威来源 / 文书未公开 | 仅作趋势参考 |
社区信源(第一章)用于抢时间,其内容凡进入第三章「15 条精选」的,均已用官方或权威媒体二次核验;未能核验的降级至第四章「社区快讯」。
AI 日报 · 2026-09-01 · 聚焦 AI Coding × 具身智能 · 共 15 条精选 + 6 条 DeepSeek 专项 + 7 条社区快讯