聚焦方向:AI Coding(AI 编程)× 具身智能
生成时间:2026-08-31 07:30 (GMT+8)
今日结论速览:DeepSeek 今日有 D ✅(DSH 开源登 GitHub 日榜 #11、V4-Flash 多模态版上线 Gateway、乌兰察布建 1 吉瓦数据中心);AI Coding 侧最大变量是 OpenAI 新模型 Astra 内测曝光(社区信源交叉印证)与 8/31「模型与价格大日」(Sonnet 5 重定价 + GPT-5.4/Kimi K2.5 退役 + Copilot 下线 6 款);具身智能侧最大变量是 优必选半年报营收 12.69 亿、人形机器人销量 921 台 与 宇树上市 4 天市值蒸发约 2000 亿被 Figure 反超。
口径说明:每条均标注「时效」与「来源」。时效分
当日/近 2 日/本周;来源给出可核验主体。字幕类内容标注"字幕由平台自动生成"。实时数据源:① 多引擎新闻检索 + Exa(中英文媒体/社区);② GitHub Search API(日榜/周榜双周期);③ livebench.ai 原始 CSV(本地聚合七类)、artificialanalysis.ai(Intelligence Index v4.1.1)、llm-stats.com(实时价/吞吐);④ B 站 UP 主字幕口径:黑鸦Heya(1 个视频 / 15 行)、Icyの狼(24h 无新视频)、无机酸-_-(24h 更新但为个人作品未开字幕)。
| 章节 | 内容 | 条目数 |
|---|---|---|
| 一 | 社区信源监控(一手线索,快于媒体) | 3 个信源 |
| 二 | DeepSeek 专项 —— 今日有 D ✅ | 6 条 |
| 三 | 今日 15 条精选(AI Coding 8 + 具身智能 7) | 15 条 |
| 四 | 社区快讯(待验证 / 低置信度) | 6 条 |
| 五 | 能力评分与价格表(三口径交叉验证) | 3 张表 + 性价比 |
| 六 | GitHub 当日趋势榜 | 日榜 + 周榜 |
| 八 | AI 社会效益 | 6 条 |
| 九 | AI 经济效益 | 6 条 |
| 十 | 方法论与免责声明 | — |
本节来自三个长期跟踪的社区信源。社区口播往往比媒体稿早 6–24 小时,但置信度低于官方渠道,因此本节只做"线索"用途,凡进入第三章「15 条精选」的内容均已用官方或权威媒体二次核验。
信源状态一览(含字幕提炼要点)
| 信源 | 最新内容 | 类型 | 字幕 | 字幕提炼要点 | 时效 |
|---|---|---|---|---|---|
| 黑鸦Heya | AI 晚报 0830(BV1A8tH6gEd5) | 资讯类 | ✅ 已采集 15 行 | ASTRA 早期访问机制、内部检查点生成像素城堡/网页前端、官方零确认+发布窗口 | 当日(约 12h 前) |
| Icyの狼 | 24h 内无新视频(最新至 08-28) | — | ✖ 无更新 | — | 当日 |
| 无机酸-_- | 24h 有更新但均为个人评测作品 | 个人作品 | ✖ 未开启字幕 | — | 当日 |
从口播正文里提取到的实质信息(已做同音字校正,例如 "deep sick" → DeepSeek、"cloud" → Claude、"open route" → OpenRouter),其中标题层看不到的增量(字幕提炼要点)包括:
来源:B 站 UP 主「黑鸦Heya」AI 晚报 0830(BV1A8tH6gEd5),字幕由平台自动生成,本节为要点摘录与同音字校正后的转述。
时效:当日(约 12h 前)。置信度:🟡 大概率属实(ASTRA 发布窗口与早期访问机制为口播线索,已由腾讯研究院 8/31 AI 速递同步披露;控制权变更条款已由官方/权威媒体交叉验证,见第三章)。
社区交叉验证:黑鸦Heya 字幕补足了媒体尚未完全覆盖的增量——ASTRA 的"早期访问机制"与"检查点生成像素城堡/网页前端"这类产物级细节,以及"官方零确认 + 9 月初发布窗口"的时间线索,已被腾讯研究院 8/31 AI 速递在第三章第 1 条同步印证,构成「社区先报 + 媒体后证」的典型闭环。
过去 24 小时(8/30–8/31)DeepSeek 侧信息密度高,不适用"今日无D"。共 6 条,其中 8/30 的多条动态(乌兰察布数据中心、足球赛事预测、涨价后评测、新规)距生成时点不足 24 小时,且 DSH 开源仍在 GitHub 持续冲榜。
以下条目来自社区讨论或单一信源,尚未获得官方或多方核验,仅作趋势参考,不建议作为决策依据。
| # | 内容 | 来源类型 | 时效 | 置信度 |
|---|---|---|---|---|
| Q1 | OpenAI Astra 发布窗口约 9/3 为媒体推测,官方未官宣,具体能力以正式发布为准 | 媒体披露 + 社区口播,官方未确认 | 当日 | 🔴 待验证 |
| Q2 | 美国拟出台远程算力出口管制草案,DeepSeek 被列为目标之一 | 媒体报道,草案未定稿 | 本周 | 🔴 待验证 |
| Q3 | Anthropic 二季度营收约 115 亿美元,反超 OpenAI | 财经媒体,双方均未正式披露 | 本周 | 🔴 待验证 |
| Q4 | Kimi 冲刺港股 IPO | 财经媒体 | 本周 | 🟡 大概率属实 |
| Q5 | 长鑫 LPDDR6 进入量产 | 产业链消息 | 本周 | 🟡 大概率属实 |
| Q6 | 1X Technologies 洽谈新一轮融资,估值目标约 100 亿美元(海外传闻) | 海外行业媒体,以官方确认为准 | 本周 | 🔴 待验证 |
另有社区口播提到"某厂商推出用于评估和改进其他 Skill 的 Skill"(见 1.1 第 5 条),指向 Agent Skill 生态的"元工具"层开始形成,但具体产品与厂商未获核验,暂不单列。
三个口径的方法论差异很大,不可直接横向比较分值,只能各自看排序:
| # | 模型 | 综合 | 推理 | 编程 | Agent编程 | 数学 | 数据分析 | 语言 | 指令跟随 |
|---|---|---|---|---|---|---|---|---|---|
| 1 | claude-fable-5-max | 83.0 | 91.2 | 86.0 | 62.2 | 95.6 | 81.4 | 89.0 | 75.8 |
| 2 | gpt-5.6-sol-max | 81.0 | 92.8 | 83.9 | 56.2 | 94.9 | 77.8 | 89.5 | 71.8 |
| 3 | claude-opus-5-max | 80.3 | 89.9 | 81.4 | 65.2 | 95.3 | 79.4 | 87.0 | 63.8 |
| 4 | gpt-5.5-xhigh | 80.2 | 91.1 | 82.1 | 54.0 | 94.8 | 81.3 | 87.0 | 70.7 |
| 5 | smaug-agentic | 79.9 | 83.9 | 82.5 | 64.6 | 94.6 | 77.1 | 85.5 | 71.0 |
| 6 | kimi-k3 | 79.6 | 84.4 | 81.4 | 62.2 | 94.6 | 76.8 | 86.3 | 71.4 |
| 7 | gemini-3.7-flash-high | 79.5 | 83.3 | 78.9 | 58.3 | 95.3 | 77.8 | 83.2 | 79.9 |
| 8 | qwen3.8-max | 78.2 | 86.8 | 72.9 | 64.6 | 94.7 | 78.0 | 76.5 | 74.1 |
| 9 | grok-4.6 | 78.2 | 87.5 | 76.8 | 57.0 | 95.1 | 75.8 | 83.5 | 71.9 |
| 10 | gpt-5.4-xhigh | 77.9 | 88.6 | 77.5 | 53.8 | 94.5 | 77.9 | 83.0 | 70.2 |
| 11 | muse-spark-1.2-xhigh | 77.7 | 88.9 | 77.5 | 57.6 | 91.3 | 73.6 | 80.9 | 74.3 |
| 12 | gpt-5.6-terra-max | 77.7 | 90.9 | 78.2 | 54.9 | 94.9 | 78.8 | 81.3 | 64.6 |
| 13 | gemini-3.1-pro-preview | 77.5 | 83.2 | 76.5 | 44.1 | 95.4 | 77.5 | 87.1 | 79.1 |
| 14 | deepseek-v4-pro-0813 | 77.4 | 87.9 | 77.2 | 54.9 | 95.4 | 76.5 | 82.1 | 67.7 |
| 15 | claude-opus-4-8-max | 76.9 | 83.1 | 81.8 | 50.5 | 96.1 | 74.4 | 80.5 | 72.0 |
| 16 | deepseek-v4-flash-vision-exp | 76.7 | 84.6 | 68.2 | 65.1 | 91.7 | 77.5 | 78.5 | 71.0 |
| 17 | glm-5.3 | 76.6 | 80.8 | 79.0 | 60.9 | 94.2 | 74.1 | 77.8 | 69.3 |
| 18 | qwen3.8-flash-next | 76.4 | 80.7 | 72.6 | 61.6 | 94.8 | 75.0 | 73.0 | 77.1 |
| 19 | claude-opus-4-7-xhigh | 76.3 | 87.0 | 82.1 | 50.7 | 95.8 | 75.1 | 76.9 | 66.7 |
| 20 | grok-4.5 | 76.2 | 83.7 | 68.6 | 56.5 | 95.1 | 75.9 | 82.2 | 71.5 |
编程类单项拔尖(不看总分):claude-fable-5-max 编程 86.0 为全场最高;gpt-5.6-luna-max 与 gpt-5.2-codex 编程分分别为 82.9 / 83.6,但总分被指令跟随拖到 32、29 位——编程专精模型在综合榜上会显得吃亏,选型时应看单项。
Agent 编程是全场最弱环节:49 款模型里最高仅 claude-opus-5-max 的 65.2,中位数约 54,grok-4.3 低至 18.5。这一列的绝对水平远低于其他六类,说明多语言 Agent 化编程仍是明确的能力洼地。值得注意:deepseek-v4-flash-vision-exp(#16)的 Agent 编程达 65.1,是多模态模型中罕见的 Agent 编程高分,呼应第二章 D2 的"多模态 + Agent"路线。
| # | 模型 | 综合 | 编程 | Agent编程 | 备注 |
|---|---|---|---|---|---|
| 14 | deepseek-v4-pro-0813 | 77.4 | 77.2 | 54.9 | 开源最高 |
| 17 | glm-5.3 | 76.6 | 79.0 | 60.9 | 开源第一梯队 |
| 18 | qwen3.8-flash-next | 76.4 | 72.6 | 61.6 | 开源 |
| 23 | qwen3.8-27b | 75.5 | 75.7 | 61.4 | 开源小尺寸 |
| 36 | glm-5.3-flash | 72.3 | 79.0 | 56.8 | 编程 79.0 与 GLM-5.3 持平,价格仅 $0.19 |
| 37 | deepseek-v4-pro | 72.0 | 70.0 | 42.6 | 前代 |
| 40 | kimi-k2.7-code | 69.9 | 74.0 | 45.7 | 编程特化 |
关键发现:glm-5.3-flash 的编程分 79.0 与旗舰 glm-5.3 完全持平,总分差距主要来自指令跟随(52.8 vs 69.3)与推理。若任务是纯编程且 prompt 结构稳定,Flash 版是极高性价比的选择。
| # | 模型 | 厂商 | 智能指数 | 吞吐(t/s) | 首字延迟(s) | 每任务成本 |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 (max) | Anthropic | 63 | 56 | 59.51 | $2.34 |
| 1 | Claude Opus 5 (xhigh) | Anthropic | 63 | 54 | 26.68 | $1.80 |
| 3 | Claude Fable 5 | Anthropic | 62 | 62 | 92.73 | $3.14 |
| 4 | Claude Opus 5 (high) | Anthropic | 61 | 54 | 20.31 | $1.23 |
| 4 | GPT-5.6 Sol (max) | OpenAI | 61 | 75 | 153.94 | $0.95 |
| 4 | Grok 4.6 (high) | SpaceXAI | 61 | 59 | 42.59 | $0.94 |
| 7 | Grok 4.6 (xhigh) | SpaceXAI | 60 | 58 | 39.75 | $1.23 |
| 7 | Kimi K3 (max) | Kimi | 60 | 39 | 4.03 | $0.84 |
| 7 | GLM-5.3 (max) | Z AI | 60 | 67 | 1.63 | $0.68 |
| 10 | GPT-5.6 Sol (xhigh) | OpenAI | 59 | 79 | 52.39 | $0.63 |
| 10 | Grok 4.6 (medium) | SpaceXAI | 59 | 59 | 33.90 | $0.78 |
| 10 | Claude Opus 5 (medium) | Anthropic | 59 | 52 | 4.19 | $0.72 |
| 13 | Qwen3.8 Max | Alibaba | 58 | 25 | 2.57 | $0.91 |
| 13 | Qwen3.8 2.4T A95B | Alibaba | 58 | 28 | 2.54 | $0.81 |
| 15 | GLM-5.3-Flash | Z AI | 57 | 49 | 1.50 | $0.09 |
| 15 | GPT-5.6 Sol (high) | OpenAI | 57 | 73 | 20.01 | $0.43 |
| 15 | Muse Spark 1.2 (xhigh) | Meta | 57 | — | — | $0.40 |
| 15 | GPT-5.6 Terra (max) | OpenAI | 57 | 110 | 143.38 | $0.53 |
| 19 | Gemini 3.7 Flash (high) | 56 | 330 | 9.35 | $0.40 | |
| 19 | Qwen3.8-Flash-Next | Alibaba | 56 | 80 | 2.79 | $0.10 |
| 19 | Grok 4.5 (high) | SpaceXAI | 56 | 53 | 14.51 | $0.43 |
| 23 | Claude Sonnet 5 (max) | Anthropic | 55 | 86 | 207.94 | $1.72 |
| 24 | DeepSeek V4 Pro 0813 (max) | DeepSeek | 53 | 72 | 1.62 | $0.27 |
| 24 | Gemini 3.7 Flash (medium) | 53 | 332 | 4.71 | $0.26 |
三个值得注意的读数:
| # | 模型 | 综合分 | 混合价/M | 吞吐 | 开源 | 标记 |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | 57.2 | $7.78 | 90 c/s | — | |
| 2 | Claude Opus 5 | 56.2 | $7.22 | 66 c/s | — | |
| 3 | Claude Mythos Preview | 55.9 | — | — | — | 未发布 |
| 4 | Claude Fable 5 | 55.9 | $14.44 | 107 c/s | — | 最贵 |
| 5 | Kimi K3 | 54.7 | $4.33 | 80 c/s | ✅ | |
| 6 | GLM-5.3 | 54.2 | $1.73 | 69 c/s | ✅ | |
| 7 | DeepSeek-V4-Pro-0813 | 54.1 | $0.48 | 124 c/s | ✅ | 吞吐最高 |
| 8 | Qwen3.8 Max | 53.0 | $2.02 | 63 c/s | — | |
| 9 | GPT-5.6 Terra | 52.6 | $3.11 | 117 c/s | — | |
| 10 | Claude Opus 4.8 | 51.7 | $7.22 | 57 c/s | — | |
| 11 | GLM-5.3-Flash | 51.6 | $0.19 | — | ✅ | NEW |
| 12 | Muse Spark 1.1 | 51.0 | $1.58 | 140 c/s | — | |
| 13 | Gemini 3.7 Flash | 50.9 | $1.08 | 158 c/s | — | |
| 14 | Qwen3.8-Flash-Next | 50.5 | — | — | ✅ | NEW |
| 15 | Claude Sonnet 5 | 49.3 | $2.89 | 80 c/s | — |
前 15 名中开源模型占 5 席(Kimi K3、GLM-5.3、DeepSeek-V4-Pro-0813、GLM-5.3-Flash、Qwen3.8-Flash-Next),且这 5 席全部由中国团队贡献。
计算方式:LiveBench 聚合总分 ÷ llm-stats 混合价($/M token)。数值越高越划算;末列为归一化占比(以榜首为 100%)。
结论:
| 位次 | 项目 | Star 量级 | 方向 |
|---|---|---|---|
| #4 | openclaw | 388.1k | Agent 运行时 |
| #6 | obra/superpowers | 279.7k | AI Skill 生态 |
| #8 | affaan-m/ECC | 244.7k | Agent harness |
| #9 | NousResearch/hermes-agent | 238.5k | Agent 框架 |
| #11 | deepseek-ai/deepseek-harness | 204.7k | DeepSeek Agent 框架("Everything is a Plugin") |
| #13 | anomalyco/opencode | 202.6k | 编程 Agent |
| 位次 | 项目 | 方向 |
|---|---|---|
| #4 | openclaw | Agent 运行时 |
| #8 | obra/superpowers | AI Skill 生态 |
日榜前 15 位里有 6 个是 Agent 基础设施项目(openclaw、ECC、hermes-agent、opencode,加上 Skill 生态的 superpowers,以及本期新晋冲入 #11 的 deepseek-ai/deepseek-harness),这个密度是近期最高的。三点观察:
来源:GitHub Search API 实时抓取(日榜 / 周榜双周期,2026-08-31)。时效:当日。置信度:✅ 已确认(Star 量级为抓取时快照,随时变动)。
8 月 28 日江苏省发改委、财政厅、商务厅联合发布通告,具身智能机器人(含人形机器人、外骨骼助力机器人、机器狗)首次被纳入消费品以旧换新补贴范围,补贴品类从原有智能家居扩展为十大类智能产品。消费者在享受商家优惠后,政府按最终销售价格 15% 给予补贴,每人每细分品类可补 1 件,每件不超过 1500 元。政策自 8 月 29 日实施至 2026 年 12 月 31 日,限额管理、用完即止;新增商品须有统一国标 13 位商品编码。
意义:这是具身智能第一次以"消费品"身份进入公共财政补贴目录,标志其从产业投资标的转向家庭可购商品。江苏是全国首个推出地方自主品类补贴的省份,示范效应值得跟踪。
来源:江苏省三部门联合通告 / 新华日报。时效:本周(8/29 生效)。置信度:✅ 已确认。
2026 数博会上,上海理工大学机器智能研究院执行院长、卓益得机器人创始人李清都表示,研发仿生机器人的初衷就是聚焦"近人服务"、重点做好养老照护,并给出务实路径:养老机器人可先切入下棋、健康监测等高成功率场景来释放护工精力,而非一上来就做全流程照护。他同时提出机器人进家庭必须守好三道安全关——物理防伤人、信息防泄露、AI 触觉防损,并强调关键是建立人与机器人之间的信任关系而非急于追求销量。
意义:把"高成功率场景优先"和"三道安全关"讲清楚,比宣传参数更有公共价值。老龄化是具身智能最刚性的社会需求,但也是容错率最低的场景。
来源:2026 中国国际大数据产业博览会 / 澳门日报(中新社)。时效:本周。置信度:✅ 已确认。
优必选情感陪伴机器人已售出 1.3 万台并走进家庭,引发伦理担忧。网信办等五部门出台《人工智能拟人化互动服务管理暂行办法》划定红线,企业正参与伦理标准制定;违规出海欧盟最高可罚 3500 万欧元。律师建议企业做好内部审查与隐私数据本地化。
意义:拟人化交互是 AI 与社会摩擦最直接的界面。监管在装机量刚过万台时就介入,节奏上快于多数技术周期。
来源:网信办等五部门规章 / 行业报道。时效:本周。置信度:🟡 大概率属实(办法已出台,罚则口径为报道引述)。
数博会现场展示的场景很具代表性:南方电网机器狗负重 200 公斤、爬坡 60 度,替代人工进入高危复杂环境作业;四足巡检机器人自主上下楼梯、穿越障碍;具身智能白酒检测机器人数秒完成基酒液位高精度计量。此外云深处、宇树等企业的四足与轮腿机器人已参与灾害侦察与物资投送,应急管理部出台指导意见并设立 6 个攻关方向——但受限于环境适应性、硬件短板与高成本,尚未大规模普及,距离像无人机一样成为救灾标配还需完善标准与生态。
意义:相比家庭陪伴,高危环境替代的社会效益更明确、伦理争议更小、付费方更清晰。这是当前最不需要讲故事的落地方向。
来源:2026 数博会 / 应急管理部指导意见 / 澳门日报。时效:本周。置信度:✅ 已确认。
《人工智能训练数据合规使用指引》发布,为训练数据的来源、授权与使用边界提供操作依据。结合第三章第 15 条提到的"实验室遥操转真实场景遥操"趋势——真实场景采集会大量涉及第一视角行为数据与场所信息,合规框架的及时到位直接决定这条数据路线能不能走通。
来源:相关主管部门发布。时效:本周。置信度:🟡 大概率属实(指引已发布,细则适用范围待实践检验)。
Anthropic 推出 Claude for Teachers / Claude for Education,并发布教育场景专用连接与校园项目;OpenAI 同步将 ChatGPT for Teachers 推广至 55 个美国学区、覆盖超 10 万名教育者。与此同时 Anthropic 设立 500 万美元基金资助 AI 对使用者幸福感影响的独立研究,并发布 Anthropic Economic Index 追踪 AI 在各类职业任务中的真实渗透。
意义:教育是从"消费级玩具"到"生产性基础设施"的关键入口。当头部模型厂同时把教师端工具、校园覆盖、影响研究三件事打包推进,AI 对人力资本的长期塑造开始有可观测指标。但"AI 依赖导致认知外包"的副作用也需同步研究。
来源:Anthropic 官方 / OpenAI 官方 / suncoastais(2026-08 下旬)。时效:本周。置信度:✅ 已确认(官方发布)。
正面数据:2026 上半年国内具身智能融资 934.74 亿元(同比 +5 倍),融资事件 322 笔(同比 +137%);7 月工业机器人产量增长 30.2%;全球人形机器人上半年出货 2.2 万台,智元以 9700 台居首。
反向信号:受限于泛化能力不足与量产成本,宇树等头部企业股价回落(上市 4 天市值蒸发约 2000 亿),行业正从概念炒作转向真实场景落地——资本市场正在挤出泡沫,企业得先搞定专用场景再谈通用。
判断:融资额与出货量同步高增,说明这一轮不是纯故事驱动;但股价回落与估值重定价同时出现,意味着估值已经跑在交付能力前面。观察指标应从"融了多少"转向"单台交付成本与真实场景成功率"。
来源:IT 桔子 / 行业出货统计 / 深圳特区报 / 东方财富。时效:本周。置信度:✅ 已确认。
机器人主机厂亲自下场投资已成行业普遍现象,数据与模型是重点投资赛道。智元已投资至少 10 家具身智能产业链企业,覆盖核心零部件、具身全模态世界模型、场景化解决方案。深圳的乐聚、众擎、智平方均在加速对外投资——乐聚投了人形机器人基础模型公司德塔智能、具身智能模型研发商旋玑智能,以及灵巧手、关节等核心部件企业,加上物流、商服场景伙伴。
判断:专家观点是谁先建成"数据喂模型、模型控本体"的生态闭环,谁就在未来的成本战和溢价战中掌握定价权。成长期企业就开始产业链整合,反映的是竞争烈度而非财力充裕。
来源:深圳特区报 / 企业公开表态。时效:本周。置信度:✅ 已确认。
小鹏机器人 9 亿美元首轮融资、63 亿美元估值领跑;奇瑞旗下机器人业务 AiMOGA 据报道正在准备 IPO;比亚迪已发布人形机器人"小迪";长安、广汽、理想、上汽、赛力斯均在探索人形机器人;蔚来投资具身智能公司(任少卿创立的物理 AI 基础模型公司,估值独角兽级),零跑确认布局机器人业务,中国一汽将突破具身智能机器人技术列为十大重点技术任务之一。
判断:车企的优势是硬件与规模化量产,短板是 AI 侧。小鹏用 3 颗自研图灵芯片 + 端侧基座模型的路线,是目前车企阵营里对 AI 侧押注最重的一家;而蔚来以"基础模型公司"切入,则说明车企的边界正在从"造本体"延伸到"造大脑"。
来源:小鹏公告 / 多家外媒 / 融中财经 / RoboRadar。时效:本周。置信度:✅ 已确认(小鹏数据)/🟡(奇瑞 IPO 准备、蔚来标的为报道口径)。
两件事叠加看很有意思:OpenAI 断供 Cursor(11/12 生效)说明模型供货已从纯商业采购变成带控制权条款的战略关系;而 8/31「模型与价格大日」(Sonnet 5 重定价 + GPT-5.4/Kimi K2.5 退役 + Copilot 下线 6 款)进一步收敛可选模型池并抬高存量成本。同时 OpenRouter 被 Stripe 以 75 亿美元收购,模型路由层的资本背景生变。
判断:AI Coding 的成本结构正在被重新定价。对企业采购方,"能力/价格"之外要加两个维度:供货关系稳定性(会不会被断供)与 token 效率(同样额度实际能干多少活)。第五章的性价比表只回答了第一个维度。
来源:OpenAI 公告 / GitHub Changelog / headsupai / 各厂商官方。时效:当日 + 本周。置信度:✅ 已确认。
llm-stats 前 15 名中开源占 5 席且全部来自中国团队;GLM-5.3 在 AA 口径以 60 分并列第 7、开源第一;GLM-5.3-Flash 以 Opus 4.8 约 1/40 的定价跑通十万张国产芯片集群,性价比是本期榜首(380.5,第 2 名的 2.4 倍)。DeepSeek-V4-Pro-0813 以 $0.48/M 的价格给到 LiveBench 77.4 分与 124 c/s 的高吞吐;阿里 Qwen3.8-Flash 再把 API 压到 1 元/百万 Token。
判断:能力差 13%、价格差 76 倍这个结构(见 5.4)意味着大量编程工作负载的经济最优解已经不在闭源旗舰。闭源溢价的合理性正在收缩到"长程复杂 Agent 任务"这一个狭窄区间——而这恰好是 LiveBench Agent 编程列全场最弱(中位数约 54)的能力洼地。
来源:livebench.ai / artificialanalysis.ai / llm-stats.com / 智谱官方 / 阿里官方。时效:当日。置信度:✅ 已确认(榜单数据)/🟡("1/40 定价""十万张集群"为厂商口径)。
| 标记 | 含义 | 判定标准 |
|---|---|---|
| ✅ 已确认 | 官方渠道发布,或 ≥2 个独立权威来源一致 | 可作为决策依据 |
| 🟡 大概率属实 | 单一权威来源,或官方事实明确但细节为媒体口径 | 需自行核验细节 |
| 🔴 待验证 | 社区流传 / 单一非权威来源 / 文书未公开 | 仅作趋势参考 |
社区信源(第一章)用于抢时间,其内容凡进入第三章「15 条精选」的,均已用官方或权威媒体二次核验;未能核验的降级至第四章「社区快讯」。
AI 日报 · 2026-08-31 · 聚焦 AI Coding × 具身智能 · 共 15 条精选 + 6 条 DeepSeek 专项 + 6 条社区快讯