聚焦方向:AI Coding(AI 编程)× 具身智能
生成时间:2026-09-03 07:30 (GMT+8)
统计窗口:2026-09-02 00:00 → 2026-09-03 07:30 (GMT+8)
今日结论速览:DeepSeek 今日无 D——V4-Flash-Vision-Exp 权重首发实为 8/31(API 更早在 8/21),已在 09-01 期覆盖,9/2 的热度全是媒体二次放大,按时效纪律判为超窗。AI Coding 侧今日是罕见的"三家旗舰同日撞车":Anthropic Claude Fable 5.1 / Mythos 5.1(缓存读取价砍 75%、已成 Claude Code 默认档)、Google Gemini 3.8 Flash / 3.8 Cyber(促销价 $0.75/$3.75,Terminal-Bench 2.1 打到 89.4%)、阿里 Qwen3.8-Max-0902(Code Arena WebDev 1691 登顶)。但今日最有价值的信号不是发布本身,而是 Terminal-Bench 4.0 榜单同步刷新暴露的"跑分—实测背离":Gemini 3.8 Flash 在 2.1 上 89.4%,在 4.0 长程终端任务上只有 19.1%。具身智能侧最大变量是估值锚开始切换——宇树科技上市第 11 个交易日股价腰斘、市值蒸发超 2000 亿,同期半年报却是营收销量双增;以及开发者级本体价格击穿(元点 8888 元、Nori A3 $1,688 同日出现)。
口径说明:每条均标注「时效」与「来源」。置信度分 🟢 已确认 / 🟡 多方报道 / 🔴 待验证 / ⚪ 存疑未采用。凡日期无法核实到窗口内的条目一律进入丢弃清单,不进正文。字幕类内容标注"字幕由平台自动生成"。
实时数据源:① 多引擎新闻检索 + Exa 语义检索(中英文媒体/社区,2026-09-03 抓取);② GitHub AI 趋势榜(日榜/周榜双周期,2026-09-03 抓取);③ livebench.ai(2026-06-25 发布版实时榜,2026-09-03 直采,含每成功任务成本)、artificialanalysis.ai(Intelligence Index,2026-09-03 解析,27 款)、llm-stats.com(2026-09-03 实时榜,371 模型);④ B 站 UP 主口径:黑鸦Heya(1 条资讯,字幕 33 行)、Icyの狼(5 条,其中 4 条资讯 + 1 条官方原声搬运,字幕合计 196 行)、无机酸-_-(3 条个人测评,均未开字幕,改取 UP 主自述结论)。
| 章节 | 内容 | 条目数 |
|---|---|---|
| 一 | 社区信源监控(一手线索,快于媒体) | 3 个信源 / 9 个视频 |
| 二 | DeepSeek 专项 —— 今日无 D | 排查说明 |
| 三 | 今日 15 条精选(AI Coding 8 + 具身智能 7) | 15 条 |
| 四 | 社区快讯(待验证 / 低置信度) | 8 条 |
| 五 | 能力评分与价格表(三口径交叉验证) | 3 张表 + 性价比 |
| 六 | GitHub 当日趋势榜 | 日榜 + 周榜 |
| 八 | AI 社会效益 | 6 条 |
| 九 | AI 经济效益 | 6 条 |
| 十 | 方法论与免责声明 | — |
本节来自三个长期跟踪的社区信源。社区口播往往比媒体稿早 6–24 小时,但置信度低于官方渠道,因此本节只做"线索"用途,凡进入第三章「15 条精选」的内容均已用官方或权威媒体二次核验。
今日窗口内三位 UP 主共发布 9 个视频,全部处理完毕:6 条有平台自动字幕(合计提取 229 行),3 条未开启字幕(改取 UP 主在简介中的自述结论,信息密度实际高于字幕)。
信源状态一览
| 信源 | 视频数 | 类型 | 字幕 | 核心增量 | 时效 |
|---|---|---|---|---|---|
| 黑鸦Heya | 1 | 资讯类(AI晚报090) | ✅ 33 行 | Astra「循环深度推理」引硅谷讨论、Gemini 3.8 Flash 灰度上线、Grok 4.7 传闻 10 天后发布 / 2.1T 参数、豆包 Work 多智能体 | 当日(约 13h 前) |
| Icyの狼 | 5 | 4 资讯 + 1 官方原声搬运 | ✅ 196 行 | Gemini 3.8 Flash 定价与 8 项第一 + Terminal-Bench 4.0 短板、Fable 5.1 缓存降价 75%、Qwen3.8-Max-0902 规格、GPT-6-Astra 端点探测方法论、Anthropic 官方发布口径全文 | 当日(5–20h 前) |
| 无机酸-_- | 3 | 个人测评(AI 六项能力测试) | ✖ 均未开字幕 | 三条实测结论均指向「跑分虚高」:Fable 5.1「效果优秀但不值这个价」、Gemini 3.8 Flash「没觉得很强,看不到跑分那个程度」、Qwen3.8-Max「变化不算大,配不上价格」 | 当日(3–14h 前) |
从 33 行口播正文提取的实质增量(已做同音字校正:ESTRA/阿斯特拉 → Astra、欧拉玛 → OpenAI、哈基米 → Gemini):
来源:B 站 UP 主「黑鸦Heya」AI晚报090(BV1U5tJ6kEXJ),字幕由平台自动生成,本节为要点摘录与同音字校正后的转述。
时效:当日(约 13h 前)。置信度:🟡 多方报道(Gemini 3.8 Flash 已被官方印证;Grok 4.7 与首席科学家表态仍为口播线索)。
窗口内 5 条视频全部有字幕,是今日信息密度最高的信源:
| 视频 | 字幕 | 关键增量 |
|---|---|---|
| Gemini 3.8 Flash 发布(BV1rKtD6EEzG,5h 前) | 49 行 | 促销价 $0.75/$3.75 至 2026-12-31,之后回 $1.5/$7.5;Terminal-Bench 2.1 89.4%(距 Opus 5 仅 0.3);8 项榜单第一;但 Terminal-Bench 4.0 仅 19.1%(对比 51.8%)、OSWorld 59%(对比 75.4%);Cyber 版漏洞发现 71%、提示注入被攻破率 5.5%,经 "Fair Wind" 计划仅面向政府/公共部门 |
| GPT-6-Astra 端倪(BV1KotS6xEsr,5.6h 前) | 41 行 | 端点探测方法论:请求已注册但无权限的模型名返回 404,完全不存在的名字返回 400——据此判定 gpt-6-astra 已在后端注册。结合 OpenAI 8/1、9/1 两份报告佐证其网络安全类任务处于顶级梯队 |
| Qwen3.8-Max-0902(BV1Y1t76CERP,19h 前) | 38 行 | 2.4T 总参 / ~95B 激活(MoE),1M 上下文,最大输出 130K;Code Arena WebDev 1691 第一;$2/$6,缓存命中 $0.17 |
| Fable 5.1 官宣(BV1F3tE6dEr6,20.5h 前) | 37 行 | Fable 5.1 与 Mythos 5.1 同步发布,Mythos = 同底座 + 更强护栏版;Terminal-Bench Science 24.7% → 52.6%;缓存命中价 $1 → $0.25(-75%);典型任务总成本 -25%、长任务 -45% |
| Fable 5.1 官方原声(BV1rgtE6xE5H,20h 前) | 31 行 | Anthropic 官方发布视频的中文字幕搬运,可作官方口径直引,见下 |
官方口径要点(来自原声搬运,可直接引用):Anthropic 把 Fable 5.1 的卖点明确压在多步骤长链任务的稳定性上——「第二步的微小错误可能在第四十步引发问题,而它全程稳定运行」,举例为复杂财务模型、长数学证明、含数百处交叉引用的合同;软件工程侧强调「从 code review 到跨整个代码库的性能优化会话」,且支持中断后续接并汇报「尝试过的方法」与「卡壳位置」;研究侧强调返回数据与来源清晰可核查的润色结果与备忘录;科学领域强调阅读文献协作、提出假设、设计实验。
注意口径差异:官方通稿全程未把 Fable 5.1 定位成"编程能力大跃进",而是"长程稳定性 + 科研"。这与无机酸-_- 的实测结论(「Coding 提升有限,优势聚拢在科研与综合素质」)高度一致——这是今日交叉印证质量最高的一组判断。
来源:B 站 UP 主「Icyの狼」上述 5 个视频,字幕由平台自动生成。
时效:当日(5–20.5h 前)。置信度:🟢 已确认(Fable 5.1 / Gemini 3.8 Flash 数据已被官方源印证);GPT-6-Astra 端点推断标 🔴 待验证。
三条视频均未开启平台自动字幕,改取 UP 主在视频简介中的自述结论。该 UP 主坚持标注测试平台、effort 档位与耗时,是少见的可复核个人评测口径:
| 视频 | 测试环境 | UP 主自述结论(要点) |
|---|---|---|
| Claude Fable 5.1(部分)(3h 前) | Windows 11 + Claude Code,AWS 渠道;1–4 题 Max Effort、5–7 题 High Effort | 耗时:前端网页/后端 MES(High)各约 15 min;黑洞模拟(High)约 25 min;Max 档中式建筑 50 min、体素山水 45 min。「考虑到价格……优秀的效果也变得不是那么值得了」「那个前端网页,Gemini 3.8 Flash 可以用更短的时间、更低的成本做出更好的成品」「Fable 的优势正在聚拢在科研、前沿探索和综合素质方向,本次 Coding 提升有限」。因数据不足不入榜,仅供参考 |
| Gemini 3.8 Flash(5.8h 前) | Windows 11 + Antigravity | 「测了一晚上,真的没觉得它很强……至少看不到跑分的那个程度。好在它依旧很快,在工作流里当快准狠的小刀还算不错」 |
| Qwen3.8 Max 0902(14h 前) | Windows 11 + Qoder | 「看到跑分我还以为能有 Claude Opus 5 的水准呢,实测发现变化不算大……较自己虽有改进但仍旧配不上它的价格」 |
为什么这条最值得看:今日三家旗舰的官方数字都很漂亮(89.4%、1691 分、52.6%),但同一位评测者在同一套六项任务上对三者给出的都是「跑分高于实测体感」。这与第三章甲组第 3 条(Terminal-Bench 4.0 上 Gemini 3.8 Flash 仅 19.1%)在完全独立的口径上得出同一方向的结论。跑分—实测背离,是本期最重要的横向发现。
来源:B 站 UP 主「无机酸-_-」上述 3 个视频的公开简介。
时效:当日(3–14h 前)。置信度:🟡 个人实测口径(样本量小、主观评分,但方法与耗时可复核;已标明为个人观点而非客观结论)。
结论:今日无 D。 窗口(2026-09-02 00:00 → 2026-09-03 07:30 GMT+8)内没有 DeepSeek 原生新事件。
本期做了一次比往期更严格的日期回溯,原因是 9/2 中文媒体出现了一批「DeepSeek 正式发布多模态开源权重」的稿件,看上去像是当日新闻。逐一核到一手源后确认:这些都是超窗事件的媒体二次放大。按既定的时效纪律(宁缺毋滥、旧闻不当新闻),一律不计入。
| 信息 | 为何不计入 |
|---|---|
| V4-Flash-Vision-Exp「9/2 正式发布 / 开源权重」 | 权重首发实为 8/31(API 更早在 8/21)。多个一手渠道的发布日志一致指向 8/31,且本刊 09-01 期已报道。9/2 稿件属二次放大 |
| 前七月财务披露(营收约 4.75 亿、算力投入约 110 亿) | 9/2 有媒体转载并做「商业化叙事对冲」分析,但非官方新公告,也无独立权威源支撑该组数字 |
| 峰谷分时计价「调整」讨论 | 调价实际 8/17 上线,云厂商规则 8/29 生效,均超窗;9/2 仅为第三方解读 |
| Harness 开源框架热度 | 开发者预览版为 8 月末发布,预热更早在 8/13;9/2 仅为媒体补稿 |
| 接入微信支付 | 8/31 宣布,超窗 |
需要区分两件事:「DeepSeek 有没有新动作」 与 「DeepSeek 模型表现如何」。后者今日依然亮眼,但属于榜单快照而非事件:
判定纪律说明:第三方平台上架、榜单出现、他人使用、旧闻复述,均不构成原生事件。本刊坚持「无 D 就说无 D」,避免把生态外溢包装成公司动作——这是过去几期反复校准过的口径。
时效:核查截至 2026-09-03 07:30。置信度:🟢 已确认(多渠道日期回溯一致)。
甲组备选(窗口内但未入选):① 腾讯 WorkBuddy 开放平台 9/2 上线,首批超百家伙伴,向开发者开放 Skill / Expert / Connector 三层能力(中证网、上海证券报,🟢);② Google Antigravity CLI v1.1.24(仅二次聚合源,🔴 待验证);③ Grok 4.7 传闻 10 天后发布、2.1T 参数(单一信源,🔴 待验证,本轮未获独立佐证)。
乙组备选(窗口内但未入选):① 天工机器人完成数亿元融资,初芯基金领投、经纬创投与合肥国资跟投,用于分拣类机器人扩产与人形分拣研发(大河财立方,🟡);② UniSteer——微软亚洲研究院 / 悉尼科技大学 / 清华提出动作到噪声近似反演,把人类纠正接入流匹配 VLA 的噪声空间强化学习,机械臂用 2 条演示轨迹完成 16 颗拼豆(机器之心 9/2 10:45,🟡);③ 顺德智能机器人应用大会发布《湾区具身智能产业集聚发展倡议》,中科紫东太初发布通用多模态具身灵巧操作大模型,新宝旗下东菱咖啡机器人整套方案成本较同类低 20%–30%(南方+,🟡);④ 长江日报统计国内已有 14 家主流车企明确布局人形机器人(🟡)。
乙组丢弃清单(超窗,不入正文):Sharpa 融资超 45 亿元 / 估值 33 亿美元并开出全自主人形餐厅(9/1);梅卡曼德港交所上市、市值 127.1 亿港元(9/1);特斯拉 Optimus 确认弗里蒙特量产启动、9 月周产目标 1000 台(9/1);我国牵头的家用机器人国际标准发布(9/1);玄创机器人数千万元 A1 轮(9/1);舜行奇点数千万元种子轮(9/1);众擎 T800 郑州下线(9/1);前 7 月工业机器人出口 73.4 亿元、同比 +13.2%(9/1);英伟达 35 亿美元认购联发科可转债(9/1);智元觅蜂第 2 万套无本体数采设备交付(8/31);赛迪六维力传感器市场报告(8/31);小鹏机器人首轮超 9 亿美元融资(8/24)。另有 SAG「2026H1 全球人形交付 19100 台」数据因原始统计源无法独立核验,⚪ 存疑未采用。
本节是「官媒还没报、社区已在讨论」的早期信号。默认置信度低于第三章,仅供建立观察假设,请勿直接当结论使用。
| 编号 | 快讯 | 信号价值 | 交叉印证 | 置信 |
|---|---|---|---|---|
| C-1 | Fable 5.1 缓存降价 75%,但第三方实测单次任务成本反而 +20% —— 原因是输出 token 增至约 1.7 倍,抵消了缓存折扣。相关讨论在 Hacker News 当日达 1200 分 / 1122 评论 | 揭示「降价」叙事与真实 Agent 账单之间的落差,直接影响选型与预算测算。这条的实用价值高于任何官方定价通稿 | 3+ 独立信源 | 🟢 已确认 |
| C-2 | Astra 的「循环深度」让思维链不可读,安全社区强烈反弹 —— 有报道披露 Astra 把部分推理转入无可读输出的激活值;一位安全研究机构成员在社交平台称这是「AI 安全史上最糟的进展」,担心破坏 CoT 可监控性。OpenAI 首席科学家回应称报道有误读 | 前沿架构开始用可解释性换成本与能力。若成为主流路线,现有基于思维链审计的安全方案将大面积失效,监管口径也会被迫调整 | 2 个独立信源 | 🟡 多方报道 |
| C-3 | 有人系统复盘知名 AI 唱衰者的历史预测,结论是多数落空 —— 该复盘帖上 Hacker News 首页并获 900+ 分,引发「AI 泡沫论可信度」的大讨论 | 社区对「AI 是否泡沫」的叙事正在自我校正。这类元讨论往往领先于投资情绪与招聘节奏的转向 | 2 个独立信源 | 🟡 多方报道 |
| C-4 | Linux 内核 CVE 数量因 AI 自动扫描暴增 —— 稳定版维护者分享:6.x 每版约修 500 个 CVE,7.x 后升至 1000+,7.3 或破 2000。主因是 AI 辅助静态分析在「翻旧账」,挖出大量历史代码隐患,维护者已直言忙不过来 | AI 正在改变漏洞披露的节奏,而修复能力没有同步扩容。开源维护负担与供应链风险同时上升,这是被严重低估的二阶效应 | 单一信源(经媒体转述) | 🔴 待验证 |
| C-5 | r/LocalLLaMA 为 GLM-5.3-Flash 建中央讨论帖 —— 社区围绕智谱这款原生多模态模型集中交流量化、微调与推理服务经验 | 中国开源模型在海外本地推理社区的采用度上升。结合第五章性价比表里 GLM-5.3-Flash 高居第一,这个生态外溢值得持续跟踪 | 单一信源 | 🔴 待验证 |
| C-6 | 本地推理提速:Qwen3.8 27B 跑出 280 tok/s —— 有用户报告双 R9700 + AWQ MXFP4 量化下达 280 tok/s、920k KV 缓存;ExLlama v3 更新支持 MoE 的 CPU offload 与 MTP | 消费级硬件上跑长上下文 Agent 循环的可行性在提升。若成立,本地 coding agent 的经济性会明显改善 | 单一信源 | 🔴 待验证 |
| C-7 | 开源视频模型衍生生态活跃 —— 社区自建 15+ 个 LoRA / 加速变体榜单(FastH3、Lightx2v 等),226 赞 / 49 评论 | 衍生生态密度是开源模型成熟度的可靠代理指标,比下载量更能反映真实使用 | 单一信源 | 🔴 待验证 |
| C-8 | 传闻有头部闭源厂负责人游说限制开源算力访问 —— 社区热帖引述某社交平台账号说法,质疑此举将削弱本地推理生态 | 若属实将影响开源 / 本地推理的长期可得性。但目前仅为未经证实的指控,无一手证据,列此仅作观察项 | 单一信源,未经证实 | 🔴 待验证 |
另有一条中文社区讨论:有开发者反映给某编程 Agent 配置网络代理后,代理信息疑似被回传厂商,引发隐私与合规担忧。🔴 待验证(单一信源,未见厂商回应)。该类讨论的价值在于提示企业落地时应把「Agent 的数据回传边界」列入评估清单——这也正好呼应甲-5 自托管方案的市场逻辑。
为什么要三个口径:单一榜单容易被针对性优化,也容易因评测集设计放大某一类能力。本节并列三个独立机构的口径,并额外给出跨口径的性价比合成,目的不是选出「最强模型」,而是让口径之间的分歧本身成为信息。今日甲-3 揭示的 Terminal-Bench 2.1 与 4.0 的巨大落差,就是这种分歧最好的例子。
发布版本 2026-06-25。cost 列为每成功任务成本(美元),是本表最实用的一列——它把能力与账单放到了同一行。
| # | 模型 | 开源 | 综合 | 推理 | 编程 | Agentic | 数学 | 数据 | 语言 | 指令 | 每任务 $ |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 Max Effort | ✖ | 83.4 | 91.7 | 86.4 | 66.1 | 97.0 | 80.3 | 89.5 | 73.0 | 1.212 |
| 2 | Claude Fable 5 Max Effort | ✖ | 83.0 | 89.7 | 86.0 | 62.2 | 96.0 | 80.5 | 90.7 | 75.8 | 1.439 |
| 3 | GPT-5.6 Sol Max Effort | ✖ | 81.0 | 91.7 | 83.9 | 56.2 | 96.2 | 79.8 | 87.7 | 71.8 | 0.515 |
| 4 | GPT-5.5 Thinking xHigh | ✖ | 80.2 | 89.7 | 82.1 | 54.0 | 95.9 | 81.6 | 87.4 | 70.7 | 0.435 |
| 5 | Claude 5 Opus Thinking Max | ✖ | 80.1 | 91.2 | 81.4 | 65.2 | 95.7 | 74.6 | 88.7 | 63.8 | 0.699 |
| 6 | Kimi K3 | ✅ | 79.2 | 90.7 | 81.4 | 62.2 | 84.4 | 78.7 | 85.5 | 71.4 | 0.348 |
| 7 | Gemini 3.7 Flash High | ✖ | 78.8 | 87.8 | 78.9 | 58.3 | 93.5 | 68.0 | 85.5 | 79.9 | 0.157 |
| 8 | Qwen 3.8 Max | ✅ | 78.5 | 88.2 | 72.9 | 64.6 | 91.3 | 78.4 | 79.7 | 74.1 | 0.275 |
| 9 | Grok 4.6 | ✖ | 78.0 | 90.5 | 76.8 | 57.0 | 92.6 | 73.9 | 83.7 | 71.9 | 0.207 |
| 10 | GPT-5.4 Thinking xHigh | ✖ | 78.0 | 88.1 | 77.5 | 53.8 | 94.1 | 79.3 | 82.6 | 70.2 | 0.387 |
| 11 | Muse Spark 1.2 xHigh | ✖ | 78.0 | 90.0 | 77.5 | 57.6 | 91.2 | 76.5 | 78.6 | 74.3 | 0.375 |
| 12 | GPT-5.6 Terra Max Effort | ✖ | 77.9 | 90.6 | 78.2 | 54.9 | 94.9 | 79.3 | 82.9 | 64.6 | 0.352 |
| 13 | DeepSeek V4 Pro 0813 | ✅ | 77.4 | 85.8 | 77.2 | 54.9 | 95.1 | 79.2 | 82.1 | 67.7 | 0.044 |
| 14 | Gemini 3.1 Pro Preview High | ✖ | 77.0 | 84.0 | 76.5 | 44.1 | 91.0 | 78.5 | 85.4 | 79.1 | 0.286 |
| 15 | DeepSeek V4 Flash Vision Exp | ✅ | 76.8 | 85.4 | 68.2 | 65.1 | 87.8 | 79.5 | 80.4 | 71.0 | 0.051 |
| 16 | Claude 4.7 Opus Thinking xHigh | ✖ | 76.5 | 87.2 | 82.1 | 50.7 | 92.9 | 78.3 | 77.9 | 66.7 | 0.528 |
| 17 | Claude 4.8 Opus Thinking Max | ✖ | 76.2 | 89.2 | 81.8 | 50.5 | 94.3 | 66.0 | 79.7 | 72.0 | 0.983 |
| 18 | Qwen 3.8 Flash Next | ✅ | 76.2 | 87.4 | 72.6 | 61.6 | 85.8 | 74.2 | 74.6 | 77.1 | 0.042 |
| 19 | GLM-5.3 | ✅ | 76.1 | 85.8 | 79.0 | 60.9 | 87.9 | 70.2 | 79.9 | 69.3 | 0.450 |
| 20 | Claude Sonnet 5 xHigh | ✖ | 76.0 | 88.7 | 80.7 | 59.4 | 92.9 | 71.7 | 75.0 | 63.9 | 0.505 |
读表要点:
混合价 = (输入×3 + 输出) ÷ 4(美元 / 百万 token)。
| # | 模型 | 厂商 | 智能指数 | 编程指数 | 混合价 | 每任务 $ | 输出速度 tok/s |
|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 (max) | Anthropic | 65.7 | 61.3 | 20.00 | 3.689 | 66.2 |
| 2 | Claude Opus 5 (max) | Anthropic | 63.1 | 59.2 | 10.00 | 2.337 | 56.6 |
| 3 | Muse Spark 1.3 (max) | Meta | 62.1 | 59.3 | — | — | — |
| 4 | Claude Fable 5 | Anthropic | 62.1 | 56.6 | 20.00 | 3.140 | 65.1 |
| 5 | GPT-5.6 Sol (max) | OpenAI | 60.9 | 57.8 | 8.00 | 0.953 | 71.3 |
| 6 | Grok 4.6 (high) | xAI | 60.9 | 58.7 | 3.00 | 0.937 | 54.6 |
| 7 | Muse Spark 1.3 (xhigh) | Meta | 60.8 | 56.1 | 2.00 | 0.547 | 181.7 |
| 8 | Kimi K3 (max) | Kimi | 59.7 | 54.3 | 6.00 | 0.837 | 37.9 |
| 9 | GLM-5.3 (max) | Z AI | 59.5 | 59.1 | 2.15 | 0.683 | 62.8 |
| 10 | Gemini 3.8 Flash (high) | 58.7 | 50.0 | 1.50 | 0.577 | 302.1 | |
| 11 | Qwen3.8 2.4T A95B | Alibaba | 57.7 | 57.1 | 3.00 | 0.807 | 38.6 |
| 12 | GLM-5.3-Flash | Z AI | 57.5 | 58.2 | 0.2375 | 0.087 | 44.6 |
| 13 | GPT-5.6 Terra (max) | OpenAI | 56.6 | 50.2 | 4.50 | 0.526 | 97.7 |
| 14 | DeepSeek V4 Pro 0813 (max) | DeepSeek | 53.2 | 49.6 | 1.98 | 0.265 | 60.2 |
| 15 | GPT-5.6 Luna (max) | OpenAI | 52.3 | 46.9 | 0.45 | 0.049 | 115.6 |
| 16 | Qwen3.8 27B (xhigh) | Alibaba | 52.0 | 50.9 | 1.125 | 0.369 | 40.1 |
| 17 | MiniMax-M3 | MiniMax | 45.4 | 36.1 | 0.525 | 0.139 | 89.4 |
| 18 | Inkling | Thinking Machines | 42.3 | 34.1 | 1.763 | 0.339 | 74.6 |
| 19 | Nemotron 3 Ultra | NVIDIA | 38.3 | 27.5 | 1.175 | 0.386 | 116.5 |
读表要点:
该站未提供单一综合分,本表的「综合」列为 HLE / GPQA / SWE 三项均值(本地计算),仅用于横向排序,不与前两表数值直接可比。
| # | 模型 | 厂商 | 综合 | 输入 $ | 输出 $ | 混合价 | 吞吐 tok/s | 上下文 | 开源 |
|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 0.946 | 5.00 | 30.00 | 11.25 | 106.6 | 1.05M | ✖ |
| 2 | Grok 4.5 | xAI | 0.930 | 2.00 | 6.00 | 3.00 | 40.1 | 500K | ✖ |
| 3 | GPT-5.6 Terra | OpenAI | 0.929 | 2.00 | 12.00 | 4.50 | 117.9 | 1.05M | ✖ |
| 4 | GPT-5.6 Luna | OpenAI | 0.923 | 0.20 | 1.20 | 0.45 | 189.3 | 1.05M | ✖ |
| 5 | Hy4 preview | Tencent | 0.923 | — | — | — | — | — | ✅ |
| 6 | GPT-5.1 High | OpenAI | 0.881 | — | — | — | — | — | ✖ |
| 7 | GPT-5 Medium | OpenAI | 0.881 | — | — | — | — | — | ✖ |
| 8 | GPT-5 High | OpenAI | 0.873 | — | — | — | — | — | ✖ |
| 9 | GPT-5.5 Instant | OpenAI | 0.856 | 5.00 | 30.00 | 11.25 | 288.9 | 400K | ✖ |
| 10 | Grok-3 | xAI | 0.846 | 3.00 | 15.00 | 6.00 | — | 128K | ✖ |
| 11 | Claude Mythos Preview | Anthropic | 0.844 | — | — | — | — | — | ✖ |
| 12 | Hy3 | Tencent | 0.842 | — | — | — | — | — | ✅ |
| 13 | ChatGPT-4o Latest | OpenAI | 0.840 | — | — | — | — | — | ✖ |
| 14 | Grok-3 Mini | xAI | 0.840 | — | — | — | — | — | ✖ |
| 15 | Claude Opus 4.5 | Anthropic | 0.840 | — | — | — | — | — | ✖ |
读表要点:该口径的排序与前两个口径明显不同——GPT 系列在此更占优,Claude Fable 5.1 未进前 15。原因是三项均值(HLE / GPQA / SWE)偏重知识与学术推理,对长程 Agentic 能力几乎不敏感。这正是并列三口径的意义:如果你的场景是长程自动化,请以口径 A 的 Agentic 列为准,不要看这一表的排序。 另外该表中 GPT-5.6 Luna 以 $0.45 混合价拿到 0.923 综合分,性价比表现突出(见 5.4 第 2 名)。
PVP = Artificial Analysis 智能指数 ÷ 混合价(同一口径内计算,避免跨口径污染)。数值越高越划算,仅看量级,不宜精确比较。
今日最关键的一组数字——榜首能力模型 vs 榜首性价比模型:
| 对比项 | Claude Fable 5.1 (max) | GLM-5.3-Flash | 差距 |
|---|---|---|---|
| 智能指数 | 65.7 | 57.5 | 能力差 12.5% |
| 混合价 / 百万 token | $20.00 | $0.2375 | 价格差 84.2 倍 |
| 每成功任务成本 | $3.689 | $0.087 | 成本差 42.5 倍 |
| PVP | 3.3 | 241.9 | 73 倍 |
怎么用这张表:12.5% 的能力差距对应 42.5 倍的成本差距——这个比例意味着,除了确实需要顶格能力的长程科研 / 复杂重构任务,绝大多数日常 coding 场景用低价档 + 多轮重试的期望成本更低。合理的工程做法是分层路由:高频简单任务走 Flash 档(GLM-5.3-Flash / Gemini 3.8 Flash),中等任务走 $2–3 档(GLM-5.3 / Muse Spark 1.3 xhigh),只把真正的长程硬任务交给旗舰。但请务必对照甲-3 的警告:低价档在长程终端任务上的崩塌是真实的(Gemini 3.8 Flash 在 Terminal-Bench 4.0 仅 19.1%),分层路由的关键在于把任务长度和自主步数作为路由依据,而不只看任务表面难度。
本节采用 AI 专项口径(按 AI/ML/LLM 关键词与话题检索近窗被 push 且高 star 增量仓库),而非 GitHub 整体 trending——后者今日前排被 awesome、public-apis、freeCodeCamp 这类元清单占据,与 AI 日报主题错位。数据于 2026-09-03 经 github-ai-trends 脚本直采。
日榜 Top 12(AI 专项,2026-09-03)
| # | 仓库 | 语言 | 简介 | 与本期关联 |
|---|---|---|---|---|
| 1 | openclaw/openclaw | TypeScript | 跨 OS 的个人 AI 助手("龙虾之道") | 开源 Agent 基础设施热度第一,呼应甲-5 自托管执行面趋势 |
| 2 | deepseek-ai/deepseek-harness | TypeScript | DeepSeek 官方 Harness:Everything is a Plugin | 与第二章「DeepSeek 无原生新事、但生态外溢持续」互为印证 |
| 3 | n8n-io/n8n | TypeScript | 公平代码工作流自动化,原生 AI 能力 | 低代码 Agent 编排进入主榜 |
| 4 | Significant-Gravitas/AutoGPT | Python | 自主 Agent 愿景 | 长青自主 Agent 项目 |
| 5 | f/prompts.chat | HTML | 经典 ChatGPT Prompt 合集 | 提示工程仍是高频入口 |
| 6 | Snailclimb/JavaGuide | JavaScript | Java/后端面试指南(已含 AI 应用开发) | 传统面试资料开始覆盖 AI 应用开发 |
| 7 | langgenius/dify | TypeScript | Agentic 工作流 / RAG 管线 | |
| 8 | langflow-ai/langflow | Python | 可视化构建并部署 AI 应用 | |
| 9 | open-webui/open-webui | Python | 本地友好 AI 界面(兼容 Ollama/OpenAI) | 呼应 C-6 本地推理提速趋势 |
| 10 | langchain-ai/langchain | Python | Agent 工程平台 | |
| 11 | Shubhamsaboo/awesome-llm-apps | Python | 100+ 开源 Agents / Skills / RAG 应用 | |
| 12 | nextlevelbuilder/ui-ux-pro-max-skill | Python | 提供设计智能的 AI Skill | 与甲-6 MuseCode、Skill/Expert 三层能力开放形成呼应 |
周榜(AI 专项,2026-09-03):排序与日榜完全一致(openclaw / deepseek-harness / n8n / AutoGPT / prompts.chat …),说明本周 AI 开源热度集中且稳定,头部无单日异动。
观察:本期 AI 开源热度的关键词是 「Agent 执行面」(openclaw 跨端助手、deepseek-harness 插件化、n8n 工作流、AutoGPT 自主)——与本期甲组「AI Coding 从补全走向长程自主执行」的主线完全一致。开源社区正在把「能跑、能插、能编」作为 Agent 的默认形态,而非单纯追求模型分数。
| # | 议题 | 影响与关注理由 | 置信 |
|---|---|---|---|
| 8.1 | 宇树腰斩 = 公众第一次系统性重估「量产元年」叙事 | 销量/营收双增、股价却 11 个交易日腰斩,是把「概念估值」拉回「基本面定价」的公开课。对散户与产业观察者而言,这是比任何研报都直观的投资者教育:订单 ≠ 稳定运营 ≠ 估值永续(见乙-4) | 🟢 已确认 |
| 8.2 | 信通院 C-L 双维分级成国家级标尺 | 场景挑战度 C1–C5 + 应用成熟度 L1–L5 打通「定义—实测—分级」,将直接改写项目验收口径与政府采购门槛。行业最大信任赤字(演示 ≠ 交付 ≠ 连续运营)第一次有了可审计的解法(见乙-3) | 🟡 多方报道 |
| 8.3 | 「遥操作 0.5 折算系数」让自主性可计量 | 世界人形机器人运动会规定全自主按原始成绩、遥操作得分乘 0.5——把宣传词「自主」变成可比较、可排名的指标。规则比论文更快地改变行业行为(见乙-5) | 🟢 已确认 |
| 8.4 | Linux CVE 因 AI 自动扫描暴增 | 稳定版维护者称 6.x 每版修约 500 CVE、7.x 后破 1000、7.3 或破 2000,主因是 AI 静态分析在「翻旧账」。修复能力没同步扩容,开源维护负担与供应链风险同时上升——被严重低估的二阶效应(见 C-4) | 🔴 待验证 |
| 8.5 | 自托管执行面推动企业「数据主权」意识 | Cursor Self-Hosted Machines 把代码/密钥留在内网,使「代码不能出内网」的大客户阻力被工程化消除。这把数据主权从合规口号变成可采购的功能(见甲-5) | 🟢 已确认 |
| 8.6 | Astra 循环深度推理冲击 AI 安全治理 | 把部分推理转入不可读激活值,削弱 CoT 可监控性这一安全支柱。若成主流路线,基于思维链审计的监管方案将大面积失效,监管口径被迫调整(见甲-8 / C-2) | 🟡 多方报道 |
| # | 议题 | 数据 / 看点 | 置信 |
|---|---|---|---|
| 9.1 | 具身智能上半年融资 935 亿元、同比增 5 倍 | 国家级智库首次定调「从展台到赛场」商业化转折期。935 亿是判断一级市场热度的关键基准(见乙-5) | 🟢 已确认 |
| 9.2 | 二级市场估值锚切换:宇树市值蒸发 2000 亿 | 营收 +48.5%、累计下线 1.8 万台人形,却腰斩。一级/二级背离明确,融资故事须讲毛利率与复购而非台数(见乙-4) | 🟢 已确认 |
| 9.3 | 开发者级本体价格击穿,价值向数据/模型层迁移 | 元点「小桥」8888 元、Nori A3 $1688 同日出现,本体跌进个人可负担区间。数据瓶颈解法从「造更好的机器人」转向「铺更多的机器人」(见乙-7) | 🔴 待验证 |
| 9.4 | 三旗舰同日发布 + 缓存降价,重画 coding 账单结构 | Fable 5.1 缓存 -75%、Gemini 3.8 Flash 促销价 $0.75、Qwen3.8 单价仅 1/6.7。高频低复杂度 coding 任务的单位成本断崖式下降,企业 Agent 月账单可显著压缩(见甲-1 / 甲-2 / 甲-4) | 🟢 已确认 |
| 9.5 | 世界模型首进量产 OTA,自动驾驶数据飞轮启动 | 上汽大众 Momenta R7 强化学习世界模型大规模 OTA,30 万级价格带落地 = 大规模真实交互数据回流,是纯机器人公司短期难复制的护城河(见乙-6) | 🟡 多方报道 |
| 9.6 | 开源 Agent 基建繁荣,降低创业与二次开发成本 | GitHub AI 日/周榜头部(openclaw、deepseek-harness、n8n、dify、langflow、open-webui)均为可自部署的 Agent 栈,意味着中小团队搭建专属 Agent 的边际成本持续走低(见第六章) | 🟢 已确认 |
信息时效纪律:本报告严格按统计窗口(2026-09-02 00:00 → 2026-09-03 07:30 GMT+8)筛选。所有无法核到窗口内的条目,无论多重要,一律进入「丢弃清单」或「超窗」标注,不计入已确认正文。DeepSeek 专项执行「无 D 即明说无 D」纪律,旧闻二次放大不当新闻。
多源交叉验证:① 社区信源(B 站三 UP 主字幕/自述)仅作一手线索,进入第三章精选者均已用官方或权威媒体二次核验;② 模型评分并列 livebench.ai / artificialanalysis.ai / llm-stats.com 三口径,分歧本身即信息;③ 社区快讯默认低置信度,标注 🔴 待验证,仅用于建立观察假设。
置信度图例:🟢 已确认(官方/可核渠道)|🟡 多方报道(独立源≥2,部分细节未终核)|🔴 待验证(单源/未获独立佐证)|⚪ 存疑未采用。
性价比(PVP)计算口径:PVP = Artificial Analysis 智能指数 ÷ 混合价(混合价 = (输入×3 + 输出)/4,美元/百万 token),同一口径内计算避免跨源污染;条形图与相对值仅看量级,不宜精确比较。跨口径对比(如 LiveBench 综合 vs AA 智能指数)只作方向性参考。
数据来源透明度:评分价格表数据于 2026-09-03 经脚本直采三大站点;GitHub 趋势于同日经脚本直采。因第三方站点接口偶发变动(如 AA 实时表 404、LiveBench CSV 路径调整),凡遇字段缺失均已透明标注,不臆补。
隐私与脱敏:对外发布版本不含任何真实邮箱、电话、本地路径、账号或内部技术细节;B 站字幕提取的内部记录不公开。
免责声明:本日报由自动化流程汇总公开信息生成,仅供参考,不构成任何投资、采购或商业决策依据。模型分数与价格随厂商调整实时变动,请以官方渠道为准。转载请注明原始信源与日期。
本报告由 AI 日报自动化流程生成 · 生成时间 2026-09-03 07:30 (GMT+8) · 统计窗口 2026-09-02 00:00 → 09-03 07:30