AI 日报 · 2026-09-03(周四)

聚焦方向:AI Coding(AI 编程)× 具身智能

生成时间:2026-09-03 07:30 (GMT+8)

统计窗口:2026-09-02 00:00 → 2026-09-03 07:30 (GMT+8)

今日结论速览:DeepSeek 今日无 D——V4-Flash-Vision-Exp 权重首发实为 8/31(API 更早在 8/21),已在 09-01 期覆盖,9/2 的热度全是媒体二次放大,按时效纪律判为超窗。AI Coding 侧今日是罕见的"三家旗舰同日撞车":Anthropic Claude Fable 5.1 / Mythos 5.1(缓存读取价砍 75%、已成 Claude Code 默认档)、Google Gemini 3.8 Flash / 3.8 Cyber(促销价 $0.75/$3.75,Terminal-Bench 2.1 打到 89.4%)、阿里 Qwen3.8-Max-0902(Code Arena WebDev 1691 登顶)。但今日最有价值的信号不是发布本身,而是 Terminal-Bench 4.0 榜单同步刷新暴露的"跑分—实测背离":Gemini 3.8 Flash 在 2.1 上 89.4%,在 4.0 长程终端任务上只有 19.1%。具身智能侧最大变量是估值锚开始切换——宇树科技上市第 11 个交易日股价腰斘、市值蒸发超 2000 亿,同期半年报却是营收销量双增;以及开发者级本体价格击穿(元点 8888 元、Nori A3 $1,688 同日出现)。

口径说明:每条均标注「时效」与「来源」。置信度分 🟢 已确认 / 🟡 多方报道 / 🔴 待验证 / ⚪ 存疑未采用。凡日期无法核实到窗口内的条目一律进入丢弃清单,不进正文。字幕类内容标注"字幕由平台自动生成"。

实时数据源:① 多引擎新闻检索 + Exa 语义检索(中英文媒体/社区,2026-09-03 抓取);② GitHub AI 趋势榜(日榜/周榜双周期,2026-09-03 抓取);③ livebench.ai(2026-06-25 发布版实时榜,2026-09-03 直采,含每成功任务成本)、artificialanalysis.ai(Intelligence Index,2026-09-03 解析,27 款)、llm-stats.com(2026-09-03 实时榜,371 模型);④ B 站 UP 主口径:黑鸦Heya(1 条资讯,字幕 33 行)、Icyの狼(5 条,其中 4 条资讯 + 1 条官方原声搬运,字幕合计 196 行)、无机酸-_-(3 条个人测评,均未开字幕,改取 UP 主自述结论)。


目录

章节内容条目数
社区信源监控(一手线索,快于媒体)3 个信源 / 9 个视频
DeepSeek 专项 —— 今日无 D排查说明
今日 15 条精选(AI Coding 8 + 具身智能 7)15 条
社区快讯(待验证 / 低置信度)8 条
能力评分与价格表(三口径交叉验证)3 张表 + 性价比
GitHub 当日趋势榜日榜 + 周榜
AI 社会效益6 条
AI 经济效益6 条
方法论与免责声明

一、社区信源监控(今日一手线索,快于媒体)

本节来自三个长期跟踪的社区信源。社区口播往往比媒体稿早 6–24 小时,但置信度低于官方渠道,因此本节只做"线索"用途,凡进入第三章「15 条精选」的内容均已用官方或权威媒体二次核验。

今日窗口内三位 UP 主共发布 9 个视频,全部处理完毕:6 条有平台自动字幕(合计提取 229 行),3 条未开启字幕(改取 UP 主在简介中的自述结论,信息密度实际高于字幕)。

信源状态一览

信源视频数类型字幕核心增量时效
黑鸦Heya1资讯类(AI晚报090)✅ 33 行Astra「循环深度推理」引硅谷讨论、Gemini 3.8 Flash 灰度上线、Grok 4.7 传闻 10 天后发布 / 2.1T 参数、豆包 Work 多智能体当日(约 13h 前)
Icyの狼54 资讯 + 1 官方原声搬运✅ 196 行Gemini 3.8 Flash 定价与 8 项第一 + Terminal-Bench 4.0 短板、Fable 5.1 缓存降价 75%、Qwen3.8-Max-0902 规格、GPT-6-Astra 端点探测方法论、Anthropic 官方发布口径全文当日(5–20h 前)
无机酸-_-3个人测评(AI 六项能力测试)✖ 均未开字幕三条实测结论均指向「跑分虚高」:Fable 5.1「效果优秀但不值这个价」、Gemini 3.8 Flash「没觉得很强,看不到跑分那个程度」、Qwen3.8-Max「变化不算大,配不上价格」当日(3–14h 前)

1.1 黑鸦Heya —— AI晚报090(资讯类,字幕由平台自动生成)

从 33 行口播正文提取的实质增量(已做同音字校正:ESTRA/阿斯特拉 → Astra、欧拉玛 → OpenAI、哈基米 → Gemini):

  1. OpenAI Astra 未发布即引发硅谷讨论:核心卖点被指为「循环深度推理」(recurrent depth / latent reasoning)——在潜空间内多轮迭代,而非纯 token 级思维链。这与本期社区快讯 C-2 的安全争议互为印证。
  2. OpenAI 首席科学家做降温式澄清:对 Astra 的能力边界表态,指外部报道有误读。
  3. Gemini 3.8 Flash 疑似已在 web 端与 Vertex AI 灰度上线——此条在数小时后被 Icyの狼 与榜单数据双重印证为已正式发布,是本期社区信源"快于媒体"的最典型样本。
  4. Grok 4.7 传闻 10 天后发布,参数规模 2.1T——单一信源,本期检索未获独立佐证,标 🔴 待验证,不入精选。
  5. 豆包 Work:多智能体协作办公形态。

来源:B 站 UP 主「黑鸦Heya」AI晚报090(BV1U5tJ6kEXJ),字幕由平台自动生成,本节为要点摘录与同音字校正后的转述。

时效:当日(约 13h 前)。置信度:🟡 多方报道(Gemini 3.8 Flash 已被官方印证;Grok 4.7 与首席科学家表态仍为口播线索)。

1.2 Icyの狼 —— 4 条资讯 + 1 条官方原声搬运(字幕 196 行)

窗口内 5 条视频全部有字幕,是今日信息密度最高的信源:

视频字幕关键增量
Gemini 3.8 Flash 发布(BV1rKtD6EEzG,5h 前)49 行促销价 $0.75/$3.75 至 2026-12-31,之后回 $1.5/$7.5;Terminal-Bench 2.1 89.4%(距 Opus 5 仅 0.3);8 项榜单第一;但 Terminal-Bench 4.0 仅 19.1%(对比 51.8%)、OSWorld 59%(对比 75.4%);Cyber 版漏洞发现 71%、提示注入被攻破率 5.5%,经 "Fair Wind" 计划仅面向政府/公共部门
GPT-6-Astra 端倪(BV1KotS6xEsr,5.6h 前)41 行端点探测方法论:请求已注册但无权限的模型名返回 404,完全不存在的名字返回 400——据此判定 gpt-6-astra 已在后端注册。结合 OpenAI 8/1、9/1 两份报告佐证其网络安全类任务处于顶级梯队
Qwen3.8-Max-0902(BV1Y1t76CERP,19h 前)38 行2.4T 总参 / ~95B 激活(MoE),1M 上下文,最大输出 130K;Code Arena WebDev 1691 第一;$2/$6,缓存命中 $0.17
Fable 5.1 官宣(BV1F3tE6dEr6,20.5h 前)37 行Fable 5.1 与 Mythos 5.1 同步发布,Mythos = 同底座 + 更强护栏版;Terminal-Bench Science 24.7% → 52.6%缓存命中价 $1 → $0.25(-75%);典型任务总成本 -25%、长任务 -45%
Fable 5.1 官方原声(BV1rgtE6xE5H,20h 前)31 行Anthropic 官方发布视频的中文字幕搬运,可作官方口径直引,见下

官方口径要点(来自原声搬运,可直接引用):Anthropic 把 Fable 5.1 的卖点明确压在多步骤长链任务的稳定性上——「第二步的微小错误可能在第四十步引发问题,而它全程稳定运行」,举例为复杂财务模型、长数学证明、含数百处交叉引用的合同;软件工程侧强调「从 code review 到跨整个代码库的性能优化会话」,且支持中断后续接并汇报「尝试过的方法」与「卡壳位置」;研究侧强调返回数据与来源清晰可核查的润色结果与备忘录;科学领域强调阅读文献协作、提出假设、设计实验。

注意口径差异:官方通稿全程未把 Fable 5.1 定位成"编程能力大跃进",而是"长程稳定性 + 科研"。这与无机酸-_- 的实测结论(「Coding 提升有限,优势聚拢在科研与综合素质」)高度一致——这是今日交叉印证质量最高的一组判断。

来源:B 站 UP 主「Icyの狼」上述 5 个视频,字幕由平台自动生成。

时效:当日(5–20.5h 前)。置信度:🟢 已确认(Fable 5.1 / Gemini 3.8 Flash 数据已被官方源印证);GPT-6-Astra 端点推断标 🔴 待验证

1.3 无机酸-_- —— 3 条个人测评,构成今日最强"反跑分"信号

三条视频均未开启平台自动字幕,改取 UP 主在视频简介中的自述结论。该 UP 主坚持标注测试平台、effort 档位与耗时,是少见的可复核个人评测口径:

视频测试环境UP 主自述结论(要点)
Claude Fable 5.1(部分)(3h 前)Windows 11 + Claude Code,AWS 渠道;1–4 题 Max Effort、5–7 题 High Effort耗时:前端网页/后端 MES(High)各约 15 min;黑洞模拟(High)约 25 min;Max 档中式建筑 50 min、体素山水 45 min。「考虑到价格……优秀的效果也变得不是那么值得了」「那个前端网页,Gemini 3.8 Flash 可以用更短的时间、更低的成本做出更好的成品」「Fable 的优势正在聚拢在科研、前沿探索和综合素质方向,本次 Coding 提升有限」。因数据不足不入榜,仅供参考
Gemini 3.8 Flash(5.8h 前)Windows 11 + Antigravity「测了一晚上,真的没觉得它很强……至少看不到跑分的那个程度。好在它依旧很快,在工作流里当快准狠的小刀还算不错」
Qwen3.8 Max 0902(14h 前)Windows 11 + Qoder「看到跑分我还以为能有 Claude Opus 5 的水准呢,实测发现变化不算大……较自己虽有改进但仍旧配不上它的价格

为什么这条最值得看:今日三家旗舰的官方数字都很漂亮(89.4%、1691 分、52.6%),但同一位评测者在同一套六项任务上对三者给出的都是「跑分高于实测体感」。这与第三章甲组第 3 条(Terminal-Bench 4.0 上 Gemini 3.8 Flash 仅 19.1%)在完全独立的口径上得出同一方向的结论。跑分—实测背离,是本期最重要的横向发现。

来源:B 站 UP 主「无机酸-_-」上述 3 个视频的公开简介。

时效:当日(3–14h 前)。置信度:🟡 个人实测口径(样本量小、主观评分,但方法与耗时可复核;已标明为个人观点而非客观结论)。


二、DeepSeek 专项 今日无 D

结论:今日无 D。 窗口(2026-09-02 00:00 → 2026-09-03 07:30 GMT+8)内没有 DeepSeek 原生新事件

本期做了一次比往期更严格的日期回溯,原因是 9/2 中文媒体出现了一批「DeepSeek 正式发布多模态开源权重」的稿件,看上去像是当日新闻。逐一核到一手源后确认:这些都是超窗事件的媒体二次放大。按既定的时效纪律(宁缺毋滥、旧闻不当新闻),一律不计入。

2.1 边缘信息(已排查,不计入)

信息为何不计入
V4-Flash-Vision-Exp「9/2 正式发布 / 开源权重」权重首发实为 8/31(API 更早在 8/21)。多个一手渠道的发布日志一致指向 8/31,且本刊 09-01 期已报道。9/2 稿件属二次放大
前七月财务披露(营收约 4.75 亿、算力投入约 110 亿)9/2 有媒体转载并做「商业化叙事对冲」分析,但非官方新公告,也无独立权威源支撑该组数字
峰谷分时计价「调整」讨论调价实际 8/17 上线,云厂商规则 8/29 生效,均超窗;9/2 仅为第三方解读
Harness 开源框架热度开发者预览版为 8 月末发布,预热更早在 8/13;9/2 仅为媒体补稿
接入微信支付8/31 宣布,超窗

2.2 榜单里仍有 DeepSeek,但那不算「今日新事」

需要区分两件事:「DeepSeek 有没有新动作」「DeepSeek 模型表现如何」。后者今日依然亮眼,但属于榜单快照而非事件:

判定纪律说明:第三方平台上架、榜单出现、他人使用、旧闻复述,均不构成原生事件。本刊坚持「无 D 就说无 D」,避免把生态外溢包装成公司动作——这是过去几期反复校准过的口径。

时效:核查截至 2026-09-03 07:30。置信度:🟢 已确认(多渠道日期回溯一致)。


三、今日 15 条精选

甲组 · AI Coding(8 条)

甲-1|Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,缓存读取价砍 75%,已成 Claude Code 默认档

甲-2|Google 发布 Gemini 3.8 Flash 与 3.8 Cyber,促销价 $0.75/$3.75,Cyber 版仅面向政府

甲-3|Terminal-Bench 4.0 榜单刷新:Gemini 3.8 Flash 仅 19.1%,暴露「跑分—长程能力」断层

甲-4|阿里 Qwen3.8-Max-0902 登顶 Code Arena WebDev,编程 8 项全涨

甲-5|Cursor 上线自托管机器(Self-Hosted Machines),代码与密钥不出内网

甲-6|Meta 发布 Muse Spark 1.3 并上架 MuseCode CLI,宣称将开源权重

甲-7|终端 Agent 安全加固日:Codex CLI 0.152.1 修 Guardian 审批漏洞,Gemini CLI 0.58.0 加固 macOS 沙箱

甲-8|OpenAI 发布 Astra 上线前安全预览,称首次触达「关键网络安全能力阈值」

甲组备选(窗口内但未入选):① 腾讯 WorkBuddy 开放平台 9/2 上线,首批超百家伙伴,向开发者开放 Skill / Expert / Connector 三层能力(中证网、上海证券报,🟢);② Google Antigravity CLI v1.1.24(仅二次聚合源,🔴 待验证);③ Grok 4.7 传闻 10 天后发布、2.1T 参数(单一信源,🔴 待验证,本轮未获独立佐证)。

乙组 · 具身智能(7 条)

乙-1|酷哇科技发布自适应世界模型框架 RISE 并全量开源,推演延迟压至 287ms

乙-2|自变量发布 TwinDEX 孪生三指灵巧手,称无本体数据可近乎完全替代真机遥操作

乙-3|中国信通院启动具身智能实景应用能力评估,首发 C-L 双维分级模型

乙-4|宇树股价首破 550 元、11 个交易日腰斩,市值蒸发超 2000 亿——量价背离开始了

乙-5|新华社中经社定调「从展台到赛场」:上半年具身智能融资 935 亿元、同比增 5 倍

乙-6|上汽大众 ID.ERA 9X 大规模 OTA 推送强化学习世界模型,世界模型首次进量产 OTA

乙-7|开发者级本体价格击穿:元点 8888 元「小桥」与 Nori A3 的 $1,688 同日出现

乙组备选(窗口内但未入选):① 天工机器人完成数亿元融资,初芯基金领投、经纬创投与合肥国资跟投,用于分拣类机器人扩产与人形分拣研发(大河财立方,🟡);② UniSteer——微软亚洲研究院 / 悉尼科技大学 / 清华提出动作到噪声近似反演,把人类纠正接入流匹配 VLA 的噪声空间强化学习,机械臂用 2 条演示轨迹完成 16 颗拼豆(机器之心 9/2 10:45,🟡);③ 顺德智能机器人应用大会发布《湾区具身智能产业集聚发展倡议》,中科紫东太初发布通用多模态具身灵巧操作大模型,新宝旗下东菱咖啡机器人整套方案成本较同类低 20%–30%(南方+,🟡);④ 长江日报统计国内已有 14 家主流车企明确布局人形机器人(🟡)。

乙组丢弃清单(超窗,不入正文):Sharpa 融资超 45 亿元 / 估值 33 亿美元并开出全自主人形餐厅(9/1);梅卡曼德港交所上市、市值 127.1 亿港元(9/1);特斯拉 Optimus 确认弗里蒙特量产启动、9 月周产目标 1000 台(9/1);我国牵头的家用机器人国际标准发布(9/1);玄创机器人数千万元 A1 轮(9/1);舜行奇点数千万元种子轮(9/1);众擎 T800 郑州下线(9/1);前 7 月工业机器人出口 73.4 亿元、同比 +13.2%(9/1);英伟达 35 亿美元认购联发科可转债(9/1);智元觅蜂第 2 万套无本体数采设备交付(8/31);赛迪六维力传感器市场报告(8/31);小鹏机器人首轮超 9 亿美元融资(8/24)。另有 SAG「2026H1 全球人形交付 19100 台」数据因原始统计源无法独立核验,⚪ 存疑未采用。


四、社区快讯(待验证 / 低置信度)

本节是「官媒还没报、社区已在讨论」的早期信号。默认置信度低于第三章,仅供建立观察假设,请勿直接当结论使用。

编号快讯信号价值交叉印证置信
C-1Fable 5.1 缓存降价 75%,但第三方实测单次任务成本反而 +20% —— 原因是输出 token 增至约 1.7 倍,抵消了缓存折扣。相关讨论在 Hacker News 当日达 1200 分 / 1122 评论揭示「降价」叙事与真实 Agent 账单之间的落差,直接影响选型与预算测算。这条的实用价值高于任何官方定价通稿3+ 独立信源🟢 已确认
C-2Astra 的「循环深度」让思维链不可读,安全社区强烈反弹 —— 有报道披露 Astra 把部分推理转入无可读输出的激活值;一位安全研究机构成员在社交平台称这是「AI 安全史上最糟的进展」,担心破坏 CoT 可监控性。OpenAI 首席科学家回应称报道有误读前沿架构开始用可解释性换成本与能力。若成为主流路线,现有基于思维链审计的安全方案将大面积失效,监管口径也会被迫调整2 个独立信源🟡 多方报道
C-3有人系统复盘知名 AI 唱衰者的历史预测,结论是多数落空 —— 该复盘帖上 Hacker News 首页并获 900+ 分,引发「AI 泡沫论可信度」的大讨论社区对「AI 是否泡沫」的叙事正在自我校正。这类元讨论往往领先于投资情绪与招聘节奏的转向2 个独立信源🟡 多方报道
C-4Linux 内核 CVE 数量因 AI 自动扫描暴增 —— 稳定版维护者分享:6.x 每版约修 500 个 CVE,7.x 后升至 1000+,7.3 或破 2000。主因是 AI 辅助静态分析在「翻旧账」,挖出大量历史代码隐患,维护者已直言忙不过来AI 正在改变漏洞披露的节奏,而修复能力没有同步扩容。开源维护负担与供应链风险同时上升,这是被严重低估的二阶效应单一信源(经媒体转述)🔴 待验证
C-5r/LocalLLaMA 为 GLM-5.3-Flash 建中央讨论帖 —— 社区围绕智谱这款原生多模态模型集中交流量化、微调与推理服务经验中国开源模型在海外本地推理社区的采用度上升。结合第五章性价比表里 GLM-5.3-Flash 高居第一,这个生态外溢值得持续跟踪单一信源🔴 待验证
C-6本地推理提速:Qwen3.8 27B 跑出 280 tok/s —— 有用户报告双 R9700 + AWQ MXFP4 量化下达 280 tok/s、920k KV 缓存;ExLlama v3 更新支持 MoE 的 CPU offload 与 MTP消费级硬件上跑长上下文 Agent 循环的可行性在提升。若成立,本地 coding agent 的经济性会明显改善单一信源🔴 待验证
C-7开源视频模型衍生生态活跃 —— 社区自建 15+ 个 LoRA / 加速变体榜单(FastH3、Lightx2v 等),226 赞 / 49 评论衍生生态密度是开源模型成熟度的可靠代理指标,比下载量更能反映真实使用单一信源🔴 待验证
C-8传闻有头部闭源厂负责人游说限制开源算力访问 —— 社区热帖引述某社交平台账号说法,质疑此举将削弱本地推理生态若属实将影响开源 / 本地推理的长期可得性。但目前仅为未经证实的指控,无一手证据,列此仅作观察项单一信源,未经证实🔴 待验证

另有一条中文社区讨论:有开发者反映给某编程 Agent 配置网络代理后,代理信息疑似被回传厂商,引发隐私与合规担忧。🔴 待验证(单一信源,未见厂商回应)。该类讨论的价值在于提示企业落地时应把「Agent 的数据回传边界」列入评估清单——这也正好呼应甲-5 自托管方案的市场逻辑。


五、截至今日 AI 多项能力评分表(三口径交叉验证)

为什么要三个口径:单一榜单容易被针对性优化,也容易因评测集设计放大某一类能力。本节并列三个独立机构的口径,并额外给出跨口径的性价比合成,目的不是选出「最强模型」,而是让口径之间的分歧本身成为信息。今日甲-3 揭示的 Terminal-Bench 2.1 与 4.0 的巨大落差,就是这种分歧最好的例子。

5.1 口径 A · LiveBench 实时榜(Top 20,2026-09-03 直采)

发布版本 2026-06-25。cost 列为每成功任务成本(美元),是本表最实用的一列——它把能力与账单放到了同一行。

#模型开源综合推理编程Agentic数学数据语言指令每任务 $
1Claude Fable 5.1 Max Effort83.491.786.466.197.080.389.573.01.212
2Claude Fable 5 Max Effort83.089.786.062.296.080.590.775.81.439
3GPT-5.6 Sol Max Effort81.091.783.956.296.279.887.771.80.515
4GPT-5.5 Thinking xHigh80.289.782.154.095.981.687.470.70.435
5Claude 5 Opus Thinking Max80.191.281.465.295.774.688.763.80.699
6Kimi K379.290.781.462.284.478.785.571.40.348
7Gemini 3.7 Flash High78.887.878.958.393.568.085.579.90.157
8Qwen 3.8 Max78.588.272.964.691.378.479.774.10.275
9Grok 4.678.090.576.857.092.673.983.771.90.207
10GPT-5.4 Thinking xHigh78.088.177.553.894.179.382.670.20.387
11Muse Spark 1.2 xHigh78.090.077.557.691.276.578.674.30.375
12GPT-5.6 Terra Max Effort77.990.678.254.994.979.382.964.60.352
13DeepSeek V4 Pro 081377.485.877.254.995.179.282.167.70.044
14Gemini 3.1 Pro Preview High77.084.076.544.191.078.585.479.10.286
15DeepSeek V4 Flash Vision Exp76.885.468.265.187.879.580.471.00.051
16Claude 4.7 Opus Thinking xHigh76.587.282.150.792.978.377.966.70.528
17Claude 4.8 Opus Thinking Max76.289.281.850.594.366.079.772.00.983
18Qwen 3.8 Flash Next76.287.472.661.685.874.274.677.10.042
19GLM-5.376.185.879.060.987.970.279.969.30.450
20Claude Sonnet 5 xHigh76.088.780.759.492.971.775.063.90.505

读表要点

5.2 口径 B · Artificial Analysis 智能指数(Top 19 有完整价格数据,2026-09-03 解析)

混合价 = (输入×3 + 输出) ÷ 4(美元 / 百万 token)。

#模型厂商智能指数编程指数混合价每任务 $输出速度 tok/s
1Claude Fable 5.1 (max)Anthropic65.761.320.003.68966.2
2Claude Opus 5 (max)Anthropic63.159.210.002.33756.6
3Muse Spark 1.3 (max)Meta62.159.3
4Claude Fable 5Anthropic62.156.620.003.14065.1
5GPT-5.6 Sol (max)OpenAI60.957.88.000.95371.3
6Grok 4.6 (high)xAI60.958.73.000.93754.6
7Muse Spark 1.3 (xhigh)Meta60.856.12.000.547181.7
8Kimi K3 (max)Kimi59.754.36.000.83737.9
9GLM-5.3 (max)Z AI59.559.12.150.68362.8
10Gemini 3.8 Flash (high)Google58.750.01.500.577302.1
11Qwen3.8 2.4T A95BAlibaba57.757.13.000.80738.6
12GLM-5.3-FlashZ AI57.558.20.23750.08744.6
13GPT-5.6 Terra (max)OpenAI56.650.24.500.52697.7
14DeepSeek V4 Pro 0813 (max)DeepSeek53.249.61.980.26560.2
15GPT-5.6 Luna (max)OpenAI52.346.90.450.049115.6
16Qwen3.8 27B (xhigh)Alibaba52.050.91.1250.36940.1
17MiniMax-M3MiniMax45.436.10.5250.13989.4
18InklingThinking Machines42.334.11.7630.33974.6
19Nemotron 3 UltraNVIDIA38.327.51.1750.386116.5

读表要点

5.3 口径 C · llm-stats 综合分 + 混合价(Top 15,共 371 款,2026-09-03)

该站未提供单一综合分,本表的「综合」列为 HLE / GPQA / SWE 三项均值(本地计算),仅用于横向排序,不与前两表数值直接可比。

#模型厂商综合输入 $输出 $混合价吞吐 tok/s上下文开源
1GPT-5.6 SolOpenAI0.9465.0030.0011.25106.61.05M
2Grok 4.5xAI0.9302.006.003.0040.1500K
3GPT-5.6 TerraOpenAI0.9292.0012.004.50117.91.05M
4GPT-5.6 LunaOpenAI0.9230.201.200.45189.31.05M
5Hy4 previewTencent0.923
6GPT-5.1 HighOpenAI0.881
7GPT-5 MediumOpenAI0.881
8GPT-5 HighOpenAI0.873
9GPT-5.5 InstantOpenAI0.8565.0030.0011.25288.9400K
10Grok-3xAI0.8463.0015.006.00128K
11Claude Mythos PreviewAnthropic0.844
12Hy3Tencent0.842
13ChatGPT-4o LatestOpenAI0.840
14Grok-3 MinixAI0.840
15Claude Opus 4.5Anthropic0.840

读表要点:该口径的排序与前两个口径明显不同——GPT 系列在此更占优,Claude Fable 5.1 未进前 15。原因是三项均值(HLE / GPQA / SWE)偏重知识与学术推理,对长程 Agentic 能力几乎不敏感。这正是并列三口径的意义:如果你的场景是长程自动化,请以口径 A 的 Agentic 列为准,不要看这一表的排序。 另外该表中 GPT-5.6 Luna 以 $0.45 混合价拿到 0.923 综合分,性价比表现突出(见 5.4 第 2 名)。

5.4 性价比表(Price vs Performance)

PVP = Artificial Analysis 智能指数 ÷ 混合价(同一口径内计算,避免跨口径污染)。数值越高越划算,仅看量级,不宜精确比较。

GLM-5.3-Flash
241.9
57.5 / 0.2375
GPT-5.6 Luna (max)
116.3
52.3 / 0.45
MiniMax-M3
86.5
45.4 / 0.525
Qwen3.8 27B (xhigh)
46.2
52.0 / 1.125
Gemini 3.5 Flash-Lite
44.0
37.4 / 0.85
Gemini 3.8 Flash (high)
39.1
58.7 / 1.50
Nemotron 3 Ultra
32.6
38.3 / 1.175
Muse Spark 1.3 (xhigh)
30.4
60.8 / 2.00
GLM-5.3 (max)
27.7
59.5 / 2.15
DeepSeek V4 Pro 0813
26.9
53.2 / 1.98
Inkling
24.0
42.3 / 1.763
Grok 4.6 (high)
20.3
60.9 / 3.00
Qwen3.8 2.4T A95B
19.2
57.7 / 3.00
GPT-5.6 Terra (max)
12.6
56.6 / 4.50
Kimi K3 (max)
9.9
59.7 / 6.00
GPT-5.6 Sol (max)
7.6
60.9 / 8.00
Claude Opus 5 (max)
6.3
63.1 / 10.00
Claude Fable 5.1 (max)
3.3
65.7 / 20.00
Claude Fable 5
3.1
62.1 / 20.00

今日最关键的一组数字——榜首能力模型 vs 榜首性价比模型:

对比项Claude Fable 5.1 (max)GLM-5.3-Flash差距
智能指数65.757.5能力差 12.5%
混合价 / 百万 token$20.00$0.2375价格差 84.2 倍
每成功任务成本$3.689$0.087成本差 42.5 倍
PVP3.3241.973 倍

怎么用这张表12.5% 的能力差距对应 42.5 倍的成本差距——这个比例意味着,除了确实需要顶格能力的长程科研 / 复杂重构任务,绝大多数日常 coding 场景用低价档 + 多轮重试的期望成本更低。合理的工程做法是分层路由:高频简单任务走 Flash 档(GLM-5.3-Flash / Gemini 3.8 Flash),中等任务走 $2–3 档(GLM-5.3 / Muse Spark 1.3 xhigh),只把真正的长程硬任务交给旗舰。但请务必对照甲-3 的警告:低价档在长程终端任务上的崩塌是真实的(Gemini 3.8 Flash 在 Terminal-Bench 4.0 仅 19.1%),分层路由的关键在于把任务长度和自主步数作为路由依据,而不只看任务表面难度。


六、GitHub 当日趋势榜(开源生态风向标)

本节采用 AI 专项口径(按 AI/ML/LLM 关键词与话题检索近窗被 push 且高 star 增量仓库),而非 GitHub 整体 trending——后者今日前排被 awesomepublic-apisfreeCodeCamp 这类元清单占据,与 AI 日报主题错位。数据于 2026-09-03github-ai-trends 脚本直采。

日榜 Top 12(AI 专项,2026-09-03)

#仓库语言简介与本期关联
1openclaw/openclawTypeScript跨 OS 的个人 AI 助手("龙虾之道")开源 Agent 基础设施热度第一,呼应甲-5 自托管执行面趋势
2deepseek-ai/deepseek-harnessTypeScriptDeepSeek 官方 Harness:Everything is a Plugin与第二章「DeepSeek 无原生新事、但生态外溢持续」互为印证
3n8n-io/n8nTypeScript公平代码工作流自动化,原生 AI 能力低代码 Agent 编排进入主榜
4Significant-Gravitas/AutoGPTPython自主 Agent 愿景长青自主 Agent 项目
5f/prompts.chatHTML经典 ChatGPT Prompt 合集提示工程仍是高频入口
6Snailclimb/JavaGuideJavaScriptJava/后端面试指南(已含 AI 应用开发)传统面试资料开始覆盖 AI 应用开发
7langgenius/difyTypeScriptAgentic 工作流 / RAG 管线
8langflow-ai/langflowPython可视化构建并部署 AI 应用
9open-webui/open-webuiPython本地友好 AI 界面(兼容 Ollama/OpenAI)呼应 C-6 本地推理提速趋势
10langchain-ai/langchainPythonAgent 工程平台
11Shubhamsaboo/awesome-llm-appsPython100+ 开源 Agents / Skills / RAG 应用
12nextlevelbuilder/ui-ux-pro-max-skillPython提供设计智能的 AI Skill与甲-6 MuseCode、Skill/Expert 三层能力开放形成呼应

周榜(AI 专项,2026-09-03):排序与日榜完全一致(openclaw / deepseek-harness / n8n / AutoGPT / prompts.chat …),说明本周 AI 开源热度集中且稳定,头部无单日异动。

观察:本期 AI 开源热度的关键词是 「Agent 执行面」(openclaw 跨端助手、deepseek-harness 插件化、n8n 工作流、AutoGPT 自主)——与本期甲组「AI Coding 从补全走向长程自主执行」的主线完全一致。开源社区正在把「能跑、能插、能编」作为 Agent 的默认形态,而非单纯追求模型分数。


八、AI 社会效益(对社会运行与公共福祉的影响)

#议题影响与关注理由置信
8.1宇树腰斩 = 公众第一次系统性重估「量产元年」叙事销量/营收双增、股价却 11 个交易日腰斩,是把「概念估值」拉回「基本面定价」的公开课。对散户与产业观察者而言,这是比任何研报都直观的投资者教育:订单 ≠ 稳定运营 ≠ 估值永续(见乙-4)🟢 已确认
8.2信通院 C-L 双维分级成国家级标尺场景挑战度 C1–C5 + 应用成熟度 L1–L5 打通「定义—实测—分级」,将直接改写项目验收口径与政府采购门槛。行业最大信任赤字(演示 ≠ 交付 ≠ 连续运营)第一次有了可审计的解法(见乙-3)🟡 多方报道
8.3「遥操作 0.5 折算系数」让自主性可计量世界人形机器人运动会规定全自主按原始成绩、遥操作得分乘 0.5——把宣传词「自主」变成可比较、可排名的指标。规则比论文更快地改变行业行为(见乙-5)🟢 已确认
8.4Linux CVE 因 AI 自动扫描暴增稳定版维护者称 6.x 每版修约 500 CVE、7.x 后破 1000、7.3 或破 2000,主因是 AI 静态分析在「翻旧账」。修复能力没同步扩容,开源维护负担与供应链风险同时上升——被严重低估的二阶效应(见 C-4)🔴 待验证
8.5自托管执行面推动企业「数据主权」意识Cursor Self-Hosted Machines 把代码/密钥留在内网,使「代码不能出内网」的大客户阻力被工程化消除。这把数据主权从合规口号变成可采购的功能(见甲-5)🟢 已确认
8.6Astra 循环深度推理冲击 AI 安全治理把部分推理转入不可读激活值,削弱 CoT 可监控性这一安全支柱。若成主流路线,基于思维链审计的监管方案将大面积失效,监管口径被迫调整(见甲-8 / C-2)🟡 多方报道

九、AI 经济效益(产业价值与资本动向)

#议题数据 / 看点置信
9.1具身智能上半年融资 935 亿元、同比增 5 倍国家级智库首次定调「从展台到赛场」商业化转折期。935 亿是判断一级市场热度的关键基准(见乙-5)🟢 已确认
9.2二级市场估值锚切换:宇树市值蒸发 2000 亿营收 +48.5%、累计下线 1.8 万台人形,却腰斩。一级/二级背离明确,融资故事须讲毛利率与复购而非台数(见乙-4)🟢 已确认
9.3开发者级本体价格击穿,价值向数据/模型层迁移元点「小桥」8888 元、Nori A3 $1688 同日出现,本体跌进个人可负担区间。数据瓶颈解法从「造更好的机器人」转向「铺更多的机器人」(见乙-7)🔴 待验证
9.4三旗舰同日发布 + 缓存降价,重画 coding 账单结构Fable 5.1 缓存 -75%、Gemini 3.8 Flash 促销价 $0.75、Qwen3.8 单价仅 1/6.7。高频低复杂度 coding 任务的单位成本断崖式下降,企业 Agent 月账单可显著压缩(见甲-1 / 甲-2 / 甲-4)🟢 已确认
9.5世界模型首进量产 OTA,自动驾驶数据飞轮启动上汽大众 Momenta R7 强化学习世界模型大规模 OTA,30 万级价格带落地 = 大规模真实交互数据回流,是纯机器人公司短期难复制的护城河(见乙-6)🟡 多方报道
9.6开源 Agent 基建繁荣,降低创业与二次开发成本GitHub AI 日/周榜头部(openclaw、deepseek-harness、n8n、dify、langflow、open-webui)均为可自部署的 Agent 栈,意味着中小团队搭建专属 Agent 的边际成本持续走低(见第六章)🟢 已确认

十、方法论与免责声明

信息时效纪律:本报告严格按统计窗口(2026-09-02 00:00 → 2026-09-03 07:30 GMT+8)筛选。所有无法核到窗口内的条目,无论多重要,一律进入「丢弃清单」或「超窗」标注,不计入已确认正文。DeepSeek 专项执行「无 D 即明说无 D」纪律,旧闻二次放大不当新闻。

多源交叉验证:① 社区信源(B 站三 UP 主字幕/自述)仅作一手线索,进入第三章精选者均已用官方或权威媒体二次核验;② 模型评分并列 livebench.ai / artificialanalysis.ai / llm-stats.com 三口径,分歧本身即信息;③ 社区快讯默认低置信度,标注 🔴 待验证,仅用于建立观察假设。

置信度图例:🟢 已确认(官方/可核渠道)|🟡 多方报道(独立源≥2,部分细节未终核)|🔴 待验证(单源/未获独立佐证)|⚪ 存疑未采用。

性价比(PVP)计算口径:PVP = Artificial Analysis 智能指数 ÷ 混合价(混合价 = (输入×3 + 输出)/4,美元/百万 token),同一口径内计算避免跨源污染;条形图与相对值仅看量级,不宜精确比较。跨口径对比(如 LiveBench 综合 vs AA 智能指数)只作方向性参考。

数据来源透明度:评分价格表数据于 2026-09-03 经脚本直采三大站点;GitHub 趋势于同日经脚本直采。因第三方站点接口偶发变动(如 AA 实时表 404、LiveBench CSV 路径调整),凡遇字段缺失均已透明标注,不臆补。

隐私与脱敏:对外发布版本不含任何真实邮箱、电话、本地路径、账号或内部技术细节;B 站字幕提取的内部记录不公开。

免责声明:本日报由自动化流程汇总公开信息生成,仅供参考,不构成任何投资、采购或商业决策依据。模型分数与价格随厂商调整实时变动,请以官方渠道为准。转载请注明原始信源与日期。


本报告由 AI 日报自动化流程生成 · 生成时间 2026-09-03 07:30 (GMT+8) · 统计窗口 2026-09-02 00:00 → 09-03 07:30