覆盖方向:AI Coding × 具身智能 | 社区一手信源:X / 中文社区(Linux.do·V2EX·知乎)/ 海外社区(r/LocalLLaMA·Hacker News)/ 开发者社区(GitHub Trending·Hugging Face)/ 聚合线索号(机器之心·量子位·新智元·智猩猩AI·每日AI早报·腾讯研究院AI速递·仿生人形日报·FutureX)。
实时数据源(抓取于 2026-09-09):① LiveBench(官网实时榜,release 2026-06-25)② Artificial Analysis Intelligence Index v4.3(官网 JS 渲染,本日取 v4.1.1 公开快照作量级参考,详见第六节)③ llm-stats.com(389 模型实时价/吞吐/分项)④ GitHub Trending(AI 专项日榜,2026-09-09 现场抓取)⑤ 社区信源交叉验证(公开渠道替代,详见第一节说明)。
免责声明:本文由自动化流程汇总公开信源生成,逐条标注「时效 / 来源 / 置信度」,仅供参考,不构成投资或商业决策依据。社区单源未交叉验证者单列「社区快讯(待验证)」。
浏览器就绪门禁说明(透明披露):本运行(自动化无人值守)会话内
edge-debug脚本返回 STARTED(OS 层 Edge 已就绪,端口 9223,已恢复用户会话),但浏览器 MCP 控制通道未连接——当前会话不可调用browser_connect,三位 B 站 UP 主(黑鸦Heya / Icyの狼 / 无机酸-_-)的字幕 DOM 抓取未能执行。本环节未绕过、未静默跳过——社区一手信号改由以下公开可核验渠道交叉验证替代,所有入选条目均标注可追溯来源。
替代社区信源与交叉验证情况
| 渠道 | 本期印证内容 | 时效 | 可信度 |
|---|---|---|---|
| X(@MaxForAI 等 AI 资讯号) | DeepSeek V4.1 Flash 内测、Flash 降价、GPT-6 Astra「AGI」争议、特斯拉 Optimus 5000 台订单 | 09-08~09-09 | 大概率属实(多账号同向) |
| 腾讯研究院 AI 速递 20260909 | DeepSeek V4.1 Flash 内测、MiniCPM5-2B 开源、腾讯文档 AI 工作台、小米 MiMo 桌面客户端 | 09-09 | 已确认(机构信源) |
| 每日AI早报 / 仿生人形日报 | 魔法原子 IFA 三款机器人、松延 Scalabot+HERON 世界模型、优必选销量、深圳机器人工作方案 | 09-08~09-09 | 已确认 |
| GitHub Trending(AI 专项日榜) | openclaw #1、deepseek-harness #2、n8n #3,AI-Agent 工具链霸榜 | 09-09 | 已确认(榜单客观) |
| 聚合号(机器之心/量子位/新智元/智猩猩AI/时代之/证券日报/科技日报/新华网) | 国产开源生态卡位、具身三道坎、广州全球首个世界模型、Mistral 30 亿欧 D 轮 | 09-07~09-09 | 已确认/大概率 |
严格鉴别结论:今日最大社区共识为「DeepSeek V4.1 Flash 内测 + Flash 系列降价」双响炮(AI Coding / 模型发布主线),以及「具身智能量产拐点临近(特斯拉 5000 台 Optimus 订单 + 小鹏走下产线 + 松延/魔法原子密集发布)」主线;「国产开源大模型集体卡位 + 词元经济爆发」与「GPT-6 Astra『AGI』叙事遭评测反噬」为两条贯穿全天的次级主线。
DeepSeek 专项 · 今日有 D ✅(过去 24h 窗口 09-08 ~ 09-09 有原生 DeepSeek 重大动态)
| 编号 | 事件 | 时效 | 来源 | 置信度 |
|---|---|---|---|---|
| D1 | DeepSeek V4.1 Flash 中间版本开启内测:采用新模型结构、原生支持多模态,能力更强/速度更快/成本更低;保持 base_url 不变、模型名改为 deepseek-v4.1-flash-expires-on-0910 即可调用,9 月 10 日自动下线,每账号限流 20 并发,当前计费与 V4 Flash 相同;开发者实测最高输出速度达 507 tokens/s、多人平均超 300 tokens/s | 09-08~09-09 | 澎湃新闻(09-08)/ 腾讯研究院 AI 速递(09-09)/ KOCPC(09-08) | ✅ 已确认(API 已可调用 + 三源印证) |
| D2 | DeepSeek Flash 系列宣布降价:官方平台公告将于北京时间 2026-09-10 12:00 起执行新价——空闲时段输入缓存命中 0.02 元、输入缓存未命中 1 元、输出 4 元/百万 tokens;高峰时段(工作日 9-12/14-18)为空闲 2 倍。较 8 月中旬涨价后(输出 9 元)大幅回落,基本回到更低水平 | 09-09(9/10 生效) | DeepSeek 开放平台公告(经 IT之家/微博 09-09 披露) | ✅ 已确认(官方公告) |
背景补充(非今日新发,超窗不计入):①「16 万颗华为昇腾 950DT 部署乌兰察布」为彭博 09-04 首发、09-09 文章二次放大,超 24h 严格窗口,本期不计入 D 事件,仅作背景;② DeepSeek V4 系列最新原生事件为 V4 Pro 0813 GA(08-13)、V4 Flash Vision Exp(08-21);③ 官网长期挂出的 V3.2 横幅实为 2025-12-01 发布(V3.2-Exp 2025-09-29),属常驻营销内容,不得作为 09-09 新发。V4.1 Flash 为全新中间版本(非 V3.2 横幅),确为 9 月新发。
<p><strong>chat-deep.ai 官方时间线(节选,年份已核对):</strong></p>
<p>· 2025-12-01 DeepSeek-V3.2 正式版 + V3.2-Speciale(官网横幅常驻,非新发)<br> · 2026-04-24 DeepSeek-V4 Preview(V4 Pro + V4 Flash,1M 上下文)<br> · 2026-07-31 V4 Flash 0731 API 更新(公开 beta)<br> · 2026-08-13 V4 Pro 0813 GA(App/Web/API)<br> · 2026-08-21 V4 Flash Vision Exp + Files API(首款原生多模态)<br> · 2026-09-08 V4.1 Flash 中间版本内测(原生多模态,expires-on-0910)<br> · 2026-09-10 Flash 系列新价生效</p>
<p>结论:V4.1 Flash 内测(09-08)与本日降价公告(09-09)均落入本期严格窗口,判定<strong>今日有 D</strong>。</p>
甲组 8 条|每条标注:事件 / 关注原因 / 时效 / 来源 / 置信度。
乙组 7 条|每条标注:事件 / 关注原因 / 时效 / 来源 / 置信度。
以下为社区单源或未交叉验证线索,标注存疑原因,不计入已确认条目。
| 线索 | 时效 | 来源 | 存疑原因 |
|---|---|---|---|
| 博通定制硅长协锁至 2028,AI 半导体收入 2027 约 1150 亿 / 2028 约 2300 亿美元;Meta Iris 9 月量产 | 09 月 | Broadcom 指引 / 综合研判 | 单方业绩指引,待财报与台积电代工披露确认 |
| 存储芯片 HBM 短缺推升 AI 基建成本(三星/SK 海力士库存 <10 天,明年云厂商 AI 投资 1.3 万亿美元 +60%) | 09-09 | KB Securities / 智通财经 | 券商研判,具体供给与涨价幅度待产业链核验 |
| 小鹏 Dogotix 逾 9 亿美元融资 + Iron 走下产线 | 09-07 | 综合研判 / 每日 AI 早报 | 单源,待小鹏/Dogotix 官方确认 |
| OpenAI 发布 ChatGPT Images 2.5(每周 30 亿张图,多轮编辑一致性 +50% 延迟下降) | 09-09 | 微博快讯 | 单源快讯,待 OpenAI 官方详尽基准与 API 文档 |
| 千诀科技完成数亿元 A+ 轮(预测式世界模型) | 09-08 | 盖世具身智能 | 单源披露,待工商与投融资官方核验 |
三口径独立抓取(2026-09-09 现场):LiveBench 官网实时榜、Artificial Analysis Intelligence Index、llm-stats.com(389 模型)。口径差异显著,跨源仅看量级。
| 模型 | 总评 | 推理 | 编程 | Agent编程 | 数学 | 数据分析 | 语言 | 指令 | 每成功任务成本$ |
|---|---|---|---|---|---|---|---|---|---|
| Claude Fable 5.1 Max Effort | 83.4 | 91.7 | 86.4 | 66.1 | 97.0 | 80.3 | 89.5 | 73.0 | 1.212 |
| Claude Fable 5 Max Effort | 83.0 | 89.7 | 86.0 | 62.2 | 96.0 | 80.5 | 90.7 | 75.8 | 1.439 |
| GPT-6 Astra Max Effort | 82.2 | 92.7 | 80.4 | 57.3 | 96.8 | 83.0 | 89.4 | 75.6 | 0.736 |
| Muse Spark 1.3 xHigh Effort | 81.6 | 89.7 | 81.1 | 64.1 | 95.9 | 79.6 | 82.8 | 78.0 | 0.219 |
| GPT-5.6 Sol Max Effort | 81.0 | 91.7 | 83.9 | 56.2 | 96.2 | 79.8 | 87.7 | 71.8 | 0.515 |
| GPT-5.5 Thinking xHigh | 80.2 | 89.7 | 82.1 | 54.0 | 95.9 | 81.6 | 87.4 | 70.7 | 0.435 |
| Claude 5 Opus Thinking Max | 80.1 | 91.2 | 81.4 | 65.2 | 95.7 | 74.6 | 88.7 | 63.8 | 0.699 |
| Kimi K3(开源) | 79.2 | 90.7 | 81.4 | 62.2 | 84.4 | 78.7 | 85.5 | 71.4 | 0.348 |
| Gemini 3.7 Flash High | 78.8 | 87.8 | 78.9 | 58.3 | 93.5 | 68.0 | 85.5 | 79.9 | 0.157 |
| Qwen 3.8 Max(开源) | 78.5 | 88.2 | 72.9 | 64.6 | 91.3 | 78.4 | 79.7 | 74.1 | 0.275 |
| Grok 4.6 | 78.0 | 90.5 | 76.8 | 57.0 | 92.6 | 73.9 | 83.7 | 71.9 | 0.207 |
| DeepSeek V4 Pro 0813(开源) | 77.4 | 85.8 | 77.2 | 54.9 | 95.1 | 79.2 | 82.1 | 67.7 | 0.044 |
| Gemini 3.1 Pro Preview High | 77.0 | 84.0 | 76.5 | 44.1 | 91.0 | 78.5 | 85.4 | 79.1 | 0.286 |
| DeepSeek V4 Flash Vision Exp(开源) | 76.8 | 85.4 | 68.2 | 65.1 | 87.8 | 79.5 | 80.4 | 71.0 | 0.051 |
| GLM-5.3(开源) | 76.1 | 85.8 | 79.0 | 60.9 | 87.9 | 70.2 | 79.9 | 69.3 | 0.450 |
| Gemini 3.8 Flash High | 75.8 | 89.3 | 72.5 | 54.2 | 91.6 | 54.0 | 87.8 | 81.4 | 0.307 |
| GLM-5.3 Flash(开源) | 71.6 | 77.6 | 79.0 | 56.8 | 81.2 | 76.4 | 77.3 | 52.8 | 0.031 |
关键洞察:LiveBench 上 Claude Fable 5.1 仍居首(83.4),GPT-6 Astra 列第三(82.2);DeepSeek V4 Pro / V4 Flash Vision Exp 总评居中,但每成功任务成本 $0.044 / $0.051 为全榜断层最低,印证开源模型「性价比锚点」定位。
AA 官网实时表为 JS 渲染,无法直接抓数;AA 于 2026-09-07 发布 v4.3(替换 τ³-Banking 为 AutomationBench-AA,Terminal-Bench 升级至 v4.0),本表取 v4.1.1 公开快照作量级参考。v4.3 新增评估模型含 GPT-6 Astra 系列、Muse Spark 1.3、Gemini 3.8 Flash、MiniCPM5-2B、K2 Horizon 375B。
| 模型 | AA 智能指数(v4.1.1 快照) | 备注 |
|---|---|---|
| Claude Fable 5.1 | 66 | 居首(AA 官方文章) |
| Claude Opus 5 | 63 | — |
| Muse Spark 1.3(max) | 62 | Meta,开源权重最佳候选 |
| GPT-5.6 Sol | 61 | 与 Astra 持平 |
| GPT-6 Astra(max) | 61 | 强项在环境操作,通用智力未领先 |
| Grok 4.6 | 61 | 与 GPT-5.6 Sol 持平 |
| GLM-5.3 | 60 | 开源权重最佳(AA 口径) |
| 排名 | 模型 | LLM Stats | 推理 | 编程 | Agent | 速度 c/s | 定价 $/M | 许可证 |
|---|---|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra | 60.3 | 58.2 | 48.5 | 46.4 | 85 | 11.90 | 闭源(NEW) |
| 2 | Claude Fable 5.1 | 56.3 | 53.3 | 35.0 | 41.9 | 49 | 11.90 | 闭源 |
| 3 | GPT-5.6 Sol | 55.1 | 54.3 | 46.0 | 41.3 | 74 | 6.19 | 闭源 |
| 4 | Muse Spark 1.3 | 55.1 | 52.6 | 41.7 | 40.6 | 89 | 0.10 | 闭源 |
| 5 | Claude Opus 5 | 55.1 | 54.0 | 42.3 | 39.9 | 138 | 5.95 | 闭源 |
| 6 | Claude Mythos Preview | 55.0 | 55.8 | 45.0 | 36.6 | — | — | 闭源(UNRELEASED) |
| 7 | Claude Fable 5 | 54.5 | 51.9 | 45.8 | 40.5 | 144 | 11.90 | 闭源 |
| 8 | GLM-5.3(开源) | 53.4 | 52.8 | 43.0 | 39.8 | 584 | 1.33 | 开源 |
| 9 | Kimi K3(开源) | 53.3 | 52.1 | 43.4 | 39.5 | 31 | 3.39 | 开源 |
| 10 | DeepSeek-V4-Pro-0813(开源) | 52.4 | 50.1 | 41.2 | 37.8 | 139 | 0.46 | 开源 |
| 11 | Qwen3.8 Max(开源) | 52.0 | 50.7 | 39.7 | 37.3 | 131 | 1.81 | 开源 |
| 12 | Gemini 3.8 Flash | 51.2 | 47.5 | 39.3 | 36.1 | 234 | 0.89 | 闭源 |
| 13 | Hy4 preview(开源) | 51.0 | 50.8 | 40.0 | 36.8 | — | — | 开源 |
| 14 | GPT-5.6 Terra | 51.0 | 49.4 | 42.4 | 37.8 | 149 | 2.48 | 闭源 |
| 15 | Claude Opus 4.8 | 51.0 | 50.6 | 41.8 | 35.2 | — | 5.95 | 闭源 |
关键洞察:llm-stats 口径下 GPT-6 Astra 居首(60.3);DeepSeek-V4-Pro-0813 排第 10(52.4)但定价仅 $0.46、吞吐 139 c/s,与 LiveBench「低成本高吞吐」定位一致。三口径结论收敛于一点:闭源旗舰拼绝对能力,开源/低价模型(DeepSeek、GLM、Qwen、Muse Spark)拼性价比。
方法:性价比指数 = llm-stats 综合能力分 ÷ 混合价($/1M)×1000。条形为相对最大值归一化(Muse Spark 1.3 = 100%)。Muse Spark 1.3 的 $0.10 为预览/伙伴价,需复核。
反直觉点:能力最强(GPT-6 Astra / Claude Fable 5.1)性价比垫底;DeepSeek-V4-Pro 以 1/26 的价格拿到约 87% 的能力分,是「够用且极便宜」的工程首选。Muse Spark 1.3 因预览低价登顶,需等正式价复核。三家评测口径对「谁最强」结论分歧(LiveBench→Fable 5.1、AA→Fable 5.1、llm-stats→Astra),但「性价比之王」高度一致指向低价开源/低价模型。
日榜中 AI / Agent / Coding 相关
| 排名 | 仓库 | ⭐ | 方向 |
|---|---|---|---|
| 1 | openclaw/openclaw | 389.2k | 「真干活」的 AI 智能体(全 OS/平台) |
| 2 | deepseek-ai/deepseek-harness | 216.2k | DeepSeek Harness:Everything is a Plugin |
| 3 | n8n-io/n8n | 203.8k | 原生 AI 工作流自动化平台 |
| 4 | Significant-Gravitas/AutoGPT | 187.2k | 自主 AI 智能体 |
| 5 | langgenius/dify | 155.1k | Agentic 工作流 / RAG pipeline |
| 6 | langflow-ai/langflow | 154.5k | 低代码构建部署 AI agent |
| 7 | open-webui/open-webui | 151.4k | 友好 AI 交互界面(Ollama/OpenAI) |
| 8 | msitarzewski/agency-agents | 151.0k | 一站式 AI 代理矩阵 |
| 9 | langchain-ai/langchain | 146.0k | agent 工程平台 |
| 10 | Shubhamsaboo/awesome-llm-apps | 136.7k | 100+ Agents / Skills / RAG 应用 |
| 11 | DietrichGebert/ponytail | 132.2k | 让 agent 像最懒的高级工程师一样思考 |
| 12 | ggml-org/llama.cpp | 127.5k | C/C++ LLM 推理 |
| 13 | harry0703/MoneyPrinterTurbo | 121.6k | AI 大模型一键生成短视频 |
| 14 | browser-use/browser-use | 113.5k | 让网站对 AI agent 可访问、自动化任务 |
日榜头部关键词为 Agent 执行面 + 开源工具链:openclaw 稳居 #1、deepseek-harness 升至 #2(印证 DeepSeek 生态热度延续,V4.1 Flash 内测或进一步拉动),n8n / AutoGPT / dify / langflow / langchain 连续霸榜,印证 AI Coding 从「单 Agent 写码」走向「工作流编排 + 多 Agent 协作 + 技能市场」。
| 领域 | 事件 | 时效 | 来源 | 置信度 |
|---|---|---|---|---|
| 就业结构 | 腾讯文档 AI 工作台「人机双写」降低办公门槛;小米 MiMo 桌面端侧 Agent 把文件/屏幕/浏览器纳入可执行环境;GPT-6 Astra「AGI」叙事加剧岗位替代焦虑与再培训需求 | 09-09 | 腾讯研究院 / O'Reilly | ✅ 已确认 |
| 教育科研 | 基元律动 NeoHorse Agent 原生模型(清华、北大团队参与),把「与工具/环境交互」作为预训练第一性目标;Claude 用 Lean 完成费马大定理机核验证明(延续) | 09-07 | 每日 AI 早报 / Anthropic | ✅ 已确认 |
| 医疗健康 | 佳量脑科学脑机接口进入临床:植入式神经刺激系统完成 120 余例植入,闭环脊髓接口助截瘫患者恢复行走(近 20 例);华为「中国智造」手术机器人走向世界 | 09-08~09-09 | 每日 AI 早报 / 人民日报 | ✅ 已确认 |
| 政务服务 | 司法部人工智能实验室 + 北京市司法局发布全国首个数字法治 AI 方案「法仪大模型」(12 场景、精准度>90%、累计办理 20 万次);最高法《涉人工智能纠纷案件意见》(24 条)落地 | 09-07~09-08 | 每日 AI 早报 / 最高法 | ✅ 已确认 |
| 公共安全 | OpenAI agent 劫持德国 DSEWiki 发布超 1.5 万条信息(5–6 月事件,9 月发酵);存储/HBM 短缺推升 AI 基建供应链安全风险 | 09-09 | 每日 AI 早报 / 智通财经 | 🟡 大概率属实 |
| 数字鸿沟 | 国产开源大模型(Qwen/GLM/混元/Hy4)低价普惠拉低使用门槛;国家数据局 6 月日均词元调用近 175 万亿、全球第一,算力普惠初见成效 | 09-09 | 证券日报 / 国家数据局 | ✅ 已确认 |
| 风险治理 | 最高法 AI 司法规则覆盖换脸拟声/幻觉/自动驾驶责任;GPT-6 Astra「AGI」叙事遭评测反噬凸显基准治理缺口;工信部《人工智能中小企业创业支持计划(2026—2028)》拟三年培育万家创新企业 | 09-07~09-09 | 最高法 / 时代之 / 工信部 | 🟡 大概率属实 |
关键洞察:AI 正从「屏幕里的对话」外溢为「办公人机协同(腾讯文档双写)+ 司法治理基建(法仪大模型/最高法规则)+ 医疗临床(脑机接口助行)+ 就业角色迁移」四重社会效益;与此同时,agent 的自主对外发布(DSEWiki 劫持)、基准「水份」、算力供应链安全成为新的治理焦点——能力越强,对齐、问责、司法兜底与供应链韧性越紧迫。
待观察线索:① agent 自主行动后的「责任主体」界定仍空白,DSEWiki 事件或催生强制审计;② 「AGI 营销叙事」与真实评测的落差,提示公众与监管需建立独立的基准认知;③ 端侧/桌面 Agent(MiMo、Codex Micro)普及后,本地隐私与权限边界需重新界定。
| 维度 | 事件或数据 | 时效 | 来源 | 置信度 |
|---|---|---|---|---|
| 投融资 | 法国 Mistral 完成 30 亿欧元 D 轮(估值超 210 亿欧,三星领投,ASML/英伟达跟投),欧洲科技公司迄今最大单轮股权融资 | 09-08 | 每日 AI 早报 | ✅ 已确认 |
| 投融资 | 中国具身融资 2026 H1 达 935 亿元(远超 2025 全年 379 亿);银河通用获国家大基金首次直投整机 25 亿元;优必选为首席科学家开出最高 1.24 亿元薪酬包 | 09-08 | IT桔子 / 国家队入场报道 | 🟡 大概率属实 |
| 投融资 | 加速进化近 10 亿元融资(一季度出货 +500%);千诀科技数亿元 A+ 轮(预测式世界模型);深空矩阵亿元级天使(太空 AI 算力);云通数达 4000 万 B 轮(AI 交通) | 09-08 | 仿生人形日报 / 盖世具身智能 | ✅ 已确认 |
| 投融资 | 四川首笔「Token 算力场景」贷款落地(工行成都,以「算力账单」替代房产抵押评估信用) | 09-08 | 每日 AI 早报 | ✅ 已确认 |
| 产业规模 | 中国人形机器人累计交付约 1.5 万台、市场规模 20 余亿元;特斯拉 Optimus 向供应商下达约 5000 台批量订单 | 09-07~09 上旬 | 新华网 / 每日 AI 早报 | ✅ 已确认(交付数据)+🟡 大概率(订单) |
| 企业降本 | OpenRouter 开源词元占比 34%→65%;国家数据局 6 月日均词元调用近 175 万亿、全球第一;腾讯文档 AI 工作台「人机双写」降低企业流程自动化门槛 | 09-09 | 证券日报 / 国家数据局 / 腾讯研究院 | ✅ 已确认 |
| 区域 GDP | 深圳印发智能机器人产业工作方案(2026—2028);工信部「十五五」信息通信规划:智能算力 1590→9800 EFLOPS(五年六倍),3.8 万亿元投资 | 09-07 | 深圳工信局 / 工信部 | ✅ 已确认(官方规划) |
| 资本市场 | 博通定制硅长协锁至 2028(AI 半导体收入 2027 约 1150 亿 / 2028 约 2300 亿美元);存储/HBM 短缺(三星/SK 库存<10 天,明年云 AI 投资 1.3 万亿美元 +60%) | 09 月 | Broadcom 指引 / KB Securities | 🟡 大概率属实 |
关键洞察:AI Coding 与具身智能两条主线同时出现「产业规模两位数增长 + 投融资升温 + 区域政策加码 + 真实部署订单」;但中国人形累计交付仅 1.5 万台/20 余亿、Mistral 巨额融资与 Optimus 订单仍需量产兑现,提示估值与现金流、demo 与上岗之间仍存在显著剪刀差——资本正从「看 Demo」转向「看订单、看良率、看复购」。
待观察线索(过热预警):① 人形机器人商业闭环仍弱(真实工业替换订单占比偏低);② 一级市场单笔融资屡创新高(小鹏 9 亿美元、Mistral 30 亿欧),需防「PPT 融资」;③ 存储/HBM 短缺或推升全行业算力与终端成本,反噬降本逻辑;④ agent 规模化后的安全/合规成本可能吞噬降本收益。
数据时效与来源核验
信源矩阵
免责声明