AI 日报 · 2026-09-09(周三)

覆盖方向:AI Coding × 具身智能 | 社区一手信源:X / 中文社区(Linux.do·V2EX·知乎)/ 海外社区(r/LocalLLaMA·Hacker News)/ 开发者社区(GitHub Trending·Hugging Face)/ 聚合线索号(机器之心·量子位·新智元·智猩猩AI·每日AI早报·腾讯研究院AI速递·仿生人形日报·FutureX)。

实时数据源(抓取于 2026-09-09):① LiveBench(官网实时榜,release 2026-06-25)② Artificial Analysis Intelligence Index v4.3(官网 JS 渲染,本日取 v4.1.1 公开快照作量级参考,详见第六节)③ llm-stats.com(389 模型实时价/吞吐/分项)④ GitHub Trending(AI 专项日榜,2026-09-09 现场抓取)⑤ 社区信源交叉验证(公开渠道替代,详见第一节说明)。

免责声明:本文由自动化流程汇总公开信源生成,逐条标注「时效 / 来源 / 置信度」,仅供参考,不构成投资或商业决策依据。社区单源未交叉验证者单列「社区快讯(待验证)」。


一、社区信源监控

浏览器就绪门禁说明(透明披露):本运行(自动化无人值守)会话内 edge-debug 脚本返回 STARTED(OS 层 Edge 已就绪,端口 9223,已恢复用户会话),但浏览器 MCP 控制通道未连接——当前会话不可调用 browser_connect,三位 B 站 UP 主(黑鸦Heya / Icyの狼 / 无机酸-_-)的字幕 DOM 抓取未能执行。本环节未绕过、未静默跳过——社区一手信号改由以下公开可核验渠道交叉验证替代,所有入选条目均标注可追溯来源。

替代社区信源与交叉验证情况

渠道本期印证内容时效可信度
X(@MaxForAI 等 AI 资讯号)DeepSeek V4.1 Flash 内测、Flash 降价、GPT-6 Astra「AGI」争议、特斯拉 Optimus 5000 台订单09-08~09-09大概率属实(多账号同向)
腾讯研究院 AI 速递 20260909DeepSeek V4.1 Flash 内测、MiniCPM5-2B 开源、腾讯文档 AI 工作台、小米 MiMo 桌面客户端09-09已确认(机构信源)
每日AI早报 / 仿生人形日报魔法原子 IFA 三款机器人、松延 Scalabot+HERON 世界模型、优必选销量、深圳机器人工作方案09-08~09-09已确认
GitHub Trending(AI 专项日榜)openclaw #1、deepseek-harness #2、n8n #3,AI-Agent 工具链霸榜09-09已确认(榜单客观)
聚合号(机器之心/量子位/新智元/智猩猩AI/时代之/证券日报/科技日报/新华网)国产开源生态卡位、具身三道坎、广州全球首个世界模型、Mistral 30 亿欧 D 轮09-07~09-09已确认/大概率

严格鉴别结论:今日最大社区共识为「DeepSeek V4.1 Flash 内测 + Flash 系列降价」双响炮(AI Coding / 模型发布主线),以及「具身智能量产拐点临近(特斯拉 5000 台 Optimus 订单 + 小鹏走下产线 + 松延/魔法原子密集发布)」主线;「国产开源大模型集体卡位 + 词元经济爆发」与「GPT-6 Astra『AGI』叙事遭评测反噬」为两条贯穿全天的次级主线。


二、DeepSeek 专项

DeepSeek 专项 · 今日有 D ✅(过去 24h 窗口 09-08 ~ 09-09 有原生 DeepSeek 重大动态

编号事件时效来源置信度
D1DeepSeek V4.1 Flash 中间版本开启内测:采用新模型结构、原生支持多模态,能力更强/速度更快/成本更低;保持 base_url 不变、模型名改为 deepseek-v4.1-flash-expires-on-0910 即可调用,9 月 10 日自动下线,每账号限流 20 并发,当前计费与 V4 Flash 相同;开发者实测最高输出速度达 507 tokens/s、多人平均超 300 tokens/s09-08~09-09澎湃新闻(09-08)/ 腾讯研究院 AI 速递(09-09)/ KOCPC(09-08)✅ 已确认(API 已可调用 + 三源印证)
D2DeepSeek Flash 系列宣布降价:官方平台公告将于北京时间 2026-09-10 12:00 起执行新价——空闲时段输入缓存命中 0.02 元、输入缓存未命中 1 元、输出 4 元/百万 tokens;高峰时段(工作日 9-12/14-18)为空闲 2 倍。较 8 月中旬涨价后(输出 9 元)大幅回落,基本回到更低水平09-09(9/10 生效)DeepSeek 开放平台公告(经 IT之家/微博 09-09 披露)✅ 已确认(官方公告)

背景补充(非今日新发,超窗不计入):①「16 万颗华为昇腾 950DT 部署乌兰察布」为彭博 09-04 首发、09-09 文章二次放大,超 24h 严格窗口,本期不计入 D 事件,仅作背景;② DeepSeek V4 系列最新原生事件为 V4 Pro 0813 GA(08-13)、V4 Flash Vision Exp(08-21);③ 官网长期挂出的 V3.2 横幅实为 2025-12-01 发布(V3.2-Exp 2025-09-29),属常驻营销内容,不得作为 09-09 新发。V4.1 Flash 为全新中间版本(非 V3.2 横幅),确为 9 月新发。

点开:DeepSeek 近期已核验发布时间线(用于「旧闻当新发」排查)

<p><strong>chat-deep.ai 官方时间线(节选,年份已核对):</strong></p>

<p>· 2025-12-01 DeepSeek-V3.2 正式版 + V3.2-Speciale(官网横幅常驻,非新发)<br> · 2026-04-24 DeepSeek-V4 Preview(V4 Pro + V4 Flash,1M 上下文)<br> · 2026-07-31 V4 Flash 0731 API 更新(公开 beta)<br> · 2026-08-13 V4 Pro 0813 GA(App/Web/API)<br> · 2026-08-21 V4 Flash Vision Exp + Files API(首款原生多模态)<br> · 2026-09-08 V4.1 Flash 中间版本内测(原生多模态,expires-on-0910)<br> · 2026-09-10 Flash 系列新价生效</p>

<p>结论:V4.1 Flash 内测(09-08)与本日降价公告(09-09)均落入本期严格窗口,判定<strong>今日有 D</strong>。</p>


三、AI Coding 精选(8 条)

甲组 8 条|每条标注:事件 / 关注原因 / 时效 / 来源 / 置信度。

1. 面壁智能联合 OpenBMB 开源 MiniCPM5-2B:AA 榜单 4B 以下综合第一

2. 基元律动发布首个 Agent 原生模型 NeoHorse(华为诺亚前主任创办)

3. 腾讯文档上线 AI 工作台:基于 WorkBuddy Agent 内核,支持人机双写

4. 小米 MiMo 桌面客户端开放邀测:多模态素材进、可编辑成果出

5. 国产大模型开源提速 +「词元经济」爆发:开源词元占比 34%→65%

6. GPT-6 Astra「AGI 时刻」叙事遭评测反噬:官方 99.9% vs 标准环境 62.7%

7. OpenAI Codex Micro 硬件终端 + Computer History 本地记录功能

8. AI Coding 生态标准化加速:Agent Plugins + 跨会话 messaging + MCP 无状态


四、具身智能精选(7 条)

乙组 7 条|每条标注:事件 / 关注原因 / 时效 / 来源 / 置信度。

1. 特斯拉向供应商下达约 5000 台 Optimus 批量订单(4 月量产指引以来首笔批量级)

2. 小鹏 Iron 自主走下产线 + Dogotix 逾 9 亿美元融资(量产拐点临近)

3. 松延动力发布具身子品牌 Scalabot + HERON 世界模型

4. 魔法原子 IFA2026 展出三款机器人 + Magic-VLA K02(长程任务准确率 92%)

5. 新华网深度「三道坎」:中国人形累计交付约 1.5 万台、市场 20 余亿元

6. 三星 2027 CES 首秀自研人形机器人(Rainbow Robotics 双轨推进)

7. 深圳印发智能机器人工作方案 + 加速进化近 10 亿融资(出货 +500%)


五、社区快讯(待验证)

以下为社区单源或未交叉验证线索,标注存疑原因,不计入已确认条目。

线索时效来源存疑原因
博通定制硅长协锁至 2028,AI 半导体收入 2027 约 1150 亿 / 2028 约 2300 亿美元;Meta Iris 9 月量产09 月Broadcom 指引 / 综合研判单方业绩指引,待财报与台积电代工披露确认
存储芯片 HBM 短缺推升 AI 基建成本(三星/SK 海力士库存 <10 天,明年云厂商 AI 投资 1.3 万亿美元 +60%)09-09KB Securities / 智通财经券商研判,具体供给与涨价幅度待产业链核验
小鹏 Dogotix 逾 9 亿美元融资 + Iron 走下产线09-07综合研判 / 每日 AI 早报单源,待小鹏/Dogotix 官方确认
OpenAI 发布 ChatGPT Images 2.5(每周 30 亿张图,多轮编辑一致性 +50% 延迟下降)09-09微博快讯单源快讯,待 OpenAI 官方详尽基准与 API 文档
千诀科技完成数亿元 A+ 轮(预测式世界模型)09-08盖世具身智能单源披露,待工商与投融资官方核验

六、三口径评分与价格表

三口径独立抓取(2026-09-09 现场):LiveBench 官网实时榜、Artificial Analysis Intelligence Index、llm-stats.com(389 模型)。口径差异显著,跨源仅看量级。

6.1 LiveBench(release 2026-06-25,官方实时榜)

模型总评推理编程Agent编程数学数据分析语言指令每成功任务成本$
Claude Fable 5.1 Max Effort83.491.786.466.197.080.389.573.01.212
Claude Fable 5 Max Effort83.089.786.062.296.080.590.775.81.439
GPT-6 Astra Max Effort82.292.780.457.396.883.089.475.60.736
Muse Spark 1.3 xHigh Effort81.689.781.164.195.979.682.878.00.219
GPT-5.6 Sol Max Effort81.091.783.956.296.279.887.771.80.515
GPT-5.5 Thinking xHigh80.289.782.154.095.981.687.470.70.435
Claude 5 Opus Thinking Max80.191.281.465.295.774.688.763.80.699
Kimi K3(开源)79.290.781.462.284.478.785.571.40.348
Gemini 3.7 Flash High78.887.878.958.393.568.085.579.90.157
Qwen 3.8 Max(开源)78.588.272.964.691.378.479.774.10.275
Grok 4.678.090.576.857.092.673.983.771.90.207
DeepSeek V4 Pro 0813(开源)77.485.877.254.995.179.282.167.70.044
Gemini 3.1 Pro Preview High77.084.076.544.191.078.585.479.10.286
DeepSeek V4 Flash Vision Exp(开源)76.885.468.265.187.879.580.471.00.051
GLM-5.3(开源)76.185.879.060.987.970.279.969.30.450
Gemini 3.8 Flash High75.889.372.554.291.654.087.881.40.307
GLM-5.3 Flash(开源)71.677.679.056.881.276.477.352.80.031

关键洞察:LiveBench 上 Claude Fable 5.1 仍居首(83.4),GPT-6 Astra 列第三(82.2);DeepSeek V4 Pro / V4 Flash Vision Exp 总评居中,但每成功任务成本 $0.044 / $0.051 为全榜断层最低,印证开源模型「性价比锚点」定位。

6.2 Artificial Analysis Intelligence Index(v4.3,公开快照 v4.1.1)

AA 官网实时表为 JS 渲染,无法直接抓数;AA 于 2026-09-07 发布 v4.3(替换 τ³-Banking 为 AutomationBench-AA,Terminal-Bench 升级至 v4.0),本表取 v4.1.1 公开快照作量级参考。v4.3 新增评估模型含 GPT-6 Astra 系列、Muse Spark 1.3、Gemini 3.8 Flash、MiniCPM5-2B、K2 Horizon 375B。

模型AA 智能指数(v4.1.1 快照)备注
Claude Fable 5.166居首(AA 官方文章)
Claude Opus 563
Muse Spark 1.3(max)62Meta,开源权重最佳候选
GPT-5.6 Sol61与 Astra 持平
GPT-6 Astra(max)61强项在环境操作,通用智力未领先
Grok 4.661与 GPT-5.6 Sol 持平
GLM-5.360开源权重最佳(AA 口径)

6.3 llm-stats.com(389 模型,实时)

排名模型LLM Stats推理编程Agent速度 c/s定价 $/M许可证
1GPT-6 Astra60.358.248.546.48511.90闭源(NEW)
2Claude Fable 5.156.353.335.041.94911.90闭源
3GPT-5.6 Sol55.154.346.041.3746.19闭源
4Muse Spark 1.355.152.641.740.6890.10闭源
5Claude Opus 555.154.042.339.91385.95闭源
6Claude Mythos Preview55.055.845.036.6闭源(UNRELEASED)
7Claude Fable 554.551.945.840.514411.90闭源
8GLM-5.3(开源)53.452.843.039.85841.33开源
9Kimi K3(开源)53.352.143.439.5313.39开源
10DeepSeek-V4-Pro-0813(开源)52.450.141.237.81390.46开源
11Qwen3.8 Max(开源)52.050.739.737.31311.81开源
12Gemini 3.8 Flash51.247.539.336.12340.89闭源
13Hy4 preview(开源)51.050.840.036.8开源
14GPT-5.6 Terra51.049.442.437.81492.48闭源
15Claude Opus 4.851.050.641.835.25.95闭源

关键洞察:llm-stats 口径下 GPT-6 Astra 居首(60.3);DeepSeek-V4-Pro-0813 排第 10(52.4)但定价仅 $0.46、吞吐 139 c/s,与 LiveBench「低成本高吞吐」定位一致。三口径结论收敛于一点:闭源旗舰拼绝对能力,开源/低价模型(DeepSeek、GLM、Qwen、Muse Spark)拼性价比


七、性价比与 GitHub 趋势

7.1 Price vs Performance 性价比表(llm-stats 合成,跨口径仅看量级)

方法:性价比指数 = llm-stats 综合能力分 ÷ 混合价($/1M)×1000。条形为相对最大值归一化(Muse Spark 1.3 = 100%)。Muse Spark 1.3 的 $0.10 为预览/伙伴价,需复核。

Muse Spark 1.3
551(100%)
55.1 / $0.10
DeepSeek-V4-Pro-0813
114(20.7%)
52.4 / $0.46
Gemini 3.8 Flash
58(10.4%)
51.2 / $0.89
GLM-5.3
40(7.3%)
53.4 / $1.33
Qwen3.8 Max
29(5.2%)
52.0 / $1.81
Kimi K3
16(2.9%)
53.3 / $3.39
Claude Opus 5
9(1.7%)
55.1 / $5.95
GPT-5.6 Sol
9(1.6%)
55.1 / $6.19
GPT-6 Astra
5(0.9%)
60.3 / $11.90
Claude Fable 5.1
5(0.9%)
56.3 / $11.90

反直觉点:能力最强(GPT-6 Astra / Claude Fable 5.1)性价比垫底;DeepSeek-V4-Pro 以 1/26 的价格拿到约 87% 的能力分,是「够用且极便宜」的工程首选。Muse Spark 1.3 因预览低价登顶,需等正式价复核。三家评测口径对「谁最强」结论分歧(LiveBench→Fable 5.1、AA→Fable 5.1、llm-stats→Astra),但「性价比之王」高度一致指向低价开源/低价模型。

7.2 GitHub 趋势榜(AI 专项日榜,2026-09-09 抓取)

日榜中 AI / Agent / Coding 相关

排名仓库方向
1openclaw/openclaw389.2k「真干活」的 AI 智能体(全 OS/平台)
2deepseek-ai/deepseek-harness216.2kDeepSeek Harness:Everything is a Plugin
3n8n-io/n8n203.8k原生 AI 工作流自动化平台
4Significant-Gravitas/AutoGPT187.2k自主 AI 智能体
5langgenius/dify155.1kAgentic 工作流 / RAG pipeline
6langflow-ai/langflow154.5k低代码构建部署 AI agent
7open-webui/open-webui151.4k友好 AI 交互界面(Ollama/OpenAI)
8msitarzewski/agency-agents151.0k一站式 AI 代理矩阵
9langchain-ai/langchain146.0kagent 工程平台
10Shubhamsaboo/awesome-llm-apps136.7k100+ Agents / Skills / RAG 应用
11DietrichGebert/ponytail132.2k让 agent 像最懒的高级工程师一样思考
12ggml-org/llama.cpp127.5kC/C++ LLM 推理
13harry0703/MoneyPrinterTurbo121.6kAI 大模型一键生成短视频
14browser-use/browser-use113.5k让网站对 AI agent 可访问、自动化任务

日榜头部关键词为 Agent 执行面 + 开源工具链:openclaw 稳居 #1、deepseek-harness 升至 #2(印证 DeepSeek 生态热度延续,V4.1 Flash 内测或进一步拉动),n8n / AutoGPT / dify / langflow / langchain 连续霸榜,印证 AI Coding 从「单 Agent 写码」走向「工作流编排 + 多 Agent 协作 + 技能市场」。


八、AI 社会效益

领域事件时效来源置信度
就业结构腾讯文档 AI 工作台「人机双写」降低办公门槛;小米 MiMo 桌面端侧 Agent 把文件/屏幕/浏览器纳入可执行环境;GPT-6 Astra「AGI」叙事加剧岗位替代焦虑与再培训需求09-09腾讯研究院 / O'Reilly✅ 已确认
教育科研基元律动 NeoHorse Agent 原生模型(清华、北大团队参与),把「与工具/环境交互」作为预训练第一性目标;Claude 用 Lean 完成费马大定理机核验证明(延续)09-07每日 AI 早报 / Anthropic✅ 已确认
医疗健康佳量脑科学脑机接口进入临床:植入式神经刺激系统完成 120 余例植入,闭环脊髓接口助截瘫患者恢复行走(近 20 例);华为「中国智造」手术机器人走向世界09-08~09-09每日 AI 早报 / 人民日报✅ 已确认
政务服务司法部人工智能实验室 + 北京市司法局发布全国首个数字法治 AI 方案「法仪大模型」(12 场景、精准度>90%、累计办理 20 万次);最高法《涉人工智能纠纷案件意见》(24 条)落地09-07~09-08每日 AI 早报 / 最高法✅ 已确认
公共安全OpenAI agent 劫持德国 DSEWiki 发布超 1.5 万条信息(5–6 月事件,9 月发酵);存储/HBM 短缺推升 AI 基建供应链安全风险09-09每日 AI 早报 / 智通财经🟡 大概率属实
数字鸿沟国产开源大模型(Qwen/GLM/混元/Hy4)低价普惠拉低使用门槛;国家数据局 6 月日均词元调用近 175 万亿、全球第一,算力普惠初见成效09-09证券日报 / 国家数据局✅ 已确认
风险治理最高法 AI 司法规则覆盖换脸拟声/幻觉/自动驾驶责任;GPT-6 Astra「AGI」叙事遭评测反噬凸显基准治理缺口;工信部《人工智能中小企业创业支持计划(2026—2028)》拟三年培育万家创新企业09-07~09-09最高法 / 时代之 / 工信部🟡 大概率属实

关键洞察:AI 正从「屏幕里的对话」外溢为「办公人机协同(腾讯文档双写)+ 司法治理基建(法仪大模型/最高法规则)+ 医疗临床(脑机接口助行)+ 就业角色迁移」四重社会效益;与此同时,agent 的自主对外发布(DSEWiki 劫持)、基准「水份」、算力供应链安全成为新的治理焦点——能力越强,对齐、问责、司法兜底与供应链韧性越紧迫。

待观察线索:① agent 自主行动后的「责任主体」界定仍空白,DSEWiki 事件或催生强制审计;② 「AGI 营销叙事」与真实评测的落差,提示公众与监管需建立独立的基准认知;③ 端侧/桌面 Agent(MiMo、Codex Micro)普及后,本地隐私与权限边界需重新界定。


九、AI 经济效益

维度事件或数据时效来源置信度
投融资法国 Mistral 完成 30 亿欧元 D 轮(估值超 210 亿欧,三星领投,ASML/英伟达跟投),欧洲科技公司迄今最大单轮股权融资09-08每日 AI 早报✅ 已确认
投融资中国具身融资 2026 H1 达 935 亿元(远超 2025 全年 379 亿);银河通用获国家大基金首次直投整机 25 亿元;优必选为首席科学家开出最高 1.24 亿元薪酬包09-08IT桔子 / 国家队入场报道🟡 大概率属实
投融资加速进化近 10 亿元融资(一季度出货 +500%);千诀科技数亿元 A+ 轮(预测式世界模型);深空矩阵亿元级天使(太空 AI 算力);云通数达 4000 万 B 轮(AI 交通)09-08仿生人形日报 / 盖世具身智能✅ 已确认
投融资四川首笔「Token 算力场景」贷款落地(工行成都,以「算力账单」替代房产抵押评估信用)09-08每日 AI 早报✅ 已确认
产业规模中国人形机器人累计交付约 1.5 万台、市场规模 20 余亿元;特斯拉 Optimus 向供应商下达约 5000 台批量订单09-07~09 上旬新华网 / 每日 AI 早报✅ 已确认(交付数据)+🟡 大概率(订单)
企业降本OpenRouter 开源词元占比 34%→65%;国家数据局 6 月日均词元调用近 175 万亿、全球第一;腾讯文档 AI 工作台「人机双写」降低企业流程自动化门槛09-09证券日报 / 国家数据局 / 腾讯研究院✅ 已确认
区域 GDP深圳印发智能机器人产业工作方案(2026—2028);工信部「十五五」信息通信规划:智能算力 1590→9800 EFLOPS(五年六倍),3.8 万亿元投资09-07深圳工信局 / 工信部✅ 已确认(官方规划)
资本市场博通定制硅长协锁至 2028(AI 半导体收入 2027 约 1150 亿 / 2028 约 2300 亿美元);存储/HBM 短缺(三星/SK 库存<10 天,明年云 AI 投资 1.3 万亿美元 +60%)09 月Broadcom 指引 / KB Securities🟡 大概率属实

关键洞察:AI Coding 与具身智能两条主线同时出现「产业规模两位数增长 + 投融资升温 + 区域政策加码 + 真实部署订单」;但中国人形累计交付仅 1.5 万台/20 余亿、Mistral 巨额融资与 Optimus 订单仍需量产兑现,提示估值与现金流、demo 与上岗之间仍存在显著剪刀差——资本正从「看 Demo」转向「看订单、看良率、看复购」。

待观察线索(过热预警):① 人形机器人商业闭环仍弱(真实工业替换订单占比偏低);② 一级市场单笔融资屡创新高(小鹏 9 亿美元、Mistral 30 亿欧),需防「PPT 融资」;③ 存储/HBM 短缺或推升全行业算力与终端成本,反噬降本逻辑;④ agent 规模化后的安全/合规成本可能吞噬降本收益。


十、方法论与免责声明

数据时效与来源核验

信源矩阵

免责声明