中美 AI 观察方法论 v1.1:从观点判断到 38 个可审计指标
公开中美 AI 半月监测的 Level 3 定义、多榜单规则、NA 处理、区间解释,以及第 00 期从 +39 重算为 +17 的完整原因。
更新于
Technical Summary
中美 AI 观察从方法 v1.0 升级到 v1.1。核心变化不是增加更多新闻,而是把原先十个二级判断拆成 38 个可落原始值、证据、日期和缺失状态的 Level 3 观测项。
按照新方法重算 2026 年 7 月 21 日基线,综合分从 +39 变为 +17,仍是美国方向,但区间从“美国中等优势”变为“美国小幅优势”。固定权重中有 48.75% 获得了可评分的 A/B 级证据,其余明确记为 NA,因此这是一条暂定基线。
这 -22 不是同一天中美实力突然变化,而是四个方法变化的结果:
- 前沿能力改用多榜单、每国前三个基础模型家族的中位数。
- 缺少可比数据的项目从模糊的
0改为NA。 - 普通工业机器人保留,但只占产业自动化指标的一半权重。
- 规划、企业单方宣称和不可复核的集群数字不再填补证据空白。
精确值会继续保留以便画时间序列,但必须同时展示区间和证据覆盖率;个位数变化不应被解读为真实精度。
重算结果:从 +39 到 +17
| 项目 | v1.0 原始基线 | v1.1 重算 | 差异 | 解释 |
|---|---|---|---|---|
| 有用智能 | +24 | +7 | -17 | 多榜单仍支持美国小幅领先,但可靠性、延迟、可获得性和人才数据大量改为 NA;中国成本效率形成反向分。 |
| 可部署算力 | +77 | +33 | -44 | 方向仍明显偏美国,但交付量、HBM 合格产出、真实 goodput 和运营效率没有对称数据,不能继续用专家判断填满权重。 |
| 生态与价值捕获 | +13 | +9 | -4 | 中国开放模型和机器人扩散继续对冲美国资本、云与商业收入优势;机器人只计半权。 |
| 综合 | +39 | +17 | -22 | 纯方法与覆盖率差异,不构成结构性变化。 |
v1.1 的综合未四舍五入值是 +17.2。保留精确值是为了让未来折线可复算,而公开结论只写“美国小幅优势”。
三个一级结果与十个二级驱动
| 一级结果 | 权重 | 二级驱动及总权重 |
|---|---|---|
| 有用智能 | 30% | 前沿能力与可靠性 14%;成本、延迟与可获得性 8%;研发、人才与模型供给 8% |
| 可部署算力 | 35% | 加速器、HBM 与封装 14%;集群 goodput 与软件栈 11%;数据中心、云与能源 10% |
| 生态与价值捕获 | 35% | 开发者与开放生态 10%;产业采用与生产率 10%;商业回报与资本 8%;国际采购、标准与治理 7% |
一级结果回答“优势体现在哪里”,二级指标解释“什么驱动了优势”,Level 3 才是实际观测和计分单位。
38 个 Level 3 观测项
有用智能:9 项
| ID | 指标 | 总权重 | 关键口径 |
|---|---|---|---|
| U1.1 | 前沿任务综合成功率 | 7.0% | 多榜单、每国前三个基础模型家族中位数;至少两个任务族同向才改分。 |
| U1.2 | 长程任务可靠性 | 4.2% | 30 分钟至数小时任务的无人工接管完成率、恢复率和方差。 |
| U1.3 | 可信与安全部署能力 | 2.8% | 事实、引用、越权工具、对抗攻击和拒答准确性。 |
| U2.1 | 每个成功任务的有效成本 | 3.6% | 费用包含重试、工具和失败损耗,不比较孤立 token 标价。 |
| U2.2 | 端到端延迟与吞吐 | 2.4% | 同等成功率和 SLA 下比较 P50/P95 与完整任务时长。 |
| U2.3 | 前沿服务可获得性 | 2.0% | 普通企业实际可购买的区域、配额、能力和正常率。 |
| U3.1 | 质量调整后的前沿模型供给 | 3.2% | 滚动 12 个月内进入至少两个任务族前沿 10% 的模型家族数。 |
| U3.2 | 高影响研究贡献 | 2.4% | 算法、数据集、评测与产业采用,不按论文数量直接计分。 |
| U3.3 | 前沿人才与组织厚度 | 2.4% | 顶尖人才净流动、团队稳定性和独立训练组织数。 |
可部署算力:12 项
| ID | 指标 | 总权重 | 关键口径 |
|---|---|---|---|
| C1.1 | 芯片实际性能与能效 | 3.5% | 已交付硅片在相同工作负载的实测值,不用理论峰值。 |
| C1.2 | 国内可获得的有效交付算力 | 4.9% | 交付量 × 实测性能 × 国内可获得比例。 |
| C1.3 | HBM 与先进封装合格产出 | 3.5% | 客户认证后的合格产量、良率、带宽和封装能力。 |
| C1.4 | 关键供应链抗阻断能力 | 2.1% | 按 EDA、设备、材料、制造与封装中的最弱一环衡量。 |
| C2.1 | 大集群训练 goodput | 3.85% | 万卡级持续训练中真正用于有效计算的比例。 |
| C2.2 | 互联与规模扩展效率 | 2.75% | 千卡到万卡的扩展效率、延迟与有效带宽。 |
| C2.3 | 大规模推理效率 | 2.75% | 相同成功率和 P95 SLA 下,每美元/瓦完成的任务量。 |
| C2.4 | 软件栈生产成熟度 | 1.65% | 编译器、算子、框架、调试、编排、恢复与迁移成本。 |
| C3.1 | 已通电 AI 计算容量 | 4.0% | 已通电、装机并能执行 AI 任务的容量,规划不算。 |
| C3.2 | 24 个月确定性电力管线 | 2.0% | 同时具备融资、施工、并网和电力;通电前评分封顶 ±1。 |
| C3.3 | 可租用前沿云容量 | 2.5% | 普通客户实际可获得的加速器小时、区域、价格与配额。 |
| C3.4 | 运行效率与可靠性 | 1.5% | PUE、故障时间、利用率、冷却与网络稳定性。 |
生态与价值捕获:17 项
| ID | 指标 | 总权重 | 关键口径 |
|---|---|---|---|
| E1.1 | 活跃生产下游 | 3.0% | 持续维护并进入生产的下游,仓库数和下载量不能单独证明。 |
| E1.2 | 开放模型质量与开放程度 | 2.5% | 能力差距加权重、许可证、训练披露与可复现性。 |
| E1.3 | 推理用量与留存 | 3.0% | 去除机器人/评测流量后的付费使用和 90 天留存。 |
| E1.4 | 工具链与迁移成本 | 1.5% | 集成覆盖和生产系统迁入/迁出的工程工时。 |
| E2.1 | 付费生产部署渗透率 | 3.0% | 排除试点、展示、内部测试和 MoU。 |
| E2.2 | 续约与扩张 | 2.5% | 续约率、净收入留存、席位和工作负载扩张。 |
| E2.3 | 已验证生产率与质量收益 | 3.0% | 要求对照组或可审计基线的工时、周期、良率、收入或成本。 |
| E2.4a | AI 具身与工业自主化 | 0.75% | 具备感知、决策或自主操作能力并进入付费生产。 |
| E2.4b | 普通工业机器人安装 | 0.75% | 保留为自动化基础代理,但只能占 E2.4 的一半。 |
| E3.1 | 已确认 AI 收入及质量 | 2.4% | 已确认收入、经常性比例与集中度,意向订单不算。 |
| E3.2 | 单位经济与客户 ROI | 2.4% | 推理贡献毛利、回本期和维持收入所需资本。 |
| E3.3 | 私人资本耐久度 | 1.6% | 扣除关联和循环融资后的资本、融资成本与集中度。 |
| E3.4 | 公共与战略资本 | 1.6% | 已拨付预算、采购、补贴和税收支持,不用目标基金规模。 |
| E4.1 | 第三国实际采购 | 2.45% | 中美以外付费方已经验收、交付或运行。 |
| E4.2 | 国际服务覆盖与用量 | 1.75% | 第三国真实 SLA 区域和当地付费用量。 |
| E4.3 | 技术标准实际采纳 | 1.4% | 进入正式标准、强制规范、采购或认证;提案不算。 |
| E4.4 | 制度与监管影响力 | 1.4% | 条约生效、预算、常设机构、许可证、执法或采购联动。 |
前沿模型必须跨五类榜单
U1.1 的核心不是“多找几个榜”,而是让不同测量偏差相互约束。每期固定检查:
- NIST/CAISI 独立评测:包含五个能力领域、16 项评测和半私有任务。其 2026 年 5 月结果认为 DeepSeek V4 Pro 是当时最强中国模型,但相对美国前沿约落后 8 个月。
- Artificial Analysis Intelligence Index:综合九类推理、知识工作、工具和编码评测,并同时给出成本。Kimi K3 得分 57,已经接近榜首模型的 60 和 GPT-5.6 Sol 的 59。Kimi K3 独立评测说明
- LiveBench:最新批次包含 23 个客观任务、七个类别,并定期刷新,降低静态题污染。
- Arena 文本榜:仅使用匿名投票形成的正式排名,代表人类偏好,但不能替代客观任务。
- SWE-bench-Live 等更新型软件工程评测:优先新任务、隐藏题和受控脚手架。
每个榜单分别取中美前三个基础模型家族的中位数。同一基础模型的不同推理档、预览版和供应商路由只留一个;某国不足三个合格模型时,该榜只能作最佳模型旁证。
公开榜和隐藏题冲突时不强行平均。基线中,公开榜显示中国最新模型非常接近甚至在前端编码局部领先,而 CAISI 的受控评测仍显示美国领先。因此 U1.1 评为美国方向 +1,而不是 0 或中国反超。
SWE-bench Verified 自 v1.1 起退出前沿主评分:公开题污染、测试质量和脚手架差异已经妨碍它区分最新模型。它仍可用于历史比较,但不能单独触发改分。
NA 不是平手
v1.0 的 0 同时表示“接近”和“证据不足”,这是不可审计的。v1.1 规定:
0:有足够证据,双方接近或相互抵消;NA:没有对称、可比、未过期的证据;NA不重新分配给其他指标,不制造虚假的权重漂移;- 半月更新可以沿用仍在有效期内的最近一次观测,并记录
staleDays;超期后回到NA。
当前最明显的 NA 包括中国与美国的有效芯片交付量、HBM 合格产出、万卡集群 goodput、数据中心利用率、企业 AI 续约和客户 ROI。把它们空出来,比用厂商新闻填满更诚实。
评分区间和时间序列
每个 Level 3 评分为 -3..+3,负数指向中国、正数指向美国。综合分公式为:
100 ÷ 3 × Σ(Level 3 固定权重 × Level 3 分数)
NA 在点估计中不贡献方向,但会降低证据覆盖率。固定权重不重新归一,因此同一方法版本内可以复算。
| 综合区间 | 公开解释 |
|---|---|
| -100 ~ -60 | 中国强优势 |
| -60 ~ -30 | 中国中等优势 |
| -30 ~ -10 | 中国小幅优势 |
| -10 ~ +10 | 接近或方向不清 |
| +10 ~ +30 | 美国小幅优势 |
| +30 ~ +60 | 美国中等优势 |
| +60 ~ +100 | 美国强优势 |
精确分用于折线,不代表个位数真的可靠。未来图表会同时画两条线:综合精确分和证据覆盖率。若变化主要来自新数据补齐或方法调整,必须标注为“覆盖变化”或“方法断点”,不能称为结构性转折。
证据门槛与防重复计分
- A 级:政府、法规、国际组织、公司申报或可复核原始基准。
- B 级:有明确方法的权威研究,或至少两个独立可靠来源交叉确认。
- C 级:企业单方技术、产能、投资或交付宣称,只进观察清单。
- D 级:匿名爆料、社交媒体和聚合摘要,不进入事实层。
同一个项目只有在不同阶段真实发生时才能分别进入多个 Level 3。例如芯片发布不等于批量交付,批量交付不等于数据中心通电,通电也不等于客户已经付费使用。
政策同样必须走到生效、许可、执法、预算、采购或正式标准采纳;成员国数量、签署仪式和规则更新次数不能独立改变分数。
局限和下一步
- v1.1 基线覆盖率只有 48.75%,属于暂定状态。它更诚实,但不能被当作对真实实力差距的精确估计。
- 中美披露制度不同会造成系统性缺失,尤其是芯片交付、集群 goodput、私营收入和政府资金实际拨付。
- 榜单会饱和、污染或改变方法。每期必须保存版本和抓取日期,不能把不同版本直接连成同一序列。
- 普通工业机器人只保留半权;未来如果能得到 AI 自主化部署数据,应主要由 E2.4a 承担解释。
后续每月 1 日和 16 日都会按 v1.1 更新。只有至少两个一级结果连续两期同向变化,才会写成结构性转折。
完整半月报告见中美 AI 观察。