中美 AI 观察约 11 分钟

中美 AI 半月监测 #01:Kimi 开放权重,结构分未变

截至 2026 年 8 月 1 日 09:00:Kimi K3 开放完整权重、CAISI 发布网络能力评估,但固定指标尚无一项跨过改分门槛。

更新于

  • AI
  • 中美 AI
  • 半月监测

Executive Summary

资料窗口:2026 年 7 月 21 日 09:00 之后至 2026 年 8 月 1 日 09:00(北京时间)。

  • 本期无结构性变化。 v1.1 综合分仍为 +17,未四舍五入值为 +17.2,处于“美国小幅优势”区间;相较上期事实变化 0 分
  • 证据覆盖率仍为 48.75%,属于“暂定”。 覆盖率变化 0 个百分点,方法或覆盖效应 0 分NA 没有被重新分配,也不代表平手。
  • 两条最重要的新证据都没有触发改分。 UK AISI 与美国 CAISI 的初步评估显示 Kimi K3 在网络能力上落后于领先美国模型,但只覆盖一个能力族;Kimi K3 同时发布了可核验的完整权重,但一个新家族不足以让开放模型篮子跨过 5 个百分点门槛。
  • 榜单方向一致、力度并不一致。 Artificial Analysis、LiveBench 与 Arena 的前三基础模型家族中位数都仍偏美国,CAISI 和 SWE-bench-Live 只能作边界旁证;本期没有发现可比的期环比大幅变化。

+17.2 只用于复算和时间序列,不表示现实判断精确到个位数。综合分不是胜率、预测或投资建议。

分数与覆盖率

结果 上期 本期 事实 delta coverage 解读
有用智能 +7 +7 0 54% 美国在前沿家族深度和综合能力上小幅领先,成本效率偏中国
可部署算力 +33 +33 0 55% 已验证差距仍集中在芯片、互联、软件栈和可租用云容量
生态与价值捕获 +9 +9 0 38% 美国资本与已披露收入领先,中国开放模型和机器人安装形成对冲
综合 +17 +17 0 48.75% 美国小幅优势;判断暂定

精确计算为:100 ÷ 3 × Σ(38 项固定权重 × Level 3 分数)= +17.2。38 项权重合计 1.0,三个 Level 1 权重仍为 30% / 35% / 35%;有效分数覆盖的固定权重合计 48.75%。

事实变化与方法/覆盖变化

变化层 本期结果 原因
事实变化 0 分 没有 A/B 级新增证据使任何 Level 3 跨过既定评分区间和实质门槛
coverageDelta 0 个百分点 新证据补强了观察,但没有把任何 NA 变成有效分数,也没有使有效值过期
methodEffect 0 分 本期沿用 methodologyVersion 1.1,没有改变定义、权重、榜单篮子或 NA 规则

这一区分很重要:更多新闻不等于更多可评分覆盖;更多可比数据也不一定意味着竞争事实发生变化。

达到门槛的变化

无。 本期资料窗口内,38 个 Level 3 指标没有一项满足“证据达到 A/B 级、跨过评分区间、同时达到实质变化门槛”三个条件。因此不调整 Level 3、Level 1 或综合分,也不作结构性转折判断。

未改分观察

1. CAISI 的 Kimi K3 网络评估:差距明确,覆盖太窄

UK AISI 与美国 CAISI 的初步评估给出了可复核的方向:

  • 在 32 步 TLO 测试中,Kimi K3 完成 17 步,领先美国模型中位数为 28.5 步;
  • 在 10 个完整任务上,Kimi K3 解出 1 个,两个领先美国模型分别解出 6 个和 7 个;
  • ExploitBench 上 Kimi K3 为 32%,GLM-5.2 为 24%;ACE 上 Kimi K3 为 0/41,领先模型平均为 20/41。

这是 A 级官方评估,但仍是初步、选择性的网络能力测试。美国模型关闭了安全防护,Kimi 的托管条件也限制了部分测试覆盖。它只能补强 U1.1/U1.3 的边界,不能替代“至少两个能力族”或“两项独立同口径安全测试”,因此不改分。

2. Kimi K3 开放完整权重:可获得性已确认,扩散仍待验证

Kimi K3 官方 Hugging Face 仓库显示约 1.56 TB、96 个 safetensor 权重分片;技术报告与代码/权重工件能够互相对应。这足以把“是否有完整权重”从企业宣称提升为可直接核验的事实。

但 E1.2 衡量的是开放模型篮子的质量、开放程度和扩散,而不是单一仓库是否上线。Kimi K3 的企业性能、训练成本和效率宣称仍按 C 级处理;在没有第二个独立家族或生产采用证据推动前三家族中位数跨过 5 个百分点前,E1.2 继续为 -1(中国小幅领先)

3. 微软付费席位与资本开支:需求强,但不具备国家对称分母

微软 FY2026 Q4 披露显示 Microsoft Cloud 收入 593 亿美元、同比增长 27%,Azure 增长 43%;业绩会材料称 Microsoft 365 Copilot 付费席位超过 3,000 万,本季资本开支 410 亿美元,新增容量很快被需求吸收。

这些是 E2.1、E3.1 和 C3.3 的强观察信号,但不是可直接评分的国家对比:云收入不等于纯 AI 收入,付费席位没有中国同口径企业人口分母,资本开支也不等于已经交付和可租用的 AI 算力。因此保留观察,不用美国单家公司替代美国总体,更不与中国的不同口径数字硬比。

4. Meta 与 APEC:区分投入、宣称和执行

Meta Q2 2026 财报披露收入 608.01 亿美元、资本开支 310.8 亿美元,并把全年资本开支预期提高到 1,300–1,450 亿美元。财务数字本身可以核验,但管理层对 AI 增量收入的归因仍是 C 级;宣布资本开支也不满足 C3.2 的融资、施工、并网和电力四项测试。

7 月 24 日的亚太经合组织人工智能倡议声明属于正式多边议程信号,但没有同步出现有约束力的标准、预算、采购、执行机构或执法结果。E4.3 与 E4.4 因而继续为 0:这是“证据充分但方向仍抵消/接近”,不是 NA

三个 Level 1 结果

有用智能:+7,coverage 54%

多榜单前三家族中位数仍支持美国小幅领先;Kimi K3 在 Arena 和 LiveBench 上保持竞争力,同时 CAISI 的网络任务显示受控评估差距。中国模型的质量调整成本仍有小幅优势。由于长程可靠性、可信部署和服务可获得性缺少同口径数据,有用智能不能被简化成“榜单第一是谁”。

可部署算力:+33,coverage 55%

本期没有新的独立交付、HBM 合格产出或大集群 goodput 数据使分数改变。微软资本开支和容量紧张说明需求与扩建仍强,但不能把采购计划当作已经通电的容量。可部署算力仍是综合分最主要的美国方向来源,也是对称数据缺口最大的部分之一。

生态与价值捕获:+9,coverage 38%

这是唯一低于 40% coverage 的 Level 1,因此不单独发布趋势判断。微软付费席位、Kimi 开放权重与 APEC 声明都增加了观察密度,却没有解决企业续约、客户 ROI、生产下游、第三国实际采购等核心分母。中国普通工业机器人安装仍只使用 0.75% 固定权重,不扩大成“AI 产业采用”的替代指标。

榜单分歧

榜单 中国前三基础家族中位数 美国前三基础家族中位数 本期处理
Artificial Analysis v4.1 51 59 美国 +8 个指数点;纳入
LiveBench 2026-06-25 73.16 81.05 美国 +7.90 个类别均值百分点;版本在窗口内未更新
Arena Text(7 月 31 日) 1474.66 1505.41 美国 +30.75 Arena 分;预览状态和置信区间限制解读
NIST/CAISI 不足 3 家族 不足 3 家族 Kimi 网络评估只作受控边界旁证
SWE-bench-Live 不足 3 家族 有新增提交 语言/任务分母不对称,不计算国家中位数

不同榜单量纲不能直接平均。Artificial Analysis 是复合指数,LiveBench 偏新鲜客观任务,Arena 是匿名人类偏好;Arena Agent 榜上 Kimi K3 与部分美国模型的不确定区间还会重叠。共同方向可以补强 +1,但冲突和覆盖边界必须公开,不能只挑支持结论的榜单。

SWE-bench Verified 继续只作历史参照,不回到主评分;软件工程新鲜任务以 SWE-bench-Live或更新型隐藏题评测为主。

下一期观察

  1. Kimi K3 从权重可用走向生产扩散。 等待独立部署量、活跃生产下游、付费推理和持续维护证据,而不是累计下载数。
  2. CAISI 评估能否扩展到第二个能力族。 尤其是长程工具、真实软件工程和安全部署,且要保持中美相同测试条件。
  3. 微软与 Meta 的资本开支是否转成确定性容量。 只记录同时满足融资、施工、并网和电力的项目;通电前 C3.2 最多只能到 ±1。
  4. 榜单是否形成可比的期环比。 对 AA、LiveBench、Arena 和 SWE-bench-Live 保留家族去重、版本和原始行,防止推理档或预览版本重复计数。
  5. APEC 倡议是否进入执行。 观察共同标准、预算、采购、成员采用和具体执行机制,而不是继续累计声明数量。

局限

  • 当前固定权重覆盖率只有 48.75%,总体判断是“暂定”;低覆盖尤其集中在生态价值、有效交付算力、HBM 产出和运行效率。
  • 企业财报能确认收入、席位和资本开支,却通常不能独立确认 AI 增量归因、客户 ROI 或国家竞争份额。
  • 榜单的题集、量纲、推理预算和发布时间不同。前三家族中位数用于降低单模型噪声,不会消除所有测量偏差。
  • 半月报告只纳入资料窗口内的新证据和对旧证据的修正;年度统计沿用时会标记 sourceAsOfstaleDays,过期后改为 NA
  • 至少两个 Level 1 连续两期同向变化,才会写成结构性转折。本期三个 Level 1 均未变化。

完整定义、38 项固定权重、NA 与门槛规则见方法论 v1.1,历期报告见中美 AI 观察

直接来源

返回文章列表