中美 AI 半月监测 #01:Kimi 开放权重,结构分未变
截至 2026 年 8 月 1 日 09:00:Kimi K3 开放完整权重、CAISI 发布网络能力评估,但固定指标尚无一项跨过改分门槛。
更新于
Executive Summary
资料窗口:2026 年 7 月 21 日 09:00 之后至 2026 年 8 月 1 日 09:00(北京时间)。
- 本期无结构性变化。 v1.1 综合分仍为 +17,未四舍五入值为 +17.2,处于“美国小幅优势”区间;相较上期事实变化 0 分。
- 证据覆盖率仍为 48.75%,属于“暂定”。 覆盖率变化 0 个百分点,方法或覆盖效应 0 分。
NA没有被重新分配,也不代表平手。 - 两条最重要的新证据都没有触发改分。 UK AISI 与美国 CAISI 的初步评估显示 Kimi K3 在网络能力上落后于领先美国模型,但只覆盖一个能力族;Kimi K3 同时发布了可核验的完整权重,但一个新家族不足以让开放模型篮子跨过 5 个百分点门槛。
- 榜单方向一致、力度并不一致。 Artificial Analysis、LiveBench 与 Arena 的前三基础模型家族中位数都仍偏美国,CAISI 和 SWE-bench-Live 只能作边界旁证;本期没有发现可比的期环比大幅变化。
+17.2只用于复算和时间序列,不表示现实判断精确到个位数。综合分不是胜率、预测或投资建议。
分数与覆盖率
| 结果 | 上期 | 本期 | 事实 delta | coverage | 解读 |
|---|---|---|---|---|---|
| 有用智能 | +7 | +7 | 0 | 54% | 美国在前沿家族深度和综合能力上小幅领先,成本效率偏中国 |
| 可部署算力 | +33 | +33 | 0 | 55% | 已验证差距仍集中在芯片、互联、软件栈和可租用云容量 |
| 生态与价值捕获 | +9 | +9 | 0 | 38% | 美国资本与已披露收入领先,中国开放模型和机器人安装形成对冲 |
| 综合 | +17 | +17 | 0 | 48.75% | 美国小幅优势;判断暂定 |
精确计算为:100 ÷ 3 × Σ(38 项固定权重 × Level 3 分数)= +17.2。38 项权重合计 1.0,三个 Level 1 权重仍为 30% / 35% / 35%;有效分数覆盖的固定权重合计 48.75%。
事实变化与方法/覆盖变化
| 变化层 | 本期结果 | 原因 |
|---|---|---|
| 事实变化 | 0 分 | 没有 A/B 级新增证据使任何 Level 3 跨过既定评分区间和实质门槛 |
| coverageDelta | 0 个百分点 | 新证据补强了观察,但没有把任何 NA 变成有效分数,也没有使有效值过期 |
| methodEffect | 0 分 | 本期沿用 methodologyVersion 1.1,没有改变定义、权重、榜单篮子或 NA 规则 |
这一区分很重要:更多新闻不等于更多可评分覆盖;更多可比数据也不一定意味着竞争事实发生变化。
达到门槛的变化
无。 本期资料窗口内,38 个 Level 3 指标没有一项满足“证据达到 A/B 级、跨过评分区间、同时达到实质变化门槛”三个条件。因此不调整 Level 3、Level 1 或综合分,也不作结构性转折判断。
未改分观察
1. CAISI 的 Kimi K3 网络评估:差距明确,覆盖太窄
UK AISI 与美国 CAISI 的初步评估给出了可复核的方向:
- 在 32 步 TLO 测试中,Kimi K3 完成 17 步,领先美国模型中位数为 28.5 步;
- 在 10 个完整任务上,Kimi K3 解出 1 个,两个领先美国模型分别解出 6 个和 7 个;
- ExploitBench 上 Kimi K3 为 32%,GLM-5.2 为 24%;ACE 上 Kimi K3 为 0/41,领先模型平均为 20/41。
这是 A 级官方评估,但仍是初步、选择性的网络能力测试。美国模型关闭了安全防护,Kimi 的托管条件也限制了部分测试覆盖。它只能补强 U1.1/U1.3 的边界,不能替代“至少两个能力族”或“两项独立同口径安全测试”,因此不改分。
2. Kimi K3 开放完整权重:可获得性已确认,扩散仍待验证
Kimi K3 官方 Hugging Face 仓库显示约 1.56 TB、96 个 safetensor 权重分片;技术报告与代码/权重工件能够互相对应。这足以把“是否有完整权重”从企业宣称提升为可直接核验的事实。
但 E1.2 衡量的是开放模型篮子的质量、开放程度和扩散,而不是单一仓库是否上线。Kimi K3 的企业性能、训练成本和效率宣称仍按 C 级处理;在没有第二个独立家族或生产采用证据推动前三家族中位数跨过 5 个百分点前,E1.2 继续为 -1(中国小幅领先)。
3. 微软付费席位与资本开支:需求强,但不具备国家对称分母
微软 FY2026 Q4 披露显示 Microsoft Cloud 收入 593 亿美元、同比增长 27%,Azure 增长 43%;业绩会材料称 Microsoft 365 Copilot 付费席位超过 3,000 万,本季资本开支 410 亿美元,新增容量很快被需求吸收。
这些是 E2.1、E3.1 和 C3.3 的强观察信号,但不是可直接评分的国家对比:云收入不等于纯 AI 收入,付费席位没有中国同口径企业人口分母,资本开支也不等于已经交付和可租用的 AI 算力。因此保留观察,不用美国单家公司替代美国总体,更不与中国的不同口径数字硬比。
4. Meta 与 APEC:区分投入、宣称和执行
Meta Q2 2026 财报披露收入 608.01 亿美元、资本开支 310.8 亿美元,并把全年资本开支预期提高到 1,300–1,450 亿美元。财务数字本身可以核验,但管理层对 AI 增量收入的归因仍是 C 级;宣布资本开支也不满足 C3.2 的融资、施工、并网和电力四项测试。
7 月 24 日的亚太经合组织人工智能倡议声明属于正式多边议程信号,但没有同步出现有约束力的标准、预算、采购、执行机构或执法结果。E4.3 与 E4.4 因而继续为 0:这是“证据充分但方向仍抵消/接近”,不是 NA。
三个 Level 1 结果
有用智能:+7,coverage 54%
多榜单前三家族中位数仍支持美国小幅领先;Kimi K3 在 Arena 和 LiveBench 上保持竞争力,同时 CAISI 的网络任务显示受控评估差距。中国模型的质量调整成本仍有小幅优势。由于长程可靠性、可信部署和服务可获得性缺少同口径数据,有用智能不能被简化成“榜单第一是谁”。
可部署算力:+33,coverage 55%
本期没有新的独立交付、HBM 合格产出或大集群 goodput 数据使分数改变。微软资本开支和容量紧张说明需求与扩建仍强,但不能把采购计划当作已经通电的容量。可部署算力仍是综合分最主要的美国方向来源,也是对称数据缺口最大的部分之一。
生态与价值捕获:+9,coverage 38%
这是唯一低于 40% coverage 的 Level 1,因此不单独发布趋势判断。微软付费席位、Kimi 开放权重与 APEC 声明都增加了观察密度,却没有解决企业续约、客户 ROI、生产下游、第三国实际采购等核心分母。中国普通工业机器人安装仍只使用 0.75% 固定权重,不扩大成“AI 产业采用”的替代指标。
榜单分歧
| 榜单 | 中国前三基础家族中位数 | 美国前三基础家族中位数 | 本期处理 |
|---|---|---|---|
| Artificial Analysis v4.1 | 51 | 59 | 美国 +8 个指数点;纳入 |
| LiveBench 2026-06-25 | 73.16 | 81.05 | 美国 +7.90 个类别均值百分点;版本在窗口内未更新 |
| Arena Text(7 月 31 日) | 1474.66 | 1505.41 | 美国 +30.75 Arena 分;预览状态和置信区间限制解读 |
| NIST/CAISI | 不足 3 家族 | 不足 3 家族 | Kimi 网络评估只作受控边界旁证 |
| SWE-bench-Live | 不足 3 家族 | 有新增提交 | 语言/任务分母不对称,不计算国家中位数 |
不同榜单量纲不能直接平均。Artificial Analysis 是复合指数,LiveBench 偏新鲜客观任务,Arena 是匿名人类偏好;Arena Agent 榜上 Kimi K3 与部分美国模型的不确定区间还会重叠。共同方向可以补强 +1,但冲突和覆盖边界必须公开,不能只挑支持结论的榜单。
SWE-bench Verified 继续只作历史参照,不回到主评分;软件工程新鲜任务以 SWE-bench-Live或更新型隐藏题评测为主。
下一期观察
- Kimi K3 从权重可用走向生产扩散。 等待独立部署量、活跃生产下游、付费推理和持续维护证据,而不是累计下载数。
- CAISI 评估能否扩展到第二个能力族。 尤其是长程工具、真实软件工程和安全部署,且要保持中美相同测试条件。
- 微软与 Meta 的资本开支是否转成确定性容量。 只记录同时满足融资、施工、并网和电力的项目;通电前 C3.2 最多只能到 ±1。
- 榜单是否形成可比的期环比。 对 AA、LiveBench、Arena 和 SWE-bench-Live 保留家族去重、版本和原始行,防止推理档或预览版本重复计数。
- APEC 倡议是否进入执行。 观察共同标准、预算、采购、成员采用和具体执行机制,而不是继续累计声明数量。
局限
- 当前固定权重覆盖率只有 48.75%,总体判断是“暂定”;低覆盖尤其集中在生态价值、有效交付算力、HBM 产出和运行效率。
- 企业财报能确认收入、席位和资本开支,却通常不能独立确认 AI 增量归因、客户 ROI 或国家竞争份额。
- 榜单的题集、量纲、推理预算和发布时间不同。前三家族中位数用于降低单模型噪声,不会消除所有测量偏差。
- 半月报告只纳入资料窗口内的新证据和对旧证据的修正;年度统计沿用时会标记
sourceAsOf与staleDays,过期后改为NA。 - 至少两个 Level 1 连续两期同向变化,才会写成结构性转折。本期三个 Level 1 均未变化。
完整定义、38 项固定权重、NA 与门槛规则见方法论 v1.1,历期报告见中美 AI 观察。