by 戚兆禹中美 AI 观察约 10 分钟

中美 AI 半月监测 #02:Qwen 与 DeepSeek 上榜,结构分未变

截至 2026 年 8 月 16 日 09:00:Qwen3.8 与 DeepSeek V4 Pro 补强中国侧前沿模型观察,但严格 cutoff 与可比门槛均不支持改分。

更新于

  • AI
  • 中美 AI
  • 半月监测

Executive Summary

资料窗口:2026 年 8 月 1 日 09:00 之后至 2026 年 8 月 16 日 09:00(北京时间)。

  • 本期无结构性变化。 v1.1 综合分仍为 +17,未四舍五入值为 +17.2,处于“美国小幅优势”区间;相较上期事实变化 0 分
  • 证据覆盖率仍为 48.75%,属于“暂定”。 coverageDelta 为 0 个百分点,methodEffect 为 0 分。本期没有把 NA 重新分配成已有指标,也没有把证据不足写成平手。
  • 中国侧前沿模型供给明显补强,但不足以改分。 千问平台在窗口内上线 Qwen3.8-Max、Qwen3.8 开放版本与 DeepSeek V4 Pro 0813;8 月 17 日的独立榜单回看显示 Artificial Analysis 与 LiveBench 的中美前三家族中位数差距都缩小。
  • 严格 cutoff 是本期的关键约束。 独立榜单的新模型行缺少可以证明其在 8 月 16 日 09:00 前已经发布的行级时间戳;只有 LiveBench 的观察差距变化超过 5 点,Artificial Analysis 变化为 4 点,而且两者量纲不能直接相加。相关结果进入观察清单,不触发 U1.1 或 U3.1 改分。
  • 固定篮子没有被选择性裁剪。 Arena 正式页仍停留在 8 月 1 日快照;NIST/CAISI 没有新增同口径受控评估;SWE-bench-Live 仍不足以构成中美各三家族的对称篮子。

+17.2 只用于复算和时间序列,不表示现实判断精确到个位数。综合分不是胜率、预测或投资建议。

分数与覆盖率

结果 上期 本期 事实 delta coverage 解读
有用智能 +7 +7 0 54% 新模型缩小部分榜单差距,但 cutoff 与多评测族门槛未满足
可部署算力 +33 +33 0 55% 已验证差距仍集中在芯片、互联、软件栈和可租用云容量
生态与价值捕获 +9 +9 0 38% 中国开放模型观察增强,但许可、扩散与商业回报仍缺对称分母
综合 +17 +17 0 48.75% 美国小幅优势;判断暂定

精确计算为:100 ÷ 3 × Σ(38 项固定权重 × Level 3 分数)= +17.2。38 项固定权重合计 1.0,三个 Level 1 权重仍为 30% / 35% / 35%;具有有效 -3..+3 分数的固定权重合计 48.75%。

事实变化与方法/覆盖变化

变化层 本期结果 原因
事实变化 0 分 没有 cutoff 合格的 A/B 级新增证据使任一 Level 3 同时跨过评分区间和实质门槛
coverageDelta 0 个百分点 新证据补强观察,没有把 NA 变成有效分数,也没有有效值超过陈旧期限
methodEffect 0 分 methodologyVersion 仍为 1.1;定义、38 项权重、篮子、NA 规则和门槛均未改变

本期出现了“事实事件在窗口内、独立测量在截止后回看”的情况。文章公开保留这项观察,但评分只使用能证明在 cutoff 前已经公开的证据,避免把晚到数据倒灌进时间序列。

达到门槛的变化

无。 三个 Level 1 与 38 个 Level 3 均未改分,因此也不满足“至少两个 Level 1 连续两期同向变化”才可称为结构性转折的规则。

未改分观察

1. Qwen3.8 与 DeepSeek V4 Pro:前沿供给增强,发布事实与性能宣称分开处理

千问 AI 平台模型发布记录显示:

  • 8 月 3 日上线 Qwen3.8-Max,平台披露其为 2.4T MoE、支持 100 万 token 上下文;
  • 8 月 13 日上线 Qwen3.8-2.4T-A95B,平台将其描述为开放版本,披露每步激活约 95B;
  • 同日上线 DeepSeek V4 Pro 0813,平台披露总参数 1.6T、激活 49B、支持 100 万 token 上下文。

Qwen 自有平台上的上线时间、参数与可调用性属于可核验发布事实;“能力显著提升”等性能描述仍是企业单方宣称。DeepSeek 条目只能确认该平台提供了指定版本,不能替代 DeepSeek 自身发布记录或独立性能测量。

对 E1.2 而言,Qwen 页面称其为开放版本,但本期 cutoff 内没有完成对完整权重、许可证、可商业使用范围和生产扩散的独立核验。因此 E1.2 仍为 -1(中国小幅领先),不把“开放”两个字直接当成完整开放工件。

2. 独立榜单回看:差距缩小是真实观察,但不是本期可评分变化

8 月 17 日访问 Artificial Analysis 时,其 v4.1.1 指数的中美前三基础模型家族中位数分别为 58 和 62,美国方向差距为 4 点;上期同口径记录为 51 与 59,差距为 8 点。

同日读取 LiveBench 的 2026-06-25 公开数据时,中国前三家族中位数为 78.4609,美国为 81.0535,差距为 2.5926 点;上期差距为 7.8962 点,观察变化为缩小 5.3036 点。

这两项都显示中国侧新家族进入前沿区间,但不触发 U1.1 改分:

  1. 榜单没有提供新模型行的发布时间,无法证明这些行在 cutoff 前已经可见;
  2. 只有 LiveBench 的观察变化超过 5 点,Artificial Analysis 为 4 点;
  3. 一个是复合指数点,一个是类别均值百分点,不能为了过门槛而直接平均;
  4. Arena 没有新的正式窗口快照,不能只保留支持“差距缩小”的榜单。

3. U3.1:两个候选家族出现,不等于滚动篮子已经完成重估

Qwen3.8 与 DeepSeek V4 Pro 0813 在晚到榜单读取中都进入中国侧前三,构成两个值得跟踪的前沿家族候选。但 U3.1 要求滚动 12 个月、至少两个评测族、全球前 10% 与基础家族去重后的对称计数。本期无法证明新行的 cutoff 合格时间,也没有完成中美全篮子同口径重算,所以 U3.1 继续为 +1(美国小幅领先)

这不是否认新模型,而是把“发布”“独立上榜”“达到滚动篮子门槛”拆成三个不同阶段。

4. 其余固定篮子:没有用旧榜单制造假更新

Arena Text Leaderboard的正式页仍标注 8 月 1 日,本期沿用上期中美中位数差距 30.7524 Arena 分,不把低票数或非正式变化写入 cutoff 快照。

NIST/CAISI没有发布新的中美各三家族受控评估;SWE-bench-Live也没有形成共享隐藏题分母上的中美对称前三家族。二者继续作为边界证据。SWE-bench Verified 只作历史参照,不回到主评分。

Level 1 解释

有用智能:+7,coverage 54%

Qwen3.8 与 DeepSeek V4 Pro 增加了中国侧前沿家族深度,晚到榜单也显示差距收窄;但只有 cutoff 合格、同口径、跨过门槛的结果才能改变时间序列。长程可靠性、可信部署与服务可获得性仍缺对称证据,因此有用智能维持 +7。

可部署算力:+33,coverage 55%

本期没有新的独立交付、HBM 合格产出、大集群 goodput、已通电容量或同时满足融资、施工、并网和电力四项条件的项目证据。模型参数增长不能替代国内实际可获得算力,C3.2 也继续为 NA

生态与价值捕获:+9,coverage 38%

该 Level 1 的 coverage 低于 40%,因此不单独发布趋势判断。Qwen 开放版本是重要观察,但完整许可证、生产下游、付费推理、续约、客户 ROI 与第三国实际采购仍缺对称数据。普通工业机器人安装继续只占 E2.4b 的 0.75% 固定权重。

榜单分歧

榜单 中国前三基础家族中位数 美国前三基础家族中位数 本期处理
Artificial Analysis v4.1.1 58 62 8 月 17 日回看差距 4 点;行级发布时间不可核验,只作观察
LiveBench 2026-06-25 78.4609 81.0535 回看差距 2.5926 点;较上期缩小 5.3036,但 cutoff 不合格
Arena Text(8 月 1 日正式页) 1474.6573 1505.4097 没有新正式窗口快照,沿用上期记录
NIST/CAISI 不足 3 家族 不足 3 家族 没有新增同口径受控评估
SWE-bench-Live 不足 3 家族 不足 3 家族 共享隐藏题分母不对称,只作边界旁证

Artificial Analysis 偏复合智能指数,LiveBench 偏客观新鲜任务,Arena 是匿名人类偏好;它们的量纲、题集、推理预算与更新时间不同。共同方向可以形成观察,但不能把不同单位拼成一个刚好跨门槛的数字。

下一期观察

  1. Qwen3.8 开放工件。 核验权重完整性、许可证、商业使用范围、持续维护与独立部署,而不是只看平台文案。
  2. Qwen3.8 与 DeepSeek V4 Pro 的榜单时间线。 保存行级版本与发布时间,完成 U1.1、U3.1 的 cutoff 合格重算。
  3. Arena 与隐藏题软件工程评测。 等待新的正式快照和中美对称家族篮子,避免用低票数预览制造趋势。
  4. 算力从宣布到投产。 继续区分融资、施工、并网、电力、通电与商业回报;通电前 C3.2 封顶 ±1。
  5. 开放模型从上榜到价值捕获。 观察付费推理、活跃生产下游、续约与第三国实际采购,而不是下载量。

局限

  • 固定权重 coverage 只有 48.75%,总体判断为“暂定”;生态与价值捕获只有 38%,不能单独发布趋势。
  • 本期独立榜单读取发生在 cutoff 次日。新模型事件发生在窗口内,但新行发布时间不可核验,因此没有倒灌成分数。
  • 企业平台可确认上线与参数,不自动证明性能、开放许可证、实际产能、生产采用或商业回报。
  • 榜单的题集、量纲、推理档和发布时间不同;前三基础家族中位数能减少重复版本噪声,不能消除全部测量偏差。
  • 最近有效值只在 v1.1 陈旧期限内沿用,并记录 sourceAsOfstaleDays;超期后改为 NA,不重新分配权重。
  • 至少两个 Level 1 连续两期同向变化,才可写成结构性转折。本期三个 Level 1 均未变化。

完整定义、38 项固定权重、NA 与门槛规则见方法论 v1.1,历期报告见中美 AI 观察

直接来源

返回文章列表