有用智能
比较模型在真实任务中的能力、可靠性、成本与研发供给,不依赖单一榜单。
Semi-monthly Monitor
每月 1 日与 16 日更新。只记录相较上期发生的、可核实且足以改变判断的信号;宣传口径、传闻和重复旧闻不进入评分。
Measurement
三个一级结果、十个二级驱动和 38 个 Level 3 观测项,中美使用相同口径。
比较模型在真实任务中的能力、可靠性、成本与研发供给,不依赖单一榜单。
比较芯片、HBM、封装、集群、软件栈、云和电力组成的有效算力,不只数卡。
比较开发者生态、产业生产率、商业回报以及国际采购和标准采纳。
评分不是胜率。 精确值用于画线,公开判断同时给出优势区间与证据覆盖率。
缺失不是平手。 无对称证据时记录 NA;企业单方宣称只进观察清单。
Issues
首期是基线;后续每期都会与上一份快照逐项对比。