深度 · 小互解读

中国 AI 模型追上美国前沿了吗?中美 AI 差距到底如何?

Kimi K3 发布后「中国追平了」的说法四起,但换一把尺子量,落后天数差了三倍多,连谁在加速都反过来。
一分钟速览
  • 中国 AI 模型追上美国前沿了吗?按 Epoch 的能力指数 ECI 算,答案是还没有:Kimi K3 仍落后 4.37 到 5.29 个月,趋势线上找不到反超点。
  • 可「追平了」的说法也有依据:月之暗面自评的 35 项里 30 项赢 Claude Opus 4.8,前端代码竞技场排第一,GPU 内核优化和 Claude Fable 5 并列前沿。
  • 但这些成绩取决于选了哪些题:自报的 35 项里 24 项是视觉和 agentic 类,没有长上下文、没有正经数学、没有安全类,也没有一项在量推理的 token 效率。
  • Artificial Analysis Index 有同样的偏:Agents 占 34% 加 Coding 占 24%,58% 的权重压在 Agent 和短任务编码上,而且完全不管每项评测有多难。
  • Epoch AI 的 ECI 换了个思路,借考试测评那套办法,把每项基准的难度和区分度估出来,再反推模型的能力值放到同一把尺子上,Anthropic 在自家系统卡里也用同一套方法。
  • 两把尺子给出相反的答案:AAI 上中国落后 1.22 到 1.61 个月、2027 年 11 月反超;ECI 上落后 4.37 到 5.29 个月、按趋势线不存在反超。连七家实验室谁跑得快的排名都几乎是反的。
开门见山

答案是还没有,但榜单让很多人以为已经追上了

答案是还没有。

7 月 16 日月之暗面发布 2.8 万亿参数的 Kimi K3 之后,Substack 专栏 scaling01 上的独立分析者 Lisan al Gaib 用 Epoch 的能力指数(ECI)算了一轮:Kimi K3 虽然在好几个榜单上亮眼,综合能力仍落后美国前沿 4.37 到 5.29 个月,而且按拟合出来的趋势线,压根找不到反超点。
🔀
让人犯迷糊的地方在这儿:同样这批模型、同样这段时间,换一个同样流行的评测指数去量,落后天数会缩到 1.22 到 1.61 个月,还会算出 2027 年 11 月中国反超。两个答案差了三倍多,连谁在加速都是反的。

所以这篇分析真正在处理的问题是:为什么会有两个答案,以及该信哪一个。要看懂这一点,得先看看「追平论」的事实基础有多硬,它比一般的立场之争硬得多。

先看 Kimi K3 的成绩单

Kimi K3 是目前最大的开放权重模型,参数量接近 DeepSeek V4 的两倍,也超过了当年引爆这轮 AI 热潮的初代 GPT-4(1.8 万亿)。在月之暗面自己公布的 35 项基准上,它有 30 项赢过 Claude Opus 4.8,19 项赢过 GPT-5.6 Sol,12 项赢过 Claude Fable 5。

📌
而且对手不是老模型:GPT-5.6 Sol 只比 Kimi K3 早发布 7 天,Claude Fable 5 早 37 天,Claude Opus 4.8 早 49 天。同一个季度里的对手。

第三方评测也给了它位置。在 Artificial Analysis 的排行榜上,Kimi K3 拿到 57.1 分,排在 Claude Fable 5 和 GPT-5.6 Sol 之后位列第三,比 GLM-5.2、Kimi K2.6、Qwen3.7-Max、DeepSeek-V4-Pro 这批此前的中国旗舰有明显跳升。

Artificial Analysis 智能指数与输出 token 散点图
Artificial Analysis 的排行图。纵轴是智能指数,横轴是每道题消耗的输出 token(对数刻度),左上角绿色区域是「分高且省 token」。Kimi K3 落在绿区内。来源:Artificial Analysis

在专门比拼网页前端效果的 Frontend Code Arena 上,Kimi K3 拿了 1679 分排第一,领先第二名 Claude Fable 5 四十八分,是整张榜上最大的一档差距。

Frontend Code Arena 排行榜,Kimi K3 排名第一
Frontend Code Arena 排行榜(原文称其为 WebDev Arena,同一个榜单的两种叫法):Kimi-K3 1679、Claude Fable 5 1631、GPT-5.6 Sol 1618、GLM-5.2 1587。来源:Arena AI

还有一个不太上头条、但对做 AI 的人很实际的领域:GPU 内核优化。模型跑得快不快,取决于硬件被榨得有多干净,每浪费一个时钟周期就是更少的吞吐和更高的延迟,最后都变成钱。这件事不光在生产环境要紧,做研究时也要紧,每个新架构想法都得跑一批实验去验证,直接用 PyTorch 跑不满硬件,得靠手写内核提速。

KernelBench 在 RTX PRO 6000 上的加速倍数排行
KernelBench(RTX PRO 6000):指标是相对优化过的 PyTorch 基线的最佳解码加速倍数。Kimi K3 与 Claude Fable 5 同处最前一档,都在 18 倍上下。来源:KernelBench
站内相关
月之暗面发布 Kimi K3:全球首个 3 万亿级开放模型

把这些摆在一起,「中国已经追上美国前沿」看起来像个已经结案的判断。那开头那个「还没有」是怎么来的?分歧的第一层,藏在「能力」这两个字里。

分领域

把能力拆开看,真正追平的只有一类

「追上了」这三个字之所以能同时被证实和证伪,是因为能力本来就是分领域的。一个模型可以在写代码上追平对手,同时在别的领域差着好几代。把这篇分析里出现过的领域逐个摆出来,落差立刻显形。

写代码
和美国前沿可比
前端代码竞技场 1679 分排第一,领先 Claude Fable 5 四十八分
GPU 内核优化
与 Claude Fable 5 并列前沿
KernelBench 上约 18 倍加速,与 Claude Fable 5 同处最前一档
综合能力
落后 4.37 到 5.29 个月
Epoch 初步 ECI 155.53,位置卡在 GPT-5.3 Codex 和 GPT-5.4 Pro 之间
研究级数学
落后约七个月
FrontierMath Tier 4 约 39 分,低于七个月前的 GPT-5.2 Pro(约 45 分);Claude Fable 5 是 88 分
长链条硬任务
退回到七八个月前的水平
UK AISI 的 32 步网络靶场上 GLM-5.2 走到约 11 步,与 Claude Opus 4.5 同级,而 GPT-5.6 Sol 走到约 29 步。这一项测的是 GLM-5.2,不是 Kimi K3
token 效率
仍差于美国模型
自评的 35 项基准里,没有一项在量这件事
长上下文、安全类
没有公开数据
自评的 35 项基准里,这两类一项都没有
科学突破
尚未看到
到目前为止,还没有中国模型解开此前未解的数学或物理问题

写代码这一项恰恰是最容易被看见的:它有最多的公开榜单,也是所有人天天在用的能力。而下面几项要么需要专门的评测机构去跑,要么根本没被列进自评清单。舆论场上的「追平了」,基本是从第一行长出来的。

可写代码这一项,偏偏是最要命的那一项

目前测得最扎实的一条趋势就在软件工程上:AI 能独立完成的任务长度,大约每 4 个月翻一倍。作者也提到,这条趋势很可能在数学等其他领域同样成立,只是软件工程这边的测量最充分。这里的「任务长度」有个专门的说法,叫时间跨度。

时间跨度是什么

一件事人类要花多长时间做完,而模型有一半概率能做成,这个时长就是模型的时间跨度。用它当难度标尺,比数代码行数靠谱得多,而且能直接换算成经济价值:能顶下一个人一天的活,和能顶下一个人三个月的活,是完全不同的两件事。

照这条趋势再往前推两三年,就是「一个人要干几个月到几年的活,模型能接下来」。就算这条趋势只在写代码这一件事上成立,谁先握住超人类水平的程序员模型,谁就握住了一个很难被追平的战略位置。这就是为什么值得花力气去算清楚那几个月的差距。

AI Futures Model 的时间线与起飞推演界面
AI Futures Model(2025 年 12 月版,参数于 2026-04-02 更新)。左下角两个日期是这套推演在中位参数下给出的结果:自动化程序员 2028 年 6 月、超级智能 2029 年 5 月;关键参数一栏里,编码时间跨度的翻倍周期填的是 4 个月。这是一套预测模型的输出,不是实测数据。来源:AI Futures Project

比较只在中美之间做,因为最好的模型、最多的 AI 研究和最多的算力都集中在这两边。欧洲理论上有钱也有人,但到目前为止没有表现出认真下场竞争的意思。

于是问题变成了:分领域看落差这么明显,为什么一到榜单上就成了「整体追平」?往下拆两层就清楚了。第一层是「差距」这个词本身,它其实同时在说两件事,而大多数人只用了其中一件。

概念

「差距」这个词同时在说两件事

差距的定义只有一句话:一家实验室要花多久才能做出另一家已经做出的能力。但这句话里藏着两个方向完全不同的问题。

后向差距
  • 问的是:落后的这一方今天的水平,相当于领先方多久以前?
  • 看历史就能算,数据都已经发生了。
  • 平时说的「差几个月」基本都是这个。
前向差距
  • 问的是:落后的这一方还要多久,才能摸到领先方今天的水平?
  • 得先预测未来,取决于对算力、人才、AI 自己带来的提速等一堆变量的假设。
  • 不确定性大得多。
后向差距与前向差距的示意图
示意图,不是真实数据。图上的 6.3 个月和 10.0 个月是画出来解释概念的假想数字:左边那段量的是「领先方什么时候达到落后方今天的分数」,右边那段量的是「落后方什么时候能到领先方今天的分数」。来源:scaling01

还有一层容易被跳过:能力是分领域的。一个模型可以在写代码上追平另一个,同时在别的领域、或者综合起来仍然更差。所以「追平了」这三个字,必须问清楚是哪一项追平了。

模型是一批一批发的,中间没有连续曲线

真要动手算,会撞上一个现实问题:进步是离散的。模型每隔几周到几个月才发一次,两个模型的分数也不会正好相等,没法直接量中间隔了多长时间。三种办法各有取舍。

往上取相邻模型
高估
往下取相邻模型
低估
拟合回归线
居中

作者选了第三种,理由是它对称,更能反映底下那条大趋势,而且能看出差距在扩大还是在缩小。代价也说清楚了:结果取决于回归模型怎么选,而且会把趋势的断点抹平。这一点对 Kimi K3 是不利的,如果它真的是一次断点,回归线会把它按回去。

不过过去五年左右,能算得上趋势断点的只有一两次:2024 年第三季度的推理模型,以及 2025 年 11 月 Claude Opus 4.5 发布后 agentic 模型开始起量,可能算第二次。这两次都和模型大小无关,所以一个体量不到 DeepSeek-V4-Pro 两倍的模型,仅凭尺寸就打断趋势,说不太通。

因此后面每个结论都会给两组数:相邻模型区间(当下的瞬时差距,图里还会给一个区间内插值),以及趋势线估计(拉长时间看的长期水平)。方法定好了,接下来是分歧的第二层,也是最要命的一层:你拿哪些题去量。

题目构成

榜单上的题目怎么选,直接决定了结论

「35 项里赢了 30 项」这句话的分量,完全取决于那 35 项是怎么挑出来的。把构成拆开看,缺席的题型比在场的更能说明问题。

在场:35 项
  • 视觉类 12 项
  • agentic 类 12 项
  • 编码类 8 项
  • 「推理」与知识类 3 项
缺席
  • 长上下文,一项都没有
  • 网络、生物、化学等安全相关,一项都没有
  • 正经的数学,只有 MathVision、GPQA-D 和 HLE
  • 纯推理,那 3 项挂在「推理」名下的其实是知识题带一点数学
  • 推理的 token 效率,一项都没有

视觉和 agentic 两类加起来 24 项,占了这份榜单的近七成。编码类里倒是有几项作者认为信号质量高的,比如 ProgramBench 和 SWE-Marathon,它们的任务范围更大、时间跨度更长。

这批数据能支持的结论

能成立的说法只有一句:Kimi K3 的编码能力和当前美国前沿模型可比。

推不出「Kimi K3 整体强过 Claude Opus 4.8 和 GPT-5.6 Sol」。对 Claude Fable 5 更谈不上,35 项里它输掉了大多数。

第三方榜单也有同样的偏

那换成第三方的 Artificial Analysis Index 呢?它今天是最流行的指数之一,但作者认为它不该被用来判断模型的综合强弱,理由有两条。

第一条是权重。指数的构成明显偏向 Agent 和短时间跨度的编码题。

Artificial Analysis Index 的四类权重与所含评测
指数的四类权重:Agents 34%、Coding 24%、General 18%、Scientific Reasoning 24%,前两类合计 58%。占比最大的 GDPval-AA v2 是一套 220 个任务的 Agent 评测。来源:Artificial Analysis

第二条是难度。每项评测有多难、跑出成绩能提供多少信息量,这个指数完全不计。所有评测按人工设定的权重加权平均,一项随手能过的评测和一项几乎没有模型能做对的评测,进指数的分量是一样的。

这不等于说它没用。它的排名和日常使用体感对得上,因为它测的是经济上真正有用的活。作者的处理办法是给它换个定位:把它当成日常好用程度的指标,而不是综合智能的指标。所以在他的文章里,这个指数被叫作 Artificial Analysis Index,官方名字里的 Intelligence 那个词被拿掉了。那有没有一把尺子,能不靠人工挑权重、还能把题目难度算进去?有,而且 Anthropic 自己也在用。

机制

ECI 怎么把题目难度也算进分数里

Epoch AI 的 Capability Index(简称 ECI)针对的就是上面那两个毛病。它想测的是模型底下那个综合能力值,并且把所有模型放到同一把尺子上。用的办法叫 Item Response Theory,中文常译作项目反应理论。

先用考试打个比方

两个人都考了 60 分,一个考的是小学卷子,一个考的是奥数卷子,说明的水平天差地别。要把他们放到一起比,就得先知道每张卷子有多难。项目反应理论干的就是这件事:答对一道题的概率,同时取决于考生有多强和这道题有多难,那就把两边一起估出来。

具体到评测上,每一项基准要估两个参数:

难度参数
  • 要在这项基准上拿到 50 分,需要多强的能力。
斜率参数
  • 这项基准的分数对能力变化有多敏感,也就是它能不能把水平接近的模型区分开。

估完这些参数,再拟合一个统一的统计模型,去找那个最能解释全部观测分数的能力值。这个能力值就是模型的 ECI。

和 AAI 比,它多做对了三件事

一是减少了对人工挑选权重的依赖;二是不要求所有模型都跑过所有基准,缺项也能算;三是把每项基准的难度和区分能力都算了进去。

Anthropic 最近也采用了同一套办法来衡量模型强弱,在自家的系统卡里叫 AECI。他们那张图顺带把不同基准的难度画了出来。

拿其中一格验算一遍,就能看出这套方法在干什么。GPQA Diamond 的 50 分刻度落在 129 附近,意思是能力值约 129 的模型,在这项基准上大概能考 50 分。Claude 3 Opus 的 AECI 约 126,比 129 低一点,按这个模型该预测它略低于 50 分。实测是 50.4 分,比预期高了一点点。

Anthropic 系统卡里的 AECI 随时间变化图
据 Anthropic 系统卡数据绘制的 AECI 图。红点是各代 Claude 模型的能力值,彩色方框是各项基准的难度区间(框体覆盖 25% 到 75% 分数所需能力,中间横线是 50% 刻度)。从左到右,GPQA Diamond 的横线最低、GSO-Bench 最高,难度依次递增。来源:Mythos Preview 系统卡

能力值落在一把共享的尺子上,而且比人工挑选加权的指数更少偏见,这就是 ECI 的用处。两把尺子都齐了,现在把同一批模型分别放上去量一遍。

对照

两把尺子量同一批模型,差距差了三倍多

同一批模型、同一段时间,换一把尺子,中美差距的数字和方向都变了。

先看 AAI 这把尺子

Kimi K3 在这个指数上拿 57.1 分。因为指数被卡在 0 到 100 之间,作者用 sigmoid 曲线拟合两国的前沿趋势。

按 Artificial Analysis Index 拟合的中美前沿趋势
按 AAI 拟合的中美前沿趋势。右下角信息框:相邻模型区间 37 到 49 天(1.22 到 1.61 个月),局部插值 45 天(1.48 个月),趋势线口径 88 天(2.89 个月),中美交叉点 2027-11-09。来源:scaling01

按这把尺子,中国前沿落后美国前沿一个多月,而且照趋势线推下去,2027 年 11 月 9 日就会反超。

换成 ECI,同一批模型的结论反过来

Epoch 放出 Kimi K3 的初步跑分之后,拿这些跑分加上月之暗面公布的成绩,一共 9 项基准,就能直接拟合出它的 ECI:155.53,90% 区间在 153.87 到 158.21 之间。这个数是作者自己算的,不是 Epoch 官方发布的 ECI。位置卡在 GPT-5.3 Codex 和 GPT-5.4 Pro 之间,离前者更近。

按 ECI 拟合的中美前沿趋势
按 ECI 拟合的中美前沿趋势。右下角信息框:相邻模型区间 133 到 161 天(4.37 到 5.29 个月),局部插值 160 天(5.27 个月),趋势线口径 185 天(6.08 个月),中美交叉点一栏写的是 none。年进步速率美国 14.6、中国 11.0。来源:scaling01
同一件事,两个答案

AAI:落后 1.22 到 1.61 个月,趋势线 2.89 个月,2027 年 11 月 9 日反超。

ECI:落后 4.37 到 5.29 个月,趋势线 6.08 个月,交叉点一栏是 none。

后向差距差了三倍多,前一把尺子上中国跑得更快,后一把尺子上美国跑得更快。

拆到实验室这一层,排名几乎是翻过来的

只看国家前沿会盖掉单个实验室的节奏,所以两张图都做了分实验室的版本。把两边的年进步速率并排放,能看到这套评测方法的分歧有多大。

AAI 年进步速率 ECI 年进步速率 Moonshot 月之暗面 39.4 Alibaba 阿里 37.4 Z AI 智谱 36.2 DeepSeek 深度求索 33.9 Anthropic 29.7 OpenAI 29.0 Google 21.4 Anthropic 25.0 Z AI 智谱 16.2 OpenAI 14.3 Moonshot 月之暗面 13.8 DeepSeek 深度求索 8.5 Alibaba 阿里 8.3 Google 6.3 中国实验室 美国实验室 单位:每年增加的指数分数。两侧各自按本尺子的分数排位,纵向刻度不通用。
左边是 AAI 的年进步速率,四家中国实验室全部快过三家美国实验室。右边换成 ECI,Anthropic 以 25.0 断层第一,Moonshot 从榜首掉到 OpenAI 后面,连线在中间交叉成一片。数值取自两张分实验室趋势图右下角的信息框。

Moonshot 从左边的榜首掉到右边 OpenAI 的后面,Anthropic 从左边的第五位升到右边断层第一。七家里排名不变的只有 Google:21.4 和 6.3,两边都是最后一名。

按 AAI 的分实验室趋势,Moonshot 的斜率最陡,会在 2027 年 2 月 8 日穿过美国前沿线;原文正文的说法是超过 Anthropic。按 ECI 的分实验室趋势,Moonshot 的交叉点一栏同样写着 none;即便把 Mythos Preview 从 Anthropic 的数据里拿掉,它的进步速率仍是 18.1 分每年,最快。

两张分实验室趋势图,以及 Kimi K3 的 ECI 是怎么估出来的
按 AAI 拟合的分实验室趋势
AAI 分实验室趋势,右下角是七家的年进步速率与 Moonshot 的交叉点 2027-02-08。来源:scaling01
按 ECI 拟合的分实验室趋势
ECI 分实验室趋势,同一批实验室,速率排名与上图几乎相反。来源:scaling01

Epoch 的跑分出来之前,作者先做过一轮估算。社区投票认为 Kimi K3 的 ECI 会落在 158 到 159,他本人猜 156 到 157,分析者 Teortaxes 猜 157 到 158。

为了不靠直觉,他用 AAI 与 ECI 的高相关性来换算。直接套一条直线不行:AAI 被卡在 0 到 100 之间,越靠近两端分数越挤成一团,而 ECI 没有上限、是线性的。结果就是直线在很弱的 Claude 2 和 Claude 3 那头高估,在中间一段低估,到强模型那头又高估。

办法是先对 AAI 做 logit 变换,也就是 sigmoid 的逆运算,把被压扁的两端重新拉开,再去拟合。

logit 变换后的 AAI 与 ECI 拟合曲线
做过 logit 变换后的拟合,平均绝对误差比直接线性拟合降了 37.2%。来源:scaling01

换算给出的估计是 158.33,bootstrap 80% 区间 154.49 到 162.02。随后 Epoch 的跑分放出来,用 9 项基准直接拟合得到 155.53,落在这个区间内,但比换算值低一些。后续分析用的是 155.53 这个数,换算公式留着以后备用。

Mythos Preview 这一侧也得估。Anthropic 只给了自家刻度的 AECI,需要换算:Substack 专栏 Point Estimate 按 ECI 方法算出 161.5,Ramez Naam 用最小二乘算出 161,作者自己得到 161,90% 区间 158 到 166。这个数和 Claude Fable 5 的实际 ECI 160(区间 158 到 165)很接近,判断依据是 Fable 5 很可能是从 Mythos Preview 蒸馏出来的更小模型,还额外做了安全训练,两件事都会把分数往下压一点。

前向差距:追到今天的最强要多久

把问题换成前向的那一问,答案是这样:按国家趋势线,中国模型要到 2027 年 3 月 7 日才够得着 Mythos Preview 的 161 分,也就是约 11 个月。90% 置信带给出的区间是 2026 年 12 月 28 日到 2027 年 6 月 18 日,换成滞后时长是 8.72 到 14.38 个月。

8.57 个月
Moonshot 追到 Mythos Preview 水平的中位估计,日期 2026-12-23,90% 区间 7.05 到 10.57 个月
8.83 个月
Z AI 的同一个数,日期 2026-12-31,90% 区间 6.60 到 12.48 个月

最难的那些题上,差距更明显

Epoch 放出的初步结果里,有一项特别能说明问题。在 FrontierMath Tier 4 这套研究级难度的数学题上,Kimi K3 拿到约 39 分,还落在七个月前发布的 GPT-5.2 Pro(约 45 分)后面。同一张图上,Claude Fable 5 是 88 分。

FrontierMath Tier 4 各模型成绩随发布日期分布
FrontierMath Tier 4(v2),Epoch AI 内部跑分,40 个模型,最高分 88%。红框标出的绿点是 Kimi K3,约 39 分;上方紫点 Claude Fable 5(max)约 88 分。来源:Epoch AI
未计入的部分

这套算法还漏掉了五样东西

作者自己的判断是,上面两个差距数字都偏小,因为有几件影响很大的事根本没进公式,原因通常是这些数字没有公开。

一是模型大小。Kimi K3 是 2.8 万亿参数。Cursor 的 Michael Truell 说过,Opus 和 GPT 系列的体量和 Cursor 新发布的 1.5 万亿模型接近,指的多半是 Claude Opus 4.8 和 GPT-5.4;GPT-5.5 和 GPT-5.6 则被估计接近 3 万亿。也就是说,一个 2.8 万亿的模型在若干项上赢过 1.5 万亿量级的 Claude Opus 4.8,从架构角度说明不了太多。

二是推理效率。那 35 项基准里没有一项在量这件事,而按作者的判断,Kimi K3 的推理效率仍然差于美国模型。同样参数量级下多花 token 才拿到同样的分,这笔成本不进任何一张榜单。

三是真实服务成本和总算力。手里是一百万张最新的 Blackwell,还是一批吞吐更低的老 Hopper,决定了能同时开多少个实例、以多快的速度供给用户。真到了两国全力竞争的场景,这件事的分量不比模型分数小。

四是安全测试的时间。美国实验室的安全测试比中国实验室彻底得多,这部分工作可能再往差距上加一个月。

五是评测本身的代表性。多数基准不能代表真实工作里的任务,而且出于成本和时间限制,跑分时也没有把模型的最大性能榨出来。

不过差距被低估,不代表中国实验室没有真的在提速。它们确实变快了,快到反常。

还有一层:美国实验室手里压着没发的模型

Mythos 传闻是 10 万亿参数的模型。SpaceX AI、OpenAI 和 Meta 也都在做自己的 10 万亿级模型。作者的看法是,Kimi K3 这次看起来的追平,很可能是中国模型追上了上一代,而美国实验室已经走到下一代,只是因为网络和生化能力带来的法律不确定性,把最强的模型压着没发。

已确认
  • Kimi K3 参数量 2.8 万亿,开放权重
  • Michael Truell 关于 Cursor 1.5 万亿模型与 Opus、GPT 体量接近的说法
  • Epoch 已放出 Kimi K3 的 FrontierMath 等基准跑分(ECI 155.53 由作者据此拟合,非 Epoch 官方值)
  • Anthropic 在系统卡中采用 AECI 衡量模型强弱
推测或传闻
  • Mythos 为 10 万亿参数,属传闻
  • GPT-5.5、GPT-5.6 接近 3 万亿,属估计
  • Claude Fable 5.1 与 GPT-6 已训练完成但未发布
  • 安全测试可能再加一个月,属作者的量级判断
  • 所有 2027 年的交叉点日期,均为趋势线外推
如果 Anthropic 和 OpenAI 真把 Claude Fable 5.1 和 GPT-6 发出来,就不会有什么追平的讨论,因为这批 10 万亿参数的模型完全是另一种东西。Lisan al Gaib,scaling01
加速的来源

中国模型从去年八月起为什么突然快了

中国实验室的进步速度确实变快了,而且起点很具体。作者试着用指数对时间的导数去找这个拐点,也承认这不是个特别好的估计办法。

各实验室瞬时进步速率随时间变化
瞬时进步速率(AA 指数分/年)。两条竖线是超车时点:Moonshot 从 2025-08-06 起超过 Anthropic,GLM 从 2025-10-19 起超过。峰值上 Moonshot 约 39.8、Z AI 约 36.5,而 Anthropic 约 31、OpenAI 约 30.3。来源:scaling01

这件事本身是反常的:美国实验室有更多算力、数据、人才,还有更强的模型来加速自己的研发,进步速度反而更慢。作者先排查了一个技术性解释:会不会只是因为指数有上限,美国那头分数已经高、往上爬更难,所以显得慢?他把 logit 变换套上去,把这层压缩去掉,Moonshot 和 Z AI 的峰值速度依然更高。

蒸馏是其中一条,但不是全部

严格意义的蒸馏需要拿到模型本身,不过用一个更强的模型去给弱模型的输出打分,也已经算这一类。Anthropic 多次报告说,他们能把蒸馏攻击追溯到中国的实验室。所以这件事是真实存在的,只是外界不知道规模有多大、到底帮了多少忙。作者的表述是:中国模型获得的能力里,多多少少有一部分来自蒸馏。

除此之外还有几种解释,作者认为实际情况是它们的组合:

路径本身更容易
  • 追赶比开路容易,改进的方向是前沿现成给出的。
  • AAI 测的那些能力公开可见,也适合用强化学习一点点往上爬,天然成为刷分目标。
观测方式的问题
  • 只挑了增长最快的两家中国实验室,它们是冒险押对了的那批,有选择偏差。
  • 纳入的模型数量不多,可能只是一段运气好的观察窗口。

还有一个限定条件要跟上:这套追赶叙事只在 AAI 上成立,在 ECI 上并不成立。

一个反向证据:任务越难越长,差距越露出来

英国 AI 安全研究所的网络靶场是目前最难的一类评测,任务本身很硬,模型要烧掉 1 亿 token 才能被推到极限。Epoch 的 MirrorCode 走得更极端,单个模型用到 10 亿 token。

在这套 32 步的企业网络攻击模拟里,GLM-5.2 平均走到约 11 步,和 Claude Opus 4.5 一个水平。而 GPT-5.6 Sol 走到约 29 步,Anthropic 更新的 Claude Mythos 5 约 27 步。可是在自报的那些编码基准上,GLM-5.2 的成绩接近 Claude Opus 4.8。

UK AISI 网络靶场上各模型完成的步数轨迹
UK AISI 的「The Last Ones」网络靶场,32 步的企业网络攻击模拟,横轴是累计消耗的 token(对数刻度),每个模型跑 10 次、每次 1 亿 token。GLM-5.2(绿线)与 Opus 4.5 都停在约 11 步,DeepSeek-V4-Pro(蓝线)约 8 步。来源:UK AI Security Institute

同一个模型,在公开可见、容易针对性优化的编码榜上接近最新的 Claude Opus 4.8,在需要长链条推进的硬任务上退回到七八个月前的 Claude Opus 4.5,这个落差本身就是个信号。

文章最后留了一个观察:如果中国模型真的和美国前沿一样强,按理说也该解开一些此前没被解开的数学和物理问题。到目前为止,还没有看到。

来源
Have Chinese AI Models Caught Up to the US Frontier?Lisan al Gaib,发表于个人 Substack 专栏 scaling01·原文·2026-07-19
本站说明
分领域对照卡与七家实验室年进步速率连线图为本站绘制:前者的每一行结论均出自原文,后者的数据取自原文两张分实验室趋势图右下角的信息框,以及中美趋势图上的美国 14.6、中国 11.0。Kimi K3 的 ECI 155.53 是原文作者用 Epoch 与月之暗面公布的 9 项基准自行拟合的结果,不是 Epoch 官方发布值。后向与前向差距示意图中的 6.3 与 10.0 个月是原文用于解释概念的假想数字,非实测。