中国 AI 模型追上美国前沿了吗?中美 AI 差距到底如何?
- 中国 AI 模型追上美国前沿了吗?按 Epoch 的能力指数 ECI 算,答案是还没有:Kimi K3 仍落后 4.37 到 5.29 个月,趋势线上找不到反超点。
- 可「追平了」的说法也有依据:月之暗面自评的 35 项里 30 项赢 Claude Opus 4.8,前端代码竞技场排第一,GPU 内核优化和 Claude Fable 5 并列前沿。
- 但这些成绩取决于选了哪些题:自报的 35 项里 24 项是视觉和 agentic 类,没有长上下文、没有正经数学、没有安全类,也没有一项在量推理的 token 效率。
- Artificial Analysis Index 有同样的偏:Agents 占 34% 加 Coding 占 24%,58% 的权重压在 Agent 和短任务编码上,而且完全不管每项评测有多难。
- Epoch AI 的 ECI 换了个思路,借考试测评那套办法,把每项基准的难度和区分度估出来,再反推模型的能力值放到同一把尺子上,Anthropic 在自家系统卡里也用同一套方法。
- 两把尺子给出相反的答案:AAI 上中国落后 1.22 到 1.61 个月、2027 年 11 月反超;ECI 上落后 4.37 到 5.29 个月、按趋势线不存在反超。连七家实验室谁跑得快的排名都几乎是反的。
答案是还没有,但榜单让很多人以为已经追上了
答案是还没有。
所以这篇分析真正在处理的问题是:为什么会有两个答案,以及该信哪一个。要看懂这一点,得先看看「追平论」的事实基础有多硬,它比一般的立场之争硬得多。
先看 Kimi K3 的成绩单
Kimi K3 是目前最大的开放权重模型,参数量接近 DeepSeek V4 的两倍,也超过了当年引爆这轮 AI 热潮的初代 GPT-4(1.8 万亿)。在月之暗面自己公布的 35 项基准上,它有 30 项赢过 Claude Opus 4.8,19 项赢过 GPT-5.6 Sol,12 项赢过 Claude Fable 5。
第三方评测也给了它位置。在 Artificial Analysis 的排行榜上,Kimi K3 拿到 57.1 分,排在 Claude Fable 5 和 GPT-5.6 Sol 之后位列第三,比 GLM-5.2、Kimi K2.6、Qwen3.7-Max、DeepSeek-V4-Pro 这批此前的中国旗舰有明显跳升。
在专门比拼网页前端效果的 Frontend Code Arena 上,Kimi K3 拿了 1679 分排第一,领先第二名 Claude Fable 5 四十八分,是整张榜上最大的一档差距。
还有一个不太上头条、但对做 AI 的人很实际的领域:GPU 内核优化。模型跑得快不快,取决于硬件被榨得有多干净,每浪费一个时钟周期就是更少的吞吐和更高的延迟,最后都变成钱。这件事不光在生产环境要紧,做研究时也要紧,每个新架构想法都得跑一批实验去验证,直接用 PyTorch 跑不满硬件,得靠手写内核提速。
把这些摆在一起,「中国已经追上美国前沿」看起来像个已经结案的判断。那开头那个「还没有」是怎么来的?分歧的第一层,藏在「能力」这两个字里。
把能力拆开看,真正追平的只有一类
「追上了」这三个字之所以能同时被证实和证伪,是因为能力本来就是分领域的。一个模型可以在写代码上追平对手,同时在别的领域差着好几代。把这篇分析里出现过的领域逐个摆出来,落差立刻显形。
写代码这一项恰恰是最容易被看见的:它有最多的公开榜单,也是所有人天天在用的能力。而下面几项要么需要专门的评测机构去跑,要么根本没被列进自评清单。舆论场上的「追平了」,基本是从第一行长出来的。
可写代码这一项,偏偏是最要命的那一项
目前测得最扎实的一条趋势就在软件工程上:AI 能独立完成的任务长度,大约每 4 个月翻一倍。作者也提到,这条趋势很可能在数学等其他领域同样成立,只是软件工程这边的测量最充分。这里的「任务长度」有个专门的说法,叫时间跨度。
一件事人类要花多长时间做完,而模型有一半概率能做成,这个时长就是模型的时间跨度。用它当难度标尺,比数代码行数靠谱得多,而且能直接换算成经济价值:能顶下一个人一天的活,和能顶下一个人三个月的活,是完全不同的两件事。
照这条趋势再往前推两三年,就是「一个人要干几个月到几年的活,模型能接下来」。就算这条趋势只在写代码这一件事上成立,谁先握住超人类水平的程序员模型,谁就握住了一个很难被追平的战略位置。这就是为什么值得花力气去算清楚那几个月的差距。
比较只在中美之间做,因为最好的模型、最多的 AI 研究和最多的算力都集中在这两边。欧洲理论上有钱也有人,但到目前为止没有表现出认真下场竞争的意思。
于是问题变成了:分领域看落差这么明显,为什么一到榜单上就成了「整体追平」?往下拆两层就清楚了。第一层是「差距」这个词本身,它其实同时在说两件事,而大多数人只用了其中一件。
「差距」这个词同时在说两件事
差距的定义只有一句话:一家实验室要花多久才能做出另一家已经做出的能力。但这句话里藏着两个方向完全不同的问题。
- 问的是:落后的这一方今天的水平,相当于领先方多久以前?
- 看历史就能算,数据都已经发生了。
- 平时说的「差几个月」基本都是这个。
- 问的是:落后的这一方还要多久,才能摸到领先方今天的水平?
- 得先预测未来,取决于对算力、人才、AI 自己带来的提速等一堆变量的假设。
- 不确定性大得多。
还有一层容易被跳过:能力是分领域的。一个模型可以在写代码上追平另一个,同时在别的领域、或者综合起来仍然更差。所以「追平了」这三个字,必须问清楚是哪一项追平了。
模型是一批一批发的,中间没有连续曲线
真要动手算,会撞上一个现实问题:进步是离散的。模型每隔几周到几个月才发一次,两个模型的分数也不会正好相等,没法直接量中间隔了多长时间。三种办法各有取舍。
作者选了第三种,理由是它对称,更能反映底下那条大趋势,而且能看出差距在扩大还是在缩小。代价也说清楚了:结果取决于回归模型怎么选,而且会把趋势的断点抹平。这一点对 Kimi K3 是不利的,如果它真的是一次断点,回归线会把它按回去。
不过过去五年左右,能算得上趋势断点的只有一两次:2024 年第三季度的推理模型,以及 2025 年 11 月 Claude Opus 4.5 发布后 agentic 模型开始起量,可能算第二次。这两次都和模型大小无关,所以一个体量不到 DeepSeek-V4-Pro 两倍的模型,仅凭尺寸就打断趋势,说不太通。
因此后面每个结论都会给两组数:相邻模型区间(当下的瞬时差距,图里还会给一个区间内插值),以及趋势线估计(拉长时间看的长期水平)。方法定好了,接下来是分歧的第二层,也是最要命的一层:你拿哪些题去量。
榜单上的题目怎么选,直接决定了结论
「35 项里赢了 30 项」这句话的分量,完全取决于那 35 项是怎么挑出来的。把构成拆开看,缺席的题型比在场的更能说明问题。
- 视觉类 12 项
- agentic 类 12 项
- 编码类 8 项
- 「推理」与知识类 3 项
- 长上下文,一项都没有
- 网络、生物、化学等安全相关,一项都没有
- 正经的数学,只有 MathVision、GPQA-D 和 HLE
- 纯推理,那 3 项挂在「推理」名下的其实是知识题带一点数学
- 推理的 token 效率,一项都没有
视觉和 agentic 两类加起来 24 项,占了这份榜单的近七成。编码类里倒是有几项作者认为信号质量高的,比如 ProgramBench 和 SWE-Marathon,它们的任务范围更大、时间跨度更长。
能成立的说法只有一句:Kimi K3 的编码能力和当前美国前沿模型可比。
推不出「Kimi K3 整体强过 Claude Opus 4.8 和 GPT-5.6 Sol」。对 Claude Fable 5 更谈不上,35 项里它输掉了大多数。
第三方榜单也有同样的偏
那换成第三方的 Artificial Analysis Index 呢?它今天是最流行的指数之一,但作者认为它不该被用来判断模型的综合强弱,理由有两条。
第一条是权重。指数的构成明显偏向 Agent 和短时间跨度的编码题。
第二条是难度。每项评测有多难、跑出成绩能提供多少信息量,这个指数完全不计。所有评测按人工设定的权重加权平均,一项随手能过的评测和一项几乎没有模型能做对的评测,进指数的分量是一样的。
这不等于说它没用。它的排名和日常使用体感对得上,因为它测的是经济上真正有用的活。作者的处理办法是给它换个定位:把它当成日常好用程度的指标,而不是综合智能的指标。所以在他的文章里,这个指数被叫作 Artificial Analysis Index,官方名字里的 Intelligence 那个词被拿掉了。那有没有一把尺子,能不靠人工挑权重、还能把题目难度算进去?有,而且 Anthropic 自己也在用。
ECI 怎么把题目难度也算进分数里
Epoch AI 的 Capability Index(简称 ECI)针对的就是上面那两个毛病。它想测的是模型底下那个综合能力值,并且把所有模型放到同一把尺子上。用的办法叫 Item Response Theory,中文常译作项目反应理论。
两个人都考了 60 分,一个考的是小学卷子,一个考的是奥数卷子,说明的水平天差地别。要把他们放到一起比,就得先知道每张卷子有多难。项目反应理论干的就是这件事:答对一道题的概率,同时取决于考生有多强和这道题有多难,那就把两边一起估出来。
具体到评测上,每一项基准要估两个参数:
- 要在这项基准上拿到 50 分,需要多强的能力。
- 这项基准的分数对能力变化有多敏感,也就是它能不能把水平接近的模型区分开。
估完这些参数,再拟合一个统一的统计模型,去找那个最能解释全部观测分数的能力值。这个能力值就是模型的 ECI。
一是减少了对人工挑选权重的依赖;二是不要求所有模型都跑过所有基准,缺项也能算;三是把每项基准的难度和区分能力都算了进去。
Anthropic 最近也采用了同一套办法来衡量模型强弱,在自家的系统卡里叫 AECI。他们那张图顺带把不同基准的难度画了出来。
拿其中一格验算一遍,就能看出这套方法在干什么。GPQA Diamond 的 50 分刻度落在 129 附近,意思是能力值约 129 的模型,在这项基准上大概能考 50 分。Claude 3 Opus 的 AECI 约 126,比 129 低一点,按这个模型该预测它略低于 50 分。实测是 50.4 分,比预期高了一点点。
能力值落在一把共享的尺子上,而且比人工挑选加权的指数更少偏见,这就是 ECI 的用处。两把尺子都齐了,现在把同一批模型分别放上去量一遍。
两把尺子量同一批模型,差距差了三倍多
同一批模型、同一段时间,换一把尺子,中美差距的数字和方向都变了。
先看 AAI 这把尺子
Kimi K3 在这个指数上拿 57.1 分。因为指数被卡在 0 到 100 之间,作者用 sigmoid 曲线拟合两国的前沿趋势。
按这把尺子,中国前沿落后美国前沿一个多月,而且照趋势线推下去,2027 年 11 月 9 日就会反超。
换成 ECI,同一批模型的结论反过来
Epoch 放出 Kimi K3 的初步跑分之后,拿这些跑分加上月之暗面公布的成绩,一共 9 项基准,就能直接拟合出它的 ECI:155.53,90% 区间在 153.87 到 158.21 之间。这个数是作者自己算的,不是 Epoch 官方发布的 ECI。位置卡在 GPT-5.3 Codex 和 GPT-5.4 Pro 之间,离前者更近。
AAI:落后 1.22 到 1.61 个月,趋势线 2.89 个月,2027 年 11 月 9 日反超。
ECI:落后 4.37 到 5.29 个月,趋势线 6.08 个月,交叉点一栏是 none。
后向差距差了三倍多,前一把尺子上中国跑得更快,后一把尺子上美国跑得更快。
拆到实验室这一层,排名几乎是翻过来的
只看国家前沿会盖掉单个实验室的节奏,所以两张图都做了分实验室的版本。把两边的年进步速率并排放,能看到这套评测方法的分歧有多大。
Moonshot 从左边的榜首掉到右边 OpenAI 的后面,Anthropic 从左边的第五位升到右边断层第一。七家里排名不变的只有 Google:21.4 和 6.3,两边都是最后一名。
按 AAI 的分实验室趋势,Moonshot 的斜率最陡,会在 2027 年 2 月 8 日穿过美国前沿线;原文正文的说法是超过 Anthropic。按 ECI 的分实验室趋势,Moonshot 的交叉点一栏同样写着 none;即便把 Mythos Preview 从 Anthropic 的数据里拿掉,它的进步速率仍是 18.1 分每年,最快。
两张分实验室趋势图,以及 Kimi K3 的 ECI 是怎么估出来的
Epoch 的跑分出来之前,作者先做过一轮估算。社区投票认为 Kimi K3 的 ECI 会落在 158 到 159,他本人猜 156 到 157,分析者 Teortaxes 猜 157 到 158。
为了不靠直觉,他用 AAI 与 ECI 的高相关性来换算。直接套一条直线不行:AAI 被卡在 0 到 100 之间,越靠近两端分数越挤成一团,而 ECI 没有上限、是线性的。结果就是直线在很弱的 Claude 2 和 Claude 3 那头高估,在中间一段低估,到强模型那头又高估。
办法是先对 AAI 做 logit 变换,也就是 sigmoid 的逆运算,把被压扁的两端重新拉开,再去拟合。
换算给出的估计是 158.33,bootstrap 80% 区间 154.49 到 162.02。随后 Epoch 的跑分放出来,用 9 项基准直接拟合得到 155.53,落在这个区间内,但比换算值低一些。后续分析用的是 155.53 这个数,换算公式留着以后备用。
Mythos Preview 这一侧也得估。Anthropic 只给了自家刻度的 AECI,需要换算:Substack 专栏 Point Estimate 按 ECI 方法算出 161.5,Ramez Naam 用最小二乘算出 161,作者自己得到 161,90% 区间 158 到 166。这个数和 Claude Fable 5 的实际 ECI 160(区间 158 到 165)很接近,判断依据是 Fable 5 很可能是从 Mythos Preview 蒸馏出来的更小模型,还额外做了安全训练,两件事都会把分数往下压一点。
前向差距:追到今天的最强要多久
把问题换成前向的那一问,答案是这样:按国家趋势线,中国模型要到 2027 年 3 月 7 日才够得着 Mythos Preview 的 161 分,也就是约 11 个月。90% 置信带给出的区间是 2026 年 12 月 28 日到 2027 年 6 月 18 日,换成滞后时长是 8.72 到 14.38 个月。
最难的那些题上,差距更明显
Epoch 放出的初步结果里,有一项特别能说明问题。在 FrontierMath Tier 4 这套研究级难度的数学题上,Kimi K3 拿到约 39 分,还落在七个月前发布的 GPT-5.2 Pro(约 45 分)后面。同一张图上,Claude Fable 5 是 88 分。
这套算法还漏掉了五样东西
作者自己的判断是,上面两个差距数字都偏小,因为有几件影响很大的事根本没进公式,原因通常是这些数字没有公开。
一是模型大小。Kimi K3 是 2.8 万亿参数。Cursor 的 Michael Truell 说过,Opus 和 GPT 系列的体量和 Cursor 新发布的 1.5 万亿模型接近,指的多半是 Claude Opus 4.8 和 GPT-5.4;GPT-5.5 和 GPT-5.6 则被估计接近 3 万亿。也就是说,一个 2.8 万亿的模型在若干项上赢过 1.5 万亿量级的 Claude Opus 4.8,从架构角度说明不了太多。
二是推理效率。那 35 项基准里没有一项在量这件事,而按作者的判断,Kimi K3 的推理效率仍然差于美国模型。同样参数量级下多花 token 才拿到同样的分,这笔成本不进任何一张榜单。
三是真实服务成本和总算力。手里是一百万张最新的 Blackwell,还是一批吞吐更低的老 Hopper,决定了能同时开多少个实例、以多快的速度供给用户。真到了两国全力竞争的场景,这件事的分量不比模型分数小。
四是安全测试的时间。美国实验室的安全测试比中国实验室彻底得多,这部分工作可能再往差距上加一个月。
五是评测本身的代表性。多数基准不能代表真实工作里的任务,而且出于成本和时间限制,跑分时也没有把模型的最大性能榨出来。
不过差距被低估,不代表中国实验室没有真的在提速。它们确实变快了,快到反常。
还有一层:美国实验室手里压着没发的模型
Mythos 传闻是 10 万亿参数的模型。SpaceX AI、OpenAI 和 Meta 也都在做自己的 10 万亿级模型。作者的看法是,Kimi K3 这次看起来的追平,很可能是中国模型追上了上一代,而美国实验室已经走到下一代,只是因为网络和生化能力带来的法律不确定性,把最强的模型压着没发。
- Kimi K3 参数量 2.8 万亿,开放权重
- Michael Truell 关于 Cursor 1.5 万亿模型与 Opus、GPT 体量接近的说法
- Epoch 已放出 Kimi K3 的 FrontierMath 等基准跑分(ECI 155.53 由作者据此拟合,非 Epoch 官方值)
- Anthropic 在系统卡中采用 AECI 衡量模型强弱
- Mythos 为 10 万亿参数,属传闻
- GPT-5.5、GPT-5.6 接近 3 万亿,属估计
- Claude Fable 5.1 与 GPT-6 已训练完成但未发布
- 安全测试可能再加一个月,属作者的量级判断
- 所有 2027 年的交叉点日期,均为趋势线外推
如果 Anthropic 和 OpenAI 真把 Claude Fable 5.1 和 GPT-6 发出来,就不会有什么追平的讨论,因为这批 10 万亿参数的模型完全是另一种东西。Lisan al Gaib,scaling01
中国模型从去年八月起为什么突然快了
中国实验室的进步速度确实变快了,而且起点很具体。作者试着用指数对时间的导数去找这个拐点,也承认这不是个特别好的估计办法。
这件事本身是反常的:美国实验室有更多算力、数据、人才,还有更强的模型来加速自己的研发,进步速度反而更慢。作者先排查了一个技术性解释:会不会只是因为指数有上限,美国那头分数已经高、往上爬更难,所以显得慢?他把 logit 变换套上去,把这层压缩去掉,Moonshot 和 Z AI 的峰值速度依然更高。
蒸馏是其中一条,但不是全部
严格意义的蒸馏需要拿到模型本身,不过用一个更强的模型去给弱模型的输出打分,也已经算这一类。Anthropic 多次报告说,他们能把蒸馏攻击追溯到中国的实验室。所以这件事是真实存在的,只是外界不知道规模有多大、到底帮了多少忙。作者的表述是:中国模型获得的能力里,多多少少有一部分来自蒸馏。
除此之外还有几种解释,作者认为实际情况是它们的组合:
- 追赶比开路容易,改进的方向是前沿现成给出的。
- AAI 测的那些能力公开可见,也适合用强化学习一点点往上爬,天然成为刷分目标。
- 只挑了增长最快的两家中国实验室,它们是冒险押对了的那批,有选择偏差。
- 纳入的模型数量不多,可能只是一段运气好的观察窗口。
还有一个限定条件要跟上:这套追赶叙事只在 AAI 上成立,在 ECI 上并不成立。
一个反向证据:任务越难越长,差距越露出来
英国 AI 安全研究所的网络靶场是目前最难的一类评测,任务本身很硬,模型要烧掉 1 亿 token 才能被推到极限。Epoch 的 MirrorCode 走得更极端,单个模型用到 10 亿 token。
在这套 32 步的企业网络攻击模拟里,GLM-5.2 平均走到约 11 步,和 Claude Opus 4.5 一个水平。而 GPT-5.6 Sol 走到约 29 步,Anthropic 更新的 Claude Mythos 5 约 27 步。可是在自报的那些编码基准上,GLM-5.2 的成绩接近 Claude Opus 4.8。
同一个模型,在公开可见、容易针对性优化的编码榜上接近最新的 Claude Opus 4.8,在需要长链条推进的硬任务上退回到七八个月前的 Claude Opus 4.5,这个落差本身就是个信号。
文章最后留了一个观察:如果中国模型真的和美国前沿一样强,按理说也该解开一些此前没被解开的数学和物理问题。到目前为止,还没有看到。
同一批模型,换一把尺子量 → 中美 AI 差距从 1 个多月变成 5 个月
独立分析者 Lisan al Gaib 把「中国追上了吗」拆成一道能算的题,一页带图讲完两把尺子为什么给出相反答案。
↓ 一页读完 · 有一张会动的图
7 月 16 日月之暗面发布 2.8 万亿参数的 Kimi K3,「中国追平美国」的说法四起。它的成绩单确实硬:自评的 35 项里 30 项赢过 Claude Opus 4.8,前端代码竞技场 1679 分排第一。但这句话到底能撑住多少,取决于那 35 项是怎么挑出来的。
✘ 这批成绩证明不了的:它整体到底落后多久。
因为选了哪些题,就决定了结论。35 项里 24 项是看图和跑任务这两类,占了近七成;长上下文一项没有,网络与生化等安全类一项没有,正经数学几乎没有,答一道题要烧多少字(token 效率,也就是花多少算力)同样一项没有。缺席的比在场的更说明问题。
把同一批模型、同一段时间,分别放进两套评测体系里量,出来的不只是数字不同,方向也反了。
Agents 34% + Coding 24% = 58%
每项有多难 → 不计
结论:落后 1.22–1.61 个月
2027-11-09 反超
每项估「难度 + 区分度」
再反推模型能力值
结论:落后 4.37–5.29 个月
交叉点:none
连谁在加速都反过来:AAI 上四家中国实验室的年进步速率全部快过三家美国实验室,月之暗面 39.4 全场第一;换成 ECI,Anthropic 以 25.0 断层第一,月之暗面掉到 13.8,排在 OpenAI 的 14.3 后面。
办法借自考试测评,叫项目反应理论(Item Response Theory)。一句话:两个人都考 60 分,一个考小学卷子一个考奥数卷子,说明的水平天差地别;要比,就得先知道每张卷子有多难。
「差三倍」听着抽象,换成天数就有体感了。同一个问题,中国前沿今天的水平,相当于美国前沿多少天以前,两把尺子给出的答案是这样:
赢 Claude Opus 4.8
的项数
- × 长上下文
- × 正经数学
- × 安全类
- × 答一题烧多少字
需要能力 129
最难一档
「差三倍多」的来处