研究解读 · 小互解读

Databricks 实测:在数百万行复杂代码库中,到底哪种模型和 Harness 框架性价比最高、用起来最顺手

同一个模型换个外壳,成本差两倍;开源的 GLM 5.2 和 Opus 4.8 打平,每题便宜三成。考题是从自家已合并的 PR 改的,网上搜不到。
一分钟速览
  • Databricks 把主流 AI 编程助手拉到自家几百万行代码上考了一遍,考题从工程师已经合并的 PR 改造而来,网上搜不到、模型没背过
  • 最反直觉的一条:按 token 单价挑模型会挑错。Sonnet 5 每 token 比 Opus 4.8 便宜 1.7 倍,一道题做下来反而更贵($2.09 对 $1.94),分还低 6 个点
  • 外壳比模型更影响花销。同一个模型同一个思考档位(thinking effort),换个外壳成本能差两倍以上,差别在每轮往模型嘴里塞多少上下文:Opus 走 claude code 每题累计 742k token,走 pi 只要 236k
  • 开源模型进了第一梯队:GLM 5.2 质量和 Opus 4.8 打平(都是 87%),每题 $1.28 对 $1.94
  • 思考档位不是越高越好:Opus 4.8 拉到 max 档,每题 $3.6 只拿 82 分,比 high 档的 $0.93、85 分又贵又差
这是 Databricks 发在自家博客的内部测试报告,所有数据由他们自己采集、自己判卷。文中提到的 Omnigent 和 Unity AI Gateway 是他们自家产品,文末也预告了后续要讲自家的智能路由。数据按此阅读,正文不再逐处标注。

这是 Databricks 官方发的一份内部实测总结,要回答的问题是:在一个几百万行的大型代码库里,哪种 AI 编程 Agent(模型 + 运行框架的组合)性价比最高、用起来最顺手。7 月 8 日发布,五位作者里包括他们的 CTO、Spark 的作者 Matei Zaharia。

先说说 Databricks 是谁

做数据和 AI 平台的公司,2013 年由 Apache Spark 的原班人马创立。Spark 是大数据处理领域用得最广的开源引擎之一,全世界的企业拿它跑数据管道和机器学习任务。这家公司现在给一万两千多家企业提供数据平台,2026 年 2 月完成 L 轮融资,估值 1340 亿美元,年化收入 54 亿美元。

$1340 亿2026 年 2 月 L 轮融资后估值
$54 亿年化收入,同比增长超过 65%
12000+企业客户
几百万行自家代码库规模,横跨十几种语言

作者分量。五位署名作者里有两位是 Databricks 的联合创始人:Matei Zaharia 是 Spark 的作者、现任 CTO,Patrick Wendell 同为联合创始人。

代码库够复杂。Scala、Go、Rust、Java、Python、TypeScript、Bazel、Protobuf 都在用,工程师每天合并上千次代码改动。这种复杂度是公开测试集模拟不出来的。

动机是省自己的钱。他们做这套测试是为了让自家工程团队用 AI 更划算,属于内部体检,做完把方法和数据一起公开了,不是对外的产品评测。

做法说起来不复杂:拿自家工程师平时写的真实代码改造成考题,跑一遍主流的模型和框架组合,看谁做得对、各花多少钱。得出的几条结论,和大部分人现在的选型习惯是反着的。

每题成本与通过率的散点图,红色虚线是帕累托前沿
全部结果:横轴是每做完一道题花多少钱,纵轴是通过率。越靠左上越划算,右下角的点意味着又贵又差。红色虚线连起来的七个点是当前"花这么多钱能买到的最好结果"。图片来源:Databricks

下面是六条结论,最后一节是可以照着做的部分。

1核心干货

模型分成了「三大梯队」,没必要凡事都用最贵的

他们没有盯着名次看,因为几个点的差距在真实任务里会被拉平。有用的是分组:所有模型和外壳的组合,清楚地落进三个能力档。

档位通过率里面有谁
第一档82–90%Opus 4.8、GLM 5.2、GPT 5.5 的高配组合
第二档71–82%Sonnet 5、Sonnet 4.6、GPT 5.5 中配、GPT 5.4
第三档51–60%GPT-5.4-mini、Haiku 4.5

日常小活不用顶配。改个开关、更新个配置这类操作,中低档模型完全够用,而且便宜得多。但他们过去的默认设置一直是最贵的那些。

分工比升级更划算。看完数据,他们决定把更多任务推给 Haiku 和 GPT 5.4 Mini 这一档,只有复杂的架构探索和深层排错才调最聪明的模型。

模型按通过率聚成三个能力档