Databricks 实测:在数百万行复杂代码库中,到底哪种模型和 Harness 框架性价比最高、用起来最顺手
- Databricks 把主流 AI 编程助手拉到自家几百万行代码上考了一遍,考题从工程师已经合并的 PR 改造而来,网上搜不到、模型没背过
- 最反直觉的一条:按 token 单价挑模型会挑错。Sonnet 5 每 token 比 Opus 4.8 便宜 1.7 倍,一道题做下来反而更贵($2.09 对 $1.94),分还低 6 个点
- 外壳比模型更影响花销。同一个模型同一个思考档位(thinking effort),换个外壳成本能差两倍以上,差别在每轮往模型嘴里塞多少上下文:Opus 走 claude code 每题累计 742k token,走 pi 只要 236k
- 开源模型进了第一梯队:GLM 5.2 质量和 Opus 4.8 打平(都是 87%),每题 $1.28 对 $1.94
- 思考档位不是越高越好:Opus 4.8 拉到 max 档,每题 $3.6 只拿 82 分,比 high 档的 $0.93、85 分又贵又差
这是 Databricks 官方发的一份内部实测总结,要回答的问题是:在一个几百万行的大型代码库里,哪种 AI 编程 Agent(模型 + 运行框架的组合)性价比最高、用起来最顺手。7 月 8 日发布,五位作者里包括他们的 CTO、Spark 的作者 Matei Zaharia。
先说说 Databricks 是谁
做数据和 AI 平台的公司,2013 年由 Apache Spark 的原班人马创立。Spark 是大数据处理领域用得最广的开源引擎之一,全世界的企业拿它跑数据管道和机器学习任务。这家公司现在给一万两千多家企业提供数据平台,2026 年 2 月完成 L 轮融资,估值 1340 亿美元,年化收入 54 亿美元。
作者分量。五位署名作者里有两位是 Databricks 的联合创始人:Matei Zaharia 是 Spark 的作者、现任 CTO,Patrick Wendell 同为联合创始人。
代码库够复杂。Scala、Go、Rust、Java、Python、TypeScript、Bazel、Protobuf 都在用,工程师每天合并上千次代码改动。这种复杂度是公开测试集模拟不出来的。
动机是省自己的钱。他们做这套测试是为了让自家工程团队用 AI 更划算,属于内部体检,做完把方法和数据一起公开了,不是对外的产品评测。
做法说起来不复杂:拿自家工程师平时写的真实代码改造成考题,跑一遍主流的模型和框架组合,看谁做得对、各花多少钱。得出的几条结论,和大部分人现在的选型习惯是反着的。
下面是六条结论,最后一节是可以照着做的部分。
模型分成了「三大梯队」,没必要凡事都用最贵的
他们没有盯着名次看,因为几个点的差距在真实任务里会被拉平。有用的是分组:所有模型和外壳的组合,清楚地落进三个能力档。
| 档位 | 通过率 | 里面有谁 |
|---|---|---|
| 第一档 | 82–90% | Opus 4.8、GLM 5.2、GPT 5.5 的高配组合 |
| 第二档 | 71–82% | Sonnet 5、Sonnet 4.6、GPT 5.5 中配、GPT 5.4 |
| 第三档 | 51–60% | GPT-5.4-mini、Haiku 4.5 |
日常小活不用顶配。改个开关、更新个配置这类操作,中低档模型完全够用,而且便宜得多。但他们过去的默认设置一直是最贵的那些。
分工比升级更划算。看完数据,他们决定把更多任务推给 Haiku 和 GPT 5.4 Mini 这一档,只有复杂的架构探索和深层排错才调最聪明的模型。