编程智能体排行榜

真实软件工程任务中的智能体表现、每任务 API 成本与执行时间

Coding Agent Index v1.5快照日期: 2026-09-14
排序
#智能体 / 模型指数每任务成本每任务耗时
1
Claude Code
62.2%最佳US$12.3934.8m
2
Devin Fusion CLI
61.7%US$7.9035.8m
3
Codex
61.6%US$7.4729.4m
4
Claude Code
59.7%US$10.7941.9m
5
Devin Fusion CLI
58.9%US$4.5424.7m
6
Codex
54.6%US$6.5820.6m
7
Muse Code
Muse Spark 1.3 (max)
54.3%US$3.9818.4m
8
Opencode
53.6%US$4.2448.1m
9
Kimi Code CLI
51.9%US$5.051h
10
Grok Build
47.0%US$3.5719.5m
11
Claude Code
43.3%US$3.491.1h
12
Codex
43.1%US$0.2440.3m
13
Antigravity SDK v0.1.12
41.9%US$2.4711.7m
14
Codex
38.7%US$0.0818.3m

指数如何构成

Artificial Analysis 让每个智能体在三个基准上各跑三遍取 pass@1:DeepSWE v1.1(113 个软件工程任务)、Terminal-Bench 4.0(66 个终端任务)与 SWE-Atlas-QnA(124 个技术问答)。综合指数为三项等权平均。成本按供应商 token 报价 × 实测 token 用量计算,不含订阅套餐。