编程智能体排行榜
真实软件工程任务中的智能体表现、每任务 API 成本与执行时间
Coding Agent Index v1.5快照日期: 2026-09-14
排序
| # | 智能体 / 模型 | 指数 | 每任务成本 | 每任务耗时 |
|---|---|---|---|---|
| 1 | Claude Code | 62.2%最佳 | US$12.39 | 34.8m |
| 2 | Devin Fusion CLI | 61.7% | US$7.90 | 35.8m |
| 3 | Codex | 61.6% | US$7.47 | 29.4m |
| 4 | Claude Code | 59.7% | US$10.79 | 41.9m |
| 5 | Devin Fusion CLI | 58.9% | US$4.54 | 24.7m |
| 6 | Codex | 54.6% | US$6.58 | 20.6m |
| 7 | Muse Code Muse Spark 1.3 (max) | 54.3% | US$3.98 | 18.4m |
| 8 | Opencode | 53.6% | US$4.24 | 48.1m |
| 9 | Kimi Code CLI | 51.9% | US$5.05 | 1h |
| 10 | Grok Build | 47.0% | US$3.57 | 19.5m |
| 11 | Claude Code | 43.3% | US$3.49 | 1.1h |
| 12 | Codex | 43.1% | US$0.24 | 40.3m |
| 13 | Antigravity SDK v0.1.12 | 41.9% | US$2.47 | 11.7m |
| 14 | Codex | 38.7% | US$0.08 | 18.3m |
指数如何构成
Artificial Analysis 让每个智能体在三个基准上各跑三遍取 pass@1:DeepSWE v1.1(113 个软件工程任务)、Terminal-Bench 4.0(66 个终端任务)与 SWE-Atlas-QnA(124 个技术问答)。综合指数为三项等权平均。成本按供应商 token 报价 × 实测 token 用量计算,不含订阅套餐。