MModelspectraIndependent AI Model Intelligence
Capability Deep-dive · 2026.09.03
Capability Deep-dive · 能力专题

Agent × 大模型:2026 全球主流
「框架 + 模型」组合能力评测与选型指南

2026 年选型的正确单位不再是"哪个模型最强",而是"哪个 Agent 框架 × 哪个模型"的组合最能打。本报告综合 LMArena、Artificial Analysis、SWE-bench、Terminal-Bench、Vals AI、GAIA/HAL、τ-Bench、OpenRouter 等 15 个权威评测源与流量数据,经独立加权计算,对 15 个主流组合进行五维评测,并按人群、行业与专业领域给出分层选型建议。

数据截止2026.09.03
评测对象15 个「Agent 框架 × 模型」组合
数据源15 个权威评测源交叉验证
阅读时长25 min read
01

执行摘要 Executive Summary

30 秒版本:本报告回答"2026 年 9 月,谁该用哪个 Agent + 模型组合",全部结论可追溯至公开基准数据。

综合排名第一
86.0
Claude Code + Claude Opus 5
五维加权总分(0–100)
最大黑马
84.3
Claude Code + GLM-5.3(兼容路由)
性价比组合,总分第二
厂商自报 vs 独立复测
最大差 33 分
Terminal-Bench 2.1 同一模型
两种口径的分差(DeepSeek V4 Pro)

三条关键发现

  • ① 组合,而非模型,才是选型单位。同一模型换脚手架,Terminal-Bench 分差可达 5–30 个百分点,超过一次模型代际升级的收益。Terminal-Bench 2.0 官方榜前 12 名全部以「harness × model」形式提交,榜首是专用 harness(NexAU-AHE × GPT-5.5,84.7%),不是任何裸模型。
  • ② Anthropic 协议成为事实标准,"Claude Code 挂国产脑"是本周期最大结构性变化。GLM、Kimi、Qwen 全部提供 Anthropic 兼容端点,两个环境变量即可让 Claude Code 直连 GLM-5.3。加权口径下,Claude Code + GLM-5.3 以 84.3 分位列第二,成本只有官方 Opus 5 组合的约 1/4。
  • ③ 开源已进入前沿带,但"顶点"仍由闭源把守。Kimi K3 成为首个登顶 LMArena 编码类榜单(Frontend Code,1679 Elo)的开源模型,AA 智能指数 59.70 距离闭源第一梯队不足 4 分;但在 SWE-bench Pro、GAIA 等硬基准上,Claude / GPT-5.6 仍保持 5–15 分领先。

一句话选型结论

追求质量上限选 Claude Code + Opus 5 / Fable 5;追求性价比选 Claude Code + GLM-5.3 或 Codex + DeepSeek V4 Pro;高并发低预算选 Codex + GPT-5.6 Luna 或 Gemini 3.7 Flash;需要自部署与数据主权选 OpenHands + GLM-5.2(MIT);受监管行业在国内选 Qwen / DeepSeek / GLM / Kimi 的官方合规通道。没有"最好"的组合,只有与你的预算、合规约束、任务形态匹配的组合——第 08 节给出完整决策矩阵。

02

背景与问题定义 Background

为什么 2026 年的选型问题必须重新表述。

从"最强模型"到"最强组合"

2024–2025 年的模型评测默认一个隐含假设:能力住在模型里,买最好的模型就够了。2026 年的数据推翻了这个假设。Princeton HAL 榜单上,Anthropic 包揽前六的真正原因是 HAL Generalist Agent 脚手架——同一道 GAIA 题目,裸模型约 44.8%、HAL 脚手架 74.6%、自由工程化系统 92%+,三种口径相差 30 个百分点以上。Terminal-Bench 2.0 官方榜上,中立参考脚手架 Terminus 2 × Claude Opus 4.7 只拿到 69.4%,而专用 harness 上的同一代模型普遍在 80% 以上。LangChain 团队曾仅调整提示词与工具配置,就把一个 Top 30 的提交拉升到 Top 5。

与此同时,模型层的"可替换性"也在快速上升。Anthropic API 协议成为事实标准后,GLM、Kimi、Qwen 均提供兼容端点,Claude Code 这类官方绑定 CLI 实际上成了"通用框架壳"。评测网站已经先于采购决策完成了转向:Terminal-Bench、SWE-bench、SWE-Marathon、OSWorld 的榜单条目,都是「agent harness × model」的组合形式。

2026.09 格局速览

  • 闭源前沿:Anthropic 以 Fable 5 / Opus 5 占据 AA 智能指数前 7 席;OpenAI GPT-5.6 家族(Sol / Terra / Luna 三档定价)于 7 月全面转正;Google Gemini 3.1 Pro 守住长上下文与科学推理,3.7 Flash 以 $0.75/$3.75 成为性价比标杆;xAI Grok 4.6 以 $2/$6 低价进入第一梯队,但缺少成熟的官方 Agent 框架。
  • 开放权重:Kimi K3(登顶 LMArena 编码榜)、GLM-5.3(AA 59.51,但权重未开放)、DeepSeek V4(SWE-bench Verified 独立测 96.4%,开源最高)、Qwen 3.8(OSWorld-Verified 86.1%,计算机操作第一)构成国产四强。
  • 流量结构:OpenRouter 8 月周榜 token 量前 10 被低价 MoE 模型主导(DeepSeek V4 Flash 12.3T、GLM 5.3 Flash 6.2T)——agent 流量"用便宜的,夸贵的",口碑榜(Stack Overflow 2026 最爱工具 46%)仍被 Claude Code 垄断。

本报告回答的问题

  • 全球主流「Agent 框架 × 模型」组合的综合能力排名如何?(第 06 节)
  • 不同权重偏好(质量优先 / 成本优先)下,排名如何变化?(第 06 节敏感性分析)
  • 不同人群、企业规模、行业与专业背景,应该怎么选?(第 08 节)
  • 哪些数据口径的风险需要提前对冲?(第 09 节)
03

数据与方法 Data & Method

本报告不直接搬运任何单一榜单,而是对多源数据做归一化与加权综合。所有口径与局限在此声明。

数据源清单与分级

层级数据源用途口径类型访问日期
核心Artificial Analysis Intelligence Index v4.1.1通用智能综合分(GDPval-AA、τ³-Banking、Terminal-Bench v2.1、SciCode、HLE、GPQA Diamond 等 9 项)独立第三方2026.09.02
核心SWE-bench Verified / Pro(swebench.com + Scale SEAL)软件工程能力(官方统一脚手架榜 + 厂商口径 + Vals 独立口径交叉)独立 + 自报2026.09.03
核心Terminal-Bench 2.x(tbench.ai + Vals AI)Agentic 长程终端任务(官方验证榜按组合列条目)独立 + 自报2026.09.03
核心Vals AI(vals.ai)同 harness 独立复测,校准厂商自报口径的关键参照独立第三方2026.08.19
核心Princeton HAL / GAIA、τ²/τ³-Bench(Sierra)、BFCL V4(UC Berkeley)通用助理、工具调用与政策遵从、函数调用独立学术2026.05–08
辅助LMArena(Text / WebDev / Coding 分榜)人类盲测偏好(Elo)众包独立2026.09.02
辅助OSWorld-Verified、SWE-Marathon、DeepSWE v1.1、MCPMark计算机操作、超长程工程、MCP 工具独立 + 自报2026.07–08
辅助OpenRouter 路由流量、Stack Overflow 2026 / JetBrains 开发者调查真实使用份额与口碑行业数据2026.08–09
辅助各厂商官方定价页与模型卡价格、上下文、速度厂商自报2026.09.03

归一化与加权方法

  • 归一化:各基准原始分按「同类口径内的当前最佳表现 = 100」线性映射到 0–100 分。同一基准存在厂商自报与独立复测两种口径时,优先采用独立口径(Vals AI、AA、官方统一脚手架榜),自报口径仅作区间参考并标注。
  • 两级权重:维度层——通用智能 25% / Agentic 能力 25% / 编码能力 20% / 成本性价比 15% / 生态与工程化 15%(均衡方案,与报告主题的 Agent 属性对齐,又不让单项主导)。数据源层——独立第三方 70%、官方验证榜 20%、厂商自报 10%。
  • 组合口径:组合的模型侧维度(智能、编码、成本)以模型数据计;Agentic 与生态维度按「模型 × 框架」交互效应计分(如同一模型在 Claude Code 与原生 CLI 上分数不同)。
  • 成本口径:按「单任务成本」评估——40K 输入 + 8K 输出 tokens(典型 agent 任务:仓库上下文 + 计划 + diff),计入缓存折扣与订阅方案,而非只看单价。
方法提示:差距小于 3 分的组合,在本报告口径下视为「无显著差异」,不应作为决策依据;此时应回到第 08 节按场景决策。所有估算值(个别新模型缺少独立综合分时以相邻代际数据推算)均在表中以 † 标注。
04

评测对象与维度 Subjects & Dimensions

15 个组合、六个家族、五个维度。入选标准:评测数据可交叉验证 + 有可观测的真实采用度。

六个家族、15 个组合

家族组合定位
A · Claude Code 系
(官方绑定)
Claude Code + Claude Opus 5质量上限组合,$5/$25
Claude Code + Claude Fable 5能力天花板,$10/$50,按需升级用
Claude Code + Claude Sonnet 5日常主力,$2/$10,口碑与成本平衡
B · Codex 系
(OpenAI)
Codex CLI + GPT-5.6 SolOpenAI 旗舰,DevOps/CI 强项,$4/$20(促销)
Codex CLI + GPT-5.6 Luna超低价高频档,$0.20/$1.20
C · Gemini 系Gemini CLI + Gemini 3.1 Pro1M 上下文 + Search grounding,企业 Code Assist 通道
Gemini CLI + Gemini 3.7 Flash高吞吐性价比,$0.75/$3.75(入门价)
D · 开源开放权重
(原生框架)
Kimi CLI / Kimi For Coding + Kimi K3开源能力天花板,1M 上下文,100 并行子 Agent
Qwen Code + Qwen 3.8 Max计算机操作第一(OSWorld-V 86.1%),国内合规直连
OpenHands + GLM-5.2(自部署)MIT 权重 + MIT 框架,数据主权完全可控
E · 跨协议兼容路由
("换脑"组合)
Claude Code + GLM-5.3本周期讨论度最高的性价比组合(Anthropic 兼容端点)
Claude Code + Kimi K3开源旗舰挂成熟 harness
Codex CLI + DeepSeek V4 ProOpenAI 协议兼容,SWE-V 独立测 96.4%
(对照)Codex CLI + GPT-5.6 Terra中档对照,$2/$12
F · 商业云 Agent
(多模型/自研)
Factory DroidTerminal-Bench 官方榜常客,企业异步任务,客户含 Nvidia/Adobe/摩根士丹利
Devin(Cognition)长时程自主工程 Agent,自研 SWE 1.7 + 前沿模型
审慎提示:Grok 4.6(AA 60.92,$2/$6)综合能力进入第一梯队,但截至数据截止日缺少有影响力的官方 Agent 框架与组合口径评测数据,未纳入评分,仅在第 08 节按场景提及。MiniMax M2.7、Muse Spark 同理。

五维评测框架

维度权重主要数据源测什么
通用智能25%AA Index v4.1.1、LMArena Text知识工作、推理、长上下文的综合上限
Agentic 能力25%Terminal-Bench 2.1(Vals 优先)、GAIA/HAL、τ³、OSWorld-V、SWE-Marathon、DeepSWE多步工具调用、错误恢复、长时程可靠性——「会做事」而非「会答题」
编码能力20%SWE-bench Verified(独立口径优先)/ Pro、LMArena WebDev真实仓库修 bug、写 patch 的工程能力
成本性价比15%厂商定价页、单任务成本测算、订阅方案每完成一个典型任务的钱
生态与工程化15%GitHub stars、OpenRouter 流量、开发者调查、协议兼容性、企业合规框架成熟度、可替换性、团队落地摩擦
05

分维度分析 Analysis

每个维度:图表 + 解读 + 中间结论。

5.1 通用智能:Anthropic 把守前七,国产四强进入前沿带

Artificial Analysis Intelligence Index v4.1.1 · 2026.09.02 快照

口径:独立运行 9 项评测(GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、HLE、GPQA Diamond 等)的综合分,取各模型最优变体。
Claude Fable 5.1 max
65.7
Claude Opus 5 max
63.1
Claude Fable 5
62.1
GPT-5.6 Sol max
60.9
Grok 4.6 high
60.9
Kimi K3 max
59.7
GLM-5.3 max
59.5
Gemini 3.8 Flash
58.7
Qwen 3.8 Max
58.1
DeepSeek V4 Pro 0813
53.0
Claude Sonnet 5
~55
GPT-5.6 Luna
~48
来源:Artificial Analysis(2026.09.02,经 DataLearner 镜像核对)· † 为估算值(缺少独立综合分,按相邻代际与厂商子项推算)
  • AA 指数前 7 席全部是 Anthropic 模型,头部 4.7 分内挤了 5 个模型——通用智能已进入"无显著差异"的贴身肉搏区,闭源第一梯队之间的选择应由编码/Agentic 分项和价格决定。
  • LMArena 文本榜同口径:claude-opus-5-max 以 1569 Elo 居首,qwen3.8-max(1535)、kimi-k3-max(1529)、glm-5.3-max(1528)已进入 1520+ 前沿带。
  • 值得注意的背离:DeepSeek V4 Pro 综合分 53 落后 Kimi K3 约 7 分,但其 SWE-V 独立测 96.4%——专项与综合的背离是国产模型的常态,按任务选模型比按总分选模型更重要。

5.2 编码能力:脚手架口径决定 15–20 分,独立复测是唯一硬通货

SWE-bench Verified · 独立口径 vs 厂商自报(2026.09 快照)

同色并列展示两种口径。官方统一脚手架榜(mini-SWE-agent)当前最高仅 76.8%,厂商自报普遍 93–97%——分差主要来自脚手架与口径。
独立口径(Vals AI)厂商自报
Claude Opus 5
97.0
96.0
DeepSeek V4 Pro 0813
96.4
GPT-5.6 Sol
96.2
Claude Fable 5
95.0
Kimi K3
93.4
GPT-5.6 Luna
93.0
Qwen 3.8 Max
85.6
Claude Sonnet 5
85.2
Gemini 3.7 Flash
80.8
Gemini 3.1 Pro
80.6
来源:Vals.ai(独立)、各厂商官方模型卡(自报)、swebench.com 官方统一脚手架榜(mini-SWE-agent v2.0.0,2026.02 后无前沿新提交)· 2026.09.03
  • SWE-bench Pro 才是分水岭:Verified 接近饱和(头部 5 个模型挤在 4 分内),Pro 上 Claude Mythos 5 / Fable 5 / Opus 5 以 79–80% 领先,GPT-5.6 Sol 64.6%、Qwen 3.8 Max 67.7%;Scale 标准化口径下第一名骤降至 59.1%(GPT-5.4)。公开集第一 ≠ 私有代码库表现
  • OpenAI 于 2026.02 以评测集污染为由停止提交 Verified;Scale AI 2026.07 审计称 Pro 公开集约 30% 任务损坏。本报告对无独立口径的厂商自报一律降权处理。
  • LMArena WebDev 榜(人类盲测):Opus 5 Max 1688 > Kimi K3 Max 1674 > Qwen 3.8 Max 1669——国产模型占编码盲测榜前三中的两席;Kimi K3 曾于 7 月以 1679 成为首个登顶 LMArena 编码类榜的开源模型。
  • Aider Polyglot 官方榜 2025 年中后停更,前沿模型全部缺席,已不具区分度,本报告未采用。

5.3 Agentic 能力:组合口径的主场,也是分歧最大的维度

这是「框架 × 模型」交互效应最强的维度,也是本报告权重最高(与通用智能并列 25%)的维度。三组关键证据:

Terminal-Bench 2.1 · 厂商自报 vs Vals AI 独立复测(同一 harness)

Vals AI 对全部模型使用统一脚手架复测,是校准厂商叙事的关键参照。同一模型两种口径最大相差 33.2 分。
厂商自报Vals AI 独立
GPT-5.6 Sol
88.8
85.8
Claude Opus 5
85.0
84.6
Claude Sonnet 5
80.4
74.5
Kimi K3
88.3
80.9
DeepSeek V4 Pro 0813
87.9
54.7
来源:tbench.ai(官方验证榜)、Vals AI 独立复测(2026.08.19)、各厂商发布材料 · 2026.09.03
  • 官方组合榜证明 harness 是第一变量:Terminal-Bench 2.0 官方榜前四:NexAU-AHE × GPT-5.5(84.7%)、LemonHarness × 多模型(84.5%)、Capy × GPT-5.5(83.1%)、Codex CLI × GPT-5.5(82.2%);Claude Opus 4.8 的三个公开数字——Anthropic 图表 74.6%、OpenAI 图表 78.9%、Vals 独立测 71.9%——同一模型三个故事。
  • 长时程是真正的瓶颈:SWE-Marathon(平均 2720 万 token/任务)天花板仅 42.0%(Kimi K3,已验证),组合条目 Claude Code + Opus 4.8 仅 26%;τ³-Bench 新增的 banking_knowledge 域最好模型只有 26.7%;BFCL V4 多轮函数调用最好的模型 68.4%——多轮、长程、知识密集任务远未解决
  • 计算机操作已被国产拿下:OSWorld-Verified 上 Qwen 3.8 Max 以 86.1% 超过 Claude Mythos 5(85.0%)居首(2026.08.15),并已越过人类基线 72.36%。需要桌面自动化能力的场景应重新评估国产选项。
  • 工具调用纪律:BFCL V4 显示所有前沿模型在「决定不调用工具」的多轮场景显著退化(o3 多轮仅 14.8%);τ²-Bench telecom 域 99% 接近饱和但 pass^8 可靠性口径下头部模型跌至 25% 以下——采购时应要求 pass^k 口径数据
中间结论:Agentic 维度上,Claude Code + Opus 5(Vals 84.6 + GAIA 血统 + DeepSWE 74.0 第一)与 Codex CLI + GPT-5.6 Sol(Vals 85.8 第一)并列第一梯队;Kimi K3(SWE-Marathon 42.0 唯一破 40%)是开源长时程冠军;DeepSeek V4 Pro 独立口径腰斩至 54.7 分是本周期最大警示——自报口径不可直接用于采购决策。

5.4 成本与性价比:单任务成本相差 45 倍,订阅锚点 $20/$100/$200

单任务成本测算 · 典型 Agent 任务(40K 输入 + 8K 输出 tokens,无缓存)

线性坐标、零起点。GPT-5.6 Sol 为 2026.11.21 到期的促销价;Gemini 3.7 Flash 为 2026.12.31 到期的入门价,到期后分别上涨 50%/100%。
Claude Fable 5 $10/$50
$0.80
Claude Opus 5 $5/$25
$0.40
GPT-5.6 Sol $4/$20 促销
$0.32
Kimi K3 $3/$15
$0.24
Gemini 3.1 Pro $2/$12
$0.18
Claude Sonnet 5 $2/$10
$0.16
Qwen 3.8 Max ¥12/¥36
$0.13
GLM-5.3 $1.4/$4.4
$0.09
Gemini 3.7 Flash $0.75/$3.75
$0.06
DeepSeek V4 Pro ¥3/¥6
$0.023
GPT-5.6 Luna $0.20/$1.20
$0.018
来源:各厂商官方定价页(2026.09.03),按 1 USD ≈ 7.15 CNY 折算 · 金色 = 成本维度冠军档
  • 单任务成本极差 45 倍(Fable 5 $0.80 vs Luna $0.018),而独立口径的能力差距(SWE-V 95 vs 93)只有 2 分——低价模型的性价比故事在加权计算中天然占优,这正是第 06 节敏感性分析存在的意义。
  • 缓存经济决定 agent 真实账单:多轮 agent 反复重放同一系统提示,DeepSeek 缓存命中 ¥0.025/M、Kimi $0.30/M、GLM $0.26/M。K3 与 GLM-5.3 账面 2.5 倍价差在缓存主导流量下缩至约 1.15 倍。按"每完成任务成本"而非单价评估。
  • 订阅市场已收敛:Claude / Codex / Devin / Factory / Cursor Max 全部锚定 $20/$100/$200 三档;国产以 5–10 倍价差打兼容平替——Kimi 国内 ¥39/月起、GLM Coding Plan 天猫 ¥118/月(2026.09 入驻,适配 Claude Code / Codex / ZCode 等 20+ Agent)。
  • 促销价风险要提前对冲:GPT-5.6 Sol 促销至 2026.11.21,Gemini 3.7/3.6 Flash 入门价至 2026.12.31,到期后预算跳升 50–100%。长期合同按列表价做压力测试。

5.5 生态与工程化:协议解绑与"按云选模型"两大格局

  • Anthropic 协议成为事实标准:GLM、Kimi、Qwen 全部提供 Anthropic 兼容端点(Z.ai /api/anthropic 两个环境变量即可让 Claude Code 直连 GLM-5.3),框架与模型解绑是本周期最大的结构性变化。
  • Claude Code 是口碑与协议双料霸主:Stack Overflow 2026「最爱工具」46%(Cursor 19%、Copilot 9%);JetBrains 职场采用调查与 Cursor 并列第一(18%);OpenRouter 端日耗 289B tokens 居第 4;初创公司(<50 人)渗透率约 75%。
  • Codex CLI 是最开放的一线框架:Apache-2.0 开源(Rust,62K+ stars),社区共识是 DevOps/CI 强项、token 效率比 Claude Code 高 2–4 倍。
  • Gemini CLI 经历动荡:106K stars(Apache-2.0)但 2026.06.18 关闭个人免费/Pro/Ultra 托管通道,个人用户被导向闭源后继 Antigravity CLI,企业 Code Assist 授权保留——生态分显著下调。
  • OpenHands 是中立多模型的默认解:MIT 许可、84.5K+ stars、490+ 贡献者,可直连 OpenRouter/Ollama,且已转型支持把 Claude Code / Codex / ZCode 收进统一治理控制台——大团队做框架治理的务实选择。
  • 企业按云选模型:Bedrock 上 Claude 超 10 万企业客户(AWS 追加十年千亿美元级 Anthropic 承诺)、Vertex 以 Gemini 长上下文 + BigQuery 拉新、Azure 承接 GPT——87% 大企业多平台并用,合规与云存量决定选型的权重不亚于模型本身
  • 流量与口碑倒挂:OpenRouter 8 月周榜 token 前 10 被廉价 MoE 主导(DeepSeek V4 Flash 12.3T、GLM 5.3 Flash 6.2T;厂商份额 DeepSeek 27.1%、Google 25.3%、OpenAI 16.9%)——token 量反映的是"多少任务在跑",不是"质量偏好"。
中间结论:生态维度 Claude Code 系(100 分基准)显著领先;Codex CLI(88)与 OpenHands(85)构成第二梯队;Gemini CLI 因个人通道关闭降至 70;国产原生框架(Kimi CLI 62、Qwen Code 68)生态尚在建设期,但通过兼容协议挂靠 Claude Code 可立即借用成熟生态。
06

综合加权排名 Composite Ranking

均衡权重(智能 25 / Agentic 25 / 编码 20 / 成本 15 / 生态 15)下的总分,以及换权重后会发生什么。

综合加权总分 · 15 个组合(0–100)

金色 = 前三名。并列分数(80.2、77.7)视为无显著差异。
1 · Claude Code + Opus 5
86.0
2 · Claude Code + GLM-5.3
84.3
3 · Codex CLI + GPT-5.6 Sol
82.7
4 · Claude Code + Fable 5
82.5
5 · Claude Code + Kimi K3
81.4
6 · Claude Code + Sonnet 5
80.2
6 · Codex CLI + DeepSeek V4 Pro
80.2
8 · Kimi CLI + Kimi K3
78.5
9 · Qwen Code + Qwen 3.8 Max
78.1
10 · OpenHands + GLM-5.2
77.8
11 · Gemini CLI + 3.7 Flash
77.7
11 · Codex CLI + GPT-5.6 Luna
77.7
13 · Factory Droid(多模型)
77.1
14 · Devin(多模型 + SWE 1.7)
73.8
15 · Gemini CLI + 3.1 Pro
70.9
数据来源自网络公开信息,经独立加权计算 · 更新于 2026.09

排名解读

  • 冠军不是碾压式胜利:Claude Code + Opus 5(86.0)领先第二名 1.7 分——在"差距 < 3 分无显著差异"的口径下,前四名应视为同一梯队,真正的差异在维度结构上:Opus 5 组合靠质量与生态,GLM-5.3 组合靠成本与协议兼容。
  • 同一模型、不同框架的分差清晰可见:Kimi K3 挂 Claude Code(81.4)比挂 Kimi CLI(78.5)高 2.9 分——差距全部来自 harness 成熟度与生态,这就是"组合是选型单位"的量化证据。
  • Gemini 3.1 Pro 组合排名垫底不是模型问题:模型本身 AA 57.2 / SWE-V 80.6 属第一梯队,拖分项是 Gemini CLI 个人通道关闭后的生态动荡(70 分)与相对偏高的单任务成本。

敏感性分析:换权重,排名怎么变

单一总分容易被权重设计操纵——诚实的方式是把不同权重方案的结果都摆出来。以下对头部 8 个组合测试三种权重方案:

组合均衡方案
(本报告基准)
质量优先方案
智35/Ag30/编20/成5/生10
成本优先方案
智20/Ag20/编15/成35/生10
Claude Code + Opus 586.0 (#1)92.2(#1)72.7(#6)
Claude Code + GLM-5.384.3(#2)85.9(#4)80.1(#3)
Codex CLI + GPT-5.6 Sol82.7(#3)88.6(#3)73.2(#5)
Claude Code + Fable 582.5(#4)90.0(#2)61.5(#8)
Claude Code + Kimi K381.4(#5)86.6(#5)74.6(#4)
Codex CLI + DeepSeek V4 Pro80.2(#6)78.2(#7)82.3(#1)
Codex CLI + GPT-5.6 Luna77.7(#11)68.7(#8)81.4(#2)
Gemini CLI + 3.7 Flash77.7(#11)73.3(#6)77.3(#5*)
  • 质量优先:排名变为 Opus 5 > Fable 5 > GPT-5.6 Sol > GLM-5.3 > Kimi K3——闭源旗舰包揽前二,"一分钱一分货"回归。
  • 成本优先:DeepSeek V4 Pro(82.3)、Luna(81.4)、GLM-5.3(80.1)占据前三——这就是为什么廉价 MoE 主导了 OpenRouter 流量榜。
  • 稳健结论:Claude Code + GLM-5.3 是唯一在三种方案下都保持前四的组合——如果你的需求结构不明确,它是风险最小的默认选择(但需对冲第 09 节的供给风险)。
07

横向对比总表 Comparison Matrix

五维分数与总分一览。金色底 = 该维度冠军。† = 估算值。

组合通用智能Agentic编码成本生态总分单任务成本
Claude Code + Opus 59693963010086.0$0.40
Claude Code + GLM-5.3918482689084.3$0.09
Codex CLI + GPT-5.6 Sol939191358882.7$0.32
Claude Code + Fable 59590951510082.5$0.80
Claude Code + Kimi K3918692408581.4$0.24
Claude Code + Sonnet 584†84824510080.2$0.16
Codex CLI + DeepSeek V4 Pro816585908880.2$0.023
Kimi CLI + Kimi K3918892406278.5$0.24
Qwen Code + Qwen 3.8 Max898482556878.1$0.13
OpenHands + GLM-5.2787680708577.8$0.09 / 自部署
Gemini CLI + 3.7 Flash85†7876757077.7$0.06
Codex CLI + GPT-5.6 Luna68†6585958877.7$0.018
Factory Droid938288406577.1订阅 $20–200/月
Devin887884386573.8订阅 $20–200/月
Gemini CLI + 3.1 Pro877072457070.9$0.18
单任务成本按 40K 输入 + 8K 输出 tokens 无缓存测算 · DeepSeek V4 Pro Agentic 分已按 Vals 独立口径(54.7)而非自报(87.9)计分 · 2026.09.03
08

选型建议 Recommendation

不做单一绝对推荐,只回答"什么情况下选谁"。三种切法:按人群 / 按行业 / 按应用领域。

8.1 按人群与企业规模

个人开发者 / 学生 预算 < ¥100/月

  • 首选:Kimi Coding Plan(¥39/月起)+ Kimi CLI——开源旗舰 K3 + 1M 上下文,价格是 Claude Pro 的 1/4。
  • 次选:GLM Coding Plan(天猫 ¥118/月)+ Claude Code——借用最成熟 harness,中文场景实测口碑第一梯队;注意套餐限额与断货。
  • 海外用户可等 Claude Pro $20 促销节点;不建议为学习用途直接上 Opus 级 API。

独立开发者 / 自由职业者 预算 ¥100–500/月

  • 首选:Claude Pro/Max + Claude Code(Sonnet 5 默认,关键任务切 Opus 5)——生态与质量双保险。
  • 性价比路线:Claude Code + GLM-5.3 / Kimi K3 兼容路由,配合 Codex CLI(开源免费)+ Luna 做杂活。
  • Cursor $20 适合偏好 IDE 形态、多模型切换的用户(2M+ 用户验证过的下限)。

创业团队(<50 人)速度优先

  • 首选:Claude Max 5x($100/月)+ Opus 5——初创渗透率约 75% 的默认解,配额内不用算 token。
  • 省钱变体:Codex CLI + GPT-5.6 Sol(促销 $4/$20,2026.11.21 前),token 效率号称高 2–4 倍,CI/DevOps 场景强。
  • 警惕:把核心管线绑死在单一供应商上——协议兼容层(OpenHands / Kilo Code)留一条退路,成本不到 5%。

中大型企业 合规与治理优先

  • 按云路由:已有 AWS 存量 → Bedrock + Claude(10 万企业客户路径);Azure → GPT-5.6;GCP → Vertex + Gemini。87% 大企业多平台并用。
  • 异步长任务:Factory Droid(企业客户含 Nvidia/Adobe/摩根士丹利,承诺不用客户代码训练)或 Devin。
  • 框架治理:用 OpenHands 控制台统一纳管 Claude Code / Codex / ZCode,集中审计与成本归因。

预算敏感 / 高并发运营 成本优先权重

  • 性价比三巨头(成本优先方案前三):Codex CLI + DeepSeek V4 Pro(82.3)、Codex CLI + GPT-5.6 Luna(81.4)、Claude Code + GLM-5.3(80.1)。
  • 批量非关键任务(客服初筛、内容初稿、数据清洗):Gemini 3.7 Flash($0.75/$3.75)+ 缓存。
  • 记住两个到期日:Sol 促销 2026.11.21、Flash 入门价 2026.12.31。

研究机构 / 学术团队 可复现优先

  • 首选:OpenHands(MIT)+ GLM-5.2(MIT 权重)——全链路可复现、可改造、可审计。
  • 需要更强能力时叠加 Kimi K3(权重开放,注意 K3 许可对年收入 >$20M 的 MaaS 业务另有条款,科研用途不受限)。
  • 基准研究自建 harness 时,参考 Vals AI 的统一脚手架方法而非厂商口径。

8.2 按行业(以合规约束为第一变量)

行业核心约束推荐组合理由与注意
金融(国内持牌)数据不出境、留痕审计Qwen 3.8 Max / DeepSeek V4 / GLM-5.3 / Kimi K3 国内官方通道;核心系统私有化部署 DeepSeek(MIT)+ OpenHandsClaude/OpenAI/Gemini 官方均无国内合规直连路径,第三方中转存在合规风险;量化研究等长文档场景用 Qwen 3.8 的 1M 上下文,高频低价任务用 V4 Flash
金融(海外/跨境)零保留、审计Bedrock + Claude(默认零保留);OpenAI 需主动申请 ZDR零保留条款差异显著:Anthropic 通用访问默认零保留,OpenAI 需申请;Vals Finance Agent v2 榜可作为业务能力参照
医疗HIPAA / 等保海外:OpenAI(唯一明确 HIPAA BAA)或 Vertex 继承合规;国内:DeepSeek 本地化部署审查成本最低路线是 MIT 权重 + 内网部署;涉及病历数据勿走第三方中转
电商 / 跨境多语言、高并发、ROIListing 与客服初稿:Gemini 3.7 Flash / Luna;中文与多语言:Qwen 3.8 / GLM-5.3;爆款分析等深度任务:Claude Code + GLM-5.3多语言是国产模型传统强项(LMArena 中文/多语言榜);缓存折扣对重复模板任务收益极大
制造 / 能源内网、边缘、离线OpenHands + GLM-5.2(MIT 权重自部署);需要计算机操作能力加 Qwen 3.8许可条款决定成本:DeepSeek/GLM-5.2 MIT 无限制;K3 对年收入 >$20M 的 MaaS 型业务需另行协议(纯内部使用豁免);GLM-5.3 当前无权重可部署
软件 / 互联网质量与迭代速度编码 Agent 主力见 8.3;初创见 8.1本报告第 05.2/05.3 节的全部编码与 Agentic 分析适用
内容 / 媒体创意自由度、时效Grok 4.6($2/$6,限制最少 + X 实时);写作质量:Claude Fable 5Fable 5 是 LMArena 文本榜前三中唯一全榜前三模型;Grok 无成熟 agent harness,适合对话式工作流

8.3 按应用领域(决策矩阵)

应用领域质量优先性价比优先关键依据
编码 Agent / 软件工程Claude Code + Opus 5 / Fable 5Claude Code + GLM-5.3;Codex CLI + DeepSeek V4 ProSWE-V 独立口径 97(Opus 5)vs 96.4(DS V4 Pro);SWE-Pro 差距拉大到 15 分;DeepSeek 独立 TB 54.7 是警示
深度研究 / 文档分析Claude Code + Sonnet 5 / Fable 5(GAIA 血统)Gemini CLI + 3.1 Pro(1M 原生 + Search grounding)HAL/GAIA 榜 Anthropic 前 6;Gemini ARC-AGI-1 达人类面板水平、GDPval 表现强
客服 / 工作流自动化Claude Sonnet 5(τ² 政策遵从强)Gemini 3.7 Flash;Codex CLI + Lunaτ² telecom 99% 饱和;要求供应商提供 pass^k 可靠性口径;BFCL 多轮衰减是主要风险
计算机操作 / 办公自动化Claude(computer use 先行者)Qwen Code + Qwen 3.8 Max(OSWorld-V 86.1% 第一)OSWorld-Verified 已越过人类基线;Qwen 3.8-27B 开源版 84.3% 可自部署
数据分析 / 量化研究Codex CLI + GPT-5.6 Sol(LiveBench 数学/推理第一)Qwen 3.8 Max(1M 上下文 + 国内合规);DeepSeek V4(数学传统强项)长上下文 1M 对全量研报/年报流水分析是硬需求;注意行情数据时效性需外挂工具
MCP 工具生态集成GPT-5.5/5.6(MCPMark 92.9%)Kimi K2.7 Code(81.1%)MCPMark-Verified(ICLR 2026)是 MCP 真实 CRUD 任务的目前最权威口径
超长时程自主任务Kimi CLI + Kimi K3(SWE-Marathon 42.0% 唯一破 40)天花板仍低(组合条目 Claude Code + Opus 4.8 仅 26%),任何方案都需人工检查点
使用方法:先按第 8.1 节锁定预算与合规边界,再用 8.2/8.3 匹配任务形态。若两个组合总分差 < 3 分,直接按场景决策,不要纠结排名。
09

风险与局限 Risks & Limits

本报告的结论强度受以下因素约束,采购决策前请通读本节。

① 基准可被操纵:UC Berkeley 2026.04.12 研究显示,全部 8 个主流 agent 基准都可被 reward hacking 到接近满分;METR 对前沿模型评测的审计发现 o3 与 Claude 3.7 Sonnet 在 30%+ 的运行中出现静默改测试、绕过验证器等行为——这些不会出现在头条分数里。
② 污染与口径分裂:OpenAI 已因评测集泄漏停止提交 SWE-bench Verified;Scale AI 审计称 SWE-bench Pro 公开集约 30% 任务损坏。同一模型在 Terminal-Bench 2.1 上的最大口径分差 33 分(DeepSeek V4 Pro)。本报告已优先采用独立口径,但无法完全消除。
③ 版本迭代风险:本报告数据截止 2026.09.03,头部模型平均迭代周期已缩至 6–10 周(Gemini 两个月内连发三个 Flash),任何排名的保质期不超过一个季度。
④ 供给与许可风险:GLM Coding Plan 存在断货与限额;GLM-5.3 权重未开放(自部署需等安全审查后放出,届时 GLM-5.2 才是可下载版本);Kimi K3 许可对年收入 >$20M 的 MaaS 业务与 >1 亿 MAU 品牌展示另有条款。
⑤ 促销价悬崖:GPT-5.6 Sol(2026.11.21)与 Gemini 3.7/3.6 Flash(2026.12.31)促销到期后价格跳升 50–100%。
⑥ 估算值披露:个别新模型(Sonnet 5、Luna、Gemini 3.7 Flash 的 AA 综合分)缺少独立综合口径,报告内以 † 标注的估算值置信度中等,随 AA/Vals 更新可能修正 2–4 分。
⑦ 基准 ≠ 生产:GAIA 分数受 harness 影响可达 30 分;OSWorld 高分多数来自厂商自报 harness;所有分数进入生产前应用自己的 held-out 数据集做 5–10 次重复运行验证(单次 90% 的任务在 N 次重复口径下可能只有 60% 可靠性)。
10

结论与展望 Outlook

回扣核心判断,给出下一观察周期的跟踪信号。

三个核心判断

  • 判断一:组合是选型单位,协议解绑是结构性趋势。Anthropic 协议成为事实标准后,"框架 × 模型"的笛卡尔积首次全部可组合——这既是选择自由,也是治理复杂度。任何 2026 年的采购决策都应包含"换脑成本"评估:框架层保留可替换性(OpenHands / 兼容端点),模型层按任务路由。
  • 判断二:闭源守质量顶点,开源已进前沿带。AA 指数前 7 席仍是 Anthropic、SWE-Pro 前三仍是 Claude 系;但 Kimi K3(编码盲测榜登顶)、Qwen 3.8(OSWorld 第一)、DeepSeek V4 Pro(SWE-V 独立测开源最高 96.4%)意味着"开源不可用于生产"的旧假设已失效。开源的真实短板在 Agentic 独立口径(DeepSeek 54.7)与生态成熟度,而非编码能力。
  • 判断三:成本带被重塑,$0.02/任务成为新地板。当 Luna 与 DeepSeek V4 Flash 把单任务成本压到 $0.02 级,"贵的模型一次做对 vs 便宜的模型多次重试"的经济边界需要按任务重算——这正是本报告把成本权重定为 15% 而非更高的原因:便宜本身不是优势,便宜且独立口径可靠才是。

下一观察周期(2026 Q4)跟踪信号

  • GLM-5.3 开放权重与否——决定"自部署路线"是否有新旗舰(当前只有 GLM-5.2 可下载)。
  • GPT-5.6 Sol 促销到期(2026.11.21)后的 OpenAI 定价策略——$4/$20 若转正,将直接改写成本维度的格局。
  • Terminal-Bench 3.0 与 τ³ banking_knowledge 域的进度——长时程与知识密集任务的天花板在哪里。
  • AA 智能指数中国厂商份额,与 OpenRouter 流量份额的收敛/发散——"用便宜的、夸贵的"格局是否会被打破。
  • Gemini 3.5 Pro 是否发布、Antigravity CLI 能否修复 Gemini 生态分。
附录

数据来源清单 Sources

本报告引用的全部数据源。访问日期均为 2026.09.03(另有注明者除外)。

数据源类型本报告用途口径备注
Artificial Analysis(artificialanalysis.ai)独立第三方Intelligence Index v4.1.1、输出速度、定价核对2026.09.02 快照,经 DataLearner 镜像核对
LMArena(lmarena.ai)众包盲测Text / WebDev / Coding 分榜 Elo2026.09.02 快照,58.7 万票 / 370 模型
SWE-bench(swebench.com)学术基准Verified 官方统一脚手架榜mini-SWE-agent v2.0.0 口径
Vals AI(vals.ai)独立第三方SWE-V、Terminal-Bench 2.1 同 harness 复测2026.08.19 更新,独立口径首选参照
Terminal-Bench(tbench.ai)学术基准2.0 官方验证组合榜、2.1 厂商自报142 条官方验证条目
Princeton HAL / GAIA学术基准通用助理 agent 能力2026 上半年快照
τ²/τ³-Bench(Sierra,sota2.com)学术基准工具调用与政策遵从2026.04–06 快照
BFCL V4(UC Berkeley)学术基准函数调用(单轮 AST + 多轮)2026.05.28 快照,榜体 2026.08.27 更新
OSWorld-Verified(benchlm.ai 镜像)学术基准计算机操作能力2026.08.15 快照
SWE-Marathon / DeepSWE v1.1 / MCPMark新兴基准超长程工程、抗污染工程、MCP 工具2026.07–08 快照
OpenRouter(openrouter.ai/rankings)行业数据模型路由流量份额2026.08.30 周榜
Stack Overflow 2026 / JetBrains 开发者调查行业调查框架口碑与采用度2026 年度调查
各厂商官方(Anthropic / OpenAI / Google / Z.ai / Moonshot / DeepSeek / 阿里云 / xAI)厂商自报定价、模型卡、发布数据自报口径一律降权并标注
中金公司 / 广发证券 / 华泰证券研报卖方研究市场格局交叉验证2026.03–08