The State of
Artificial Intelligence

22 款主流模型 · 15+ 数据维度 · 场景推荐 / 速度延迟 / 函数调用 / 中英文能力 / 企业功能。支持排序、筛选、最多 4 款模型并排对比。点击行展开完整档案。

22
Models
15+
Data Fields
6
Sort Fields
4
Compare Max
95.0
Top Score

Who leads the intelligence race?

切换维度查看不同能力领域的模型排名,使用筛选和排序,点击排名徽章加入对比,点击行展开完整档案。

数据来源自网络公开信息,经独立加权计算 · 更新于 2026/09/03
开源
地区
价格
22/22
#ModelBenchmarksScore
#ModelBenchmarksScore
#ModelBenchmarksScore

Which model is right for you?

基于综合评分、价格、速度、场景适配度,为不同用户画像推荐最优选择

What the data tells us

Claude Fable 5 断层领先

三个维度同时登顶,综合得分 95.0,领先第二名 8 分。但价格最高($10/$50),速度偏慢(~30 tok/s),适合对质量不敏感成本的深度推理场景。

性价比之王 DeepSeek

DeepSeek-V4-Pro 综合第 8,价格仅 $0.44/$1.32,性价比是 Claude Fable 5 的 30 倍。开源可私有化,数学推理优秀,函数调用 82 分,适合预算有限的生产环境。

国产多模态局部超越

豆包 Seed 2.1 Pro 视频理解 89.2 全球第一,Qwen3.8-Max 多模态性价比无敌。但国产模型英文能力普遍弱于国际模型 15-20 分,出海场景需评估。

Release Timeline · 模型发布时间线
2026.04 — 2026.08 · 金色点为各榜单冠军 · 可左右滑动查看全部 22 款
CN vs Global · 国产 vs 国际最高分
三个维度分别对比 · 橙色=国产最高,深绿=国际最高
Open vs Closed · 开源 vs 闭源性能差距
综合维度 · 绿色=开源,黑色=闭源

How we built this index

更新频率
Monthly
每月初更新测评分数与元数据,重大模型发布时即时增补
LMArena 样本
2M+
真人双盲对比投票超 200 万次,覆盖 100+ 语言对
AA 基准数
10+
Artificial Analysis 综合 MMLU、GPQA、HumanEval 等 10+ 标准化基准
SuperCLUE 题量
3000+
中文基础能力、专业能力、中文特性三大维度超 3000 题
分数波动说明:排名差距在 3 分以内的模型(如 GPT-5.5 与 Claude Opus 4.8 同为 81 分),在统计上无显著差异,实际表现可能因具体任务而互换。速度数据(tokens/s、TTFT)来自 Artificial Analysis 在标准测试环境下的测量,实际速度因网络、并发、提示长度而异。函数调用能力基于 BFCL(Berkeley Function Calling Leaderboard)测评。上下文有效率基于"大海捞针"测试的实际召回率。企业功能信息来自各厂商官方文档,具体以商务合同为准。带 ⚠ 标记的模型存在特殊限制,详见行展开备注。各数据源的 License 许可与商用状态明细详见 Terms 页面。
免责声明:本页面为独立第三方评测,与所有模型厂商(OpenAI、Anthropic、Google、字节跳动、阿里巴巴等)无任何关联、赞助或合作关系。所有分数均来自公开基准测试,经 Modelspectra 独立加权计算,不接受厂商付费以影响排名结果。模型分数、价格、性能指标可能随版本更新而变化,实际以厂商最新官方信息为准。本页面数据仅供参考,不构成任何投资、采购或技术决策依据;任何依据本页面做出的决策,其风险由决策者自行承担。模型名称及商标归各自所有者所有,本页面仅作描述性引用。
Stay Updated

每月模型排名,直达邮箱

订阅 Modelspectra 月度报告:新模型发布、排名变动、价格调整、选型建议。免费,每月1-2封,随时退订。

请输入有效的邮箱地址
订阅即表示同意我们的 隐私政策。我们不会分享你的邮箱,不发送垃圾邮件。
对比 [0/4]