主流大模型综合能力对比 & 免费 Token API 汇总 · 2026年7月
| # | 模型 | 公司 | 开源 | MMLU Pro | GPQA | HumanEval | 综合 | 定价 |
|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.8 |
Anthropic | 闭源 | 93.2 | $15/M tok | |||
| 2 | GPT-5.1 |
OpenAI | 闭源 | 91.6 | $15/M tok | |||
| 3 | Gemini 2.5 Pro |
闭源 | 89.4 | $10/M tok | ||||
| 4 | Claude Sonnet 4.6 |
Anthropic | 闭源 | 88.6 | $3/M tok | |||
| 5 | DeepSeek R1 |
DeepSeek | 开源 | 86.0 | $0.55/M tok | |||
| 6 | Qwen 3 Max |
Alibaba | 开源 | 84.6 | $0.70/M tok | |||
| 7 | Llama 4 Maverick |
Meta | 开源 | 82.7 | 免费 | |||
| 8 | Claude Fable 5 |
Anthropic | 闭源 | 81.8 | $0.80/M tok | |||
| 9 | Mistral Large 3 |
Mistral AI | 开源 | 79.3 | $4/M tok | |||
| 10 | Yi-Lightning |
01.AI | 开源 | 76.0 | $0.14/M tok |
| 基准 | 全称 | 评测维度 | 题目数 |
|---|---|---|---|
| MMLU Pro | Massive Multitask Language Undersanding Pro | 多学科知识推理(数学、物理、法律、医学等) | 12,032 |
| GPQA | Googe-Proof Q&A | 研究生级别科学推理(物理、化学、生物) | 448 |
| HumanEval | HumanEval | 代码生成能力(Python 函数补全) | 164 |