LLM模型对比
3684 字约 12 分钟
domain/aiai/toolsai/models
2026-07-24
截至 2026 年 6 月 24 日,主流 LLM 的全维度对比:前沿基准(GPQA/SWE-bench/AIME/HLE)、定价、功能特性、部署方式。帮助按场景做选型决策。
一句话解释
LLM 模型对比是按场景(编码/推理/成本/延迟)评估 Claude/GPT/Gemini/DeepSeek/Qwen 等主流模型的优劣势,没有万能模型,只有最适合当前任务的模型。
核心问题:为什么需要系统对比?
- 模型数量爆发:2025-2026 年主流模型从个位数增长到 50+,各有专长
- 性能差异显著:同一模型在不同任务上表现可能天差地别
- 成本差距巨大:最贵和最便宜的模型价格差可达 50 倍
- 迭代速度极快:模型每 2-3 个月就有重大更新,去年的对比数据已彻底过时
- 部署方式不同:API/Self-host/Edge 各有适用场景
主流模型全景
闭源 Frontier 模型(2026 年 6 月)
| 模型 | 厂商 | 架构 | 上下文 | 发布 |
|---|---|---|---|---|
| Claude Mythos 5 | Anthropic | Dense Transformer | 1M | 2026.06 ⚠️ 暂停访问 |
| Claude Fable 5 | Anthropic | Dense Transformer | 1M | 2026.06 ⚠️ 暂停访问 |
| Claude Opus 4.8 | Anthropic | Dense Transformer | 1M | 2026.05 |
| Claude Opus 4.7 | Anthropic | Dense Transformer | 200K | 2025.12 |
| Claude Opus 4.6 | Anthropic | Dense Transformer | 1M | 2025.09 |
| Claude Sonnet 4.5 | Anthropic | Dense Transformer | 200K | 2025.12 |
| GPT-5.5 Pro | OpenAI | Dense Transformer (并行计算) | 1M | 2026.04 |
| GPT-5.5 | OpenAI | Dense Transformer | 1M | 2026.04 |
| GPT-5.4 Pro | OpenAI | Dense Transformer | 1M | 2026.03 |
| GPT-5.3 Codex | OpenAI | Dense Transformer | 1M | 2026.03 |
| GPT-4.1 | OpenAI | Dense Transformer | 1M | 2025.04 |
| GPT-4o | OpenAI | Dense Transformer | 128K | 2024.05 |
| Gemini 3.1 Pro | MoE Transformer | 1M | 2026.02 | |
| Gemini 3 Pro | MoE Transformer | 2M | 2025.11 | |
| Gemini 2.5 Pro | MoE Transformer | 2M | 2025.03 | |
| Grok 4.x | xAI | Dense Transformer | 256K | 2026 |
| Qwen3.7 Max | Alibaba | MoE | 1M | 2026.05 API-only |
| Kimi K2.6 Thinking | Moonshot | MoE | 256K | 2026.04 |
开源/Open-weight 模型
| 模型 | 厂商 | 架构 | 参数量(总/活跃) | 上下文 | 许可证 |
|---|---|---|---|---|---|
| DeepSeek V4 Pro | DeepSeek | MoE | 1.6T / 49B | 1M | MIT |
| DeepSeek V4 Flash | DeepSeek | MoE | 284B / 13B | 1M | MIT |
| DeepSeek R2 | DeepSeek | MoE (RL 推理) | 671B / 37B | 128K | MIT |
| DeepSeek V3 | DeepSeek | MoE | 671B / 37B | 128K | MIT |
| DeepSeek R1 | DeepSeek | MoE (RL 推理) | 671B / 37B | 128K | MIT |
| Qwen3.5-122B-A10B | Alibaba | MoE | 122B / 10B | 128K | Apache 2.0 |
| Qwen3-235B-A22B | Alibaba | MoE | 235B / 22B | 128K | Apache 2.0 |
| Qwen3-32B | Alibaba | Dense | 32B | 128K | Apache 2.0 |
| Llama 4 Scout | Meta | MoE | 109B / 17B | 10M | Llama 4 Community |
| Llama 4 Maverick | Meta | MoE | — | 1M | Llama 4 Community |
| GLM-5.2 | Z.AI | Dense | — | 1M | Open |
| Kimi K2.5 | Moonshot | MoE | — | — | Open |
| Command A+ | Cohere | Dense | — | 256K | Proprietary (free) |
| Mistral Large | Mistral | MoE | — | 256K | — |
性能基准对比
⚠️ 数据说明:数据综合自 Vellum、BenchLM、Artificial Analysis、Epoch AI、llmleaderboard.in 等独立评测方(2026 年 6 月)。MMLU 和 HumanEval 已饱和,前沿评测已转向 GPQA Diamond / SWE-bench / AIME / HLE。 "—" 表示无公开发布数据。同一 benchmark 不同评测方结果可能有 3-8% 差异。
推理与知识(当前核心区分基准)
| 模型 | GPQA Diamond | HLE (无工具) | ARC-AGI-2 | MMLU-Pro |
|---|---|---|---|---|
| Claude Mythos 5 | 94.6% | 64.5% | — | — |
| Claude Fable 5 | 94.5% | 56.8% | — | — |
| GPT-5.4 Pro | 94.5% | — | — | — |
| Claude Opus 4.8 | 94.4% | 57.9% | — | — |
| Gemini 3.1 Pro | 94.3% | 45.8% | 77.1% | — |
| Claude Opus 4.7 | 94.2% | — | — | — |
| GPT-5.5 | 93.6% | 43.1% | — | — |
| GPT-5.4 | 92.8% | — | — | — |
| Gemini 3 Pro | 92.1% | 37.5% | 59.7% | — |
| Qwen3.7 Max | 92.4% | 38.1% | — | 89.6% |
| Claude Opus 4.6 | 91.2% | 34.4% | 68.8% | — |
| Kimi K2.6 | 91.1% | 44.9% | — | — |
| DeepSeek R2 | 89.3% | — | — | — |
| DeepSeek V4 Pro | 88.8% | 35.9% | — | 87.5% |
| Claude Opus 4.5 | 87.3% | — | 37.6% | 89.5% |
💡 GPQA Diamond(研究生级科学推理)是目前最可靠的推理区分基准。Frontier 模型从 87% 到 94.6% 分布,仍能有效拉开差距。HLE(Humanity's Last Exam) 是当前天花板——人类专家~90%,Claude Mythos 5 达 64.5% 是首次大幅突破。
编码
| 模型 | SWE-bench Verified | SWE-bench Pro | Terminal-Bench 2.0/2.1 |
|---|---|---|---|
| Claude Mythos 5 | 95.5% | 80.3% | — |
| Claude Fable 5 | 95.0% | 80.3% | 88.0% |
| Claude Opus 4.8 | 88.6% | 69.2% | 74.6% |
| Claude Opus 4.7 | 87.6% | — | 90.2% |
| Claude Sonnet 4.5 | 82.0% | — | — |
| GPT-5.5 | 78.6% | 58.6% | 83.4% |
| GPT-5.4 | 77.4% | 59.1% | 81.8% |
| Gemini 3.1 Pro | 80.6% | 46.1% | 74.8% |
| Gemini 3 Pro | 76.3% | — | — |
| DeepSeek V4 Pro | 80.6% | — | 67.9% |
| DeepSeek R2 | 72.4% | — | — |
| Kimi K2.6 | 80.2% | — | — |
| GPT-4.1 | 54.6% | — | — |
💡 SWE-bench Verified 是编码基准的主流参考,但需要注意数据污染问题(OpenAI 审计发现 59.4% 的 Hard 任务有缺陷)。SWE-bench Pro(Scale AI,1865 个多语言任务)是更新更严的标准。Terminal-Bench 衡量终端/CLI 编码能力。
数学
| 模型 | AIME 2025 | MATH-500 | FrontierMath T1-3 | FrontierMath T4 |
|---|---|---|---|---|
| GPT-5.2 | 100% | — | — | — |
| Gemini 3 Pro | 100% | — | — | — |
| Claude Opus 4.6 | 99.8% | — | — | — |
| Kimi K2 Thinking | 99.1% | — | — | — |
| Claude Fable 5 | — | — | 87.0% | 87.8% |
| GPT-5.5 Pro | — | — | 87.7% | 78.0% |
| Claude Opus 4.5 Sonnet | — | — | — | — |
| DeepSeek R1 | ~70% | 97.3% | — | — |
| Qwen3.7 Max | — | — | — | — |
| GPT-4o | — | 76.6% | — | — |
💡 AIME 2025(竞赛数学)多个模型已达 100%,区分度正在下降。FrontierMath(Epoch AI)是目前最难的数学基准——研究生级问题,Claude Opus 4.5 在 2026 年初得分 <10%,半年后 Fable 5 已达 87.8%。
关键解读
- 编码领域 Anthropic 一骑绝尘:Claude 系列在 SWE-bench 上持续大幅领先,Mythos/Fable 5 达 95%+,领先 GPT-5.5 约 15-20 个百分点
- 推理基准竞争白热化:GPQA Diamond 上 Frontier 模型差距在 2-3% 以内,Claude 略领先,但 HLE 上差距更大(Claude Mythos 64.5% vs GPT-5.5 43.1%)
- AIME 趋近饱和:多个模型达 100%,FrontierMath 成为新的数学区分基准
- 开源与闭源差距在编码上最大:SWE-bench 上 DeepSeek V4 Pro 80.6% 逼近 GPT-5.5 的 78.6%,但在 SWE-bench Pro 上差距更大
- MMLU 和 HumanEval 已退役:几乎所有前沿模型在这两个基准上得分 >88%,已失去区分意义
- ⚠️ 注意 Benchmark 污染:SWE-bench Verified 被证实存在数据污染问题,OpenAI 已停止报告 Verified 分数
定价对比
价格截至 2026 年 6 月。单位:美元/百万 tokens。Cache/batch/批量折扣未列。标注 "—" 表示未公开。
| 模型 | 输入价格 | 输出价格 | 上下文 | 备注 |
|---|---|---|---|---|
| Claude Mythos 5 | — (有限访问) | — | 1M | 暂停 |
| Claude Fable 5 | $10.00 | $50.00 | 1M | 暂停 |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | — |
| Claude Opus 4.7 | $5.00 | $25.00 | 200K | — |
| Claude Sonnet 4.5 | $3.00 | $15.00 | 200K | — |
| GPT-5.5 Pro | $30.00 | $180.00 | 1M | 并行计算 |
| GPT-5.5 | $5.00 | $30.00 | 1M | — |
| GPT-5.4 Pro | $30.00 | $180.00 | 1M | — |
| GPT-5.4 | $5.00 | $30.00 | 1M | — |
| GPT-5.3 Codex | $1.75 | $14.00 | 1M | 开放权重 |
| GPT-4.1 | $2.00 | $8.00 | 1M | — |
| GPT-4o | $2.50 | $10.00 | 128K | — |
| Gemini 3.1 Pro | $2.00 | $12.00 | 1M | 多模态 |
| Gemini 3 Pro | $2.00 | $12.00 | 2M | — |
| Gemini 2.5 Flash | $0.15 | $0.60 | 1M | — |
| DeepSeek V4 Pro | $0.44 | $0.87 | 1M | MIT,永久低价 |
| DeepSeek V4 Flash | $0.14 | $0.28 | 1M | MIT |
| DeepSeek R2 | $0.55 | $2.19 | 128K | MIT |
| DeepSeek V3 | $0.27 | $1.10 | 128K | MIT |
| Qwen3.7 Max | $2.50 | $7.50 | 1M | API-only |
| Qwen3.5-122B | ~$0.50 | ~$1.50 | 128K | Apache 2.0 |
| Kimi K2.6 | $0.75 | $3.50 | 256K | — |
| Command A+ | $0.00 | $0.00 | 256K | 免费层 |
| Grok 4 | ~$2.00 | ~$10.00 | 256K | — |
定价模式关键趋势
- 推理成本断崖式下降:DeepSeek V4 Pro $0.44/$0.87 比半年前的 V3 还便宜 60%,质量接近 GPT-5.5 级别
- 免费模型层成熟:Cohere Command A+、Google Gemma 4 等提供全免费层,质量可用
- OpenAI 溢价分层明显:GPT-5.5 Pro 输出 $180/M,但 GPT-5.3 Codex 开放权重仅 $1.75/$14,差了 13 倍
- Anthropic 定位高端:Fable 5 $10/$50 是最贵的非 Pro 模型,但 Benchmark 领先最多
- 推理模型隐性成本:Chain-of-Thought 产生 2-5 倍额外输出 token,实际总成本远高于表列价格
- Qwen3.7 Max 性价比突出:$2.50/$7.50 做到 GPQA 92.4%、SWE-Pro 60.6%,是中文场景首选
功能特性对比
| 特性 | GPT-5.5 | Claude 4.7+ | Gemini 3.1 | DeepSeek V4 | Qwen3.7 Max |
|---|---|---|---|---|---|
| 多模态输入 | ✅ 文本/图像/音频 | ✅ 文本/图像/音频 | ✅ 文本/图像/音频/视频 | ❌ 仅文本 | ✅ 文本/图像 |
| 多模态输出 | ✅ DALL-E 集成 | ✅ 文本 | ✅ 图像生成 | ❌ | ❌ |
| 工具调用 | ✅ 成熟领先 | ✅ 成熟 | ✅ 成熟 | ✅ 增强 | ✅ |
| 结构化输出 | ✅ JSON Schema | ✅ JSON Schema | ✅ JSON Schema | ✅ JSON | ✅ |
| MCP 协议 | ⚠️ 第三方 | ✅ 原生支持 | ⚠️ 第三方 | ✅ 兼容 | ⚠️ |
| Function Calling | ✅ 领先 | ✅ 优秀 | ✅ 优秀 | ✅ | ✅ |
| Streaming | ✅ | ✅ | ✅ | ✅ | ✅ |
| 缓存 | ✅ Prompt Caching | ✅ Prompt Caching | ✅ Context Caching | ❌ | ❌ |
| Batch API | ✅ 50% 折扣 | ✅ 50% 折扣 | ✅ | ✅ | ✅ |
| 微调 | ✅ | ❌ | ✅ | ❌ | ❌ (API-only) |
| 自部署 | ❌ | ❌ | ❌ | ✅ MIT | ❌ (API-only) |
| Agent 能力 | ✅ 强 | ✅ 强 | ✅ 中 | ✅ 强 | ✅ 中 |
| 代码执行 | ✅ Code Interpreter | ✅ Artifacts | ✅ Code Execution | ❌ | ❌ |
可视化定位
选型决策树
按任务场景
按预算
| 预算 | 推荐模型 |
|---|---|
| 🆓 免费/极低 | DeepSeek V4 Flash (MIT自部署)、Command A+ (免费层)、Gemma 4、Qwen3.5 (Apache 2.0) |
| 💰 低 ($0-100/月) | DeepSeek V4 Pro ($0.44/$0.87)、Gemini 2.5 Flash、GPT-4o Mini |
| 💵 中 ($100-1000/月) | GPT-4o + Claude Sonnet 4.5 + Gemini 3.1 Pro 混合 |
| 💳 高 ($1000-10000/月) | 多模型路由:Claude Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro 按任务切换 |
| 🏢 企业级 | Enterprise 协议 + 私有部署 (DeepSeek V4 / Qwen3.5 / Llama 4) |
按部署方式
云 API → 质量优先: Claude Opus 4.8 / GPT-5.5
性价比优先: DeepSeek V4 Pro / Gemini 3.1 Pro
多模型路由: 按任务动态选择 (业界最佳实践)
自部署 → 旗舰级(48GB+ VRAM): DeepSeek V4 Pro (1.6T/49B active)
中端(24GB VRAM): Qwen3.5-35B-A3B, Llama 4 Scout
端侧(8-16GB): Qwen3-4B, Gemma 4, Phi-4
混合 → 日常用 DeepSeek V4 Pro API,敏感数据自部署 Qwen,复杂任务路由到 Claude/GPT选型铁律
- 没有万能模型 — 用 $180/M 的 GPT-5.5 Pro 做翻译、用 DeepSeek V4 写前端都是错的。按任务路由
- 不要只信 Benchmark — SWE-bench Verified 已被污染,同一模型不同评测方差 10%。实际业务 A/B 测试才可靠
- 保持模型无关性 — 通过 LiteLLM/OpenRouter/OpenAI SDK 兼容层保持切换灵活性
- 推理模型总成本 = (输入 + 输出 × 2~5) × 调用量 — Chain-of-Thought 输出 token 数倍于输入
- 多模型策略 > 单模型 — 78% 的企业已在用多模型路由。简单任务用便宜模型,复杂任务用旗舰
- 速度也是能力 — 延迟 200ms vs 2s 对交互式应用的影响超过 5% 的 Benchmark 差异
- 关注活跃参数而非总参数 — MoE 模型下总参数 1.6T 但活跃仅 49B,推理成本接近 49B 稠密模型
常见误区
- "最强的就是最好的" — Claude Fable 5 比 DeepSeek V4 Pro 贵 57 倍,但质量差距远小于这个倍数
- "价格便宜的质量就差" — DeepSeek V4 Pro 是 GPT-5.5 的 1/11 价格,SWE-bench Verified 分数反超
- "开源模型不如闭源" — DeepSeek V4 Pro 在编码任务上接近甚至超越 GPT-5.5,且可自部署
- "Benchmark 即真理" — SWE-bench Verified 已被 OpenAI 验证存在严重数据污染,各评测方差大
- "一个模型用到底" — 单一模型策略要么成本高要么质量差,按场景路由是唯一正确答案
- "MMLU 高分就是好模型" — MMLU 已饱和(88-92%),已不能区分前沿模型能力
- "Chatbot Arena Elo 代表真实能力" — Arena 排名受 UI/品牌/用户偏差影响,与任务基准不完全相关
选型总结速查
| 你的需求 | 首选模型 | 性价比替代 | 自部署替代 |
|---|---|---|---|
| 编码 (最高质量) | Claude Fable 5 / Opus 4.8 | GPT-5.3 Codex | DeepSeek V4 Pro |
| 编码 (日常) | Claude Sonnet 4.5 | DeepSeek V4 Pro | DeepSeek V4 Flash |
| 通用推理 | GPT-5.5 / Gemini 3.1 Pro | Qwen3.7 Max | DeepSeek V4 Pro |
| 数学/科学 | Claude Opus 4.6 / Kimi K2 | DeepSeek R2 | — |
| RAG/长上下文 | Gemini 3.1 Pro (1M) | GPT-4.1 (1M) | — |
| Agent | GPT-5.5 / Claude Fable 5 | DeepSeek V4 Pro | DeepSeek V4 Pro |
| 多模态 | Gemini 3.1 Pro / GPT-5.5 | GPT-4o | — |
| 中文 | Qwen3.7 Max | GPT-4o | Qwen3.5-122B |
| 最便宜 | DeepSeek V4 Flash | Command A+ (免费) | DeepSeek V4 Flash |
与其他概念的关系
- 模型选择与对比 — 选型原则和方法论的深化版本
- 商业闭源模型 — 闭源模型的详细介绍
- 推理模型 — o1/o3/R1/DeepSeek-R1 等推理增强模型详解
- 基座模型 — 模型架构基础概念
- 开源模型 — 开源模型生态
- 多模态模型 — 多模态能力的深入对比
- 小模型与端侧模型 — 轻量级部署场景
- 模型能力评估 — Benchmark 方法论和局限性
- AI Coding工具对比 — 编码场景的模型应用对比
- 模型幻觉与不确定性 — 模型可靠性评估
可继续补充的方向
数据来源:Vellum LLM Leaderboard (2026.06.09)、BenchLM.ai (2026.06.18)、llmleaderboard.in (2026.06.06)、Artificial Analysis Intelligence Index v4.0、Epoch AI (2026.06.24)、CodingFleet Claude Fable 5 vs GPT-5.5 Pro 对比 (2026.06.10)