AI 观察
AI── 综合能力、编程、数学、知识推理、Agent、速度和价格每日更新 ──
模型数量
532
排行维度
20
雷达维度
10
更新时间
2026/6/6 10:21:18
模型能力雷达图
全体平均固定为背景参考层,同时对比 2 个模型。
核心能力排行
综合、编程、数学三条主线,适合快速判断模型定位。
综合能力
Artificial Analysis Intelligence Index,综合推理、知识、代码和数学表现。
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
Anthropic
GPT-5.5 (xhigh)
OpenAI
GPT-5.5 (high)
OpenAI
Claude Opus 4.7 (Adaptive Reasoning, Max Effort)
Anthropic
Gemini 3.1 Pro Preview
GPT-5.4 (xhigh)
OpenAI
GPT-5.5 (medium)
OpenAI
Qwen3.7 Max
Alibaba
编程能力
Artificial Analysis Coding Index,面向代码生成、修复和工程任务。
GPT-5.5 (xhigh)
OpenAI
GPT-5.5 (high)
OpenAI
GPT-5.4 (xhigh)
OpenAI
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
Anthropic
GPT-5.5 (medium)
OpenAI
Gemini 3.1 Pro Preview
GPT-5.3 Codex (xhigh)
OpenAI
Claude Opus 4.7 (Non-reasoning, High Effort)
Anthropic
数学能力
Artificial Analysis Math Index,聚合数学推理和竞赛题表现。
GPT-5.2 (xhigh)
OpenAI
GPT-5 Codex (high)
OpenAI
Gemini 3 Flash Preview (Reasoning)
GPT-5.2 (medium)
OpenAI
DeepSeek V3.2 Speciale
DeepSeek
MiMo-V2-Flash (Reasoning)
Xiaomi
Gemini 3 Pro Preview (high)
GPT-5.1 Codex (high)
OpenAI
专项能力排行
MMLU-Pro
更高难度的多学科知识理解 benchmark。
#1 Gemini 3 Pro Preview (high)
89.8%Google · 可用数据 345 条
GPQA 科学推理
研究生级科学问题,考察专业知识和复杂推理。
#1 Gemini 3.1 Pro Preview
94.1%Google · 可用数据 501 条
Humanity Last Exam
高难知识与推理综合测试。
#1 Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
45.7%Anthropic · 可用数据 497 条
指令遵循
复杂指令遵循能力。
#1 Grok 4.3 (medium)
83.3%xAI · 可用数据 429 条
长上下文推理
长上下文中的检索、理解和推理能力。
#1 GPT-5.2 Codex (xhigh)
75.7%OpenAI · 可用数据 429 条
LiveCodeBench
真实代码题和近期编程题表现。
#1 Gemini 3 Pro Preview (high)
91.7%Google · 可用数据 343 条
SciCode
科学计算代码任务表现。
#1 Gemini 3.1 Pro Preview
58.9%Google · 可用数据 495 条
MATH-500
数学竞赛和推理题集合。
#1 GPT-5 (high)
99.4%OpenAI · 可用数据 201 条
AIME
美国邀请数学考试题表现。
#1 GPT-5 (high)
95.7%OpenAI · 可用数据 194 条
AIME 2025
2025 年 AIME 数学题表现。
#1 GPT-5.2 (xhigh)
99%OpenAI · 可用数据 269 条
终端任务
Terminal-Bench Hard,面向命令行和工程代理任务。
#1 GPT-5.5 (xhigh)
60.6%OpenAI · 可用数据 415 条
工具/Agent 任务
Tau2 工具调用和任务完成表现。
#1 JT-35B-Flash
99.1%China Mobile · 可用数据 421 条
速度、延迟和成本
输出速度
中位输出 token/s,越高越快。
首字延迟
首个 token 中位延迟,越低越快响应。
输入价格
每 100 万输入 token 价格,越低越省。
输出价格
每 100 万输出 token 价格,越低越省。
混合价格
按 3:1 输入输出比例估算的每 100 万 token 成本,越低越省。
完整模型对比
默认按综合能力排序,显示核心分数、体验指标和成本。
| 排名 | 模型 | 厂商 | 综合 | 编程 | 数学 | GPQA | HLE | 速度 | 延迟 | 混合价格 | 发布时间 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| #1 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 61.4 | 56.7 | 暂无 | 92% | 45.7% | 65.8 tok/s | 35.442s | $10.938 | 2026-05-28 |
| #2 | GPT-5.5 (xhigh) | OpenAI | 60.2 | 59.1 | 暂无 | 93.5% | 44.3% | 58.6 tok/s | 70.541s | $11.25 | 2026-04-23 |
| #3 | GPT-5.5 (high) | OpenAI | 58.9 | 58.5 | 暂无 | 93.2% | 43% | 59.5 tok/s | 16.773s | $11.25 | 2026-04-23 |
| #4 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | Anthropic | 57.3 | 52.5 | 暂无 | 91.4% | 39.6% | 59 tok/s | 25.111s | $10.938 | 2026-04-16 |
| #5 | Gemini 3.1 Pro Preview | 57.2 | 55.5 | 暂无 | 94.1% | 44.7% | 131.4 tok/s | 26.995s | $4.5 | 2026-02-19 | |
| #6 | GPT-5.4 (xhigh) | OpenAI | 56.8 | 57.2 | 暂无 | 92% | 41.6% | 83.5 tok/s | 183.009s | $5.625 | 2026-03-05 |
| #7 | GPT-5.5 (medium) | OpenAI | 56.7 | 56.2 | 暂无 | 92.6% | 40.6% | 53.1 tok/s | 5.819s | $11.25 | 2026-04-23 |
| #8 | Qwen3.7 Max | Alibaba | 56.6 | 50.1 | 暂无 | 92.3% | 38.1% | 105.5 tok/s | 1.816s | $3.75 | 2026-05-19 |
| #9 | Gemini 3.5 Flash (high) | 55.3 | 45 | 暂无 | 92.2% | 41% | 224.4 tok/s | 17.621s | $3.375 | 2026-05-19 | |
| #10 | Gemini 3.5 Flash (medium) | 54.8 | 43.9 | 暂无 | 92.1% | 39.9% | 205.9 tok/s | 14.163s | $3.375 | 2026-05-19 | |
| #11 | MiniMax-M3 | MiniMax | 54.7 | 43.4 | 暂无 | 92.9% | 37.1% | 53.2 tok/s | 1.904s | $0.525 | 2026-06-01 |
| #12 | Kimi K2.6 | Kimi | 53.9 | 47.1 | 暂无 | 91.1% | 35.9% | 44 tok/s | 1.27s | $1.712 | 2026-04-20 |
| #13 | MiMo-V2.5-Pro | Xiaomi | 53.8 | 45.5 | 暂无 | 86.6% | 33.8% | 46.1 tok/s | 2.352s | $0.544 | 2026-04-22 |
| #14 | GPT-5.3 Codex (xhigh) | OpenAI | 53.6 | 53.1 | 暂无 | 91.5% | 39.9% | 75.4 tok/s | 64.988s | $4.813 | 2026-02-05 |
| #15 | Qwen3.7 Plus | Alibaba | 53.3 | 46.5 | 暂无 | 90% | 33.4% | 53 tok/s | 1.328s | $0.59 | 2026-06-01 |
| #16 | Grok 4.3 (high) | xAI | 53.2 | 41 | 暂无 | 90.1% | 35% | 195.7 tok/s | 18.379s | $1.563 | 2026-04-30 |
| #17 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 52.9 | 48.1 | 暂无 | 89.6% | 36.7% | 52 tok/s | 13.846s | $10.938 | 2026-02-05 |
| #18 | Muse Spark | Meta | 52.2 | 47.5 | 暂无 | 88.4% | 39.9% | 0 tok/s | 0s | $0 | 2026-04-08 |
| #19 | Claude Opus 4.7 (Non-reasoning, High Effort) | Anthropic | 51.8 | 53.1 | 暂无 | 88.5% | 31.2% | 46.8 tok/s | 0.834s | $10.938 | 2026-04-16 |
| #20 | Qwen3.6 Max Preview | Alibaba | 51.8 | 44.9 | 暂无 | 88.8% | 28.9% | 41.2 tok/s | 1.992s | $2.925 | 2026-04-20 |
| #21 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 51.7 | 50.9 | 暂无 | 87.5% | 30% | 65.8 tok/s | 72.088s | $6.563 | 2026-02-17 |
| #22 | DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 51.5 | 47.5 | 暂无 | 88.8% | 35.9% | 52.6 tok/s | 1.115s | $0.544 | 2026-04-24 |
| #23 | GLM-5.1 (Reasoning) | Z AI | 51.4 | 43.4 | 暂无 | 86.8% | 28% | 61 tok/s | 0.959s | $2.15 | 2026-04-07 |
| #24 | GPT-5.2 (xhigh) | OpenAI | 51.3 | 48.7 | 99 | 90.3% | 35.4% | 73.7 tok/s | 89.529s | $4.813 | 2025-12-11 |
| #25 | GPT-5.5 (low) | OpenAI | 50.8 | 52.1 | 暂无 | 91% | 31% | 54.6 tok/s | 2.002s | $11.25 | 2026-04-23 |
| #26 | Qwen3.6 Plus | Alibaba | 50 | 42.9 | 暂无 | 88.2% | 25.7% | 52.8 tok/s | 1.868s | $1.125 | 2026-04-02 |
| #27 | DeepSeek V4 Pro (Reasoning, High Effort) | DeepSeek | 49.8 | 43.2 | 暂无 | 90.5% | 33.5% | 45.8 tok/s | 1.101s | $0.544 | 2026-04-24 |
| #28 | GLM-5 (Reasoning) | Z AI | 49.8 | 44.2 | 暂无 | 82% | 27.2% | 81.2 tok/s | 0.879s | $1.55 | 2026-02-11 |
| #29 | Claude Opus 4.5 (Reasoning) | Anthropic | 49.7 | 47.8 | 91.3 | 86.6% | 28.4% | 55.8 tok/s | 13.203s | $10.938 | 2025-11-24 |
| #30 | MiniMax-M2.7 | MiniMax | 49.6 | 41.9 | 暂无 | 87.4% | 28.1% | 67.5 tok/s | 2.962s | $0.525 | 2026-03-18 |
| #31 | Grok 4.20 0309 v2 (Reasoning) | xAI | 49.3 | 40.5 | 暂无 | 91.1% | 32.2% | 185.1 tok/s | 18.454s | $3 | 2026-04-07 |
| #32 | MiMo-V2-Pro | Xiaomi | 49.2 | 41.4 | 暂无 | 87% | 28.3% | 45.8 tok/s | 2.488s | $1.5 | 2026-03-18 |
| #33 | MiMo-V2.5 | Xiaomi | 49 | 42.1 | 暂无 | 84.9% | 25.2% | 80.6 tok/s | 2.519s | $0.175 | 2026-04-22 |
| #34 | GPT-5.2 Codex (xhigh) | OpenAI | 49 | 43 | 暂无 | 89.9% | 33.5% | 119.8 tok/s | 3.147s | $4.813 | 2025-12-11 |
| #35 | GPT-5.4 mini (xhigh) | OpenAI | 48.9 | 51.5 | 暂无 | 87.5% | 26.6% | 173.4 tok/s | 3.853s | $1.688 | 2026-03-17 |
| #36 | Grok 4.3 (medium) | xAI | 48.8 | 35.1 | 暂无 | 89% | 28.1% | 165.6 tok/s | 10.496s | $1.563 | 2026-04-30 |
| #37 | Grok 4.20 0309 (Reasoning) | xAI | 48.5 | 42.2 | 暂无 | 88.5% | 30% | 198.4 tok/s | 19.271s | $3 | 2026-03-10 |
| #38 | Gemini 3 Pro Preview (high) | 48.4 | 46.5 | 95.7 | 90.8% | 37.2% | 0 tok/s | 0s | $4.5 | 2025-11-18 | |
| #39 | GPT-5.4 (low) | OpenAI | 47.9 | 45.6 | 暂无 | 87.1% | 28.9% | 69.9 tok/s | 1.553s | $5.625 | 2026-03-05 |
| #40 | Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 47.7 | 37.6 | 暂无 | 86.7% | 26.6% | 214.7 tok/s | 0.668s | $1.1 | 2026-06-04 |
| #41 | GPT-5.1 (high) | OpenAI | 47.7 | 44.7 | 94 | 87.3% | 26.5% | 128.1 tok/s | 29.122s | $3.438 | 2025-11-13 |
| #42 | GLM-5-Turbo | Z AI | 46.8 | 36.8 | 暂无 | 84.7% | 25.4% | 0 tok/s | 0s | $0 | 2026-03-15 |
| #43 | Kimi K2.5 (Reasoning) | Kimi | 46.8 | 39.6 | 暂无 | 87.9% | 29.4% | 36.9 tok/s | 1.265s | $1.185 | 2026-01-27 |
| #44 | GPT-5.2 (medium) | OpenAI | 46.6 | 44.2 | 96.7 | 86.4% | 24.9% | 0 tok/s | 0s | $4.813 | 2025-12-11 |
| #45 | DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 46.5 | 38.7 | 暂无 | 89.4% | 32.1% | 115.7 tok/s | 0.879s | $0.175 | 2026-04-24 |
| #46 | Claude Opus 4.6 (Non-reasoning, High Effort) | Anthropic | 46.5 | 47.6 | 暂无 | 84% | 18.6% | 48.3 tok/s | 1.462s | $10.938 | 2026-02-05 |
| #47 | Gemini 3 Flash Preview (Reasoning) | 46.4 | 42.6 | 97 | 89.8% | 34.7% | 192.4 tok/s | 5.675s | $1.125 | 2025-12-17 | |
| #48 | DeepSeek V4 Flash (Reasoning, High Effort) | DeepSeek | 46 | 39.8 | 暂无 | 86.7% | 27.8% | 0 tok/s | 0s | $0.175 | 2026-04-24 |
| #49 | Qwen3.6 27B (Reasoning) | Alibaba | 45.8 | 36.5 | 暂无 | 84.2% | 21.6% | 63.4 tok/s | 1.539s | $1.35 | 2026-04-22 |
| #50 | Qwen3.5 397B A17B (Reasoning) | Alibaba | 45 | 41.3 | 暂无 | 89.3% | 27.3% | 51.8 tok/s | 1.809s | $1.35 | 2026-02-16 |
| #51 | MiMo-V2-Omni-0327 | Xiaomi | 44.9 | 36.9 | 暂无 | 85.5% | 20.4% | 76.9 tok/s | 2.366s | $0.8 | 2026-03-27 |
| #52 | GPT-5 (high) | OpenAI | 44.6 | 36 | 94.3 | 85.4% | 26.5% | 103.2 tok/s | 87.413s | $3.438 | 2025-08-07 |
| #53 | GPT-5 Codex (high) | OpenAI | 44.6 | 38.9 | 98.7 | 83.7% | 25.6% | 180.8 tok/s | 9.121s | $3.438 | 2025-09-23 |
| #54 | Claude Sonnet 4.6 (Non-reasoning, High Effort) | Anthropic | 44.4 | 46.4 | 暂无 | 79.9% | 13.2% | 50.1 tok/s | 1.151s | $6.563 | 2026-02-17 |
| #55 | GPT-5.4 nano (xhigh) | OpenAI | 44 | 43.9 | 暂无 | 81.7% | 26.5% | 163.7 tok/s | 3.476s | $0.463 | 2026-03-17 |
| #56 | Grok 4.3 (low) | xAI | 43.9 | 31.6 | 暂无 | 84.3% | 17.3% | 164 tok/s | 4.543s | $1.563 | 2026-04-30 |
| #57 | KAT Coder Pro V2 | KwaiKAT | 43.8 | 45.6 | 暂无 | 85.5% | 16% | 118.1 tok/s | 0.937s | $0.525 | 2026-03-27 |
| #58 | GLM-5.1 (Non-reasoning) | Z AI | 43.8 | 35.8 | 暂无 | 83.9% | 25.6% | 64.1 tok/s | 1.02s | $2.15 | 2026-04-07 |
| #59 | Qwen3.6 35B A3B (Reasoning) | Alibaba | 43.5 | 35.2 | 暂无 | 84.1% | 20.2% | 161.1 tok/s | 1.286s | $0.557 | 2026-04-16 |
| #60 | MiMo-V2-Omni | Xiaomi | 43.4 | 35.5 | 暂无 | 82.8% | 19.9% | 80.3 tok/s | 2.189s | $0 | 2026-03-19 |