J JYJ的小站
AI

AI 观察

AI

── 综合能力、编程、数学、知识推理、Agent、速度和价格每日更新 ──

模型数量

532

排行维度

20

雷达维度

10

更新时间

2026/6/6 10:21:18

模型能力雷达图

全体平均固定为背景参考层,同时对比 2 个模型。

核心能力排行

综合、编程、数学三条主线,适合快速判断模型定位。

综合能力

Artificial Analysis Intelligence Index,综合推理、知识、代码和数学表现。

523 条
#1

Claude Opus 4.8 (Adaptive Reasoning, Max Effort)

Anthropic

61.4
#2

GPT-5.5 (xhigh)

OpenAI

60.2
#3

GPT-5.5 (high)

OpenAI

58.9
#4

Claude Opus 4.7 (Adaptive Reasoning, Max Effort)

Anthropic

57.3
#5

Gemini 3.1 Pro Preview

Google

57.2
#6

GPT-5.4 (xhigh)

OpenAI

56.8
#7

GPT-5.5 (medium)

OpenAI

56.7
#8

Qwen3.7 Max

Alibaba

56.6

编程能力

Artificial Analysis Coding Index,面向代码生成、修复和工程任务。

433 条
#1

GPT-5.5 (xhigh)

OpenAI

59.1
#2

GPT-5.5 (high)

OpenAI

58.5
#3

GPT-5.4 (xhigh)

OpenAI

57.2
#4

Claude Opus 4.8 (Adaptive Reasoning, Max Effort)

Anthropic

56.7
#5

GPT-5.5 (medium)

OpenAI

56.2
#6

Gemini 3.1 Pro Preview

Google

55.5
#7

GPT-5.3 Codex (xhigh)

OpenAI

53.1
#8

Claude Opus 4.7 (Non-reasoning, High Effort)

Anthropic

53.1

数学能力

Artificial Analysis Math Index,聚合数学推理和竞赛题表现。

269 条
#1

GPT-5.2 (xhigh)

OpenAI

99
#2

GPT-5 Codex (high)

OpenAI

98.7
#3

Gemini 3 Flash Preview (Reasoning)

Google

97
#4

GPT-5.2 (medium)

OpenAI

96.7
#5

DeepSeek V3.2 Speciale

DeepSeek

96.7
#6

MiMo-V2-Flash (Reasoning)

Xiaomi

96.3
#7

Gemini 3 Pro Preview (high)

Google

95.7
#8

GPT-5.1 Codex (high)

OpenAI

95.7

专项能力排行

MMLU-Pro

更高难度的多学科知识理解 benchmark。

知识与推理

#1 Gemini 3 Pro Preview (high)

89.8%

Google · 可用数据 345 条

GPQA 科学推理

研究生级科学问题,考察专业知识和复杂推理。

知识与推理

#1 Gemini 3.1 Pro Preview

94.1%

Google · 可用数据 501 条

Humanity Last Exam

高难知识与推理综合测试。

知识与推理

#1 Claude Opus 4.8 (Adaptive Reasoning, Max Effort)

45.7%

Anthropic · 可用数据 497 条

指令遵循

复杂指令遵循能力。

可控性

#1 Grok 4.3 (medium)

83.3%

xAI · 可用数据 429 条

长上下文推理

长上下文中的检索、理解和推理能力。

可控性

#1 GPT-5.2 Codex (xhigh)

75.7%

OpenAI · 可用数据 429 条

LiveCodeBench

真实代码题和近期编程题表现。

代码专项

#1 Gemini 3 Pro Preview (high)

91.7%

Google · 可用数据 343 条

SciCode

科学计算代码任务表现。

代码专项

#1 Gemini 3.1 Pro Preview

58.9%

Google · 可用数据 495 条

MATH-500

数学竞赛和推理题集合。

数学专项

#1 GPT-5 (high)

99.4%

OpenAI · 可用数据 201 条

AIME

美国邀请数学考试题表现。

数学专项

#1 GPT-5 (high)

95.7%

OpenAI · 可用数据 194 条

AIME 2025

2025 年 AIME 数学题表现。

数学专项

#1 GPT-5.2 (xhigh)

99%

OpenAI · 可用数据 269 条

终端任务

Terminal-Bench Hard,面向命令行和工程代理任务。

Agent 能力

#1 GPT-5.5 (xhigh)

60.6%

OpenAI · 可用数据 415 条

工具/Agent 任务

Tau2 工具调用和任务完成表现。

Agent 能力

#1 JT-35B-Flash

99.1%

China Mobile · 可用数据 421 条

速度、延迟和成本

输出速度

中位输出 token/s,越高越快。

#1 Mercury 2 1,002.7 tok/s
#2 Granite 4.0 H Small 444.2 tok/s
#3 Step 3.7 Flash 380.1 tok/s
#4 Granite 3.3 8B (Non-reasoning) 373.7 tok/s
#5 gpt-oss-120b (low) 366.6 tok/s

首字延迟

首个 token 中位延迟,越低越快响应。

#1 Command A+ 0.171s
#2 Qwen3.5 2B (Non-reasoning) 0.219s
#3 NVIDIA Nemotron Nano 9B V2 (Reasoning) 0.248s
#4 Qwen3.5 4B (Reasoning) 0.251s
#5 Qwen3.5 4B (Non-reasoning) 0.254s

输入价格

每 100 万输入 token 价格,越低越省。

#1 Qwen3.5 0.8B (Reasoning) $0.01
#2 Qwen3.5 0.8B (Non-reasoning) $0.01
#3 Qwen3.5 2B (Reasoning) $0.02
#4 Qwen3.5 2B (Non-reasoning) $0.02
#5 Gemma 3n E4B Instruct $0.02

输出价格

每 100 万输出 token 价格,越低越省。

#1 Gemma 3n E4B Instruct $0.04
#2 Qwen3.5 0.8B (Reasoning) $0.05
#3 Qwen3.5 0.8B (Non-reasoning) $0.05
#4 Llama 3.2 Instruct 1B $0.05
#5 Gemma 3 4B Instruct $0.08

混合价格

按 3:1 输入输出比例估算的每 100 万 token 成本,越低越省。

#1 Qwen3.5 0.8B (Reasoning) $0.02
#2 Qwen3.5 0.8B (Non-reasoning) $0.02
#3 Gemma 3n E4B Instruct $0.025
#4 Qwen3.5 2B (Reasoning) $0.04
#5 Qwen3.5 2B (Non-reasoning) $0.04

完整模型对比

默认按综合能力排序,显示核心分数、体验指标和成本。

120 个模型
排名 模型 厂商 综合 编程 数学 GPQA HLE 速度 延迟 混合价格 发布时间
#1 Claude Opus 4.8 (Adaptive Reasoning, Max Effort) Anthropic 61.4 56.7 暂无 92% 45.7% 65.8 tok/s 35.442s $10.938 2026-05-28
#2 GPT-5.5 (xhigh) OpenAI 60.2 59.1 暂无 93.5% 44.3% 58.6 tok/s 70.541s $11.25 2026-04-23
#3 GPT-5.5 (high) OpenAI 58.9 58.5 暂无 93.2% 43% 59.5 tok/s 16.773s $11.25 2026-04-23
#4 Claude Opus 4.7 (Adaptive Reasoning, Max Effort) Anthropic 57.3 52.5 暂无 91.4% 39.6% 59 tok/s 25.111s $10.938 2026-04-16
#5 Gemini 3.1 Pro Preview Google 57.2 55.5 暂无 94.1% 44.7% 131.4 tok/s 26.995s $4.5 2026-02-19
#6 GPT-5.4 (xhigh) OpenAI 56.8 57.2 暂无 92% 41.6% 83.5 tok/s 183.009s $5.625 2026-03-05
#7 GPT-5.5 (medium) OpenAI 56.7 56.2 暂无 92.6% 40.6% 53.1 tok/s 5.819s $11.25 2026-04-23
#8 Qwen3.7 Max Alibaba 56.6 50.1 暂无 92.3% 38.1% 105.5 tok/s 1.816s $3.75 2026-05-19
#9 Gemini 3.5 Flash (high) Google 55.3 45 暂无 92.2% 41% 224.4 tok/s 17.621s $3.375 2026-05-19
#10 Gemini 3.5 Flash (medium) Google 54.8 43.9 暂无 92.1% 39.9% 205.9 tok/s 14.163s $3.375 2026-05-19
#11 MiniMax-M3 MiniMax 54.7 43.4 暂无 92.9% 37.1% 53.2 tok/s 1.904s $0.525 2026-06-01
#12 Kimi K2.6 Kimi 53.9 47.1 暂无 91.1% 35.9% 44 tok/s 1.27s $1.712 2026-04-20
#13 MiMo-V2.5-Pro Xiaomi 53.8 45.5 暂无 86.6% 33.8% 46.1 tok/s 2.352s $0.544 2026-04-22
#14 GPT-5.3 Codex (xhigh) OpenAI 53.6 53.1 暂无 91.5% 39.9% 75.4 tok/s 64.988s $4.813 2026-02-05
#15 Qwen3.7 Plus Alibaba 53.3 46.5 暂无 90% 33.4% 53 tok/s 1.328s $0.59 2026-06-01
#16 Grok 4.3 (high) xAI 53.2 41 暂无 90.1% 35% 195.7 tok/s 18.379s $1.563 2026-04-30
#17 Claude Opus 4.6 (Adaptive Reasoning, Max Effort) Anthropic 52.9 48.1 暂无 89.6% 36.7% 52 tok/s 13.846s $10.938 2026-02-05
#18 Muse Spark Meta 52.2 47.5 暂无 88.4% 39.9% 0 tok/s 0s $0 2026-04-08
#19 Claude Opus 4.7 (Non-reasoning, High Effort) Anthropic 51.8 53.1 暂无 88.5% 31.2% 46.8 tok/s 0.834s $10.938 2026-04-16
#20 Qwen3.6 Max Preview Alibaba 51.8 44.9 暂无 88.8% 28.9% 41.2 tok/s 1.992s $2.925 2026-04-20
#21 Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) Anthropic 51.7 50.9 暂无 87.5% 30% 65.8 tok/s 72.088s $6.563 2026-02-17
#22 DeepSeek V4 Pro (Reasoning, Max Effort) DeepSeek 51.5 47.5 暂无 88.8% 35.9% 52.6 tok/s 1.115s $0.544 2026-04-24
#23 GLM-5.1 (Reasoning) Z AI 51.4 43.4 暂无 86.8% 28% 61 tok/s 0.959s $2.15 2026-04-07
#24 GPT-5.2 (xhigh) OpenAI 51.3 48.7 99 90.3% 35.4% 73.7 tok/s 89.529s $4.813 2025-12-11
#25 GPT-5.5 (low) OpenAI 50.8 52.1 暂无 91% 31% 54.6 tok/s 2.002s $11.25 2026-04-23
#26 Qwen3.6 Plus Alibaba 50 42.9 暂无 88.2% 25.7% 52.8 tok/s 1.868s $1.125 2026-04-02
#27 DeepSeek V4 Pro (Reasoning, High Effort) DeepSeek 49.8 43.2 暂无 90.5% 33.5% 45.8 tok/s 1.101s $0.544 2026-04-24
#28 GLM-5 (Reasoning) Z AI 49.8 44.2 暂无 82% 27.2% 81.2 tok/s 0.879s $1.55 2026-02-11
#29 Claude Opus 4.5 (Reasoning) Anthropic 49.7 47.8 91.3 86.6% 28.4% 55.8 tok/s 13.203s $10.938 2025-11-24
#30 MiniMax-M2.7 MiniMax 49.6 41.9 暂无 87.4% 28.1% 67.5 tok/s 2.962s $0.525 2026-03-18
#31 Grok 4.20 0309 v2 (Reasoning) xAI 49.3 40.5 暂无 91.1% 32.2% 185.1 tok/s 18.454s $3 2026-04-07
#32 MiMo-V2-Pro Xiaomi 49.2 41.4 暂无 87% 28.3% 45.8 tok/s 2.488s $1.5 2026-03-18
#33 MiMo-V2.5 Xiaomi 49 42.1 暂无 84.9% 25.2% 80.6 tok/s 2.519s $0.175 2026-04-22
#34 GPT-5.2 Codex (xhigh) OpenAI 49 43 暂无 89.9% 33.5% 119.8 tok/s 3.147s $4.813 2025-12-11
#35 GPT-5.4 mini (xhigh) OpenAI 48.9 51.5 暂无 87.5% 26.6% 173.4 tok/s 3.853s $1.688 2026-03-17
#36 Grok 4.3 (medium) xAI 48.8 35.1 暂无 89% 28.1% 165.6 tok/s 10.496s $1.563 2026-04-30
#37 Grok 4.20 0309 (Reasoning) xAI 48.5 42.2 暂无 88.5% 30% 198.4 tok/s 19.271s $3 2026-03-10
#38 Gemini 3 Pro Preview (high) Google 48.4 46.5 95.7 90.8% 37.2% 0 tok/s 0s $4.5 2025-11-18
#39 GPT-5.4 (low) OpenAI 47.9 45.6 暂无 87.1% 28.9% 69.9 tok/s 1.553s $5.625 2026-03-05
#40 Nemotron 3 Ultra 550B A55B (Reasoning) NVIDIA 47.7 37.6 暂无 86.7% 26.6% 214.7 tok/s 0.668s $1.1 2026-06-04
#41 GPT-5.1 (high) OpenAI 47.7 44.7 94 87.3% 26.5% 128.1 tok/s 29.122s $3.438 2025-11-13
#42 GLM-5-Turbo Z AI 46.8 36.8 暂无 84.7% 25.4% 0 tok/s 0s $0 2026-03-15
#43 Kimi K2.5 (Reasoning) Kimi 46.8 39.6 暂无 87.9% 29.4% 36.9 tok/s 1.265s $1.185 2026-01-27
#44 GPT-5.2 (medium) OpenAI 46.6 44.2 96.7 86.4% 24.9% 0 tok/s 0s $4.813 2025-12-11
#45 DeepSeek V4 Flash (Reasoning, Max Effort) DeepSeek 46.5 38.7 暂无 89.4% 32.1% 115.7 tok/s 0.879s $0.175 2026-04-24
#46 Claude Opus 4.6 (Non-reasoning, High Effort) Anthropic 46.5 47.6 暂无 84% 18.6% 48.3 tok/s 1.462s $10.938 2026-02-05
#47 Gemini 3 Flash Preview (Reasoning) Google 46.4 42.6 97 89.8% 34.7% 192.4 tok/s 5.675s $1.125 2025-12-17
#48 DeepSeek V4 Flash (Reasoning, High Effort) DeepSeek 46 39.8 暂无 86.7% 27.8% 0 tok/s 0s $0.175 2026-04-24
#49 Qwen3.6 27B (Reasoning) Alibaba 45.8 36.5 暂无 84.2% 21.6% 63.4 tok/s 1.539s $1.35 2026-04-22
#50 Qwen3.5 397B A17B (Reasoning) Alibaba 45 41.3 暂无 89.3% 27.3% 51.8 tok/s 1.809s $1.35 2026-02-16
#51 MiMo-V2-Omni-0327 Xiaomi 44.9 36.9 暂无 85.5% 20.4% 76.9 tok/s 2.366s $0.8 2026-03-27
#52 GPT-5 (high) OpenAI 44.6 36 94.3 85.4% 26.5% 103.2 tok/s 87.413s $3.438 2025-08-07
#53 GPT-5 Codex (high) OpenAI 44.6 38.9 98.7 83.7% 25.6% 180.8 tok/s 9.121s $3.438 2025-09-23
#54 Claude Sonnet 4.6 (Non-reasoning, High Effort) Anthropic 44.4 46.4 暂无 79.9% 13.2% 50.1 tok/s 1.151s $6.563 2026-02-17
#55 GPT-5.4 nano (xhigh) OpenAI 44 43.9 暂无 81.7% 26.5% 163.7 tok/s 3.476s $0.463 2026-03-17
#56 Grok 4.3 (low) xAI 43.9 31.6 暂无 84.3% 17.3% 164 tok/s 4.543s $1.563 2026-04-30
#57 KAT Coder Pro V2 KwaiKAT 43.8 45.6 暂无 85.5% 16% 118.1 tok/s 0.937s $0.525 2026-03-27
#58 GLM-5.1 (Non-reasoning) Z AI 43.8 35.8 暂无 83.9% 25.6% 64.1 tok/s 1.02s $2.15 2026-04-07
#59 Qwen3.6 35B A3B (Reasoning) Alibaba 43.5 35.2 暂无 84.1% 20.2% 161.1 tok/s 1.286s $0.557 2026-04-16
#60 MiMo-V2-Omni Xiaomi 43.4 35.5 暂无 82.8% 19.9% 80.3 tok/s 2.189s $0 2026-03-19