AI 大模型排名 ArtificialAnalysis AI 大模型排行榜
本页面排行数据来自 Artificial Analysis ,它对超过 100 个 AI 模型(LLM)的性能进行了比较和排名,评估指标包括智能程度、价格等。另外排行也汇总其他权威 AI 基准测试结果以供参考。
AI 大模型排名(基于 Artificial Analysis)
| 模型信息 | Artificial Analysis测试基准结果 | 其他 AI 测试基准结果 | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 排名 | 模型名称 | 机构 | 综合指数 | Coding | Math | 价格 ($/1M) | MMLU Pro ? | GPQA ? | HLE ? | LiveCodeBench ? | SciCode ? | Math 500 ? | AIME ? |
| 1 | Claude Opus 5 (Adaptive Reasoning, Max Effort) | Anthropic | 63.1 | 78 | - | $10 | - | 0.932 | 0.549 | - | 0.557 | - | - |
| 2 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | 62.5 | 77 | - | $10 | - | 0.937 | 0.544 | - | 0.55 | - | - |
| 3 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 62.1 | 76.5 | - | $20 | - | 0.926 | 0.555 | - | 0.602 | - | - |
| 4 | Claude Opus 5 (Adaptive Reasoning, High Effort) | Anthropic | 61.5 | 76.5 | - | $10 | - | 0.937 | 0.528 | - | 0.543 | - | - |
| 5 | GPT-5.6 Sol (max) | OpenAI | 60.9 | 77.4 | - | $11.25 | - | 0.941 | 0.495 | - | 0.561 | - | - |
| 6 | Grok 4.6 (high) | SpaceXAI | 60.9 | 76.8 | - | $3 | - | 0.949 | 0.429 | - | 0.536 | - | - |
| 7 | Grok 4.6 (xhigh) | SpaceXAI | 60 | 75.9 | - | $3 | - | 0.935 | 0.441 | - | 0.516 | - | - |
| 8 | Kimi K3 (max) | Kimi | 59.7 | 76.2 | - | $6 | - | 0.935 | 0.469 | - | 0.587 | - | - |
| 9 | GLM-5.3 (max) | Z AI | 59.5 | 74.8 | - | $2.15 | - | 0.917 | 0.423 | - | 0.565 | - | - |
| 10 | GPT-5.6 Sol (xhigh) | OpenAI | 59 | 78.3 | - | $11.25 | - | 0.931 | 0.473 | - | 0.56 | - | - |
| 11 | Grok 4.6 (medium) | SpaceXAI | 59 | 74.4 | - | $3 | - | 0.935 | 0.421 | - | 0.546 | - | - |
| 12 | Claude Opus 5 (Adaptive Reasoning, Medium Effort) | Anthropic | 58.6 | 74.3 | - | $10 | - | 0.919 | 0.513 | - | 0.507 | - | - |
| 13 | Qwen3.8 Max | Alibaba | 58.1 | 71.8 | - | $3 | - | 0.927 | 0.43 | - | 0.529 | - | - |
| 14 | Qwen3.8 2.4T A95B | Alibaba | 57.7 | 71.9 | - | $3 | - | 0.935 | 0.424 | - | 0.516 | - | - |
| 15 | GPT-5.6 Sol (high) | OpenAI | 57.3 | 77.2 | - | $11.25 | - | 0.928 | 0.46 | - | 0.569 | - | - |
| 16 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 57.3 | 74.3 | - | $10 | - | 0.92 | 0.487 | - | 0.535 | - | - |
| 17 | Muse Spark 1.2 (xhigh) | Meta | 56.8 | 72.2 | - | $2 | - | 0.904 | 0.455 | - | 0.564 | - | - |
| 18 | GPT-5.6 Terra (max) | OpenAI | 56.6 | 76.7 | - | $4.5 | - | 0.925 | 0.429 | - | 0.539 | - | - |
| 19 | GPT-5.5 (xhigh) | OpenAI | 56.3 | 74.9 | - | $11.25 | - | 0.935 | 0.458 | - | 0.561 | - | - |
| 20 | Gemini 3.7 Flash (high) | 56 | 76.1 | - | $1.5 | - | 0.945 | 0.479 | - | 0.568 | - | - | |
| 21 | Grok 4.5 (high) | SpaceXAI | 55.8 | 72.4 | - | $3 | - | 0.931 | 0.427 | - | 0.541 | - | - |
| 22 | GPT-5.6 Sol (medium) | OpenAI | 55.6 | 76.3 | - | $11.25 | - | 0.926 | 0.422 | - | 0.565 | - | - |
| 23 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | Anthropic | 55.3 | 71.5 | - | $4 | - | 0.911 | 0.413 | - | 0.536 | - | - |
| 24 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | Anthropic | 55 | 73.6 | - | $10 | - | 0.914 | 0.423 | - | 0.545 | - | - |
| 25 | GPT-5.5 (high) | OpenAI | 54.7 | 71.6 | - | $11.25 | - | 0.932 | 0.45 | - | 0.559 | - | - |
| 26 | Gemini 3.7 Flash (medium) | 53.4 | 71.5 | - | $1.5 | - | 0.921 | 0.39 | - | 0.579 | - | - | |
| 27 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | DeepSeek | 53.2 | 68.8 | - | $1.98 | - | 0.928 | 0.41 | - | 0.492 | - | - |
| 28 | Muse Spark 1.1 (xhigh) | Meta | 53.2 | 71.3 | - | $2 | - | 0.898 | 0.462 | - | 0.582 | - | - |
| 29 | GPT-5.4 (xhigh) | OpenAI | 53.1 | 71.1 | - | $5.625 | - | 0.92 | 0.437 | - | 0.566 | - | - |
| 30 | GPT-5.6 Terra (xhigh) | OpenAI | 52.8 | 70.6 | - | $4.5 | - | 0.908 | 0.419 | - | 0.516 | - | - |
| 31 | GLM-5.2 (max) | Z AI | 52.6 | 68.8 | - | $2.15 | - | 0.895 | 0.411 | - | 0.505 | - | - |
| 32 | Claude Opus 5 (Adaptive Reasoning, Low Effort) | Anthropic | 52.5 | 66.9 | - | $10 | - | 0.889 | 0.434 | - | 0.48 | - | - |
| 33 | GPT-5.6 Luna (max) | OpenAI | 52.3 | 71.4 | - | $0.45 | - | 0.911 | 0.395 | - | 0.525 | - | - |
| 34 | Qwen3.8 27B (xhigh) | Alibaba | 52 | 68.1 | - | $1.125 | - | 0.905 | 0.339 | - | 0.447 | - | - |
| 35 | Gemini 3.5 Flash (high) | 52 | 70.1 | - | $3.375 | - | 0.922 | 0.427 | - | 0.531 | - | - | |
| 36 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | DeepSeek | 51.8 | 69.1 | - | $0.66 | - | 0.908 | 0.386 | - | 0.499 | - | - |
| 37 | Grok 4.6 (low) | SpaceXAI | 51.7 | 66.3 | - | $3 | - | 0.879 | 0.276 | - | 0.484 | - | - |
| 38 | Gemini 3.6 Flash (high) | 51.6 | 69.2 | - | $1.5 | - | 0.928 | 0.408 | - | 0.527 | - | - | |
| 39 | GPT-5.5 (medium) | OpenAI | 51.4 | 71.5 | - | $11.25 | - | 0.926 | 0.424 | - | 0.535 | - | - |
| 40 | Gemini 3.7 Flash (low) | 50.9 | 71 | - | $1.5 | - | 0.901 | 0.351 | - | 0.536 | - | - | |
| 41 | GPT-5.6 Sol (low) | OpenAI | 50.7 | 69.7 | - | $11.25 | - | 0.898 | 0.394 | - | 0.554 | - | - |
| 42 | GPT-5.6 Terra (high) | OpenAI | 50.1 | 67.1 | - | $4.5 | - | 0.896 | 0.385 | - | 0.501 | - | - |
| 43 | GPT-5.6 Luna (xhigh) | OpenAI | 50.1 | 68.6 | - | $0.45 | - | 0.895 | 0.37 | - | 0.5 | - | - |
| 44 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 48.4 | 63 | - | $6 | - | 0.875 | 0.336 | - | 0.468 | - | - |
| 45 | Kimi K3 (low) | Kimi | 48.3 | 72 | - | $6 | - | 0.842 | 0.25 | - | 0.512 | - | - |
| 46 | Gemini 3.1 Pro Preview | 47.7 | 68.8 | - | $4.5 | - | 0.941 | 0.47 | - | 0.589 | - | - | |
| 47 | Motif 3 | Motif Technologies | 47.4 | 63.5 | - | $0 | - | 0.834 | 0.37 | - | 0.406 | - | - |
| 48 | GPT-5.6 Luna (high) | OpenAI | 47 | 63.3 | - | $0.45 | - | 0.892 | 0.334 | - | 0.507 | - | - |
| 49 | GPT-5.6 Terra (medium) | OpenAI | 46.8 | 64.7 | - | $4.5 | - | 0.872 | 0.333 | - | 0.497 | - | - |
| 50 | Gemini 3.5 Flash (medium) | 46.7 | - | - | $3.375 | - | 0.921 | 0.413 | - | 0.53 | - | - | |
| 51 | Qwen3.7 Max | Alibaba | 46.7 | 66 | - | $3.75 | - | 0.923 | 0.405 | - | 0.488 | - | - |
| 52 | GPT-5.3 Codex (xhigh) | OpenAI | 45.5 | - | - | $4.813 | - | 0.915 | 0.425 | - | 0.532 | - | - |
| 53 | MiniMax-M3 | MiniMax | 45.4 | 58.6 | - | $0.525 | - | 0.929 | 0.39 | - | 0.454 | - | - |
| 54 | DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 45.3 | 59.4 | - | $0.544 | - | 0.888 | 0.375 | - | 0.5 | - | - |
| 55 | Motif 3 (Beta) | Motif Technologies | 45.3 | 62 | - | $0 | - | 0.869 | 0.404 | - | 0.443 | - | - |
| 56 | Kimi K2.6 | Kimi | 45.1 | 61.8 | - | $1.712 | - | 0.911 | 0.375 | - | 0.535 | - | - |
| 57 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 44.9 | - | - | $10 | - | 0.896 | 0.399 | - | 0.519 | - | - |
| 58 | Qwen3.8 27B (medium) | Alibaba | 44.5 | 56.1 | - | $1.125 | - | 0.845 | 0.141 | - | 0.381 | - | - |
| 59 | GPT-5.5 (low) | OpenAI | 44.5 | 60.9 | - | $11.25 | - | 0.91 | 0.327 | - | 0.516 | - | - |
| 60 | Muse Spark | Meta | 44.3 | 58.6 | - | $0 | - | 0.884 | 0.407 | - | 0.515 | - | - |
| 61 | Claude Opus 4.7 (Non-reasoning, High Effort) | Anthropic | 43.9 | - | - | $10 | - | 0.885 | 0.333 | - | 0.501 | - | - |
| 62 | DeepSeek V4 Pro (Reasoning, High Effort) | DeepSeek | 43.7 | 58.7 | - | $0.544 | - | 0.905 | 0.352 | - | 0.464 | - | - |
| 63 | GPT-5.2 (xhigh) | OpenAI | 43.3 | - | 99 | $4.813 | 0.874 | 0.903 | 0.377 | 0.889 | 0.521 | - | - |
| 64 | Kimi K2.7 Code | Kimi | 43 | 60.8 | - | $1.712 | - | 0.896 | 0.35 | - | 0.475 | - | - |
| 65 | MiMo-V2.5-Pro | Xiaomi | 42.9 | 60.2 | - | $0.544 | - | 0.866 | 0.357 | - | 0.502 | - | - |
| 66 | Qwen3.8 27B (low) | Alibaba | 42.9 | 58.2 | - | $1.125 | - | 0.845 | 0.14 | - | 0.398 | - | - |
| 67 | Claude Sonnet 5 (Non-reasoning, High Effort) | Anthropic | 42.6 | 66.4 | - | $4 | - | 0.8 | 0.19 | - | 0.486 | - | - |
| 68 | Inkling (xhigh) | Thinking Machines | 42.3 | 52.1 | - | $1.762 | - | 0.872 | 0.319 | - | 0.461 | - | - |
| 69 | Hy3 | Tencent | 42.2 | 58.8 | - | $0.241 | - | 0.897 | 0.335 | - | 0.476 | - | - |
| 70 | DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 42.1 | 56.2 | - | $0.168 | - | 0.894 | 0.348 | - | 0.449 | - | - |
| 71 | GPT-5.6 Sol (Non-reasoning) | OpenAI | 41.9 | 65.1 | - | $11.25 | - | 0.79 | 0.167 | - | 0.471 | - | - |
| 72 | Claude Opus 4.5 (Reasoning) | Anthropic | 41.9 | - | 91.3 | $10 | 0.895 | 0.866 | 0.301 | 0.871 | 0.495 | - | - |
| 73 | Nex-N2-Pro | Nex AGI | 41.7 | 59.1 | - | $1 | - | 0.892 | 0.337 | - | 0.418 | - | - |
| 74 | Solar Pro 4 | Upstage | 41.6 | 52.7 | - | $0.525 | - | 0.891 | 0.292 | - | 0.436 | - | - |
| 75 | MiMo-V2-Pro | Xiaomi | 41.4 | - | - | $0 | - | 0.87 | 0.304 | - | 0.425 | - | - |
| 76 | GPT-5.6 Terra (low) | OpenAI | 41.3 | 58.1 | - | $4.5 | - | 0.843 | 0.292 | - | 0.492 | - | - |
| 77 | Inkling Small | Thinking Machines | 41.2 | 52.9 | - | $0.525 | - | 0.895 | 0.333 | - | 0.487 | - | - |
| 78 | GPT-5.2 Codex (xhigh) | OpenAI | 41.2 | - | - | $4.813 | - | 0.899 | 0.357 | - | 0.546 | - | - |
| 79 | Qwen3.6 Max Preview | Alibaba | 41.1 | - | - | $2.925 | - | 0.888 | 0.308 | - | 0.469 | - | - |
| 80 | GLM-5.1 (Reasoning) | Z AI | 41 | 55.8 | - | $2.143 | - | 0.868 | 0.301 | - | 0.438 | - | - |
| 81 | GPT-5.4 mini (xhigh) | OpenAI | 40.9 | 56.1 | - | $1.688 | - | 0.875 | 0.281 | - | 0.499 | - | - |
| 82 | Grok Build 0.1 0616 | SpaceXAI | 40.7 | 51.5 | - | $1.25 | - | 0.895 | 0.383 | - | 0.502 | - | - |
| 83 | Gemini 3 Pro Preview (high) | 40.6 | - | 95.7 | $4.5 | 0.898 | 0.908 | 0.397 | 0.917 | 0.561 | - | - | |
| 84 | GLM-5 (Reasoning) | Z AI | 40.6 | - | - | $1.55 | - | 0.82 | 0.293 | - | 0.462 | - | - |
| 85 | Qwen3.6 Plus | Alibaba | 40.5 | 54.5 | - | $1.125 | - | 0.882 | 0.278 | - | 0.407 | - | - |
| 86 | GPT-5.4 (low) | OpenAI | 40.2 | - | - | $5.625 | - | 0.871 | 0.308 | - | 0.503 | - | - |
| 87 | JT-4.1 Flash 236B A21B | China Mobile | 39.9 | 52.4 | - | $0 | - | 0.845 | 0.178 | - | 0.382 | - | - |
| 88 | Agnes 2.5 Pro Alpha | Sapiens AI | 39.7 | 58.8 | - | $0.563 | - | 0.876 | 0.336 | - | 0.422 | - | - |
| 89 | GPT-5.4 nano (xhigh) | OpenAI | 39.7 | 56.1 | - | $0.463 | - | 0.817 | 0.283 | - | 0.469 | - | - |
| 90 | Qwen3.7 Plus | Alibaba | 39.4 | 55.9 | - | $0.7 | - | 0.9 | 0.356 | - | 0.455 | - | - |
| 91 | GLM-5-Turbo | Z AI | 39.1 | - | - | $0 | - | 0.847 | 0.278 | - | 0.436 | - | - |
| 92 | DeepSeek V4 Flash (Reasoning, High Effort) | DeepSeek | 39 | 52 | - | $0.168 | - | 0.867 | 0.303 | - | 0.42 | - | - |
| 93 | GPT-5.6 Luna (medium) | OpenAI | 38.9 | 50.7 | - | $0.45 | - | 0.859 | 0.258 | - | 0.458 | - | - |
| 94 | GPT-5.2 (medium) | OpenAI | 38.9 | - | 96.7 | $4.813 | 0.859 | 0.864 | 0.267 | 0.894 | 0.462 | - | - |
| 95 | MiniMax-M2.7 | MiniMax | 38.9 | 52.6 | - | $0.525 | - | 0.874 | 0.296 | - | 0.47 | - | - |
| 96 | Claude Opus 4.6 (Non-reasoning, High Effort) | Anthropic | 38.8 | - | - | $10 | - | 0.84 | 0.191 | - | 0.457 | - | - |
| 97 | Gemini 3 Flash Preview (Reasoning) | 38.7 | - | 97 | $1.125 | 0.89 | 0.898 | 0.366 | 0.908 | 0.506 | - | - | |
| 98 | Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 38.3 | 49.3 | - | $1.137 | - | 0.867 | 0.284 | - | 0.399 | - | - |
| 99 | MiMo-V2.5 | Xiaomi | 38 | 56.8 | - | $0.175 | - | 0.849 | 0.272 | - | 0.431 | - | - |
| 100 | Grok 4.20 0309 v2 (Reasoning) | SpaceXAI | 38 | - | - | $1.563 | - | 0.911 | 0.345 | - | 0.456 | - | - |
| 101 | Grok 4.3 (high) | SpaceXAI | 37.9 | 42.2 | - | $1.563 | - | 0.901 | 0.372 | - | 0.473 | - | - |
| 102 | Ling 3.0 Flash | InclusionAI | 37.8 | 50.6 | - | $0.111 | - | 0.855 | 0.237 | - | 0.411 | - | - |
| 103 | Qwen3.6 27B (Reasoning) | Alibaba | 37.7 | 53.7 | - | $1.35 | - | 0.842 | 0.231 | - | 0.398 | - | - |
| 104 | GPT-5.1 (high) | OpenAI | 37.5 | 49.4 | 94 | $3.438 | 0.87 | 0.873 | 0.285 | 0.868 | 0.433 | - | - |
| 105 | Gemini 3.5 Flash-Lite | 37.4 | 49.3 | - | $0.85 | - | 0.838 | 0.188 | - | 0.409 | - | - | |
| 106 | Solar Open2 250B | Upstage | 37.4 | 44.7 | - | $0 | - | 0.857 | 0.285 | - | 0.456 | - | - |
| 107 | Claude 4.5 Sonnet (Reasoning) | Anthropic | 37.4 | 52.1 | 88 | $6 | 0.875 | 0.834 | 0.178 | 0.714 | 0.447 | - | - |
| 108 | Grok 4.20 0309 (Reasoning) | SpaceXAI | 37.4 | - | - | $3 | - | 0.885 | 0.324 | - | 0.447 | - | - |
| 109 | MiMo-V2-Omni-0327 | Xiaomi | 37.3 | - | - | $0 | - | 0.855 | 0.226 | - | 0.395 | - | - |
| 110 | GPT-5 Codex (high) | OpenAI | 37 | - | 98.7 | $3.438 | 0.865 | 0.837 | 0.278 | 0.84 | 0.409 | - | - |
| 111 | Grok 4.3 (medium) | SpaceXAI | 36.9 | - | - | $1.563 | - | 0.89 | 0.3 | - | 0.446 | - | - |
| 112 | Claude Sonnet 4.6 (Non-reasoning, High Effort) | Anthropic | 36.8 | - | - | $6 | - | 0.799 | 0.133 | - | 0.469 | - | - |
| 113 | Grok 4.3 (low) | SpaceXAI | 36.3 | - | - | $1.563 | - | 0.843 | 0.184 | - | 0.419 | - | - |
| 114 | GLM-5.1 (Non-reasoning) | Z AI | 36.3 | - | - | $2.143 | - | 0.839 | 0.279 | - | 0.361 | - | - |
| 115 | Kimi K2.5 (Reasoning) | Kimi | 36 | 46.8 | - | $1.2 | - | 0.879 | 0.307 | - | 0.49 | - | - |
| 116 | MiMo-V2-Omni | Xiaomi | 35.9 | - | - | $0 | - | 0.828 | 0.221 | - | 0.367 | - | - |
| 117 | Gemini 3.5 Flash (minimal) | 35.8 | - | - | $3.375 | - | 0.828 | 0.241 | - | 0.488 | - | - | |
| 118 | GPT-5.5 (Non-reasoning) | OpenAI | 35.8 | 56.5 | - | $11.25 | - | 0.768 | 0.137 | - | 0.473 | - | - |
| 119 | GPT-5.1 Codex (high) | OpenAI | 35.6 | - | 95.7 | $3.438 | 0.86 | 0.86 | 0.257 | 0.849 | 0.402 | - | - |
| 120 | Claude Opus 4.5 (Non-reasoning) | Anthropic | 35.6 | - | 62.7 | $10 | 0.889 | 0.81 | 0.132 | 0.738 | 0.47 | - | - |
| 121 | Kimi K2.6 (Non-reasoning) | Kimi | 35.4 | - | - | $1.712 | - | 0.788 | 0.196 | - | 0.395 | - | - |
| 122 | GPT-5 (high) | OpenAI | 35.3 | 37.8 | 94.3 | $3.438 | 0.871 | 0.854 | 0.285 | 0.846 | 0.429 | 0.994 | 0.95666666666667 |
| 123 | GLM 5V Turbo (Reasoning) | Z AI | 35.3 | - | - | $0 | - | 0.809 | 0.171 | - | 0.435 | - | - |
| 124 | Muse Glimmer (high) | Meta | 35.1 | 49 | - | $0.581 | - | 0.835 | 0.22 | - | 0.436 | - | - |
| 125 | Claude Sonnet 4.6 (Non-reasoning, Low Effort) | Anthropic | 35.1 | - | - | $6 | - | 0.797 | 0.112 | - | 0.441 | - | - |
| 126 | A.X-K2 | SK Telecom | 35 | 38.8 | - | $0 | - | 0.857 | 0.296 | - | 0.385 | - | - |
| 127 | GLM-5.2 (Non-reasoning) | Z AI | 34.8 | 46.5 | - | $2.15 | - | 0.686 | 0.098 | - | 0.361 | - | - |
| 128 | GPT-5.6 Terra (Non-reasoning) | OpenAI | 34.6 | 52.3 | - | $4.5 | - | 0.746 | 0.114 | - | 0.446 | - | - |
| 129 | GPT-5 (medium) | OpenAI | 34.6 | - | 91.7 | $3.438 | 0.867 | 0.842 | 0.254 | 0.703 | 0.411 | 0.99133333333333 | 0.91666666666667 |
| 130 | Qwen3.5 27B (Reasoning) | Alibaba | 34.6 | - | - | $0.825 | - | 0.858 | 0.239 | - | 0.395 | - | - |
| 131 | Claude 4.1 Opus (Reasoning) | Anthropic | 34.5 | - | 80.3 | $30 | 0.88 | 0.809 | 0.125 | 0.654 | 0.409 | - | - |
| 132 | MiniMax-M2.5 | MiniMax | 34.5 | - | - | $0.525 | - | 0.848 | 0.205 | - | 0.426 | - | - |
| 133 | GLM-4.7 (Reasoning) | Z AI | 34.5 | 45.3 | 95 | $1 | 0.856 | 0.859 | 0.274 | 0.894 | 0.451 | - | - |
| 134 | Hy3-preview (Reasoning) | Tencent | 34.4 | - | - | $0.1 | - | 0.867 | 0.278 | - | 0.412 | - | - |
| 135 | Qwen3.5 397B A17B (Reasoning) | Alibaba | 34.3 | 48.2 | - | $1.35 | - | 0.893 | 0.29 | - | 0.42 | - | - |
| 136 | GPT-5.5 Instant (May 2026) | OpenAI | 34.3 | - | - | $11.25 | - | 0.846 | 0.216 | - | 0.503 | - | - |
| 137 | Grok 4 | SpaceXAI | 34.1 | - | 92.7 | $6 | 0.866 | 0.877 | 0.267 | 0.819 | 0.457 | 0.99 | 0.94333333333333 |
| 138 | MiMo-V2-Flash (Feb 2026) | Xiaomi | 34 | - | - | $0 | - | 0.835 | 0.221 | - | 0.383 | - | - |
| 139 | LongCat 2.0 | LongCat | 34 | 45.3 | - | $1.3 | - | 0.78 | 0.337 | - | 0.354 | - | - |
| 140 | G9v3-39A5B | AI9Stars | 34 | 33.1 | - | $0 | - | 0.805 | 0.175 | - | 0.34 | - | - |
| 141 | GPT-5.6 Luna (low) | OpenAI | 33.9 | 44.2 | - | $0.45 | - | 0.835 | 0.198 | - | 0.456 | - | - |
| 142 | Gemini 3 Pro Preview (low) | 33.9 | - | 86.7 | $4.5 | 0.895 | 0.887 | 0.295 | 0.857 | 0.499 | - | - | |
| 143 | KAT Coder Pro V2 | KwaiKAT | 33.7 | 59.5 | - | $0.525 | - | 0.855 | 0.161 | - | 0.383 | - | - |
| 144 | Kimi K2 Thinking | Kimi | 33.5 | - | 94.7 | $1.075 | 0.848 | 0.838 | 0.238 | 0.853 | 0.424 | - | - |
| 145 | o3-pro | OpenAI | 33.3 | - | - | $35 | - | 0.845 | - | - | - | - | - |
| 146 | GLM-5 (Non-reasoning) | Z AI | 33.2 | - | - | $1.55 | - | 0.666 | 0.076 | - | 0.383 | - | - |
| 147 | Qwen3.5 122B A10B (Reasoning) | Alibaba | 32.8 | 45.7 | - | $1.1 | - | 0.857 | 0.252 | - | 0.42 | - | - |
| 148 | DeepSeek V3.2 (Reasoning) | DeepSeek | 32.8 | 44.2 | 92 | $0.315 | 0.862 | 0.84 | 0.246 | 0.862 | 0.389 | - | - |
| 149 | Qwen3.5 397B A17B (Non-reasoning) | Alibaba | 32.7 | - | - | $1.35 | - | 0.861 | 0.198 | - | 0.411 | - | - |
| 150 | Qwen3 Max Thinking | Alibaba | 32.5 | - | - | $0 | - | 0.861 | 0.28 | - | 0.431 | - | - |
| 151 | Qwen3.6 35B A3B (Reasoning) | Alibaba | 32.1 | 41.9 | - | $0.844 | - | 0.841 | 0.222 | - | 0.358 | - | - |
| 152 | MiniMax-M2.1 | MiniMax | 32.1 | - | 82.7 | $0.525 | 0.875 | 0.83 | 0.232 | 0.81 | 0.407 | - | - |
| 153 | DeepSeek V4 Pro (Non-reasoning) | DeepSeek | 31.9 | - | - | $0.544 | - | 0.717 | 0.082 | - | 0.424 | - | - |
| 154 | GPT-5 (low) | OpenAI | 31.9 | - | 83 | $3.438 | 0.86 | 0.808 | 0.196 | 0.763 | 0.391 | 0.98733333333333 | 0.83 |
| 155 | MiMo-V2-Flash (Reasoning) | Xiaomi | 31.9 | - | 96.3 | $0.15 | 0.843 | 0.846 | 0.228 | 0.868 | 0.394 | - | - |
| 156 | Ring-2.6-1T | InclusionAI | 31.7 | 42.8 | - | $0.85 | - | 0.857 | 0.216 | - | 0.424 | - | - |
| 157 | Claude 4 Opus (Reasoning) | Anthropic | 31.7 | - | 73.3 | $30 | 0.873 | 0.796 | 0.123 | 0.636 | 0.398 | 0.982 | 0.75666666666667 |
| 158 | GPT-5 mini (medium) | OpenAI | 31.6 | - | 85 | $0.688 | 0.828 | 0.803 | 0.159 | 0.692 | 0.41 | - | - |
| 159 | DeepSeek V3.1 Terminus (Reasoning) | DeepSeek | 31.4 | 43.5 | 89.7 | $1.914 | 0.851 | 0.792 | 0.164 | 0.798 | 0.406 | - | - |
| 160 | Qwen3.5 Omni Plus | Alibaba | 31.3 | - | - | $1.5 | - | 0.826 | 0.149 | - | 0.405 | - | - |
| 161 | Qwen3.6 27B (Non-reasoning) | Alibaba | 31.3 | 46.6 | - | $1.35 | - | 0.829 | 0.151 | - | 0.373 | - | - |
| 162 | GPT-5.1 Codex mini (high) | OpenAI | 31.3 | - | 91.7 | $0.688 | 0.82 | 0.813 | 0.185 | 0.836 | 0.426 | - | - |
| 163 | Grok 4.1 Fast (Reasoning) | SpaceXAI | 31.3 | - | 89.3 | $0 | 0.854 | 0.853 | 0.193 | 0.822 | 0.442 | - | - |
| 164 | o3 | OpenAI | 31.1 | - | 88.3 | $3.5 | 0.853 | 0.827 | 0.201 | 0.808 | 0.41 | 0.992 | 0.90333333333333 |
| 165 | K-EXAONE 2.0 0803 | LG AI Research | 31 | 40.6 | - | $0 | - | 0.829 | 0.186 | - | 0.41 | - | - |
| 166 | Step 3.7 Flash | StepFun | 30.9 | 39.6 | - | $0.438 | - | 0.809 | 0.214 | - | 0.4 | - | - |
| 167 | GPT-5.4 nano (medium) | OpenAI | 30.8 | - | - | $0.463 | - | 0.761 | 0.159 | - | 0.384 | - | - |
| 168 | GPT-5.4 mini (medium) | OpenAI | 30.5 | - | - | $1.688 | - | 0.823 | 0.186 | - | 0.442 | - | - |
| 169 | Mistral Medium 3.5 | Mistral | 30.4 | 46.9 | - | $3 | - | 0.748 | 0.138 | - | 0.396 | - | - |
| 170 | Kimi K2.5 (Non-reasoning) | Kimi | 30.1 | - | - | $1.2 | - | 0.789 | 0.132 | - | 0.396 | - | - |
| 171 | Qwen3.5 27B (Non-reasoning) | Alibaba | 30 | - | - | $0.825 | - | 0.842 | 0.139 | - | 0.367 | - | - |
| 172 | Claude 4.5 Haiku (Reasoning) | Anthropic | 29.9 | 43.9 | 83.7 | $2 | 0.76 | 0.672 | 0.104 | 0.615 | 0.433 | - | - |
| 173 | Claude 4.5 Sonnet (Non-reasoning) | Anthropic | 29.9 | - | 37 | $6 | 0.86 | 0.727 | 0.072 | 0.59 | 0.428 | - | - |
| 174 | Qwen3.5 35B A3B (Reasoning) | Alibaba | 29.9 | - | - | $0.688 | - | 0.845 | 0.21 | - | 0.377 | - | - |
| 175 | Claude 4 Sonnet (Reasoning) | Anthropic | 29.8 | 37.6 | 74.3 | $6 | 0.842 | 0.777 | 0.107 | 0.655 | 0.4 | 0.99066666666667 | 0.77333333333333 |
| 176 | Gemma 4 31B (Reasoning) | 29.7 | 43.4 | - | $0 | - | 0.857 | 0.236 | - | 0.434 | - | - | |
| 177 | DeepSeek V4 Flash (Non-reasoning) | DeepSeek | 29.3 | - | - | $0.119 | - | 0.716 | 0.078 | - | 0.373 | - | - |
| 178 | GLM-4.6 (Reasoning) | Z AI | 29.3 | 45.8 | 86 | $0.963 | 0.829 | 0.78 | 0.145 | 0.695 | 0.384 | - | - |
| 179 | GPT-5.5 Instant (June 2026) | OpenAI | 29.2 | 39.4 | - | $11.25 | - | 0.823 | 0.199 | - | 0.486 | - | - |
| 180 | JT-35B-Flash | China Mobile | 29 | - | - | $0 | - | 0.829 | 0.064 | - | 0.291 | - | - |
| 181 | MiniMax-M2 | MiniMax | 28.9 | - | 78.3 | $0.525 | 0.82 | 0.777 | 0.137 | 0.826 | 0.361 | - | - |
| 182 | KAT-Coder-Pro V1 | KwaiKAT | 28.9 | - | 94.7 | $0 | 0.813 | 0.764 | 0.336 | 0.747 | 0.366 | - | - |
| 183 | Claude 4.1 Opus (Non-reasoning) | Anthropic | 28.8 | - | - | $30 | - | - | - | - | - | - | - |
| 184 | MiMo-V2.5-Pro (Non-reasoning) | Xiaomi | 28.4 | - | - | $0.544 | - | 0.762 | 0.148 | - | 0.391 | - | - |
| 185 | GPT-5.4 (Non-reasoning) | OpenAI | 28.3 | - | - | $5.625 | - | 0.748 | 0.113 | - | 0.471 | - | - |
| 186 | Qwen3.5 122B A10B (Non-reasoning) | Alibaba | 28.2 | 43.3 | - | $1.1 | - | 0.827 | 0.159 | - | 0.356 | - | - |
| 187 | Gemini 3 Flash Preview (Non-reasoning) | 27.9 | - | 55.7 | $1.125 | 0.882 | 0.812 | 0.15 | 0.797 | 0.499 | - | - | |
| 188 | Grok 4 Fast (Reasoning) | SpaceXAI | 27.9 | - | 89.7 | $0.275 | 0.85 | 0.847 | 0.191 | 0.832 | 0.442 | - | - |
| 189 | Claude 3.7 Sonnet (Reasoning) | Anthropic | 27.6 | 36.4 | 56.3 | $0 | 0.837 | 0.772 | 0.097 | 0.473 | 0.403 | 0.94666666666667 | 0.48666666666667 |
| 190 | GLM-4.7 (Non-reasoning) | Z AI | 27.1 | - | 48 | $1 | 0.794 | 0.664 | 0.064 | 0.562 | 0.354 | - | - |
| 191 | GPT-5.6 Luna (Non-reasoning) | OpenAI | 26.8 | 39.3 | - | $0.45 | - | 0.645 | 0.072 | - | 0.399 | - | - |
| 192 | Hy3-preview (Non-reasoning) | Tencent | 26.6 | - | - | $0.1 | - | 0.732 | 0.07 | - | 0.394 | - | - |
| 193 | Ling-2.6-1T | InclusionAI | 26.6 | - | - | $0.85 | - | 0.752 | 0.087 | - | 0.37 | - | - |
| 194 | Doubao Seed Code | ByteDance Seed | 26.5 | - | 79.3 | $0 | 0.854 | 0.764 | 0.141 | 0.766 | 0.407 | - | - |
| 195 | GPT-5.2 (Non-reasoning) | OpenAI | 26.5 | - | 51 | $4.813 | 0.814 | 0.712 | 0.08 | 0.669 | 0.404 | - | - |
| 196 | Step 3.5 Flash 2603 | StepFun | 26.5 | - | - | $0.15 | - | 0.826 | 0.245 | - | 0.385 | - | - |
| 197 | Gemma 4 26B A4B (Reasoning) | 26.1 | 39.3 | - | $0.179 | - | 0.792 | 0.193 | - | 0.4 | - | - | |
| 198 | o4-mini (high) | OpenAI | 26.1 | - | 90.7 | $1.925 | 0.832 | 0.784 | 0.165 | 0.859 | 0.465 | 0.98866666666667 | 0.94 |
| 199 | Claude 4 Opus (Non-reasoning) | Anthropic | 26 | - | 36.3 | $30 | 0.86 | 0.701 | 0.062 | 0.542 | 0.409 | 0.94066666666667 | 0.56333333333333 |
| 200 | Claude 4 Sonnet (Non-reasoning) | Anthropic | 26 | - | 38 | $6 | 0.837 | 0.683 | 0.043 | 0.449 | 0.373 | 0.934 | 0.40666666666667 |
| 201 | Step 3.5 Flash | StepFun | 26 | - | - | $0.15 | - | 0.831 | 0.211 | - | 0.404 | - | - |
| 202 | Gemini 2.5 Pro | 25.9 | 33.3 | 87.7 | $3.438 | 0.862 | 0.844 | 0.225 | 0.801 | 0.428 | 0.96733333333333 | 0.88666666666667 | |
| 203 | DeepSeek V3.2 Exp (Reasoning) | DeepSeek | 25.9 | - | 87.7 | $0.315 | 0.85 | 0.797 | 0.149 | 0.789 | 0.377 | - | - |
| 204 | GPT-5 mini (high) | OpenAI | 25.8 | 15.6 | 90.7 | $0.688 | 0.837 | 0.828 | 0.215 | 0.838 | 0.392 | - | - |
| 205 | Nemotron 3 Super 120B A12B (Reasoning) | NVIDIA | 25.7 | 37.7 | - | $0.35 | - | 0.8 | 0.208 | - | 0.36 | - | - |
| 206 | Gemini 3.1 Flash-Lite | 25.6 | 34.7 | - | $0.563 | - | 0.822 | 0.172 | - | 0.419 | - | - | |
| 207 | Qwen3 Max Thinking (Preview) | Alibaba | 25.5 | - | 82.3 | $2.4 | 0.824 | 0.776 | 0.127 | 0.535 | 0.387 | - | - |
| 208 | MiMo-V2-Flash (Non-reasoning) | Xiaomi | 25.1 | 49.8 | 67.7 | $0 | 0.744 | 0.656 | 0.086 | 0.402 | 0.259 | - | - |
| 209 | DeepSeek V3.2 (Non-reasoning) | DeepSeek | 25.1 | - | 59 | $0.315 | 0.837 | 0.751 | 0.112 | 0.593 | 0.387 | - | - |
| 210 | Grok 4.3 (Non-reasoning) | SpaceXAI | 25 | 35.2 | - | $1.563 | - | 0.658 | 0.068 | - | 0.374 | - | - |
| 211 | Qwen3.6 35B A3B (Non-reasoning) | Alibaba | 24.6 | 28.1 | - | $0.844 | - | 0.817 | 0.139 | - | 0.013 | - | - |
| 212 | Ling 3.0 Tiny | InclusionAI | 24.5 | 26.5 | - | $0 | - | 0.734 | 0.093 | - | 0.242 | - | - |
| 213 | Qwen3 Max | Alibaba | 24.5 | - | 80.7 | $2.4 | 0.841 | 0.764 | 0.119 | 0.767 | 0.383 | - | - |
| 214 | Qwen3.5 35B A3B (Non-reasoning) | Alibaba | 24.3 | 37 | - | $0.688 | - | 0.819 | 0.134 | - | 0.293 | - | - |
| 215 | Gemini 2.5 Flash Preview (Sep '25) (Reasoning) | 24.2 | - | 78.3 | $0 | 0.842 | 0.793 | 0.138 | 0.713 | 0.405 | - | - | |
| 216 | gpt-oss-120b (high) | OpenAI | 24.1 | 30.4 | 93.4 | $0.262 | 0.808 | 0.782 | 0.196 | 0.878 | 0.389 | - | - |
| 217 | Claude 4.5 Haiku (Non-reasoning) | Anthropic | 24.1 | - | 39 | $2 | 0.8 | 0.646 | 0.042 | 0.511 | 0.344 | - | - |
| 218 | Kimi K2 0905 | Kimi | 24 | - | 57.3 | $1.075 | 0.819 | 0.767 | 0.064 | 0.61 | 0.307 | - | - |
| 219 | o1 | OpenAI | 23.9 | 39.7 | - | $26.25 | 0.841 | 0.747 | 0.07 | 0.679 | 0.358 | 0.97 | 0.72333333333333 |
| 220 | Claude 3.7 Sonnet (Non-reasoning) | Anthropic | 23.9 | - | 21 | $6 | 0.803 | 0.656 | 0.042 | 0.394 | 0.376 | 0.85 | 0.22333333333333 |
| 221 | Nemotron 3.5 Lightning | NVIDIA | 23.6 | 26.8 | - | $0.108 | - | 0.743 | 0.106 | - | 0.316 | - | - |
| 222 | Gemini 2.5 Pro Preview (Mar' 25) | 23.4 | 46.7 | - | $0 | 0.858 | 0.836 | 0.18 | 0.778 | 0.395 | 0.98 | 0.87 | |
| 223 | GLM-4.6 (Non-reasoning) | Z AI | 23.4 | - | 44.3 | $0.981 | 0.784 | 0.632 | 0.055 | 0.561 | 0.331 | - | - |
| 224 | GLM-4.7-Flash (Reasoning) | Z AI | 23.3 | - | - | $0.153 | - | 0.581 | 0.076 | - | 0.337 | - | - |
| 225 | Grok 4.20 0309 (Non-reasoning) | SpaceXAI | 22.9 | - | - | $3 | - | 0.785 | 0.245 | - | 0.322 | - | - |
| 226 | Grok 3 mini Reasoning (high) | SpaceXAI | 22.9 | - | 84.7 | $0.35 | 0.828 | 0.791 | 0.11 | 0.696 | 0.406 | 0.992 | 0.93333333333333 |
| 227 | Command A+ | Cohere | 22.8 | 27.8 | - | $0 | - | 0.761 | 0.12 | - | 0.378 | - | - |
| 228 | Gemini 2.5 Pro Preview (May' 25) | 22.7 | - | - | $3.438 | 0.837 | 0.822 | 0.199 | 0.77 | 0.416 | 0.986 | 0.84333333333333 | |
| 229 | DeepSeek V3.2 Speciale | DeepSeek | 22.6 | - | 96.7 | $0 | 0.863 | 0.871 | 0.287 | 0.896 | 0.44 | - | - |
| 230 | K-EXAONE (Reasoning) | LG AI Research | 22.5 | 32.1 | 90.3 | $0 | 0.838 | 0.783 | 0.139 | 0.768 | 0.356 | - | - |
| 231 | Gemma 4 31B (Non-reasoning) | 22.3 | 33.2 | - | $0.212 | - | 0.763 | 0.118 | - | 0.411 | - | - | |
| 232 | ERNIE 5.0 Thinking Preview | Baidu | 22.3 | - | 85 | $0 | 0.83 | 0.777 | 0.133 | 0.812 | 0.375 | - | - |
| 233 | Gemma 4 12B (Reasoning) | 22.2 | 31 | - | $0.15 | - | 0.753 | 0.157 | - | 0.382 | - | - | |
| 234 | Grok 4.20 0309 v2 (Non-reasoning) | SpaceXAI | 22.2 | - | - | $1.563 | - | 0.776 | 0.279 | - | 0.328 | - | - |
| 235 | Nova 2.0 Pro Preview (medium) | Amazon | 22.1 | 34 | 89 | $3.438 | 0.83 | 0.785 | 0.094 | 0.73 | 0.427 | - | - |
| 236 | Grok Code Fast 1 | SpaceXAI | 22 | - | 43.3 | $0 | 0.793 | 0.727 | 0.08 | 0.657 | 0.362 | - | - |
| 237 | Mercury 2 | Inception | 21.9 | 31.1 | - | $0.375 | - | 0.77 | 0.171 | - | 0.387 | - | - |
| 238 | Qwen3.5 9B (Reasoning) | Alibaba | 21.8 | 28.7 | - | $0.151 | - | 0.806 | 0.149 | - | 0.275 | - | - |
| 239 | DeepSeek V3.2 Exp (Non-reasoning) | DeepSeek | 21.7 | - | 57.7 | $0.315 | 0.836 | 0.738 | 0.09 | 0.554 | 0.399 | - | - |
| 240 | DeepSeek V3.1 Terminus (Non-reasoning) | DeepSeek | 21.7 | - | 53.7 | $0.453 | 0.836 | 0.751 | 0.087 | 0.529 | 0.321 | - | - |
| 241 | Apriel-v1.5-15B-Thinker | ServiceNow | 21.6 | - | 87.5 | $0 | 0.773 | 0.713 | 0.121 | 0.728 | 0.348 | - | - |
| 242 | DeepSeek V3.1 (Non-reasoning) | DeepSeek | 21.4 | - | 49.7 | $0.84 | 0.833 | 0.735 | 0.067 | 0.577 | 0.367 | - | - |
| 243 | Nova 2.0 Omni (medium) | Amazon | 21.3 | - | 89.7 | $0.85 | 0.809 | 0.76 | 0.07 | 0.66 | 0.362 | - | - |
| 244 | Qwen3 Coder Next | Alibaba | 21.3 | 36.2 | - | $0.563 | - | 0.737 | 0.101 | - | 0.323 | - | - |
| 245 | DeepSeek V3.1 (Reasoning) | DeepSeek | 21 | - | 89.7 | $0.865 | 0.851 | 0.779 | 0.143 | 0.784 | 0.391 | - | - |
| 246 | Qwen3 VL 235B A22B (Reasoning) | Alibaba | 20.9 | - | 88.3 | $1.3 | 0.836 | 0.772 | 0.119 | 0.646 | 0.399 | - | - |
| 247 | Nova 2.0 Lite (high) | Amazon | 20.8 | 23 | 94.3 | $0.85 | 0.818 | 0.811 | 0.116 | 0.711 | 0.369 | - | - |
| 248 | Apriel-v1.6-15B-Thinker | ServiceNow | 20.8 | - | 88 | $0 | 0.79 | 0.733 | 0.108 | 0.807 | 0.373 | - | - |
| 249 | GPT-5.1 (Non-reasoning) | OpenAI | 20.7 | - | 38 | $3.438 | 0.801 | 0.643 | 0.053 | 0.494 | 0.365 | - | - |
| 250 | Qwen3.5 9B (Non-reasoning) | Alibaba | 20.6 | 23.5 | - | $0.19 | - | 0.786 | 0.094 | - | 0.277 | - | - |
| 251 | EXAONE 4.5 33B | LG AI Research | 20.5 | 23.6 | - | $0 | - | 0.794 | 0.129 | - | 0.28 | - | - |
| 252 | Gemma 4 26B A4B (Non-reasoning) | 20.4 | - | - | $0.198 | - | 0.714 | 0.115 | - | 0.373 | - | - | |
| 253 | Qwen3.5 4B (Reasoning) | Alibaba | 20.4 | 22.6 | - | $0.06 | - | 0.771 | 0.099 | - | 0.161 | - | - |
| 254 | DeepSeek R1 0528 (May '25) | DeepSeek | 20.4 | - | 76 | $1.763 | 0.849 | 0.813 | 0.158 | 0.77 | 0.403 | 0.98266666666667 | 0.89333333333333 |
| 255 | Gemini 2.5 Flash (Reasoning) | 20.3 | - | 73.3 | $0.85 | 0.832 | 0.79 | 0.121 | 0.695 | 0.394 | 0.98133333333333 | 0.82333333333333 | |
| 256 | North Mini Code | Cohere | 20.2 | 36.5 | - | $0 | - | 0.757 | 0.111 | - | 0.382 | - | - |
| 257 | GPT-5 nano (high) | OpenAI | 20.1 | - | 83.7 | $0.138 | 0.78 | 0.676 | 0.095 | 0.789 | 0.366 | - | - |
| 258 | Qwen3 235B A22B 2507 (Reasoning) | Alibaba | 19.9 | 22.1 | 91 | $0.747 | 0.843 | 0.79 | 0.159 | 0.788 | 0.424 | 0.984 | 0.94 |
| 259 | Nova 2.0 Pro Preview (low) | Amazon | 19.8 | 25.9 | 63.3 | $3.438 | 0.822 | 0.751 | 0.052 | 0.638 | 0.387 | - | - |
| 260 | Mistral Small 4 (Reasoning) | Mistral | 19.7 | 26.6 | - | $0.262 | - | 0.769 | 0.099 | - | 0.38 | - | - |
| 261 | Kimi K2 | Kimi | 19.7 | - | 57 | $1.002 | 0.824 | 0.766 | 0.074 | 0.556 | 0.345 | 0.97133333333333 | 0.69333333333333 |
| 262 | GLM-4.5 (Reasoning) | Z AI | 19.7 | - | 73.7 | $0 | 0.835 | 0.782 | 0.13 | 0.738 | 0.348 | 0.97866666666667 | 0.87333333333333 |
| 263 | GPT-4.1 | OpenAI | 19.6 | - | 34.7 | $3.5 | 0.806 | 0.666 | 0.042 | 0.457 | 0.381 | 0.91266666666667 | 0.43666666666667 |
| 264 | Qwen3 Max (Preview) | Alibaba | 19.4 | - | 75 | $2.4 | 0.838 | 0.764 | 0.101 | 0.651 | 0.37 | - | - |
| 265 | Devstral 2 | Mistral | 19.2 | 31.3 | 36.7 | $0 | 0.762 | 0.594 | 0.036 | 0.448 | 0.331 | - | - |
| 266 | Nova 2.0 Lite (medium) | Amazon | 19.2 | - | 88.7 | $0.85 | 0.813 | 0.768 | 0.09 | 0.663 | 0.368 | - | - |
| 267 | Qwen3.5 Omni Flash | Alibaba | 19.2 | - | - | $0.275 | - | 0.742 | 0.076 | - | 0.255 | - | - |
| 268 | o3-mini | OpenAI | 19.2 | - | - | $1.925 | 0.791 | 0.748 | 0.079 | 0.717 | 0.399 | 0.97333333333333 | 0.77 |
| 269 | GPT-5 nano (medium) | OpenAI | 19.2 | - | 78.3 | $0.138 | 0.772 | 0.67 | 0.087 | 0.763 | 0.338 | - | - |
| 270 | o1-pro | OpenAI | 19.1 | - | - | $262.5 | - | - | - | - | - | - | - |
| 271 | Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning) | 19.1 | - | 56.7 | $0 | 0.836 | 0.766 | 0.087 | 0.625 | 0.375 | - | - | |
| 272 | JT-MINI | China Mobile | 18.8 | - | - | $0 | - | 0.676 | 0.064 | - | 0.272 | - | - |
| 273 | Trinity Large Thinking | Arcee AI | 18.7 | 25.8 | - | $0.395 | - | 0.752 | 0.158 | - | 0.361 | - | - |
| 274 | DeepSeek R1 (Jan '25) | DeepSeek | 18.6 | 24.6 | 68 | $2.5 | 0.844 | 0.708 | 0.085 | 0.617 | 0.357 | 0.966 | 0.68333333333333 |
| 275 | Grok 3 | SpaceXAI | 18.6 | - | 58 | $8 | 0.799 | 0.693 | 0.041 | 0.425 | 0.368 | 0.87 | 0.33 |
| 276 | Seed-OSS-36B-Instruct | ByteDance Seed | 18.5 | - | 84.7 | $0.3 | 0.815 | 0.726 | 0.099 | 0.765 | 0.365 | - | - |
| 277 | Qwen3 235B A22B 2507 Instruct | Alibaba | 18.4 | - | 71.7 | $0.403 | 0.828 | 0.753 | 0.111 | 0.524 | 0.36 | 0.98 | 0.71666666666667 |
| 278 | HyperNova 60B 2605 | Multiverse Computing | 18.3 | 23.2 | - | $0 | - | 0.733 | 0.166 | - | 0.33 | - | - |
| 279 | Qwen3 Coder 480B A35B Instruct | Alibaba | 18.2 | - | 39.3 | $3 | 0.788 | 0.618 | 0.045 | 0.585 | 0.359 | 0.942 | 0.47666666666667 |
| 280 | Qwen3 VL 32B (Reasoning) | Alibaba | 18.1 | - | 84.7 | $0.28 | 0.818 | 0.733 | 0.101 | 0.738 | 0.285 | - | - |
| 281 | Magistral Medium 1.2 | Mistral | 18 | 21.3 | 82 | $0 | 0.815 | 0.739 | 0.103 | 0.75 | 0.392 | - | - |
| 282 | Nova 2.0 Lite (low) | Amazon | 18 | - | 46.7 | $0.85 | 0.788 | 0.698 | 0.04 | 0.469 | 0.333 | - | - |
| 283 | Sonar Reasoning Pro | Perplexity | 18 | - | - | $0 | - | - | - | - | - | 0.95733333333333 | 0.79 |
| 284 | MiniMax M1 80k | MiniMax | 17.9 | - | 61 | $0.963 | 0.816 | 0.697 | 0.089 | 0.711 | 0.374 | 0.98 | 0.84666666666667 |
| 285 | Nemotron Cascade 2 30B A3B | NVIDIA | 17.8 | 25.3 | - | $0 | - | 0.758 | 0.12 | - | 0.348 | - | - |
| 286 | GPT-5.4 nano (Non-Reasoning) | OpenAI | 17.8 | - | - | $0.463 | - | 0.558 | 0.041 | - | 0.352 | - | - |
| 287 | Devstral Small 2 | Mistral | 17.7 | 29.3 | 34.3 | $0 | 0.678 | 0.532 | 0.035 | 0.348 | 0.288 | - | - |
| 288 | Gemini 2.5 Flash Preview (Reasoning) | 17.7 | - | - | $0 | 0.8 | 0.698 | 0.121 | 0.505 | 0.359 | 0.98066666666667 | 0.84333333333333 | |
| 289 | K2 Think V2 | MBZUAI Institute of Foundation Models | 17.4 | 21 | - | $0 | - | 0.713 | 0.101 | - | 0.33 | - | - |
| 290 | LongCat Flash Lite | LongCat | 17.4 | - | - | $0 | - | 0.636 | 0.058 | - | 0.284 | - | - |
| 291 | GPT-5 (minimal) | OpenAI | 17.3 | - | 31.7 | $3.438 | 0.806 | 0.673 | 0.06 | 0.558 | 0.388 | 0.86133333333333 | 0.36666666666667 |
| 292 | HyperCLOVA X SEED Think (32B) | Naver | 17.2 | - | 59 | $0 | 0.785 | 0.615 | 0.055 | 0.629 | 0.284 | - | - |
| 293 | o1-preview | OpenAI | 17.2 | 34 | 79.7 | $28.875 | 0.848 | 0.765 | - | - | - | 0.924 | - |
| 294 | Grok 4.1 Fast (Non-reasoning) | SpaceXAI | 17 | - | 34.3 | $0 | 0.743 | 0.637 | 0.051 | 0.399 | 0.296 | - | - |
| 295 | K-EXAONE (Non-reasoning) | LG AI Research | 16.9 | - | 44 | $0 | 0.81 | 0.695 | 0.057 | - | 0.27 | - | - |
| 296 | Qwen3 Next 80B A3B (Reasoning) | Alibaba | 16.9 | 17.4 | 84.3 | $0.412 | 0.824 | 0.759 | 0.126 | 0.784 | 0.388 | - | - |
| 297 | GLM-4.6V (Reasoning) | Z AI | 16.9 | - | 85.3 | $0.45 | 0.799 | 0.719 | 0.096 | 0.16 | 0.304 | - | - |
| 298 | GPT-5.4 mini (Non-Reasoning) | OpenAI | 16.8 | - | - | $1.688 | - | 0.606 | 0.059 | - | 0.396 | - | - |
| 299 | Nova 2.0 Omni (low) | Amazon | 16.7 | - | 56 | $0.85 | 0.798 | 0.699 | - | 0.592 | 0.343 | - | - |
| 300 | GLM-4.5-Air | Z AI | 16.7 | - | 80.7 | $0.372 | 0.815 | 0.733 | 0.07 | 0.684 | 0.306 | 0.96533333333333 | 0.67333333333333 |
| 301 | Mi:dm K 2.5 Pro | Korea Telecom | 16.6 | - | 76.7 | $0 | 0.809 | 0.701 | 0.081 | 0.656 | 0.332 | - | - |
| 302 | Grok 4 Fast (Non-reasoning) | SpaceXAI | 16.6 | - | 41.3 | $0.275 | 0.73 | 0.606 | 0.045 | 0.401 | 0.329 | - | - |
| 303 | Ring-1T | InclusionAI | 16.3 | - | 89.3 | $0 | 0.806 | 0.774 | 0.111 | 0.643 | 0.367 | - | - |
| 304 | G9v3-3B | AI9Stars | 16.2 | 9.9 | - | $0 | - | 0.438 | 0.045 | - | 0.177 | - | - |
| 305 | Qwen3.5 4B (Non-reasoning) | Alibaba | 16.1 | 20.3 | - | $0.06 | - | 0.712 | 0.08 | - | 0.183 | - | - |
| 306 | Mistral Large 3 | Mistral | 15.9 | 20.1 | 38 | $0.75 | 0.807 | 0.68 | 0.042 | 0.465 | 0.362 | - | - |
| 307 | INTELLECT-3 | Prime Intellect | 15.7 | - | 88 | $0 | 0.822 | 0.761 | 0.131 | 0.777 | 0.391 | - | - |
| 308 | o3-mini (high) | OpenAI | 15.7 | 16.3 | - | $1.925 | 0.802 | 0.773 | 0.12 | 0.734 | 0.398 | 0.98466666666667 | 0.86 |
| 309 | GLM-4.7-Flash (Non-reasoning) | Z AI | 15.6 | - | - | $0.153 | - | 0.452 | 0.05 | - | 0.255 | - | - |
| 310 | GPT-5 (ChatGPT) | OpenAI | 15.4 | - | 48.3 | $0 | 0.82 | 0.686 | 0.066 | 0.543 | 0.378 | - | - |
| 311 | gpt-oss-20b (high) | OpenAI | 15.2 | 20.7 | 89.3 | $0.092 | 0.748 | 0.688 | 0.11 | 0.777 | 0.344 | - | - |
| 312 | Solar Open 100B (Reasoning) | Upstage | 15.2 | - | - | $0 | - | 0.657 | 0.104 | - | 0.269 | - | - |
| 313 | Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning) | 15.2 | - | 68.7 | $0.175 | 0.808 | 0.709 | 0.07 | 0.688 | 0.287 | - | - | |
| 314 | DeepSeek V3 0324 | DeepSeek | 15.2 | 21.2 | 41 | $0.483 | 0.819 | 0.655 | 0.047 | 0.405 | 0.358 | 0.942 | 0.52 |
| 315 | Grok 3 Reasoning Beta | SpaceXAI | 15.2 | - | - | $0 | - | - | - | - | - | - | - |
| 316 | Nemotron 3 Nano Omni 30B A3B Reasoning | NVIDIA | 15 | 13.8 | - | $0.131 | - | 0.469 | 0.048 | - | 0.278 | - | - |
| 317 | gpt-oss-120b (low) | OpenAI | 14.9 | 21.2 | 66.7 | $0.261 | 0.775 | 0.672 | 0.059 | 0.707 | 0.36 | - | - |
| 318 | Mistral Small 3.1 | Mistral | 14.9 | 26.3 | 3.7 | $0.15 | 0.659 | 0.454 | 0.043 | 0.212 | 0.265 | 0.70666666666667 | 0.093333333333333 |
| 319 | GPT-4.1 mini | OpenAI | 14.8 | 20.2 | 46.3 | $0.7 | 0.781 | 0.664 | 0.05 | 0.483 | 0.404 | 0.92533333333333 | 0.43 |
| 320 | Mistral Medium 3.1 | Mistral | 14.7 | 20.5 | 38.3 | $0.8 | 0.683 | 0.588 | 0.047 | 0.406 | 0.338 | - | - |
| 321 | Qwen3 30B A3B 2507 (Reasoning) | Alibaba | 14.6 | 12.1 | 56.3 | $0.75 | 0.805 | 0.707 | 0.103 | 0.707 | 0.333 | 0.976 | 0.90666666666667 |
| 322 | Llama 4 Maverick | Meta | 14.5 | 16.3 | 19.3 | $0.422 | 0.809 | 0.671 | 0.049 | 0.397 | 0.331 | 0.88866666666667 | 0.39 |
| 323 | Solar Pro 3 | Upstage | 14.5 | 16.2 | - | $0.262 | - | 0.724 | 0.103 | - | 0.247 | - | - |
| 324 | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | NVIDIA | 14.5 | 14.4 | 91 | $0.088 | 0.794 | 0.757 | 0.114 | 0.741 | 0.296 | - | - |
| 325 | MiniMax M1 40k | MiniMax | 14.5 | - | 13.7 | $0 | 0.808 | 0.682 | 0.078 | 0.657 | 0.378 | 0.972 | 0.81333333333333 |
| 326 | gpt-oss-20b (low) | OpenAI | 14.4 | - | 62.3 | $0.103 | 0.718 | 0.611 | 0.053 | 0.652 | 0.34 | - | - |
| 327 | Nova 2.0 Pro Preview (Non-reasoning) | Amazon | 14.4 | 20.9 | 30.7 | $3.438 | 0.772 | 0.636 | 0.039 | 0.473 | 0.281 | - | - |
| 328 | Qwen3 VL 235B A22B Instruct | Alibaba | 14.4 | - | 70.7 | $0.7 | 0.823 | 0.712 | 0.066 | 0.594 | 0.359 | - | - |
| 329 | GPT-5 mini (minimal) | OpenAI | 14.3 | - | 46.7 | $0.688 | 0.775 | 0.687 | 0.051 | 0.545 | 0.369 | - | - |
| 330 | K2-V2 (high) | MBZUAI Institute of Foundation Models | 14.2 | - | 78.3 | $0 | 0.786 | 0.681 | 0.105 | 0.694 | 0.286 | - | - |
| 331 | Gemini 2.5 Flash (Non-reasoning) | 14.2 | - | 60.3 | $0.85 | 0.809 | 0.683 | 0.047 | 0.495 | 0.291 | 0.932 | 0.5 | |
| 332 | DeepSeek V3 (Dec '24) | DeepSeek | 14.2 | 23 | 26 | $0.493 | 0.752 | 0.557 | 0.029 | 0.359 | 0.354 | 0.88666666666667 | 0.25333333333333 |
| 333 | Ling 2.6 Flash | InclusionAI | 14.2 | 25.3 | - | $0.15 | - | 0.593 | 0.063 | - | 0.271 | - | - |
| 334 | o1-mini | OpenAI | 14 | - | - | $0 | 0.742 | 0.603 | 0.036 | 0.576 | 0.323 | 0.944 | 0.60333333333333 |
| 335 | Qwen3 Next 80B A3B Instruct | Alibaba | 13.8 | - | 66.3 | $0.412 | 0.819 | 0.738 | 0.076 | 0.684 | 0.307 | - | - |
| 336 | GPT-4.5 (Preview) | OpenAI | 13.6 | - | - | $0 | - | - | - | - | - | - | - |
| 337 | Tri-21B-think Preview | Trillion Labs | 13.6 | - | - | $0 | - | 0.538 | 0.058 | - | 0.178 | - | - |
| 338 | Qwen3 Coder 30B A3B Instruct | Alibaba | 13.6 | - | 29 | $0.9 | 0.706 | 0.516 | 0.038 | 0.403 | 0.278 | 0.89333333333333 | 0.29666666666667 |
| 339 | DiffusionGemma 26B A4B | 13.5 | 19.7 | - | $0 | - | 0.669 | 0.108 | - | 0.343 | - | - | |
| 340 | Qwen3 235B A22B (Reasoning) | Alibaba | 13.5 | - | 82 | $2.625 | 0.828 | 0.7 | 0.11 | 0.622 | 0.399 | 0.93 | 0.84 |
| 341 | Qwen3 VL 30B A3B (Reasoning) | Alibaba | 13.4 | - | 82.3 | $0.75 | 0.807 | 0.72 | 0.089 | 0.697 | 0.288 | - | - |
| 342 | QwQ 32B | Alibaba | 13.4 | - | 29 | $0.745 | 0.764 | 0.593 | 0.073 | 0.631 | 0.358 | 0.95733333333333 | 0.78 |
| 343 | Gemini 2.0 Flash Thinking Experimental (Jan '25) | 13.3 | 24.1 | - | $0 | 0.798 | 0.701 | 0.064 | 0.321 | 0.329 | 0.944 | 0.5 | |
| 344 | Gemma 4 12B (Non-reasoning) | 13.2 | - | - | $0.15 | - | 0.661 | 0.063 | - | 0.297 | - | - | |
| 345 | Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning) | 13.1 | - | 46.7 | $0.175 | 0.796 | 0.651 | 0.051 | 0.641 | 0.285 | - | - | |
| 346 | Motif-2-12.7B-Reasoning | Motif Technologies | 12.8 | - | 80.3 | $0 | 0.796 | 0.695 | 0.088 | 0.651 | 0.282 | - | - |
| 347 | Nova Premier | Amazon | 12.7 | - | 17.3 | $5 | 0.733 | 0.569 | 0.042 | 0.317 | 0.279 | 0.83933333333333 | 0.17 |
| 348 | Ling-1T | InclusionAI | 12.7 | - | 71.3 | $0 | 0.822 | 0.719 | 0.073 | 0.677 | 0.352 | - | - |
| 349 | Mistral Medium 3 | Mistral | 12.5 | - | 30.3 | $0.8 | 0.76 | 0.578 | 0.041 | 0.4 | 0.331 | 0.90666666666667 | 0.44 |
| 350 | Magistral Medium 1 | Mistral | 12.5 | - | 40.3 | $0 | 0.753 | 0.679 | 0.098 | 0.527 | 0.297 | 0.91733333333333 | 0.7 |
| 351 | Solar Pro 2 (Preview) (Reasoning) | Upstage | 12.5 | - | - | $0 | 0.768 | 0.578 | 0.061 | 0.462 | 0.164 | 0.9 | 0.66333333333333 |
| 352 | Llama Nemotron Super 49B v1.5 (Reasoning) | NVIDIA | 12.4 | - | 76.7 | $0.4 | 0.814 | 0.748 | 0.073 | 0.737 | 0.348 | 0.98333333333333 | 0.86 |
| 353 | K2-V2 (medium) | MBZUAI Institute of Foundation Models | 12.4 | - | 64.7 | $0 | 0.761 | 0.598 | 0.044 | 0.541 | 0.252 | - | - |
| 354 | Celeris-1 | Celeris | 12.4 | 14.4 | - | $0.325 | 0.78 | 0.631 | 0.068 | - | 0.207 | - | - |
| 355 | Devstral Medium | Mistral | 12.4 | - | 4.7 | $0 | 0.708 | 0.492 | 0.038 | 0.337 | 0.294 | 0.70733333333333 | 0.066666666666667 |
| 356 | Mistral Small 4 (Non-reasoning) | Mistral | 12.3 | - | - | $0.262 | - | 0.571 | 0.038 | - | 0.281 | - | - |
| 357 | Tri-21B-Think | Trillion Labs | 12.3 | - | - | $0 | - | 0.601 | 0.059 | - | 0.174 | - | - |
| 358 | GPT-4o (March 2025, chatgpt-4o-latest) | OpenAI | 12.3 | - | 25.7 | $0 | 0.803 | 0.655 | 0.04 | 0.425 | 0.366 | 0.89266666666667 | 0.32666666666667 |
| 359 | Gemma 4 E4B (Reasoning) | 12.2 | 9.4 | - | $0.04 | - | 0.576 | 0.038 | - | 0.244 | - | - | |
| 360 | Gemini 2.0 Flash (Feb '25) | 12.2 | - | 21.7 | $0 | 0.779 | 0.623 | 0.043 | 0.334 | 0.333 | 0.93 | 0.33 | |
| 361 | Claude 3.5 Haiku | Anthropic | 12.2 | 15.9 | - | $0 | 0.634 | 0.408 | 0.036 | 0.314 | 0.274 | 0.72066666666667 | 0.033333333333333 |
| 362 | Llama 3.3 Nemotron Super 49B v1 (Reasoning) | NVIDIA | 12.2 | - | 54.7 | $0 | 0.785 | 0.643 | 0.056 | 0.277 | 0.282 | 0.95866666666667 | 0.58333333333333 |
| 363 | Sarvam 105B (high) | Sarvam | 11.9 | - | - | $0.074 | - | 0.738 | 0.11 | - | 0.264 | - | - |
| 364 | MiniCPM5-1B (Reasoning) | OpenBMB | 11.9 | - | - | $0 | - | 0.278 | 0.065 | - | 0.044 | - | - |
| 365 | Qwen3 4B 2507 (Reasoning) | Alibaba | 11.9 | - | 82.7 | $0 | 0.743 | 0.667 | 0.062 | 0.641 | 0.256 | - | - |
| 366 | Nova 2.0 Lite (Non-reasoning) | Amazon | 11.8 | - | 33.7 | $0.85 | 0.743 | 0.603 | 0.029 | 0.346 | 0.24 | - | - |
| 367 | Gemini 2.0 Pro Experimental (Feb '25) | 11.8 | 25.5 | - | $0 | 0.805 | 0.622 | 0.062 | 0.347 | 0.313 | 0.92266666666667 | 0.36 | |
| 368 | Claude 3 Opus | Anthropic | 11.8 | 19.5 | - | $30 | 0.696 | 0.489 | 0.028 | 0.279 | 0.233 | 0.64066666666667 | 0.033333333333333 |
| 369 | Devstral Small (May '25) | Mistral | 11.8 | - | - | $0 | 0.632 | 0.434 | 0.04 | 0.258 | 0.245 | 0.684 | 0.066666666666667 |
| 370 | MiniCPM5-1B (Non-reasoning) | OpenBMB | 11.7 | - | - | $0 | - | 0.269 | 0.045 | - | 0.014 | - | - |
| 371 | Gemini 2.5 Flash Preview (Non-reasoning) | 11.6 | - | - | $0 | 0.783 | 0.594 | 0.038 | 0.406 | 0.233 | 0.926 | 0.43333333333333 | |
| 372 | Sonar Reasoning | Perplexity | 11.6 | - | - | $0 | - | 0.623 | - | - | - | 0.92133333333333 | 0.77 |
| 373 | Magistral Small 1.2 | Mistral | 11.5 | 14.7 | 80.3 | $0.75 | 0.768 | 0.663 | 0.064 | 0.723 | 0.352 | - | - |
| 374 | Gemini 2.5 Flash-Lite (Reasoning) | 11.4 | - | 53.3 | $0.175 | 0.759 | 0.625 | 0.068 | 0.593 | 0.193 | 0.96866666666667 | 0.70333333333333 | |
| 375 | Qwen3 32B (Reasoning) | Alibaba | 11.4 | 15.3 | 73 | $0.28 | 0.798 | 0.668 | 0.074 | 0.546 | 0.354 | 0.96066666666667 | 0.80666666666667 |
| 376 | Ministral 3 14B | Mistral | 11.2 | 14.4 | 30 | $0.2 | 0.693 | 0.572 | 0.046 | 0.351 | 0.236 | - | - |
| 377 | GPT-4o (Nov '24) | OpenAI | 11.1 | - | 6 | $4.375 | 0.748 | 0.543 | 0.024 | 0.309 | 0.333 | 0.75933333333333 | 0.15 |
| 378 | LFM2.5-2.6B | Liquid AI | 11 | 7.7 | - | $0 | - | 0.558 | 0.062 | - | 0.142 | - | - |
| 379 | Nanbeige4.1-3B | Nanbeige | 11 | 9.6 | - | $0 | - | 0.849 | 0.109 | - | 0.266 | - | - |
| 380 | DeepSeek R1 Distill Qwen 32B | DeepSeek | 11 | - | 63 | $0 | 0.739 | 0.615 | 0.046 | 0.27 | 0.376 | 0.94066666666667 | 0.68666666666667 |
| 381 | Qwen3 VL 32B Instruct | Alibaba | 11 | - | 68.3 | $0.28 | 0.791 | 0.671 | 0.068 | 0.514 | 0.301 | - | - |
| 382 | GLM-4.6V (Non-reasoning) | Z AI | 10.9 | - | 26.3 | $0.45 | 0.752 | 0.566 | 0.037 | 0.411 | 0.272 | - | - |
| 383 | Qwen3 235B A22B (Non-reasoning) | Alibaba | 10.8 | - | 23.7 | $1.225 | 0.762 | 0.613 | 0.042 | 0.343 | 0.299 | 0.902 | 0.32666666666667 |
| 384 | Mistral Small 3.2 | Mistral | 10.7 | 12.5 | 27 | $0.15 | 0.681 | 0.505 | 0.043 | 0.275 | 0.264 | 0.88266666666667 | 0.32333333333333 |
| 385 | Gemini 2.0 Flash (experimental) | 10.6 | - | - | $0 | 0.782 | 0.636 | 0.041 | 0.21 | 0.34 | 0.91066666666667 | 0.3 | |
| 386 | Magistral Small 1 | Mistral | 10.6 | - | 41.3 | $0 | 0.746 | 0.641 | 0.076 | 0.514 | 0.241 | 0.96266666666667 | 0.71333333333333 |
| 387 | EXAONE 4.0 32B (Reasoning) | LG AI Research | 10.5 | - | 80 | $0 | 0.818 | 0.739 | 0.114 | 0.747 | 0.344 | 0.97666666666667 | 0.84333333333333 |
| 388 | Qwen3 VL 8B (Reasoning) | Alibaba | 10.5 | - | 30.7 | $0.66 | 0.749 | 0.579 | 0.038 | 0.353 | 0.219 | - | - |
| 389 | Nova 2.0 Omni (Non-reasoning) | Amazon | 10.4 | - | 37 | $0.85 | 0.719 | 0.555 | 0.038 | 0.305 | 0.279 | - | - |
| 390 | Qwen3 14B (Reasoning) | Alibaba | 10.4 | 13.8 | 55.7 | $1.313 | 0.774 | 0.604 | 0.045 | 0.523 | 0.316 | 0.96133333333333 | 0.76333333333333 |
| 391 | Llama 4 Scout | Meta | 10.3 | 8.2 | 14 | $0.3 | 0.752 | 0.587 | 0.038 | 0.299 | 0.17 | 0.844 | 0.28333333333333 |
| 392 | DeepSeek R1 0528 Qwen3 8B | DeepSeek | 10.3 | - | 63.7 | $0 | 0.739 | 0.612 | 0.059 | 0.513 | 0.204 | 0.932 | 0.65 |
| 393 | Qwen2.5 Max | Alibaba | 10.1 | - | - | $0 | 0.762 | 0.587 | 0.038 | 0.359 | 0.337 | 0.83466666666667 | 0.23333333333333 |
| 394 | Hermes 4 - Llama-3.1 70B (Reasoning) | Nous Research | 9.9 | - | 68.7 | $0.198 | 0.811 | 0.699 | 0.088 | 0.653 | 0.341 | - | - |
| 395 | Gemini 1.5 Pro (Sep '24) | 9.9 | 23.6 | - | $0 | 0.75 | 0.589 | 0.046 | 0.316 | 0.295 | 0.876 | 0.23 | |
| 396 | Solar Pro 2 (Preview) (Non-reasoning) | Upstage | 9.9 | - | - | $0 | 0.725 | 0.544 | 0.037 | 0.385 | 0.272 | 0.87066666666667 | 0.29666666666667 |
| 397 | Qwen3 VL 30B A3B Instruct | Alibaba | 9.9 | - | 72.3 | $0.35 | 0.764 | 0.695 | 0.063 | 0.476 | 0.308 | - | - |
| 398 | Claude 3.5 Sonnet (Oct '24) | Anthropic | 9.8 | 30.2 | - | $6 | 0.772 | 0.599 | 0.037 | 0.381 | 0.366 | 0.77133333333333 | 0.15666666666667 |
| 399 | DeepSeek R1 Distill Llama 70B | DeepSeek | 9.8 | - | 53.7 | $0.8 | 0.795 | 0.402 | 0.051 | 0.266 | 0.313 | 0.93466666666667 | 0.67 |
| 400 | Falcon-H1R-7B | TII UAE | 9.7 | - | 80 | $0 | 0.725 | 0.661 | 0.11 | 0.724 | 0.249 | - | - |
| 401 | DeepSeek R1 Distill Qwen 14B | DeepSeek | 9.7 | - | 55.7 | $0 | 0.74 | 0.484 | 0.041 | 0.376 | 0.239 | 0.94866666666667 | 0.66666666666667 |
| 402 | GPT-4.1 nano | OpenAI | 9.6 | 11.1 | 24 | $0.175 | 0.657 | 0.512 | 0.038 | 0.326 | 0.259 | 0.848 | 0.23666666666667 |
| 403 | Ling-flash-2.0 | InclusionAI | 9.6 | - | 65.3 | $0.247 | 0.777 | 0.657 | 0.062 | 0.589 | 0.289 | - | - |
| 404 | Gemma 4 E2B (Reasoning) | 9.5 | 7.2 | - | $0 | - | 0.433 | 0.048 | - | 0.209 | - | - | |
| 405 | Qwen3 Omni 30B A3B (Reasoning) | Alibaba | 9.5 | - | 74 | $0.43 | 0.792 | 0.726 | 0.075 | 0.679 | 0.306 | - | - |
| 406 | GPT-4o (Aug '24) | OpenAI | 9.4 | - | - | $4.375 | - | 0.521 | 0.023 | 0.317 | 0.331 | 0.79466666666667 | 0.11666666666667 |
| 407 | Sonar | Perplexity | 9.4 | - | - | $0 | 0.689 | 0.471 | 0.049 | 0.295 | 0.229 | 0.81666666666667 | 0.48666666666667 |
| 408 | Qwen2.5 Instruct 72B | Alibaba | 9.4 | - | 14 | $0.48 | 0.72 | 0.491 | 0.036 | 0.276 | 0.267 | 0.858 | 0.16 |
| 409 | Llama 3.3 Instruct 70B | Meta | 9.3 | 11.9 | 7.7 | $0.671 | 0.713 | 0.498 | 0.036 | 0.288 | 0.26 | 0.77266666666667 | 0.3 |
| 410 | Step3 VL 10B | StepFun | 9.3 | - | - | $0 | - | 0.69 | 0.108 | - | 0.311 | - | - |
| 411 | Qwen3 30B A3B (Reasoning) | Alibaba | 9.2 | - | 72.3 | $0.75 | 0.777 | 0.616 | 0.062 | 0.506 | 0.285 | 0.95933333333333 | 0.75333333333333 |
| 412 | Devstral Small (Jul '25) | Mistral | 9.1 | - | 29.3 | $0 | 0.622 | 0.414 | 0.038 | 0.254 | 0.243 | 0.63466666666667 | 0.0033333333333333 |
| 413 | Sonar Pro | Perplexity | 9.1 | - | - | $0 | 0.755 | 0.578 | 0.066 | 0.275 | 0.226 | 0.74466666666667 | 0.29 |
| 414 | QwQ 32B-Preview | Alibaba | 9.1 | - | - | $0 | 0.648 | 0.557 | 0.039 | 0.337 | 0.038 | 0.91 | 0.45333333333333 |
| 415 | Ministral 3 8B | Mistral | 9 | 9.7 | 31.7 | $0.15 | 0.642 | 0.471 | 0.043 | 0.303 | 0.208 | - | - |
| 416 | Mistral Large 2 (Nov '24) | Mistral | 9 | - | 14 | $0 | 0.697 | 0.486 | 0.033 | 0.293 | 0.292 | 0.736 | 0.11 |
| 417 | GLM-4.5V (Reasoning) | Z AI | 9 | - | 73 | $0.9 | 0.788 | 0.684 | 0.063 | 0.604 | 0.221 | - | - |
| 418 | Llama 3.1 Nemotron Ultra 253B v1 (Reasoning) | NVIDIA | 8.9 | - | 63.7 | $0.9 | 0.825 | 0.728 | 0.074 | 0.641 | 0.347 | 0.952 | 0.74666666666667 |
| 419 | ERNIE 4.5 300B A47B | Baidu | 8.9 | - | 41.3 | $0.485 | 0.776 | 0.811 | 0.033 | 0.467 | 0.315 | 0.93066666666667 | 0.49333333333333 |
| 420 | Qwen3 30B A3B 2507 Instruct | Alibaba | 8.9 | - | 66.3 | $0.35 | 0.777 | 0.659 | 0.069 | 0.515 | 0.304 | 0.97533333333333 | 0.72666666666667 |
| 421 | NVIDIA Nemotron Nano 12B v2 VL (Reasoning) | NVIDIA | 8.8 | - | 75 | $0.3 | 0.759 | 0.572 | 0.055 | 0.694 | 0.262 | - | - |
| 422 | Hermes 4 - Llama-3.1 405B (Reasoning) | Nous Research | 8.8 | - | 69.7 | $1.5 | 0.829 | 0.727 | 0.109 | 0.686 | 0.252 | - | - |
| 423 | Solar Pro 2 (Reasoning) | Upstage | 8.8 | - | 61.3 | $0 | 0.805 | 0.687 | 0.074 | 0.616 | 0.302 | 0.96666666666667 | 0.69 |
| 424 | Gemma 4 E4B (Non-reasoning) | 8.7 | - | - | $0.04 | - | 0.549 | 0.048 | - | 0.039 | - | - | |
| 425 | NVIDIA Nemotron Nano 9B V2 (Reasoning) | NVIDIA | 8.7 | - | 69.7 | $0.07 | 0.742 | 0.57 | 0.049 | 0.724 | 0.22 | - | - |
| 426 | Granite 4.1 30B | IBM | 8.7 | 10.4 | - | $0 | - | 0.481 | 0.041 | - | 0.258 | - | - |
| 427 | NVIDIA Nemotron 3 Nano 4B | NVIDIA | 8.6 | 8 | - | $0 | - | 0.513 | 0.049 | - | 0.164 | - | - |
| 428 | Hermes 4 - Llama-3.1 405B (Non-reasoning) | Nous Research | 8.6 | - | 15.3 | $1.5 | 0.729 | 0.536 | 0.042 | 0.546 | 0.346 | - | - |
| 429 | Gemini 2.0 Flash-Lite (Feb '25) | 8.6 | - | - | $0 | 0.724 | 0.535 | 0.034 | 0.185 | 0.25 | 0.87266666666667 | 0.27666666666667 | |
| 430 | Llama Nemotron Super 49B v1.5 (Non-reasoning) | NVIDIA | 8.5 | - | 8 | $0.4 | 0.692 | 0.481 | 0.043 | 0.29 | 0.238 | 0.77 | 0.13666666666667 |
| 431 | Qwen3 32B (Non-reasoning) | Alibaba | 8.5 | - | 19.7 | $0.28 | 0.727 | 0.535 | 0.041 | 0.288 | 0.28 | 0.86866666666667 | 0.30333333333333 |
| 432 | Kimi Linear 48B A3B Instruct | Kimi | 8.4 | - | 36.3 | $0 | 0.585 | 0.412 | 0.025 | 0.378 | 0.199 | - | - |
| 433 | K2-V2 (low) | MBZUAI Institute of Foundation Models | 8.4 | - | 35.3 | $0 | 0.713 | 0.541 | 0.036 | 0.393 | 0.223 | - | - |
| 434 | GPT-4o (May '24) | OpenAI | 8.4 | 24.2 | - | $7.5 | 0.74 | 0.526 | 0.018 | 0.334 | 0.309 | 0.79133333333333 | 0.11 |
| 435 | Gemini 2.0 Flash-Lite (Preview) | 8.4 | - | - | $0 | - | 0.542 | 0.041 | 0.179 | 0.247 | 0.87333333333333 | 0.30333333333333 | |
| 436 | Llama 3.1 Nemotron Nano 4B v1.1 (Reasoning) | NVIDIA | 8.4 | - | 50 | $0 | 0.556 | 0.408 | 0.052 | 0.493 | 0.101 | 0.94666666666667 | 0.70666666666667 |
| 437 | Llama 3.1 Instruct 405B | Meta | 8.3 | - | 3 | $0 | 0.732 | 0.515 | 0.04 | 0.305 | 0.299 | 0.70333333333333 | 0.21333333333333 |
| 438 | Llama 3.3 Nemotron Super 49B v1 (Non-reasoning) | NVIDIA | 8.3 | - | 7.7 | $0 | 0.698 | 0.517 | 0.038 | 0.28 | 0.229 | 0.77533333333333 | 0.19333333333333 |
| 439 | Qwen3 8B (Reasoning) | Alibaba | 8.3 | 9 | 19 | $0.66 | 0.743 | 0.589 | 0.039 | 0.406 | 0.226 | 0.904 | 0.74666666666667 |
| 440 | Qwen3 4B (Reasoning) | Alibaba | 8.2 | - | 22.3 | $0 | 0.696 | 0.522 | 0.044 | 0.465 | 0.035 | 0.93333333333333 | 0.65666666666667 |
| 441 | Qwen3 VL 8B Instruct | Alibaba | 8.2 | - | 27.3 | $0.31 | 0.686 | 0.427 | 0.027 | 0.332 | 0.174 | - | - |
| 442 | LFM2.5-8B-A1B | Liquid AI | 8.1 | - | - | $0 | - | 0.513 | 0.069 | - | 0.078 | - | - |
| 443 | GPT-4o (ChatGPT) | OpenAI | 8.1 | - | - | $0 | 0.773 | 0.511 | 0.027 | - | 0.334 | 0.79733333333333 | 0.10333333333333 |
| 444 | Claude 3.5 Sonnet (June '24) | Anthropic | 8.1 | 26 | - | $6 | 0.751 | 0.56 | 0.032 | - | 0.316 | 0.69533333333333 | 0.096666666666667 |
| 445 | Llama 3.1 Tulu3 405B | Allen Institute for AI | 8.1 | - | - | $0 | 0.716 | 0.516 | 0.033 | 0.291 | 0.302 | 0.778 | 0.13333333333333 |
| 446 | Ring-flash-2.0 | InclusionAI | 8 | - | 83.7 | $0.247 | 0.793 | 0.725 | 0.096 | 0.628 | 0.168 | - | - |
| 447 | Pixtral Large | Mistral | 8 | - | 2.3 | $0 | 0.701 | 0.505 | 0.028 | 0.261 | 0.292 | 0.714 | 0.07 |
| 448 | Olmo 3.1 32B Think | Allen Institute for AI | 7.9 | - | 77.3 | $0 | 0.763 | 0.591 | 0.063 | 0.695 | 0.293 | - | - |
| 449 | GPT-5 nano (minimal) | OpenAI | 7.8 | - | 27.3 | $0.138 | 0.556 | 0.428 | 0.04 | 0.47 | 0.291 | - | - |
| 450 | Gemini 1.5 Flash (Sep '24) | 7.8 | - | - | $0 | 0.68 | 0.463 | 0.032 | 0.273 | 0.267 | 0.82733333333333 | 0.18 | |
| 451 | Grok 2 (Dec '24) | SpaceXAI | 7.8 | - | - | $0 | 0.709 | 0.51 | 0.031 | 0.267 | 0.285 | 0.778 | 0.13333333333333 |
| 452 | GPT-4 Turbo | OpenAI | 7.7 | 21.5 | - | $15 | 0.694 | - | 0.031 | 0.291 | 0.319 | 0.73666666666667 | 0.15 |
| 453 | Qwen3 VL 4B (Reasoning) | Alibaba | 7.7 | - | 25.7 | $0 | 0.7 | 0.494 | 0.046 | 0.32 | 0.171 | - | - |
| 454 | Solar Pro 2 (Non-reasoning) | Upstage | 7.6 | - | 30 | $0 | 0.75 | 0.561 | 0.037 | 0.424 | 0.248 | 0.88866666666667 | 0.40666666666667 |
| 455 | Command A | Cohere | 7.5 | - | 13 | $4.375 | 0.712 | 0.527 | 0.04 | 0.287 | 0.281 | 0.81866666666667 | 0.096666666666667 |
| 456 | Nova Pro | Amazon | 7.5 | - | 7 | $1.4 | 0.691 | 0.499 | 0.032 | 0.233 | 0.208 | 0.786 | 0.10666666666667 |
| 457 | Llama 3.1 Nemotron Instruct 70B | NVIDIA | 7.4 | - | 11 | $1.2 | 0.69 | 0.465 | 0.042 | 0.169 | 0.233 | 0.73266666666667 | 0.24666666666667 |
| 458 | Qwen3.5 2B (Reasoning) | Alibaba | 7.4 | 2.9 | - | $0 | - | 0.456 | 0.026 | - | 0.028 | - | - |
| 459 | Llama 3.1 Instruct 8B | Meta | 7.4 | 5.4 | 4.3 | $0.028 | 0.476 | 0.259 | 0.053 | 0.116 | 0.132 | 0.51933333333333 | 0.076666666666667 |
| 460 | Gemma 3 27B Instruct | 7.4 | 10.1 | 20.7 | $0 | 0.669 | 0.428 | 0.044 | 0.137 | 0.212 | 0.88266666666667 | 0.25333333333333 | |
| 461 | Grok Beta | SpaceXAI | 7.3 | - | - | $0 | 0.703 | 0.471 | 0.044 | 0.241 | 0.295 | 0.73666666666667 | 0.10333333333333 |
| 462 | NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) | NVIDIA | 7.2 | - | 13.3 | $0.088 | 0.579 | 0.399 | 0.046 | 0.36 | 0.23 | - | - |
| 463 | NVIDIA Nemotron Nano 9B V2 (Non-reasoning) | NVIDIA | 7.2 | - | 62.3 | $0.086 | 0.739 | 0.557 | 0.046 | 0.701 | 0.209 | - | - |
| 464 | Qwen2.5 Instruct 32B | Alibaba | 7.2 | - | - | $0 | 0.697 | 0.466 | 0.04 | 0.248 | 0.229 | 0.80533333333333 | 0.11 |
| 465 | Ministral 3 3B | Mistral | 7.1 | 4.8 | 22 | $0.1 | 0.524 | 0.358 | 0.054 | 0.247 | 0.144 | - | - |
| 466 | Mistral Large 2 (Jul '24) | Mistral | 7 | - | 0 | $3 | 0.683 | 0.472 | 0.029 | 0.267 | 0.271 | 0.714 | 0.093333333333333 |
| 467 | Qwen2.5 Coder Instruct 32B | Alibaba | 6.9 | - | - | $0 | 0.635 | 0.417 | 0.035 | 0.295 | 0.271 | 0.76666666666667 | 0.12 |
| 468 | Qwen3 4B 2507 Instruct | Alibaba | 6.9 | - | 52.3 | $0 | 0.672 | 0.517 | 0.045 | 0.377 | 0.181 | - | - |
| 469 | GPT-4 | OpenAI | 6.8 | 13.1 | - | $37.5 | 0.562 | 0.349 | - | - | - | 0.568 | - |
| 470 | GLM-4.5V (Non-reasoning) | Z AI | 6.8 | - | 15.3 | $0.9 | 0.751 | 0.573 | 0.035 | 0.352 | 0.188 | - | - |
| 471 | Qwen3 14B (Non-reasoning) | Alibaba | 6.8 | - | 58 | $0.612 | 0.675 | 0.47 | 0.041 | 0.28 | 0.265 | 0.87133333333333 | 0.28 |
| 472 | Hermes 4 - Llama-3.1 70B (Non-reasoning) | Nous Research | 6.7 | - | 11.3 | $0.198 | 0.664 | 0.491 | 0.036 | 0.269 | 0.277 | - | - |
| 473 | GPT-4o mini | OpenAI | 6.7 | 11.4 | 14.7 | $0.262 | 0.648 | 0.426 | 0.042 | 0.234 | 0.229 | 0.78866666666667 | 0.11666666666667 |
| 474 | Gemini 2.5 Flash-Lite (Non-reasoning) | 6.7 | - | 35.3 | $0.175 | 0.724 | 0.474 | 0.037 | 0.4 | 0.177 | 0.926 | 0.5 | |
| 475 | Mistral Small 3 | Mistral | 6.7 | - | 4.3 | $0.15 | 0.652 | 0.462 | 0.038 | 0.252 | 0.236 | 0.71533333333333 | 0.08 |
| 476 | Nova Lite | Amazon | 6.7 | - | 7 | $0.105 | 0.59 | 0.433 | 0.043 | 0.167 | 0.139 | 0.76466666666667 | 0.10666666666667 |
| 477 | Qwen3 30B A3B (Non-reasoning) | Alibaba | 6.6 | - | 21.7 | $0.35 | 0.71 | 0.515 | 0.046 | 0.322 | 0.264 | 0.86266666666667 | 0.26 |
| 478 | Llama 3.1 Instruct 70B | Meta | 6.5 | - | 4 | $0.56 | 0.676 | 0.409 | 0.045 | 0.232 | 0.267 | 0.64933333333333 | 0.17333333333333 |
| 479 | DeepSeek-V2.5 (Dec '24) | DeepSeek | 6.5 | - | - | $0 | 0.666 | 0.423 | - | - | - | 0.76266666666667 | - |
| 480 | Qwen3 4B (Non-reasoning) | Alibaba | 6.5 | - | - | $0 | 0.586 | 0.398 | 0.033 | 0.233 | 0.167 | 0.84266666666667 | 0.21333333333333 |
| 481 | Granite 4.1 8B | IBM | 6.4 | 9.5 | - | $0.063 | - | 0.433 | 0.038 | - | 0.218 | - | - |
| 482 | Sarvam 30B (high) | Sarvam | 6.4 | - | - | $0.047 | - | 0.633 | 0.075 | - | 0.192 | - | - |
| 483 | Gemini 2.0 Flash Thinking Experimental (Dec '24) | 6.4 | - | - | $0 | - | - | - | - | - | 0.48 | - | |
| 484 | DeepSeek-V2.5 | DeepSeek | 6.4 | - | - | $0 | - | - | - | - | - | - | - |
| 485 | Gemma 4 E2B (Non-reasoning) | 6.2 | - | - | $0 | - | 0.405 | 0.047 | - | 0.204 | - | - | |
| 486 | Olmo 3.1 32B Instruct | Allen Institute for AI | 6.2 | - | - | $0 | - | 0.539 | 0.05 | - | 0.167 | - | - |
| 487 | Mistral Saba | Mistral | 6.2 | - | - | $0 | 0.611 | 0.424 | 0.043 | - | 0.241 | 0.67666666666667 | 0.13 |
| 488 | DeepSeek R1 Distill Llama 8B | DeepSeek | 6.2 | - | 41.3 | $0 | 0.543 | 0.302 | - | 0.233 | 0.119 | 0.85266666666667 | 0.33333333333333 |
| 489 | Gemini 1.5 Pro (May '24) | 6.1 | 19.8 | - | $0 | 0.657 | 0.371 | 0.035 | 0.244 | 0.274 | 0.67333333333333 | 0.08 | |
| 490 | Olmo 3 32B Think | Allen Institute for AI | 6.1 | - | 73.7 | $0 | 0.759 | 0.61 | 0.064 | 0.672 | 0.286 | - | - |
| 491 | Llama 3.2 Instruct 90B (Vision) | Meta | 6 | - | - | $0 | 0.671 | 0.432 | 0.045 | 0.214 | 0.24 | 0.62933333333333 | 0.05 |
| 492 | R1 1776 | Perplexity | 6 | - | - | $0 | - | - | - | - | - | 0.954 | - |
| 493 | Solar Mini | Upstage | 6 | - | - | $0.15 | - | - | - | - | - | 0.33133333333333 | - |
| 494 | Reka Flash (Sep '24) | Reka AI | 6 | - | - | $0.35 | - | - | - | - | - | 0.52866666666667 | - |
| 495 | Qwen2.5 Turbo | Alibaba | 6 | - | - | $0.088 | 0.633 | 0.41 | 0.041 | 0.163 | 0.153 | 0.80533333333333 | 0.12 |
| 496 | Grok-1 | SpaceXAI | 5.8 | - | - | $0 | - | - | - | - | - | - | - |
| 497 | Phi-4 Mini Instruct | Microsoft | 5.7 | 3.8 | 6.7 | $0 | 0.465 | 0.331 | 0.044 | 0.126 | 0.108 | 0.696 | 0.03 |
| 498 | EXAONE 4.0 32B (Non-reasoning) | LG AI Research | 5.7 | - | 39.3 | $0 | 0.768 | 0.628 | 0.05 | 0.472 | 0.252 | 0.93933333333333 | 0.47 |
| 499 | Qwen2 Instruct 72B | Alibaba | 5.7 | - | - | $0 | 0.622 | 0.371 | 0.037 | 0.159 | 0.229 | 0.70133333333333 | 0.14666666666667 |
| 500 | Gemma 3 12B Instruct | 5.5 | 5.8 | 18.3 | $0 | 0.595 | 0.349 | 0.042 | 0.137 | 0.174 | 0.85333333333333 | 0.22 | |
| 501 | Qwen3.5 2B (Non-reasoning) | Alibaba | 5.3 | 2.4 | - | $0 | - | 0.438 | 0.05 | - | 0.072 | - | - |
| 502 | Qwen3.5 0.8B (Reasoning) | Alibaba | 5.2 | 0 | - | $0 | - | 0.111 | 0.011 | - | 0 | - | - |
| 503 | Gemini 1.5 Flash-8B | 5.2 | - | - | $0 | 0.569 | 0.359 | 0.047 | 0.217 | 0.229 | 0.68933333333333 | 0.033333333333333 | |
| 504 | DeepHermes 3 - Mistral 24B Preview (Non-reasoning) | Nous Research | 5 | - | - | $0 | 0.58 | 0.382 | 0.038 | 0.195 | 0.228 | 0.59466666666667 | 0.046666666666667 |
| 505 | Jamba 1.7 Large | AI21 Labs | 5 | - | 2.3 | $0 | 0.577 | 0.39 | 0.037 | 0.181 | 0.188 | 0.6 | 0.056666666666667 |
| 506 | Granite 4.0 H Small | IBM | 4.9 | - | 13.7 | $0.107 | 0.624 | 0.416 | 0.038 | 0.251 | 0.209 | - | - |
| 507 | Qwen3 Omni 30B A3B Instruct | Alibaba | 4.8 | - | 52.3 | $0.43 | 0.725 | 0.62 | 0.046 | 0.422 | 0.186 | - | - |
| 508 | Hermes 3 - Llama-3.1 70B | Nous Research | 4.8 | - | - | $0.7 | 0.571 | 0.401 | 0.04 | 0.188 | 0.231 | 0.538 | 0.023333333333333 |
| 509 | Jamba 1.5 Large | AI21 Labs | 4.8 | - | - | $3.5 | 0.572 | 0.427 | 0.041 | 0.143 | 0.163 | 0.606 | 0.046666666666667 |
| 510 | Qwen3 8B (Non-reasoning) | Alibaba | 4.8 | - | 24.3 | $0.31 | 0.643 | 0.452 | 0.019 | 0.202 | 0.168 | 0.828 | 0.24333333333333 |
| 511 | DeepSeek-Coder-V2 | DeepSeek | 4.7 | - | - | $0 | - | - | - | - | - | 0.74266666666667 | - |
| 512 | OLMo 2 32B | Allen Institute for AI | 4.7 | - | 3.3 | $0 | 0.511 | 0.328 | 0.036 | 0.068 | 0.08 | - | - |
| 513 | Jamba 1.6 Large | AI21 Labs | 4.7 | - | - | $0 | 0.565 | 0.387 | 0.036 | 0.172 | 0.184 | 0.58 | 0.046666666666667 |
| 514 | Phi-4 | Microsoft | 4.6 | - | 18 | $0.219 | 0.714 | 0.575 | 0.038 | 0.231 | 0.26 | 0.81 | 0.14333333333333 |
| 515 | LFM2 24B A2B | Liquid AI | 4.6 | - | - | $0 | - | 0.474 | 0.042 | - | 0.109 | - | - |
| 516 | Gemini 1.5 Flash (May '24) | 4.6 | - | - | $0 | 0.574 | 0.324 | 0.044 | 0.196 | 0.181 | 0.554 | 0.093333333333333 | |
| 517 | Nova Micro | Amazon | 4.4 | - | 6 | $0.061 | 0.531 | 0.358 | 0.046 | 0.14 | 0.094 | 0.70333333333333 | 0.08 |
| 518 | Granite 4.1 3B | IBM | 4.4 | 4.7 | - | $0 | - | 0.314 | 0.034 | - | 0.119 | - | - |
| 519 | Claude 3 Sonnet | Anthropic | 4.4 | - | - | $0 | 0.579 | 0.4 | 0.036 | 0.175 | 0.229 | 0.414 | 0.046666666666667 |
| 520 | Gemini 1.0 Ultra | 4.3 | 17.6 | - | $0 | - | - | - | - | - | - | - | |
| 521 | Mistral Small (Sep '24) | Mistral | 4.3 | - | - | $0.3 | 0.529 | 0.381 | 0.043 | 0.141 | 0.156 | 0.56266666666667 | 0.063333333333333 |
| 522 | Phi-3 Mini Instruct 3.8B | Microsoft | 4.3 | - | 0.3 | $0 | 0.435 | 0.319 | 0.05 | 0.116 | 0.09 | 0.45666666666667 | 0.04 |
| 523 | Phi-4 Multimodal Instruct | Microsoft | 4.2 | - | - | $0 | 0.485 | 0.315 | 0.05 | 0.131 | 0.11 | 0.69266666666667 | 0.093333333333333 |
| 524 | NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) | NVIDIA | 4.2 | - | 26.7 | $0.3 | 0.649 | 0.439 | 0.043 | 0.345 | 0.176 | - | - |
| 525 | Gemma 3n E4B Instruct Preview (May '25) | 4.2 | - | - | $0 | 0.483 | 0.278 | 0.048 | 0.138 | 0.086 | 0.74866666666667 | 0.10666666666667 | |
| 526 | Mistral Large (Feb '24) | Mistral | 4.1 | - | - | $6 | 0.515 | 0.351 | 0.035 | 0.178 | 0.208 | 0.52666666666667 | 0 |
| 527 | Qwen2.5 Coder Instruct 7B | Alibaba | 4.1 | - | - | $0 | 0.473 | 0.339 | 0.049 | 0.126 | 0.148 | 0.66 | 0.053333333333333 |
| 528 | Mixtral 8x22B Instruct | Mistral | 4 | - | - | $0 | 0.537 | 0.332 | 0.04 | 0.148 | 0.188 | 0.54466666666667 | 0 |
| 529 | Llama 3.2 Instruct 3B | Meta | 3.9 | - | 3.3 | $0 | 0.347 | 0.255 | 0.053 | 0.083 | 0.052 | 0.48866666666667 | 0.066666666666667 |
| 530 | Llama 2 Chat 7B | Meta | 3.9 | - | - | $0.1 | 0.164 | 0.227 | 0.053 | 0.002 | 0 | 0.058666666666667 | 0 |
| 531 | MiniCPM-V 4.6 1.3B | OpenBMB | 3.8 | 0.7 | - | $0 | - | 0.305 | 0.051 | - | 0.021 | - | - |
| 532 | Jamba Reasoning 3B | AI21 Labs | 3.8 | - | 10.7 | $0 | 0.577 | 0.333 | 0.038 | 0.21 | 0.059 | - | - |
| 533 | Reka Flash 3 | Reka AI | 3.7 | - | 33.7 | $0.35 | 0.669 | 0.529 | 0.044 | 0.435 | 0.267 | 0.89266666666667 | 0.51 |
| 534 | Qwen1.5 Chat 110B | Alibaba | 3.7 | - | - | $0 | - | 0.289 | - | - | - | - | - |
| 535 | Qwen3 VL 4B Instruct | Alibaba | 3.7 | - | 37 | $0 | 0.634 | 0.371 | 0.036 | 0.29 | 0.137 | - | - |
| 536 | Olmo 3 7B Think | Allen Institute for AI | 3.6 | - | 70.7 | $0 | 0.655 | 0.516 | 0.06 | 0.617 | 0.212 | - | - |
| 537 | Claude 3 Haiku | Anthropic | 3.5 | - | - | $0.5 | - | 0.374 | 0.041 | 0.154 | 0.186 | 0.394 | 0.01 |
| 538 | Claude 2.1 | Anthropic | 3.5 | 14 | - | $0 | 0.495 | 0.319 | 0.039 | 0.195 | 0.184 | 0.374 | 0.033333333333333 |
| 539 | OLMo 2 7B | Allen Institute for AI | 3.5 | - | 0.7 | $0 | 0.282 | 0.288 | 0.054 | 0.041 | 0.037 | - | - |
| 540 | Molmo 7B-D | Allen Institute for AI | 3.4 | - | 0 | $0 | 0.371 | 0.24 | 0.051 | 0.039 | 0.036 | - | - |
| 541 | Ling-mini-2.0 | InclusionAI | 3.4 | - | 49.3 | $0 | 0.671 | 0.562 | 0.051 | 0.429 | 0.135 | - | - |
| 542 | Claude 2.0 | Anthropic | 3.3 | 12.9 | - | $0 | 0.486 | 0.344 | - | 0.171 | 0.194 | - | 0 |
| 543 | DeepSeek R1 Distill Qwen 1.5B | DeepSeek | 3.3 | - | 22 | $0 | 0.269 | 0.098 | 0.031 | 0.07 | 0.066 | 0.68733333333333 | 0.17666666666667 |
| 544 | DeepSeek-V2-Chat | DeepSeek | 3.3 | - | - | $0 | - | - | - | - | - | - | - |
| 545 | GPT-3.5 Turbo | OpenAI | 3.2 | 10.7 | - | $0.75 | 0.462 | 0.297 | - | - | - | 0.44066666666667 | - |
| 546 | Mistral Small (Feb '24) | Mistral | 3.2 | - | - | $0.262 | 0.419 | 0.302 | 0.041 | 0.111 | 0.134 | 0.562 | 0.0066666666666667 |
| 547 | Mistral Medium | Mistral | 3.2 | - | - | $3 | 0.491 | 0.349 | 0.035 | 0.099 | 0.118 | 0.40466666666667 | 0.036666666666667 |
| 548 | Llama 3 Instruct 70B | Meta | 3.1 | - | - | $1.175 | 0.574 | 0.379 | 0.045 | 0.198 | 0.189 | 0.48266666666667 | 0 |
| 549 | Llama 3.2 Instruct 11B (Vision) | Meta | 3 | - | 1.7 | $0.345 | 0.464 | 0.221 | 0.055 | 0.11 | 0.112 | 0.516 | 0.093333333333333 |
| 550 | LFM 40B | Liquid AI | 3 | - | - | $0 | 0.425 | 0.327 | 0.049 | 0.096 | 0.071 | 0.48 | 0.023333333333333 |
| 551 | Arctic Instruct | Snowflake | 3 | - | - | $0 | - | - | - | - | - | - | - |
| 552 | Qwen Chat 72B | Alibaba | 3 | - | - | $0 | - | - | - | - | - | - | - |
| 553 | Qwen3.5 0.8B (Non-reasoning) | Alibaba | 2.9 | 1.2 | - | $0 | - | 0.236 | 0.051 | - | 0.029 | - | - |
| 554 | PALM-2 | 2.8 | 4.6 | - | $0 | - | - | - | - | - | - | - | |
| 555 | Gemini 1.0 Pro | 2.7 | - | - | $0 | 0.431 | 0.277 | 0.042 | 0.116 | 0.117 | 0.40266666666667 | 0.0066666666666667 | |
| 556 | DeepSeek Coder V2 Lite Instruct | DeepSeek | 2.7 | - | - | $0 | 0.429 | 0.319 | 0.054 | 0.158 | 0.139 | - | - |
| 557 | Llama 2 Chat 70B | Meta | 2.6 | - | - | $0 | 0.406 | 0.327 | 0.052 | 0.098 | - | 0.32266666666667 | 0 |
| 558 | Llama 2 Chat 13B | Meta | 2.6 | - | - | $0 | 0.406 | 0.321 | 0.048 | 0.098 | 0.118 | 0.32866666666667 | 0.016666666666667 |
| 559 | DeepSeek LLM 67B Chat (V1) | DeepSeek | 2.6 | - | - | $0 | - | - | - | - | - | - | - |
| 560 | OpenChat 3.5 (1210) | OpenChat | 2.6 | - | - | $0 | 0.31 | 0.23 | 0.048 | 0.115 | - | 0.30733333333333 | 0 |
| 561 | DBRX Instruct | Databricks | 2.6 | - | - | $0 | 0.397 | 0.331 | 0.029 | 0.093 | 0.118 | 0.27933333333333 | 0.03 |
| 562 | Sarvam M (Reasoning) | Sarvam | 2.6 | - | - | $0 | 0.696 | 0.416 | 0.031 | 0.295 | 0.178 | 0.84733333333333 | 0.20333333333333 |
| 563 | Command-R+ (Apr '24) | Cohere | 2.6 | - | - | $6 | 0.432 | 0.323 | 0.046 | 0.122 | 0.118 | 0.27866666666667 | 0.0066666666666667 |
| 564 | Exaone 4.0 1.2B (Reasoning) | LG AI Research | 2.5 | - | 50.3 | $0 | 0.588 | 0.515 | 0.06 | 0.516 | 0.093 | - | - |
| 565 | Olmo 3 7B Instruct | Allen Institute for AI | 2.4 | - | 41.3 | $0.125 | 0.522 | 0.4 | 0.058 | 0.266 | 0.103 | - | - |
| 566 | Exaone 4.0 1.2B (Non-reasoning) | LG AI Research | 2.4 | - | 24 | $0 | 0.5 | 0.424 | 0.057 | 0.293 | 0.074 | - | - |
| 567 | LFM2 2.6B | Liquid AI | 2.3 | - | 8.3 | $0 | 0.298 | 0.306 | 0.055 | 0.081 | 0.025 | - | - |
| 568 | LFM2.5-1.2B-Thinking | Liquid AI | 2.3 | - | - | $0 | - | 0.339 | 0.062 | - | 0.042 | - | - |
| 569 | LFM2.5-1.2B-Instruct | Liquid AI | 2.3 | - | - | $0 | - | 0.326 | 0.067 | - | 0.023 | - | - |
| 570 | Jamba 1.7 Mini | AI21 Labs | 2.3 | - | 0.3 | $0 | 0.388 | 0.322 | 0.044 | 0.061 | 0.093 | 0.258 | 0.013333333333333 |
| 571 | Jamba 1.5 Mini | AI21 Labs | 2.3 | - | - | $0.25 | 0.371 | 0.302 | 0.051 | 0.062 | 0.08 | 0.35666666666667 | 0.01 |
| 572 | Granite 4.0 H 1B | IBM | 2.2 | - | 6.3 | $0 | 0.277 | 0.263 | 0.05 | 0.115 | 0.082 | - | - |
| 573 | Qwen3 1.7B (Reasoning) | Alibaba | 2.2 | - | 38.7 | $0 | 0.57 | 0.356 | 0.046 | 0.308 | 0.043 | 0.894 | 0.51 |
| 574 | Jamba 1.6 Mini | AI21 Labs | 2.1 | - | - | $0 | 0.367 | 0.3 | 0.043 | 0.071 | 0.101 | 0.25666666666667 | 0.033333333333333 |
| 575 | Gemma 3 270M | 2 | - | 2.3 | $0 | 0.055 | 0.224 | 0.036 | 0.003 | 0 | - | - | |
| 576 | Granite 4.0 Micro | IBM | 2 | - | 6 | $0 | 0.447 | 0.336 | 0.05 | 0.18 | 0.119 | - | - |
| 577 | Apertus 70B Instruct | Swiss AI Initiative | 2 | - | - | $1.345 | - | 0.272 | 0.055 | - | 0.057 | - | - |
| 578 | Mixtral 8x7B Instruct | Mistral | 2 | - | - | $0.512 | 0.387 | 0.292 | 0.047 | 0.066 | 0.028 | 0.29933333333333 | 0 |
| 579 | DeepHermes 3 - Llama-3.1 8B Preview (Non-reasoning) | Nous Research | 1.9 | - | - | $0 | 0.365 | 0.27 | 0.043 | 0.085 | 0.091 | 0.218 | 0 |
| 580 | Llama 65B | Meta | 1.7 | - | - | $0 | - | - | - | - | - | - | - |
| 581 | Qwen Chat 14B | Alibaba | 1.7 | - | - | $0 | - | - | - | - | - | - | - |
| 582 | Claude Instant | Anthropic | 1.7 | 7.8 | - | $0 | 0.434 | 0.33 | 0.035 | 0.109 | - | 0.264 | 0 |
| 583 | Mistral 7B Instruct | Mistral | 1.7 | - | - | $0.25 | 0.245 | 0.177 | 0.045 | 0.046 | 0.024 | 0.12133333333333 | 0 |
| 584 | Command-R (Mar '24) | Cohere | 1.7 | - | - | $0.75 | 0.338 | 0.284 | 0.048 | 0.048 | 0.063 | 0.164 | 0.0066666666666667 |
| 585 | Molmo2-8B | Allen Institute for AI | 1.6 | - | - | $0 | - | 0.425 | 0.043 | - | 0.133 | - | - |
| 586 | Granite 4.0 1B | IBM | 1.6 | - | 6.3 | $0 | 0.325 | 0.281 | 0.048 | 0.047 | 0.087 | - | - |
| 587 | LFM2 8B A1B | Liquid AI | 1.3 | - | 25.3 | $0 | 0.505 | 0.344 | 0.049 | 0.151 | 0.068 | - | - |
| 588 | Granite 3.3 8B (Non-reasoning) | IBM | 1.3 | - | 6.7 | $0.085 | 0.468 | 0.338 | 0.042 | 0.127 | 0.101 | 0.66466666666667 | 0.046666666666667 |
| 589 | Qwen3 1.7B (Non-reasoning) | Alibaba | 1.1 | - | 7.3 | $0 | 0.411 | 0.283 | 0.053 | 0.126 | 0.069 | 0.71733333333333 | 0.096666666666667 |
| 590 | LFM2.5-VL-1.6B | Liquid AI | 1 | - | - | $0 | - | 0.289 | 0.051 | - | 0.03 | - | - |
| 591 | Granite 4.0 H 350M | IBM | 1 | - | 1.3 | $0 | 0.127 | 0.257 | 0.064 | 0.019 | 0.017 | - | - |
| 592 | Granite 4.0 350M | IBM | 1 | - | 0 | $0 | 0.124 | 0.261 | 0.055 | 0.024 | 0.009 | - | - |
| 593 | Apertus 8B Instruct | Swiss AI Initiative | 1 | - | - | $0.125 | - | 0.256 | 0.05 | - | 0.041 | - | - |
| 594 | Tiny Aya Global | Cohere | 1 | - | - | $0 | - | 0.305 | 0.052 | - | 0.036 | - | - |
| 595 | Llama 3 Instruct 8B | Meta | 1 | - | - | $0.07 | 0.405 | 0.296 | 0.051 | 0.096 | 0.119 | 0.49933333333333 | 0 |
| 596 | Llama 3.2 Instruct 1B | Meta | 1 | - | 0 | $0 | 0.2 | 0.196 | 0.055 | 0.019 | 0.017 | 0.14 | 0 |
| 597 | Gemma 3n E2B Instruct | 1 | - | 10.3 | $0 | 0.378 | 0.229 | 0.042 | 0.095 | 0.052 | 0.69133333333333 | 0.09 | |
| 598 | Gemma 3 1B Instruct | 1 | - | 3.3 | $0 | 0.135 | 0.237 | 0.053 | 0.017 | 0.007 | 0.484 | 0 | |
| 599 | Gemma 3n E4B Instruct | 1 | 3.2 | 14.3 | $0.075 | 0.488 | 0.296 | 0.045 | 0.146 | 0.081 | 0.77066666666667 | 0.13666666666667 | |
| 600 | Gemma 3 4B Instruct | 1 | 2.7 | 12.7 | $0 | 0.417 | 0.291 | 0.053 | 0.112 | 0.073 | 0.766 | 0.063333333333333 | |
| 601 | LFM2 1.2B | Liquid AI | 1 | - | 3.3 | $0 | 0.257 | 0.228 | 0.056 | 0.02 | 0.025 | - | - |
| 602 | Qwen3 0.6B (Non-reasoning) | Alibaba | 1 | - | 10.3 | $0 | 0.231 | 0.231 | 0.049 | 0.073 | 0.041 | 0.52066666666667 | 0.016666666666667 |
| 603 | Qwen3 0.6B (Reasoning) | Alibaba | 1 | - | 18 | $0 | 0.347 | 0.239 | 0.056 | 0.121 | 0.028 | 0.75 | 0.1 |
| 604 | GPT-5.5 Pro (xhigh) | OpenAI | - | - | - | $0 | - | - | - | - | - | - | - |
| 605 | Gemini 3 Deep Think | - | - | - | $0 | - | - | - | - | - | - | - | |
| 606 | Claude Sonnet 5 (Adaptive Reasoning, Low Effort) | Anthropic | - | - | - | $4 | - | - | - | - | - | - | - |
| 607 | Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) | Anthropic | - | - | - | $4 | - | - | - | - | - | - | - |
| 608 | Claude Sonnet 5 (Adaptive Reasoning, High Effort) | Anthropic | - | - | - | $4 | - | - | - | - | - | - | - |
| 609 | Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | - | - | - | $4 | - | - | - | - | - | - | - |
| 610 | EXAONE 4.5 33B (Non-reasoning) | LG AI Research | - | - | - | $0 | - | - | - | - | - | - | - |
| 611 | Cogito v2.1 (Reasoning) | Deep Cogito | - | - | 72.7 | $1.25 | 0.849 | 0.768 | 0.12 | 0.688 | 0.41 | - | - |
| 612 | GPT-5.4 Pro (xhigh) | OpenAI | - | - | - | $67.5 | - | - | - | - | - | - | - |
| 613 | GPT-4o mini Realtime (Dec '24) | OpenAI | - | - | - | $0 | - | - | - | - | - | - | - |
| 614 | GPT-3.5 Turbo (0613) | OpenAI | - | - | - | $0 | - | - | - | - | - | - | - |
| 615 | GPT-4o Realtime (Dec '24) | OpenAI | - | - | - | $0 | - | - | - | - | - | - | - |
| 616 | Mi:dm K 2.5 Pro Preview | Korea Telecom | - | - | 78.7 | $0 | 0.813 | 0.722 | 0.091 | 0.576 | 0.297 | - | - |
* 价格为每百万 Token 的混合价格 (3:1 输入/输出)
Artificial Analysis AI 大模型排名 介绍
Artificial Analysis 是一家独立的 AI 基准测试和分析公司,提供独立的基准测试和分析,以支持开发者、研究人员、企业和其他 AI 用户。Artificial Analysis同时测试专有与开放权重模型,并以端到端用户体验为核心,测量实际使用中的响应时间、输出速度及成本。
质量基准涵盖语言理解与推理能力;性能基准则关注首次令牌到达时间、输出速度、端到端响应时间等真实可感知指标。我们区分 OpenAI Tokens 与原生 Tokens,以便在不同模型之间进行统一、公平的对比,并使用按 3:1 的输入/输出比计算混合价。基准对象包括模型、端点、系统与提供商,覆盖语言模型、语音、图像生成等多个方向,旨在帮助用户准确了解不同 AI 服务的真实表现与性价比。
Artificial Analysis AI 测试基准介绍
上下文窗口
输入和输出令牌的最大总数。输出令牌的数量限制通常要低得多(具体数量因模型而异)。
输出速度
模型生成令牌时每秒接收到的令牌数(即,对于支持流式传输的模型,在从 API 接收到第一个数据块之后)。
延迟(首次令牌到达时间)
API 请求发送后,收到第一个推理令牌所需的时间(以秒为单位)。对于共享推理令牌的推理模型,这将是第一个推理令牌。对于不支持流式传输的模型,这表示收到完成状态所需的时间。
价格
每个代币的价格,以美元/百万代币表示。价格是输入代币和输出代币价格的混合(比例为 3:1)。
常见 AI 大模型测试基准介绍
MMLU Pro
Massive Multitask Language Understanding Professional。MMLU 的增强版,旨在评估大语言模型的推理能力。它通过过滤简单问题、增加选项数量(从4个增加到10个)以及强调复杂的多步推理,来解决原版 MMLU 的局限性。涵盖 14 个领域的约 12,000 个问题。
GPQA
Graduate-Level Google-Proof Q&A Benchmark。一个具有挑战性的研究生级别问答基准,旨在评估 AI 系统在物理、化学和生物等复杂科学领域提供真实信息的能力。这些问题被设计为“防谷歌搜索”,即需要深度理解和推理,而不仅仅是简单的事实回忆。
HLE
Humanity's Last Exam。一个全面的评估框架,旨在测试 AI 系统在模仿人类水平推理、解决问题和知识整合方面的能力。包含 100 多个学科的 2,500 到 3,000 个专家级问题,强调多步推理和处理新颖场景的能力。
LiveCodeBench
一个无污染的 LLM 代码能力评估基准。它持续从 LeetCode、AtCoder 和 Codeforces 等平台的竞赛中收集新问题,以防止训练集数据污染。除了代码生成,还评估自我修复、代码执行和测试输出预测等能力。
SciCode
评估语言模型解决现实科学研究问题代码生成能力的基准。涵盖物理、数学、材料科学、生物和化学等 6 个领域的 16 个子领域。问题源自真实的科学工作流,通常需要知识回忆、推理和代码合成。
Math 500
旨在评估语言模型数学推理和解决问题能力的基准。包含 500 个来自 AMC 和 AIME 等高水平高中数学竞赛的难题,涵盖代数、组合数学、几何、数论和预微积分等领域。
AIME
American Invitational Mathematics Examination。基于美国数学邀请赛问题的基准,被认为是测试高级数学推理的最具挑战性的 AI 测试之一。包含 30 个“奥林匹克级别”的整数答案数学问题,测试多步推理、抽象和解决问题的能力。