Сводный рейтинг Neira объединяет независимые тесты, сохраняя точные версии моделей и покрытие категорий.
Последний полный снимок: 23 авг. 2026 г., 06:02. Чат 30%, знания и рассуждение 20%, код 40%, вызов инструментов 10%.
В общий рейтинг попадают модели с результатами минимум в двух категориях; веса отсутствующих категорий перераспределяются.
| Ранг | Модель | Разработчик | Оценка | Покрытие | Источники |
|---|---|---|---|---|---|
#1 | moonshotai/Kimi-K3 | moonshotai | 99.7 | 2/4 | DeepSWE, GPQA, Humanity's Last Exam |
#2 | gemini-3.7-flash-high | 93.7 | 2/4 | Arena Text, LiveBench | |
Открытые веса · 4495 моделей
#3 |
| ornith-ai/Ornith-1.5-397B |
| ornith-ai |
| 91.5 |
| 2/4 |
| DeepSWE, GPQA, SWE-bench Multilingual, SWE-bench Pro, SWE-bench Verified |
#4 | qwen3.8-max | Alibaba | 86.9 | 2/4 | Arena Text, LiveBench |
#5 | Qwen/Qwen3.8-2.4T-A95B | qwen | 83.1 | 2/4 | DeepSWE, GPQA, Humanity's Last Exam, SWE-bench Pro |
#6 | moonshotai/Kimi-K2.6 | moonshotai | 80.0 | 2/4 | GPQA, Humanity's Last Exam, MathArena AIME 2026, SWE-bench Multilingual, SWE-bench Pro, SWE-bench Verified, Terminal-Bench 2.0 |
#7 | gemini-3.5-flash-high | 78.1 | 2/4 | Arena Text, LiveBench |
#8 | gemini-3.6-flash-high | 76.3 | 2/4 | Arena Text, LiveBench |
#9 | DeepSeek-R1-0528 | DeepSeek | 75.4 | 2/4 | Arena Text, LiveCodeBench |
#10 | deepseek-ai/DeepSeek-V4-Pro | deepseek-ai | 74.8 | 2/4 | GPQA, GSM8K, Humanity's Last Exam, MMLU-Pro, SWE-bench Multilingual, SWE-bench Pro, SWE-bench Verified, Terminal-Bench 2.0 |
#11 | zai-org/GLM-5.2 | zai-org | 68.0 | 2/4 | DeepSWE, GPQA, Humanity's Last Exam, SWE-bench Pro |
#12 | tencent/Hy3 | tencent | 65.8 | 2/4 | DeepSWE, GPQA, Humanity's Last Exam, SWE-bench Multilingual, SWE-bench Pro, SWE-bench Verified |
#13 | deepseek-ai/DeepSeek-V4-Flash | deepseek-ai | 65.5 | 2/4 | GPQA, Humanity's Last Exam, MMLU-Pro, SWE-bench Multilingual, SWE-bench Verified, Terminal-Bench 2.0 |
#14 | gemini-2.5-pro | 65.0 | 2/4 | Arena Text, Galileo Agent Leaderboard v2 |
#15 | thinkingmachines/Inkling-Small | thinkingmachines | 62.5 | 2/4 | GPQA, MathArena AIME 2026, SWE-bench Pro, SWE-bench Verified |
#16 | zai-org/GLM-5 | zai-org | 61.7 | 2/4 | GPQA, Humanity's Last Exam, SWE-bench Multilingual |
#17 | deepseek-v4-pro | DeepSeek | 60.4 | 2/4 | Arena Text, LiveBench |
#18 | ornith-ai/Ornith-1.5-35B-A3B | ornith-ai | 60.4 | 2/4 | DeepSWE, GPQA, SWE-bench Multilingual, SWE-bench Pro, SWE-bench Verified |
#19 | thinkingmachines/Inkling | thinkingmachines | 60.1 | 2/4 | GPQA, Humanity's Last Exam, MathArena AIME 2026, SWE-bench Pro, SWE-bench Verified |
#20 | gpt-4.1-2025-04-14 | OpenAI | 57.2 | 2/4 | Arena Text, Galileo Agent Leaderboard v2 |
#21 | qwen3-235b-a22b-instruct-2507 | Alibaba | 57.1 | 2/4 | Arena Text, Galileo Agent Leaderboard v2 |
#22 | zai-org/GLM-5.1 | zai-org | 55.4 | 2/4 | GPQA, Humanity's Last Exam, MathArena AIME 2026, Terminal-Bench 2.0 |
#23 | Qwen/Qwen3.5-397B-A17B | qwen | 55.3 | 2/4 | GPQA, Humanity's Last Exam, MMLU-Pro, SWE-bench Multilingual, SWE-bench Verified, Terminal-Bench 2.0 |
#24 | Qwen3-235B-A22B | Alibaba | 54.9 | 2/4 | Arena Text, LiveCodeBench |
#25 | qwen3.8-27b | Alibaba | 54.5 | 2/4 | Arena Text, LiveBench |
#26 | moonshotai/Kimi-K2.5 | moonshotai | 53.7 | 2/4 | GPQA, MMLU-Pro, SWE-bench Multilingual, SWE-bench Pro |
#27 | mistral-medium-2508 | Mistral AI | 53.3 | 2/4 | Arena Text, Galileo Agent Leaderboard v2 |
#28 | tencent/Hy3-preview | tencent | 50.6 | 2/4 | GPQA, SWE-bench Verified, Terminal-Bench 2.0 |
#29 | nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 | nvidia | 48.8 | 2/4 | MMLU-Pro, SWE-bench Multilingual, SWE-bench Verified |
#30 | XiaomiMiMo/MiMo-V2.5-Pro | xiaomimimo | 46.7 | 2/4 | GPQA, GSM8K, MMLU-Pro, SWE-bench Pro, SWE-bench Verified, Terminal-Bench 2.0 |
#31 | qwen3.6-plus | Alibaba | 46.2 | 2/4 | Arena Text, LiveBench |
#32 | Qwen/Qwen3.6-27B | qwen | 45.9 | 2/4 | GPQA, Humanity's Last Exam, MMLU-Pro, MathArena AIME 2026, SWE-bench Multilingual, SWE-bench Pro, SWE-bench Verified |
#33 | claude-sonnet-4-20250514 | Anthropic | 42.7 | 2/4 | Arena Text, Galileo Agent Leaderboard v2 |
#34 | Qwen/Qwen3.8-27B | qwen | 42.0 | 2/4 | DeepSWE, GPQA |
#35 | gemini-2.5-flash | 40.9 | 2/4 | Arena Text, Galileo Agent Leaderboard v2 |
#36 | deepseek-v4-flash | DeepSeek | 40.8 | 2/4 | Arena Text, LiveBench |
#37 | gpt-4.1-mini-2025-04-14 | OpenAI | 40.8 | 2/4 | Arena Text, Galileo Agent Leaderboard v2 |
#38 | zai-org/GLM-4.7 | zai-org | 39.7 | 2/4 | GPQA, Humanity's Last Exam, SWE-bench Verified |
#39 | inclusionAI/Ling-3.0-flash | inclusionai | 36.7 | 2/4 | Humanity's Last Exam, MathArena AIME 2026, SWE-bench Multilingual, SWE-bench Pro |
#40 | nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4 | nvidia | 35.3 | 2/4 | MMLU-Pro, SWE-bench Verified |
#41 | internlm/Intern-S2-Preview | internlm | 34.8 | 2/4 | MMLU-Pro, SWE-bench Verified |
#42 | meta-models/Muse-Glimmer-30B | meta-models | 34.7 | 2/4 | GPQA, Humanity's Last Exam, MathArena AIME 2026, SWE-bench Pro, SWE-bench Verified |
#43 | Qwen/Qwen3.5-122B-A10B | qwen | 34.3 | 2/4 | GPQA, SWE-bench Verified, Terminal-Bench 2.0 |
#44 | qwen3-235b-a22b-thinking-2507 | Alibaba | 34.0 | 2/4 | Arena Text, Galileo Agent Leaderboard v2 |
#45 | MiniMaxAI/MiniMax-M2.1 | minimaxai | 33.4 | 2/4 | Humanity's Last Exam, SWE-bench Verified |
#46 | MiniMaxAI/MiniMax-M2.5 | minimaxai | 32.6 | 2/4 | GPQA, Humanity's Last Exam, SWE-bench Pro |
#47 | ornith-ai/Ornith-1.5-9B | ornith-ai | 29.1 | 2/4 | GPQA, SWE-bench Multilingual, SWE-bench Pro, SWE-bench Verified |
#48 | upstage/Solar-Open2-250B | upstage | 28.0 | 2/4 | GPQA, Humanity's Last Exam, MMLU-Pro, MathArena AIME 2026, SWE-bench Verified |
#49 | moonshotai/Kimi-K2-Thinking | moonshotai | 27.3 | 2/4 | GPQA, Humanity's Last Exam, SWE-bench Verified |
#50 | Qwen/Qwen3.6-35B-A3B | qwen | 26.1 | 2/4 | GPQA, Humanity's Last Exam, MMLU-Pro, MathArena AIME 2026, SWE-bench Multilingual, SWE-bench Pro, SWE-bench Verified |
#51 | Qwen/Qwen3.5-27B | qwen | 24.8 | 2/4 | GPQA, SWE-bench Verified, Terminal-Bench 2.0 |
#52 | DeepSeek-V3 | DeepSeek | 23.8 | 3/4 | Arena Text, Galileo Agent Leaderboard v2, LiveCodeBench |
#53 | Claude-3.5-Sonnet-20241022 | Anthropic | 20.0 | 2/4 | Arena Text, LiveCodeBench |
#54 | mistral-small-2506 | Mistral AI | 15.0 | 2/4 | Arena Text, Galileo Agent Leaderboard v2 |
#55 | GPT-4O-2024-08-06 | OpenAI | 8.2 | 2/4 | Arena Text, LiveCodeBench |
#56 | MiniMaxAI/MiniMax-M2 | minimaxai | 3.4 | 2/4 | Humanity's Last Exam, MMLU-Pro, SWE-bench Verified |
#57 | gpt-4.1-nano-2025-04-14 | OpenAI | 3.4 | 2/4 | Arena Text, Galileo Agent Leaderboard v2 |
#58 | GPT-4-Turbo-2024-04-09 | OpenAI | 3.2 | 2/4 | Arena Text, LiveCodeBench |
#59 | qwen2.5-72b-instruct | Alibaba | 2.1 | 2/4 | Arena Text, Galileo Agent Leaderboard v2 |
#60 | GPT-4O-mini-2024-07-18 | OpenAI | -2.2 | 2/4 | Arena Text, LiveCodeBench |
#61 | nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 | nvidia | -7.4 | 2/4 | GPQA, Humanity's Last Exam, MMLU-Pro, SWE-bench Multilingual, Terminal-Bench 2.0 |
#62 | zai-org/GLM-4.7-Flash | zai-org | -17.6 | 2/4 | GPQA, Humanity's Last Exam, SWE-bench Verified |
#63 | nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 | nvidia | -18.3 | 2/4 | MMLU-Pro, SWE-bench Multilingual, SWE-bench Verified |
#64 | nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 | nvidia | -20.7 | 2/4 | GPQA, MMLU-Pro, SWE-bench Multilingual, SWE-bench Verified |
#65 | inclusionAI/Ling-2.6-flash | inclusionai | -27.0 | 2/4 | MathArena AIME 2026, SWE-bench Verified |