Classement IA

Classement des meilleures IA

Le classement général : cinq capacités ramenées à un seul score, pour comparer les modèles dans leur ensemble plutôt que sur une seule tâche. Il est construit sur des comparaisons à l'aveugle par de vraies personnes : il dit donc quelles réponses sont préférées le plus souvent, pas combien de tâches ont été résolues. Pour un savoir-faire précis, la sélection dédiée est plus juste.

100 modèles dans le tableau
235 pris en compte dans le calcul
27 juillet 2026 sortie du modèle le plus récent ici
7 août 2026 dernier recalcul
# Modèle Développeur Score global Connexion$ / 1M Sortie$ / 1M Contextetokens code25 % langue20 % mathématiques15 % connaissances20 % raisonnement20 %
1 Claude Opus 5 Anthropic 99,55 94–100 $5 $25 1 000K 99,9 100 100 97,9 100
2 Claude Fable 5 ≈ Anthropic 97,78 95–99 $10 $50 1 000K 97 99,6 98,1 98,2 96,4
3 Claude Opus 4.6 ≈ Anthropic 97,74 96–99 $5 $25 1 000K 100 95,8 93,2 100 98,1
4 Claude Opus 4.7 ≈ Anthropic 95,04 93–97 $5 $25 1 000K 96,5 96,2 89,6 97,5 93,7
5 Gemini 3.6 Flash ≈ Google DeepMind 93,16 89–97 $1,5 $7,5 1 049K 92,6 94,4 93,3 94,2 91,6
6 Gemini 3.5 Flash ≈ Google DeepMind 92,6 89–96 $1,5 $9 1 049K 91,9 89,3 96,2 95,3 91,3
7 Kimi K3 ≈ Moonshot AI (Kimi) 92,55 89–96 $2 $8 1 049K 93,4 — — 92,9 91,2
8 MiMo V2.5 Pro ≈ Xiaomi 92,4 91–94 $0,44 $0,87 1 050K 93,1 94,4 87,6 94,3 91,3
9 Muse Spark 1.1 ≈ Meta AI 91,89 89–95 $1,25 $4,25 1 049K 92,6 96,4 86,3 91,3 91,4
10 GPT-5.6 Terra ≈ OpenAI 91,77 88–95 $2 $12 1 050K 91,3 96,7 86,6 94,7 88,4
11 Gemini 3.1 Pro Preview ≈ Google DeepMind 91,37 90–93 $2 $12 1 049K 90,4 94,1 89,7 91,4 91,1
12 Claude Sonnet 4.6 ≈ Anthropic 91,18 90–93 $3 $15 1 000K 93,9 90 84,5 93,9 91,2
13 ERNIE 5.1 ≈ Baidu (Ernie) 91,01 89–93 $0,75 $3 119K 91,3 93,3 87,8 91,4 90,4
14 Gemini 3 Pro ≈ Google DeepMind 90,89 89–93 $1,6 $9,6 1 049K 90,2 95,3 87,3 90,3 90,7
15 GLM 5.1 ≈ Zhipu AI / Z.ai 90,62 89–93 $0,06 $0,22 205K 92,1 91,8 87,8 90,9 89,5
16 Claude 4.5 Opus ≈ Anthropic 90,48 89–92 $5 $25 200K 93,1 92,2 84,2 91,4 89,4
17 Kimi K2.6 ≈ Moonshot AI (Kimi) 90,04 88–92 $0,22 $1,14 262K 91 90,9 87 92 88,4
18 GPT-5.6 Sol ≈ OpenAI 90,02 86–94 $5 $30 1 050K 90,8 90,2 83 94,6 89,6
19 Claude Opus 4.8 ≈ Anthropic 89,95 88–92 $5 $25 1 000K 90,7 91,3 85,5 91,8 89,1
20 Claude Sonnet 5 ≈ Anthropic 89,41 87–92 $2 $10 1 000K 90,7 90 84,8 93 87
21 GLM 5.2 ≈ Zhipu AI / Z.ai 89,16 87–92 $0,42 $1,32 1 049K 89,2 92,2 86,4 88,5 88,9
22 Qwen3.7 Plus ≈ Alibaba (Qwen) 88,91 87–91 $0,5 $3 1 000K 90 91,9 86 88,3 87,3
23 Grok 4.5 ≈ xAI 88,79 85–92 $2 $6 500K 89,5 88,3 88,8 89,9 87,3
24 Gemini 3 Flash ≈ Google DeepMind 88,54 86–91 $0,4 $2,4 1 049K 86,4 94,6 86,9 87,4 87,5
25 MiMo V2 Pro ≈ Xiaomi 87,93 86–90 $0,44 $0,87 1 049K 89 90,6 82 90 86,3
26 Inkling ≈ Thinking Machines Lab 87,44 84–91 $1,87 $4,68 1 049K 87,3 88,9 87,7 88,3 85,1
27 Kimi K2.5 Thinking TEE ≈ Moonshot AI (Kimi) 87,39 86–89 $0,3 $1,9 256K 88,5 88,1 86,3 87,9 85,6
28 Qwen3.6 Max Preview ≈ Alibaba (Qwen) 87,23 83–92 $1,3 $7,8 262K 87,3 88,4 84,7 89,2 85,9
29 Claude Sonnet 4.5 ≈ Anthropic 87,17 86–89 $3 $15 1 000K 90,7 88,8 77,1 89 87
30 DeepSeek V4 Pro ≈ DeepSeek 87,03 85–89 $0,44 $0,87 1 049K 87,9 90,1 81 87,6 86,8
31 Hy3 ≈ Tencent (Hunyuan) 86,42 83–90 $0,13 $0,53 262K 87,3 — — 87,1 84,6
32 Qwen3.5 397B-A17B ≈ Alibaba (Qwen) 86,39 85–88 $0,6 $3,6 262K 87 88,8 82,2 88,1 84,7
33 GPT-5.6 Luna ≈ OpenAI 86,35 83–90 $0,2 $1,2 1 050K 88,1 84,1 82,4 90,3 85,4
34 Grok 4.20 (Reasoning) ≈ xAI 86,12 85–88 $2 $6 2 000K 85,7 92,2 83,7 83,3 85,2
35 Gemini 2.5 Pro ≈ Google DeepMind 86,06 85–87 $1,25 $10 1 049K 84,5 91,1 82,5 86 85,7
36 MiniMax M3 ≈ MiniMax 86,02 84–88 $0,3 $1,2 1 049K 88,3 86 80,9 88,4 84,6
37 Seed 2.0 Pro ≈ ByteDance (Doubao) 85,93 84–87 $0,5 $3 131K 88 90,3 80,3 83,6 85,6
38 Qwen3 Max Preview ≈ Alibaba (Qwen) 85,84 83–88 $1,2 $6 256K 85,4 89,2 82,4 86,9 84,6
39 Qwen3.6 Plus ≈ Alibaba (Qwen) 85,84 84–88 $0,5 $3 1 000K 87 87,6 82,6 86,4 84,5
40 GLM 5V Turbo ≈ Zhipu AI / Z.ai 85,72 82–89 $0,7 $3,1 203K 87,3 88,2 83,2 85,1 83,7
41 MiMo V2.5 ≈ Xiaomi 85,67 84–87 $0,14 $0,28 1 050K 87,7 86,4 80,5 87,2 84,8
42 GLM 5 ≈ Zhipu AI / Z.ai 85,56 83–88 $0,48 $1,9 205K 86 88,8 80,2 86,3 85,1
43 Grok 4.20 Multi Agent Beta 0309 ≈ xAI 85,39 84–87 $2 $6 2 000K 85,5 90,7 80,4 84,5 84,6
44 Gemma 4 26B-A4B ≈ Google DeepMind 85,19 81–89 $0,05 $0,29 262K 82,9 90,4 85,5 84,9 82,9
45 Gemma 4 31B ≈ Google DeepMind 85,02 81–89 $0,14 $0,4 262K 85 85,4 85,4 85,4 84
46 Longcat Flash Chat ≈ Meituan 84,74 81–89 — — 131K 87,4 89,1 80,7 83,2 81,7
47 MiMo V2 Omni ≈ Xiaomi 84,54 82–87 $0,14 $0,28 262K 86,9 86,9 79 84,3 83,6
48 GLM 4.6 ≈ Zhipu AI / Z.ai 83,86 82–86 $0,29 $1,14 205K 83,9 89,5 79,1 82,5 83,1
49 Mistral Medium 3.5 ≈ Mistral AI 83,85 81–87 $1,5 $7,5 262K 86 87,4 79,3 82,5 82,4
50 DeepSeek V4 Flash ≈ DeepSeek 83,53 82–85 $0,14 $0,28 1 049K 85,2 84,7 78,2 84,1 83,7
51 Gemini 3.5 Flash Lite ≈ Google DeepMind 83,46 79–88 $0,3 $2,5 1 049K 85,1 88,2 75,8 82,6 83,3
52 GPT-5.2 Chat ≈ OpenAI 83,45 81–85 $1,75 $14 128K 83,4 86,2 79,4 83,3 84
53 Qwen3 235B A22B Instruct 2507 ≈ Alibaba (Qwen) 83,29 82–85 $0,1 $0,1 262K 83,1 87,5 78,9 84,2 81,8
54 Qwen3 VL 235B A22B Instruct ≈ Alibaba (Qwen) 83,23 79–87 $0,4 $1,6 262K 82,2 89,2 77,9 84,6 81,2
55 Claude 4.1 Opus ≈ Anthropic 83,21 82–85 $15 $75 200K 88,4 83,6 77,1 80,9 83,2
56 DeepSeek V3.2 ≈ DeepSeek 82,67 81–84 $0,28 $0,4 164K 83,8 84,4 79,8 82,6 81,8
57 Mistral Large 3 ≈ Mistral AI 82,37 81–84 $0,5 $1,5 256K 82,9 90,1 75,9 80 81,2
58 GLM 4.7 ≈ Zhipu AI / Z.ai 82,32 79–86 $0,15 $0,8 205K 85,1 83,5 77,4 80 83,7
59 Kimi K2 Thinking Turbo ≈ Moonshot AI (Kimi) 82,31 81–84 $1,15 $8 262K 84,7 83,1 78,5 83,1 80,7
60 Grok 4.1 ≈ xAI 81,83 80–83 $2 $10 200K 83 86,9 76,3 79 82,3
61 Qwen3.5 122B-A10B ≈ Alibaba (Qwen) 81,78 80–84 $0,4 $3,2 262K 81,4 86,2 78,4 82,5 79,6
62 MiniMax M2.7 ≈ MiniMax 81,65 80–83 $0,3 $1,2 205K 84,3 82,5 76,8 83,1 79,7
63 Mistral Medium 3.1 ≈ Mistral AI 81,21 80–83 $0,4 $2 262K 81,2 89,5 75 78,2 80,6
64 GLM 4.5 ≈ Zhipu AI / Z.ai 81,04 78–84 $0,2 $0,8 131K 80,9 83,2 78,1 81,4 80,9
65 Qwen3 Next 80B A3B Instruct ≈ Alibaba (Qwen) 80,91 78–84 $0,15 $1,2 262K 82,4 81,7 80,9 78,4 80,8
66 GPT-5.5 Instant ≈ OpenAI 80,57 78–83 $5 $30 400K 81,1 83,6 77,4 79,2 80,6
67 DeepSeek V3.2 Exp ≈ DeepSeek 80,46 77–84 $0,22 $0,33 164K 80,9 85,2 77,6 76,7 81,1
68 Claude Haiku 4.5 ≈ Anthropic 80,4 79–82 $1 $5 200K 84,2 80 71,7 84,1 78,9
69 Qwen3 235B A22B Thinking-2507 ≈ Alibaba (Qwen) 80,06 77–83 $0,1 $0,1 262K 79,1 — 75,5 86,2 78,5
70 Gemini 2.5 Flash ≈ Google DeepMind 80,01 79–81 $0,3 $2,5 1 049K 79,1 84,4 75 80,9 79,8
71 MiMo V2 Flash ≈ Xiaomi 79,84 78–82 $0,14 $0,28 262K 82,4 81,6 72,3 81,2 79,3
72 Qwen3 Max 2025-09-23 ≈ Alibaba (Qwen) 79,78 77–83 $0,86 $3,43 258K 82 — 80,3 76,2 80,2
73 DeepSeek V3.1 ≈ DeepSeek 79,69 76–83 $0,2 $0,7 164K 77,4 88,4 77 77,1 78,4
74 Step 3.5 Flash ≈ StepFun 79,65 78–81 $0,1 $0,3 262K 81,6 82,2 74,3 80,6 77,8
75 Qwen3.5 27B ≈ Alibaba (Qwen) 79,48 77–82 $0,3 $2,4 262K 79,3 79,7 79,3 80,9 78,1
76 ChatGPT 4o Latest ≈ OpenAI 79,12 78–81 $5 $15 128K 77,4 86,7 74,1 76,5 80,2
77 2025) ≈ Google DeepMind 78,85 77–81 $0,3 $2,5 1 049K 75 85,3 76,1 80,9 77,3
78 Grok 4 ≈ xAI 78,72 77–81 $3 $15 256K 76,3 83,2 77,6 79,6 77,2
79 o3 2025-04-16 ≈ OpenAI 78,53 77–80 $2 $8 200K 76,2 86,6 77,6 76,6 76
80 Qwen3 VL 235B A22B Thinking ≈ Alibaba (Qwen) 78,45 75–82 $0,4 $4 262K 79,9 — 75,8 80,1 77,1
81 DeepSeek R1 0528 ≈ DeepSeek 78,4 75–82 $0,25 $0,25 164K 79,7 82,4 73,8 76,1 78,5
82 Grok 4 Fast Reasoning ≈ xAI 78,33 75–81 $0,2 $0,5 2 000K 78,1 84,7 73,7 77,9 76,2
83 Gemini 3.1 Flash Lite Preview ≈ Google DeepMind 77,65 76–79 $0,25 $1,5 1 049K 74,6 82,7 78,9 76,3 76,9
84 Qwen3.5 Flash ≈ Alibaba (Qwen) 77,6 76–79 $0,09 $0,36 1 000K 77,2 80,6 74,8 78,5 76,4
85 Grok 4.1 Fast Reasoning ≈ xAI 77,42 76–79 $0,2 $0,5 2 000K 76,9 81,6 74 76,8 77,1
86 MiMo V2 Flash (Thinking) ≈ Xiaomi 77,24 74–81 $0,1 $0,31 256K 77,9 83,4 69,1 77,1 76,5
87 Qwen3.5 35B A3B ≈ Alibaba (Qwen) 77,23 75–79 $0,25 $2 262K 76,4 81,7 74 77,8 75,7
88 GPT 5 Chat ≈ OpenAI 76,95 74–79 $1,25 $10 128K 74,7 81 74,7 77,8 76,6
89 Qwen3 30B A3B Instruct 2507 ≈ Alibaba (Qwen) 76,82 74–80 $0,05 $0,19 262K 77,9 82,4 72,1 75,1 75,2
90 GPT 4.5 Preview ≈ OpenAI 76,57 72–81 $75 $150 128K 74,1 82 75,3 75,5 76,3
91 Grok 4.3 ≈ xAI 76,14 74–78 $1,25 $2,5 1 000K 77,6 80,2 71,4 74,4 75,6
92 GPT-5.3 Chat (latest) ≈ OpenAI 75,44 73–77 $1,75 $14 128K 75,8 78,7 70,2 76 75,1
93 DeepSeek V3.1 Terminus ≈ DeepSeek 75,4 71–80 $0,21 $0,79 164K 75,9 — 72,8 — 76,7
94 Nemotron 3 Super ≈ NVIDIA 75,39 72–79 $0,2 $0,8 1 000K 75,8 80,3 69,8 76,1 73,5
95 NVIDIA Nemotron 3 Super 120B A12B ≈ NVIDIA 74,16 71–77 $0,15 $0,65 262K 75,8 — 69,8 76,1 73,5
96 Hunyuan T1 ≈ Tencent (Hunyuan) 74,09 69–79 — — 131K 72,3 — 74,9 74,5 75,4
97 GLM 4.5 Air ≈ Zhipu AI / Z.ai 74,02 72–77 $0,11 $0,29 131K 74 80,3 72,6 71,3 71,6
98 Kimi K2 0905 Preview ≈ Moonshot AI (Kimi) 73,21 69–77 $0,6 $2,5 262K 74,6 75,1 72,6 70,9 72,4
99 Claude 4 Opus ≈ Anthropic 72,06 70–74 $15 $75 200K 75 72,7 68,1 71,6 71,2
100 Qwen3 Coder 480B A35B ≈ Alibaba (Qwen) 72,06 69–75 $1,5 $7,5 262K 77 77,8 66,7 65,8 70,5

Le tableau défile latéralement : toutes les colonnes ne tiennent pas.

Les colonnes de droite sont les composantes du score, ramenées à une échelle commune de 0 à 100 selon la dispersion réelle parmi les modèles mesurés. Additionnées avec les poids indiqués, elles donnent le nombre de la colonne principale : on y voit sur quoi exactement un modèle en a devancé un autre. Un tiret signifie « non mesuré », et non zéro.

Le prix est le plus bas parmi les fournisseurs du modèle, tarif de base, hors tarifs par lots ou réduits. L'entrée et la sortie sont affichées séparément à dessein : chez la plupart des modèles, la sortie coûte plusieurs fois plus cher que l'entrée, et la facture finale dépend de ce qui domine dans la tâche.

Le signe ≈ marque les modèles dont l'intervalle de confiance recoupe celui de la ligne du dessus. Il y en a ici 99 modèles — leur ordre entre eux n'est pas déterminé par les données disponibles.

L'intervalle de confiance de la moitié des modèles dépasse 4,4 points — soit environ 16 lignes voisines du tableau. À l'intérieur d'un tel groupe, l'ordre est fixé non par les données mais par ceux qui ont voté cette fois-ci ; les données soutiennent l'écart entre le début et la fin de la liste, mais pas le voisinage des places.