xAI

Grok 4

Type
modèle de langue
Contexte
256K tokens
Sortie maximale
16K
Sortie le
9 juillet 2025
Chaîne pour l'API
grok-4-0709

Prix par fournisseur

Fournisseur Entrée, $ par 1M Sortie, $ par 1M Dans nos données depuis
Jiekou.AI $2,7 $13,5 31 juil. 2026
Abacus.AI $3 $15 31 juil. 2026
xAI $3 $15 31 juil. 2026

Seul le tarif de base et uniquement les prix au token sont affichés. Les tarifs par lots, réduits ou mis en cache, ainsi que les prix par image ou par seconde de vidéo, n'entrent pas dans ce tableau : ils ne peuvent pas figurer dans la même colonne qu'un prix par million de tokens.

La date de la dernière colonne est le jour où ce prix est entré pour la première fois dans notre collecte. Le prix peut être plus ancien : avant ce jour, nous ne l'enregistrions tout simplement pas. Il n'a pas changé depuis — sinon une nouvelle ligne avec une nouvelle date figurerait à sa place.

Résultats des mesures

Jeu de tâches Résultat Conditions d'exécution Mesuré par
Arena Score en français 1 425,25 1 399–1 452 — —
Arena Score, mathématiques 1 424,24 1 412–1 437 — —
Arena Score en anglais 1 418,4 1 413–1 423 — —
Arena Score, questions d'expert 1 417,67 1 404–1 431 — —
Arena Score, dialogue à plusieurs tours 1 415,59 1 408–1 423 — —
Arena Score en espagnol 1 413,5 1 394–1 433 — —
Arena Score en russe 1 412,96 1 401–1 425 — —
Arena Score, requêtes longues 1 410,19 1 404–1 417 — —
Arena Score, classement général 1 409,91 1 406–1 414 — —
Arena Score, programmation 1 408,98 1 402–1 416 — —
Arena Score, requêtes difficiles 1 408,55 1 404–1 414 — —
Arena Score, écriture créative 1 398,43 1 390–1 407 — —
Arena Score, respect des consignes 1 387,31 1 381–1 393 — —
Arena Score, travail sur images 1 208,77 1 201–1 216 — —
Arena Score, compréhension de schémas 1 203,03 1 190–1 216 — —
Arena Score, reconnaissance de texte sur image 1 194,52 1 186–1 203 — —
Fiction.LiveBench — maintien d'un contexte long 94,4 % — Fiction.live leaderboard
Mock AIME 2024–2025 — problèmes d'olympiade 83,98 % · avec un harnais ajusté Epoch evaluations
GPQA Diamond — questions de niveau doctorat 82,67 % · avec un harnais ajusté Epoch evaluations
Aider Polyglot — modifications de code dans six langages 79,6 % · avec un harnais ajusté Aider LLM Leaderboards
Écriture créative (évaluation de Lech Mazur) 76,9 % — lechmazur/writing Github repository
ARC-AGI — généralisation à des motifs inédits 66,67 % · avec un harnais ajusté —
SimpleBench — questions pièges 52,6 % — SimpleBench Leaderboard
SimpleQA Verified — exactitude factuelle 47,9 % — Epoch evaluations
DeepResearch Bench — recherche approfondie 47,9 % — DeepResearchBench Leaderboard
WeirdML — tâches d'apprentissage automatique inhabituelles 45,73 % — WeirdML Leaderboard
GeoBench — localisation d'un lieu à partir d'une photo 45 % — GeoBench leaderboard
BALROG — environnements de jeu 43,6 % — Balrog Leaderboard
Cybench — tâches de cybersécurité 43 % · avec un harnais ajusté Grok 4 Model Card auto-déclaré
Terminal-Bench — travail en ligne de commande 27,2 % · avec un harnais ajusté Terminal-Bench v2 Leaderboard
Problèmes d'échecs 24,24 % — Epoch evaluations
GDPval — tâches de métiers réels 21,1 % effort : high —
ARC-AGI-2 15,98 % — —
APEX-Agents 15,2 % — —