OpenAI

o3 2025-04-16

Type
modèle de langue
Contexte
200K tokens
Sortie maximale
100K
Chaîne pour l'API
azure/o3-2025-04-16

Le fournisseur a déclaré ce modèle obsolète. Il répond encore, mais mieux vaut ne pas démarrer de nouveaux projets dessus.

Prix par fournisseur

Fournisseur Entrée, $ par 1M Sortie, $ par 1M Dans nos données depuis
Microsoft Foundry azure/o3-2025-04-16 $2 $8 31 juil. 2026
OpenAI $2 $8 31 juil. 2026
Microsoft Foundry azure/us/o3-2025-04-16 $2,2 $8,8 31 juil. 2026

Seul le tarif de base et uniquement les prix au token sont affichés. Les tarifs par lots, réduits ou mis en cache, ainsi que les prix par image ou par seconde de vidéo, n'entrent pas dans ce tableau : ils ne peuvent pas figurer dans la même colonne qu'un prix par million de tokens.

Un même fournisseur apparaît plusieurs fois s'il vend ce modèle sous des identifiants différents et à des prix différents — par exemple à des précisions de poids différentes. L'identifiant est indiqué à côté du nom. Les offres identiques arrivées de deux sources sous des orthographes différentes sont fusionnées en une seule ligne.

La date de la dernière colonne est le jour où ce prix est entré pour la première fois dans notre collecte. Le prix peut être plus ancien : avant ce jour, nous ne l'enregistrions tout simplement pas. Il n'a pas changé depuis — sinon une nouvelle ligne avec une nouvelle date figurerait à sa place.

Résultats des mesures

Jeu de tâches Résultat Conditions d'exécution Mesuré par
Arena Score en français 1 445,04 1 422–1 468 — —
Arena Score, mathématiques 1 424,48 1 415–1 434 — —
Arena Score en anglais 1 414,47 1 410–1 419 — —
Arena Score, classement général 1 409,5 1 406–1 413 — —
Arena Score en russe 1 408,32 1 399–1 418 — —
Arena Score, programmation 1 408,19 1 402–1 414 — —
Arena Score, dialogue à plusieurs tours 1 404,93 1 398–1 412 — —
Arena Score, requêtes difficiles 1 401,88 1 397–1 407 — —
Arena Score, questions d'expert 1 400,18 1 389–1 412 — —
Arena Score en espagnol 1 384,08 1 365–1 403 — —
Arena Score, requêtes longues 1 370,54 1 364–1 377 — —
Arena Score, respect des consignes 1 367,67 1 362–1 373 — —
Arena Score, écriture créative 1 359,4 1 352–1 367 — —
Arena Score, compréhension de schémas 1 218,28 1 206–1 230 — —
Arena Score, reconnaissance de texte sur image 1 218,19 1 210–1 226 — —
Arena Score, travail sur images 1 215,41 1 209–1 222 — —
MATH, niveau de difficulté cinq 97,77 % effort : high · avec un harnais ajusté Epoch evaluations
Fiction.LiveBench — maintien d'un contexte long 88,9 % effort : medium Fiction.live leaderboard
Écriture créative (évaluation de Lech Mazur) 83,9 % effort : medium lechmazur/writing Github repository
Mock AIME 2024–2025 — problèmes d'olympiade 83,87 % effort : low · avec un harnais ajusté Epoch evaluations
Aider Polyglot — modifications de code dans six langages 81,3 % effort : medium · avec un harnais ajusté Aider LLM Leaderboards
GPQA Diamond — questions de niveau doctorat 75,76 % effort : low · avec un harnais ajusté Epoch evaluations
CadEval — construction de modèles CAO par le code 74 % effort : medium CadEval Dashboard
GeoBench — localisation d'un lieu à partir d'une photo 74 % effort : high GeoBench leaderboard
SWE-bench Verified — correction de bugs dans des dépôts 62,32 % effort : medium · avec un harnais ajusté Epoch evaluations
ARC-AGI — généralisation à des motifs inédits 60,8 % effort : high · avec un harnais ajusté ARC Prize Leaderboard
SimpleQA Verified — exactitude factuelle 53 % effort : high Epoch evaluations
WeirdML — tâches d'apprentissage automatique inhabituelles 52,42 % effort : high WeirdML Leaderboard
DeepResearch Bench — recherche approfondie 46,6 % effort : medium DeepResearchBench Leaderboard
SimpleBench — questions pièges 43,72 % effort : high SimpleBench Leaderboard
GDPval — tâches de métiers réels 30,8 % effort : medium —
Problèmes d'échecs 23,19 % effort : low Epoch evaluations
OSWorld — travail dans un système d'exploitation, première version 23 % effort : medium · avec un harnais ajusté OS World Website
APEX-Agents 17,2 % effort : high —
Humanity’s Last Exam — questions d'expert 16,3 % effort : high —
GSO-Bench — optimisation de code 8,8 % effort : high GSO Leaderboard
ARC-AGI-2 6,53 % effort : high —
CritPt — problèmes de physique 1,4 % effort : high —