1er, rang moyen 1,83
Claude Fable 5.1
Rang moyen 1,8333
★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.Copilote des modèles IA · 66 modèles · 447 résultats · mise à jour 2026-09-04
Choisissez un travail. Le cockpit montre les scores réels, leur solidité et ce qui manque encore.
Quel modèle pour développer un logiciel ?
Proximité des classements, Kendall W : 0,8, fourchette à 95 % de 0,8 à 1. Couverture : Terminal-Bench : 13 modèles du panel, 5 requis ; compte vers la preuve solide. LiveBench : 41 modèles du panel, 5 requis ; compte vers la preuve solide. Vals AI : 41 modèles du panel, 5 requis ; compte vers la preuve solide.
★★★ 3 organismes couvrent au moins 5 modèles ; 3 requis pour une preuve solideLes étoiles notent la preuve, jamais le modèle.
3 sources indépendantes
1er, rang moyen 1,83
Rang moyen 1,8333
★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.2e, rang moyen 2,67
Rang moyen 2,6667
★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.3e ex aequo, rang moyen 3,67
Rang moyen 3,6667
★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. Fourchettes publiées recouvrantes dans un test retenu.3e ex aequo, rang moyen 3,67
Rang moyen 3,6667
★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. Fourchettes publiées recouvrantes dans un test retenu.Note Origin disponible pour 17 modèles sur 2 tests de 2 équipes indépendantes, édition origin-coding-2026-09-04-v1. Claude Fable 5.1 et Claude Fable 5 hors note : Politique de repli non documentée entre les évaluateurs.
Position relative, pas un taux de réussite. La note utilise une référence figée, les mêmes tests pour tous les modèles, au moins 15 modèles communs et 2 équipes indépendantes. Le meilleur seul vaut 100 ; des modèles à égalité en tête peuvent recevoir moins. Le seuil de 15 est une règle pratique du produit.
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.
Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.
16 tarifs renseignés sur 17 modèles de l’édition. Tarif absent ou échu : Inkling.
Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.
Note Origin sur 100. Plus haut : meilleure position relative dans l’édition, pas un taux de réussite.
Édition figée au 2026-09-04. Les prix ne participent pas à la note ni aux étoiles.
Échelle logarithmique des prix : chaque graduation multiplie le tarif par dix. Sortie et entrée restent séparées.
Ronds : API directe. Carrés : prix OpenRouter. Les numéros décalés sont reliés à leur position exacte. Chaque numéro renvoie au modèle et à ses conditions ci-dessous.
| Modèle et service | Note Origin sur 100 | Entrée / sortie USD par million | Date, source et conditions |
|---|---|---|---|
| 1. GPT-5.6 SolAPI OpenAI★★☆ : solidité de la preuve | 97/100 | 4 / 20 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 2. Claude Opus 5API Anthropic★★☆ : solidité de la preuve | 88/100 | 5 / 25 | Anthropic, source tarifaire Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 3. Claude Opus 4.8API Anthropic★★☆ : solidité de la preuve | 81/100 | 5 / 25 | Anthropic, source tarifaire Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 4. GPT-5.5API OpenAI★★☆ : solidité de la preuve | 81/100 | 5 / 30 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 10 USD en entrée et 45 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 5. GPT-5.6 LunaAPI OpenAI★★☆ : solidité de la preuve | 81/100 | 0,2 / 1,2 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 0.4 USD en entrée et 1.8 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 6. GPT-5.6 TerraAPI OpenAI★★☆ : solidité de la preuve | 75/100 | 2 / 12 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 7. Gemini 3.7 FlashAPI Google★★☆ : solidité de la preuve | 59/100 | 0,75 / 3,75 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 8. GPT-5.4API OpenAI★☆☆ : solidité de la preuve | 48/100 | 2,5 / 15 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 5 USD en entrée et 22.5 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 9. Gemini 3.6 FlashAPI Google★★☆ : solidité de la preuve | 44/100 | 0,75 / 3,75 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 10. Gemini 3.5 FlashAPI Google★★☆ : solidité de la preuve | 41/100 | 1,5 / 9 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 11. Gemini 3.8 FlashAPI Google★★☆ : solidité de la preuve | 38/100 | 0,75 / 3,75 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 12. Muse Spark 1.1prix OpenRouter★☆☆ : solidité de la preuve | 38/100 | 1,25 / 4,25 | OpenRouter, source tarifaire Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 13. Muse Spark 1.2prix OpenRouter★☆☆ : solidité de la preuve | 36/100 | 1,25 / 4,25 | OpenRouter, source tarifaire Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 14. Gemini 3.1 Pro PreviewAPI Google★★☆ : solidité de la preuve | 22/100 | 2 / 12 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 200 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 15. Gemini 3.5 Flash-LiteAPI Google★★☆ : solidité de la preuve | 9/100 | 0,3 / 2,5 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 16. GPT-5.4 miniAPI OpenAI★★☆ : solidité de la preuve | 9/100 | 0,75 / 4,5 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
Échelle réelle de 0 à 100. Plus haut est meilleur
Ce graphique ne contient aucune note Origin. Il garde le score et l’échelle du test affiché.
Échelle logarithmique des prix : chaque graduation multiplie le tarif par dix. Sortie et entrée restent séparées.
Ronds : API directe. Carrés : prix OpenRouter. Les numéros décalés sont reliés à leur position exacte. Chaque numéro renvoie au modèle et à ses conditions ci-dessous.
| Modèle et service | Échelle réelle de 0 à 100 | Entrée / sortie USD par million | Date, source et conditions |
|---|---|---|---|
| 1. GPT-6 AstraAPI OpenAI★☆☆ : solidité de la preuve | 67,74 % | 10 / 50 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 20 USD en entrée et 75 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 2. Claude Fable 5.1API Anthropic★☆☆ : solidité de la preuve | 54,607 % | 10 / 50 | Anthropic, source tarifaire Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
Claude Fable 5, MiniMax M2.5, Claude Opus 4.6, GLM 5, Kimi K2.5, Claude Opus 4.7, Claude Sonnet 4.6, Claude Sonnet 5, DeepSeek V4 Flash, DeepSeek V4 Pro, GLM 5.2, GPT-5.4 nano, Grok 4.3, Grok 4.5, Grok Build 0.1, Kimi K2.6, Kimi K2.7 Code, MiniMax M3, Qwen 3.6 27B, Qwen 3.6 Plus, Qwen 3.7 Max, Kimi K3, Inkling, DeepSeek V4 Flash 0731, Qwen 3.8 Max, Smaug-Agentic, DeepSeek V4 Pro 0813, Grok 4.6, Qwen 3.8 27B, DeepSeek V4 Flash Vision Exp, GLM 5.3, GLM 5.3 Flash, Qwen 3.8 Flash Next, Nemotron 3 Ultra 550B A55B, Muse Spark 1.3, GLM 5.1, MiMo V2.5 Pro, MiMo V2.5, Inkling Small, Qwen 3.7 Plus, MiniMax M2.7, Claude Haiku 4.5, Gemini 3 Flash Preview, Mistral Medium 3.5, Gemini 3.1 Flash Lite Preview, Nemotron 3.5 Lightning, Grok 4.20 0309 Reasoning, Ling 3.0 Flash 2607, version non confirmée. Ils ne sont pas représentés à zéro.
Analyse élargie, 3 organismes, 41 modèles. Rang moyen sur 3 sources
| Rang | Note sur 100 | Modèle | Fabricant | Solidité | Artificial Analysis Coding Agent Index v1.4 | Terminal-Bench 4.0 | SWE-bench Verified | LiveBench : code | Vals Code Migration : réécrire un programme |
|---|---|---|---|---|---|---|---|---|---|
| Non classé dans l’agrégation | Mesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre. | GPT-6 Astra | OpenAI | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | 67 points | Non mesuré | Non mesuré | Non mesuré | 67,74 % |
| 1er, rang moyen 1,83 | Mesures partielles, 2 tests sur 2, hors note Origin. Politique de repli non documentée entre les évaluateurs. | Claude Fable 5.1 | Anthropic | ★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu. | 70 points | 57,88 % | Non mesuré | 86,4 % | 54,607 % |
| 2e, rang moyen 2,67 | Mesures partielles, 2 tests sur 2, hors note Origin. Politique de repli non documentée entre les évaluateurs. | Claude Fable 5 | Anthropic | ★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu. | 67 points | 44,55 % | Non mesuré | 86,0 % | 55,065 % |
| 3e ex aequo, rang moyen 3,67 | 88/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 75 à 100 | Claude Opus 5 | Anthropic | ★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. Fourchettes publiées recouvrantes dans un test retenu. | 68 points | 51,82 % | Non mesuré | 81,4 % | 57,473 % |
| 3e ex aequo, rang moyen 3,67 | 97/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 94 à 100 | GPT-5.6 Sol | OpenAI | ★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. Fourchettes publiées recouvrantes dans un test retenu. | 65 points | 37,27 % | Non mesuré | 83,9 % | 52,916 % |
| Non classé dans l’agrégation | Pas de référence | MiniMax M2.5 | MiniMax | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | 75,8 % | Non mesuré | Non mesuré |
| Non classé dans l’agrégation | Hors catalogue de cette édition, 1 tests sur 2, hors note Origin. Version ou effort non publié et documenté dans au moins un test. | Claude Opus 4.6 | Anthropic | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | 75,6 % | 78,2 % | Non mesuré |
| Non classé dans l’agrégation | Pas de référence | GLM 5 | Z.ai | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | 72,8 % | Non mesuré | Non mesuré |
| Non classé dans l’agrégation | Mesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre. | Kimi K2.5 | Moonshot AI | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | 70,8 % | Non mesuré | 6,962 % |
| 8e, rang moyen 9 | Mesures partielles, 2 tests sur 2, hors note Origin. Efforts différents entre Vals et LiveBench. | Claude Opus 4.7 | Anthropic | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 82,1 % | 43,878 % |
| 12e, rang moyen 13 | Mesures partielles, 2 tests sur 2, hors note Origin. Efforts différents entre Vals et LiveBench. | Claude Sonnet 4.6 | Anthropic | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 79,3 % | 39,892 % |
| 10e, rang moyen 9,83 | Mesures partielles, 2 tests sur 2, hors note Origin. Efforts différents entre Vals et LiveBench. | Claude Sonnet 5 | Anthropic | ★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu. | Non mesuré | 12,42 % | Non mesuré | 80,7 % | 44,392 % |
| Non classé dans l’agrégation | Hors catalogue de cette édition, 1 tests sur 2, hors note Origin. Version ou effort non publié et documenté dans au moins un test. | DeepSeek V4 Flash | DeepSeek | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | 69,2 % | Non mesuré |
| 33e, rang moyen 32 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | DeepSeek V4 Pro | DeepSeek | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 70,0 % | 26,201 % |
| 29e, rang moyen 28,5 | 22/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 19 à 25 | Gemini 3.1 Pro Preview | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 76,5 % | 17,313 % | |
| 23e, rang moyen 21,75 | 41/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 25 à 56 | Gemini 3.5 Flash | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 78,2 % | 26,745 % | |
| 13e, rang moyen 13,5 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | GLM 5.2 | Z.ai | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 79,7 % | 37,87 % |
| 37e, rang moyen 35 | 9/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 6 à 13 | GPT-5.4 mini | OpenAI | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 71,6 % | 12,936 % |
| 36e, rang moyen 34,5 | Mesures partielles, 2 tests sur 2, hors note Origin. Efforts différents entre Vals et LiveBench. | GPT-5.4 nano | OpenAI | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 70,8 % | 14,467 % |
| 19e ex aequo, rang moyen 20,25 | 48/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 41 à 56 | GPT-5.4 | OpenAI | ★☆☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. | Non mesuré | Non mesuré | Non mesuré | 77,5 % | 34,984 % |
| 5e, rang moyen 6 | 81/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 75 à 88 | GPT-5.5 | OpenAI | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 82,1 % | 45,161 % |
| 40e ex aequo, rang moyen 39 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | Grok 4.3 | xAI | ★☆☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. | Non mesuré | Non mesuré | Non mesuré | 69,9 % | 6,795 % |
| 25e, rang moyen 22,17 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | Grok 4.5 | xAI | ★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu. | Non mesuré | 12,42 % | Non mesuré | 68,6 % | 36,596 % |
| Non classé dans l’agrégation | Hors catalogue de cette édition, 1 tests sur 2, hors note Origin. Version ou effort non publié et documenté dans au moins un test. | Grok Build 0.1 | xAI | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | 65,4 % | Non mesuré |
| 17e, rang moyen 20 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | Kimi K2.6 | Moonshot AI | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 78,6 % | 27,768 % |
| 30e, rang moyen 29 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | Kimi K2.7 Code | Moonshot AI | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 74,0 % | 25,392 % |
| 38e, rang moyen 35,5 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | MiniMax M3 | MiniMax | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 68,2 % | 19,925 % |
| Non classé dans l’agrégation | Hors catalogue de cette édition, 1 tests sur 2, hors note Origin. Version ou effort non publié et documenté dans au moins un test. | Qwen 3.6 27B | Alibaba | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | 71,8 % | Non mesuré |
| 28e, rang moyen 28,25 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | Qwen 3.6 Plus | Alibaba | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 78,2 % | 11,102 % |
| 34e, rang moyen 32,5 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | Qwen 3.7 Max | Alibaba | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 74,2 % | 13,069 % |
| 11e, rang moyen 10,5 | 75/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 63 à 88 | GPT-5.6 Terra | OpenAI | ★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu. | Non mesuré | 21,52 % | Non mesuré | 78,2 % | 47,804 % |
| 6e ex aequo, rang moyen 7,5 | 81/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 69 à 94 | GPT-5.6 Luna | OpenAI | ★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. Fourchettes publiées recouvrantes dans un test retenu. | Non mesuré | 17,27 % | Non mesuré | 82,9 % | 44,55 % |
| 26e ex aequo, rang moyen 22,25 | 38/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 31 à 44 | Muse Spark 1.1 | Meta | ★☆☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. | Non mesuré | Non mesuré | Non mesuré | 77,2 % | 31,115 % |
| 19e ex aequo, rang moyen 20,25 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | Kimi K3 | Moonshot AI | ★☆☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. | Non mesuré | Non mesuré | Non mesuré | 81,4 % | 16,099 % |
| 39e, rang moyen 36 | 3/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 0 à 6 | Inkling | Thinking Machines Lab | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 71,0 % | 11,79 % |
| 35e, rang moyen 33,5 | 9/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 0 à 19 | Gemini 3.5 Flash-Lite | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 76,1 % | 6,148 % | |
| 21e, rang moyen 21 | 44/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 38 à 50 | Gemini 3.6 Flash | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 77,9 % | 30,928 % | |
| 6e ex aequo, rang moyen 7,5 | 81/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 81 à 81 | Claude Opus 4.8 | Anthropic | ★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. Fourchettes publiées recouvrantes dans un test retenu. | Non mesuré | 23,64 % | Non mesuré | 81,8 % | 47,25 % |
| 24e, rang moyen 22 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | DeepSeek V4 Flash 0731 | DeepSeek | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 75,0 % | 38,631 % |
| 31e, rang moyen 30 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | Qwen 3.8 Max | Alibaba | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 72,9 % | 23,958 % |
| 26e ex aequo, rang moyen 22,25 | 36/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 31 à 41 | Muse Spark 1.2 | Meta | ★☆☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. | Non mesuré | Non mesuré | Non mesuré | 77,5 % | 29,954 % |
| Non classé dans l’agrégation | Hors catalogue de cette édition, 1 tests sur 2, hors note Origin. Version ou effort non publié et documenté dans au moins un test. | Smaug-Agentic | Abacus.AI | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | 82,5 % | Non mesuré |
| 16e, rang moyen 18,25 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | DeepSeek V4 Pro 0813 | DeepSeek | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 77,2 % | 41,54 % |
| 14e, rang moyen 14,17 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | Grok 4.6 | xAI | ★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu. | Non mesuré | 20,30 % | Non mesuré | 76,8 % | 44,572 % |
| 15e, rang moyen 14,83 | 59/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 50 à 69 | Gemini 3.7 Flash | ★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu. | Non mesuré | 11,21 % | Non mesuré | 78,9 % | 34,8 % | |
| 32e, rang moyen 31 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | Qwen 3.8 27B | Alibaba | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 75,7 % | 14,157 % |
| Non classé dans l’agrégation | Hors catalogue de cette édition, 1 tests sur 2, hors note Origin. Version ou effort non publié et documenté dans au moins un test. | DeepSeek V4 Flash Vision Exp | DeepSeek | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | 68,2 % | Non mesuré |
| 9e, rang moyen 9,5 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | GLM 5.3 | Z.ai | ★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu. | Non mesuré | 41,82 % | Non mesuré | 79,0 % | 44,222 % |
| 22e, rang moyen 21,25 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | GLM 5.3 Flash | Z.ai | ★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. | Non mesuré | Non mesuré | Non mesuré | 79,0 % | 20,515 % |
| Non classé dans l’agrégation | Hors catalogue de cette édition, 1 tests sur 2, hors note Origin. Version ou effort non publié et documenté dans au moins un test. | Qwen 3.8 Flash Next | Alibaba | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | 72,6 % | Non mesuré |
| 40e ex aequo, rang moyen 39 | Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. | Nemotron 3 Ultra 550B A55B | NVIDIA | ★☆☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. | Non mesuré | Non mesuré | Non mesuré | 70,7 % | 4,905 % |
| 18e, rang moyen 20,17 | 38/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 13 à 63 | Gemini 3.8 Flash | ★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu. | Non mesuré | 19,09 % | Non mesuré | 72,5 % | 36,546 % | |
| Non classé dans l’agrégation | Hors catalogue de cette édition, 1 tests sur 2, hors note Origin. Version ou effort non publié et documenté dans au moins un test. | Muse Spark 1.3 | Meta | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | 81,1 % | Non mesuré |
| Non classé dans l’agrégation | Mesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre. | GLM 5.1 | Z.ai | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | Non mesuré | 25,768 % |
| Non classé dans l’agrégation | Mesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre. | MiMo V2.5 Pro | Xiaomi | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | Non mesuré | 21,557 % |
| Non classé dans l’agrégation | Mesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre. | MiMo V2.5 | Xiaomi | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | Non mesuré | 14,228 % |
| Non classé dans l’agrégation | Mesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre. | Inkling Small | Thinking Machines Lab | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | Non mesuré | 13,675 % |
| Non classé dans l’agrégation | Mesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre. | Qwen 3.7 Plus | Alibaba | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | Non mesuré | 12,856 % |
| Non classé dans l’agrégation | Mesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre. | MiniMax M2.7 | MiniMax | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | Non mesuré | 8,685 % |
| Non classé dans l’agrégation | Mesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre. | Claude Haiku 4.5 | Anthropic | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | Non mesuré | 7,551 % |
| Non classé dans l’agrégation | Mesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre. | Gemini 3 Flash Preview | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | Non mesuré | 6,391 % | |
| Non classé dans l’agrégation | Mesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre. | Mistral Medium 3.5 | Mistral AI | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | Non mesuré | 5,127 % |
| Non classé dans l’agrégation | Hors catalogue de cette édition, 1 tests sur 2, hors note Origin. Disponibilité de cette version non vérifiée ; mesure historique conservée. | Gemini 3.1 Flash Lite Preview | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | Non mesuré | 4,609 % | |
| Non classé dans l’agrégation | Mesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre. | Nemotron 3.5 Lightning | NVIDIA | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | Non mesuré | 2,951 % |
| Non classé dans l’agrégation | Mesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre. | Grok 4.20 0309 Reasoning | xAI | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | Non mesuré | 0,314 % |
| Non classé dans l’agrégation | Hors catalogue de cette édition, 1 tests sur 2, hors note Origin. Disponibilité de cette version non vérifiée ; mesure historique conservée. | Ling 3.0 Flash 2607, version non confirmée | Ant Group | ★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile. | Non mesuré | Non mesuré | Non mesuré | Non mesuré | 0 % |
Méta-analyse par agrégation de rangs, 3 sources, 41 modèles, W = 0,8012. Fourchette à 95 % : 0,8 à 1. Sensibilité : Noyau strict, 2 organismes, 13 modèles. Accord des classements (W) : 0,82. Autre podium : Claude Fable 5.1 (1er), Claude Fable 5 (2e), GPT-5.6 Sol (3e). Écarts de podium : Claude Opus 5 : 3e ex aequo dans l’analyse affichée, 4e dans cette autre analyse ; GPT-5.6 Sol : 3e ex aequo dans l’analyse affichée, 3e dans cette autre analyse. Les deux analyses restent séparées, sans moyenne.
Claude Fable 5.1 et Claude Opus 5 : Les fourchettes publiées se recouvrent.
Claude Fable 5 et GLM 5.3 et GPT-5.6 Sol : Les fourchettes publiées se recouvrent.
Claude Opus 4.8 et GPT-5.6 Terra et Grok 4.6 et Gemini 3.8 Flash et GPT-5.6 Luna et Claude Sonnet 5 et Grok 4.5 et Gemini 3.7 Flash : Les fourchettes publiées se recouvrent.
Kimi K3 et Claude Opus 5 : Les scores publiés sont identiques.
GLM 5.3 et GLM 5.3 Flash : Les scores publiés sont identiques.
Gemini 3.5 Flash et Qwen 3.6 Plus : Les scores publiés sont identiques.
GPT-5.4 et Muse Spark 1.2 : Les scores publiés sont identiques.
DeepSeek V4 Pro 0813 et Muse Spark 1.1 : Les scores publiés sont identiques.
Claude Opus 5 et GPT-5.6 Sol : Même rang moyen après combinaison des sources.
Claude Opus 4.8 et GPT-5.6 Luna : Même rang moyen après combinaison des sources.
GPT-5.4 et Kimi K3 : Même rang moyen après combinaison des sources.
Muse Spark 1.1 et Muse Spark 1.2 : Même rang moyen après combinaison des sources.
Grok 4.3 et Nemotron 3 Ultra 550B A55B : Même rang moyen après combinaison des sources.
SWE-bench : Origine d’exécution non vérifiée : résultat publié mais non compté, la soumission ne prouve pas le contrôle par l’équipe.
Artificial Analysis : Dépend d’une autre source retenue, Terminal-Bench 4.0. Écartée pour éviter de compter deux fois la même famille de tâches.
Artificial Analysis. Valeurs exactes, sans barre. Plus haut est meilleur.
Organisme commercial extérieur
Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.
Le score mesure Claude Fable 5.1 avec un agent précis. Changer cet agent peut changer le résultat.
Organisme commercial extérieur
Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.
Le score mesure Claude Opus 5 avec un agent précis. Changer cet agent peut changer le résultat.
Organisme commercial extérieur
Agent Codex. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.
Le score mesure GPT-6 Astra avec un agent précis. Changer cet agent peut changer le résultat.
Organisme commercial extérieur
Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.
Le score mesure Claude Fable 5 avec un agent précis. Changer cet agent peut changer le résultat.
Organisme commercial extérieur
Agent Codex. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.
Le score mesure GPT-5.6 Sol avec un agent précis. Changer cet agent peut changer le résultat.
Terminal-Bench. Échelle réelle de 0 à 100. Plus haut est meilleur.
IC à 95 % publié par la source, erreur standard par tâche : 54,12 à 61,64 %
Test extérieur
Claude Code 2.1.257. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5-1. Date de sortie déclarée par Terminal-Bench : 2026-09-01. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
IC à 95 % publié par la source, erreur standard par tâche : 48,43 à 55,21 %
Test extérieur
Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-5. Date de sortie déclarée par Terminal-Bench : 2026-07-24. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
IC à 95 % publié par la source, erreur standard par tâche : 40,70 à 48,40 %
Test extérieur
Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5. Date de sortie déclarée par Terminal-Bench : 2026-06-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
IC à 95 % publié par la source, erreur standard par tâche : 38,59 à 45,05 %
Test extérieur
Claude Code 2.1.207. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/glm-5.3. Date de sortie déclarée par Terminal-Bench : 2026-08-14. Fabricant Z.ai ; préfixe source anthropic/, fournisseur du point d’accès non publié. Effort max chez Terminal-Bench ; effort LiveBench non publié. Aucune équivalence supposée. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
IC à 95 % publié par la source, erreur standard par tâche : 33,49 à 41,05 %
Test extérieur
Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-sol. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
IC à 95 % publié par la source, erreur standard par tâche : 20,08 à 27,20 %
Test extérieur
Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-4-8. Date de sortie déclarée par Terminal-Bench : 2026-05-28. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
IC à 95 % publié par la source, erreur standard par tâche : 18,27 à 24,77 %
Test extérieur
Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-terra. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
IC à 95 % publié par la source, erreur standard par tâche : 17,21 à 23,39 %
Test extérieur
Grok Build 1.0.5. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.6. Date de sortie déclarée par Terminal-Bench : 2026-08-12. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
IC à 95 % publié par la source, erreur standard par tâche : 15,73 à 22,45 %
Test extérieur
mini-SWE-agent 2.4.6. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.8-flash. Date de sortie déclarée par Terminal-Bench : 2026-09-02. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
IC à 95 % publié par la source, erreur standard par tâche : 14,42 à 20,12 %
Test extérieur
Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-luna. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
IC à 95 % publié par la source, erreur standard par tâche : 9,36 à 15,48 %
Test extérieur
Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-sonnet-5. Date de sortie déclarée par Terminal-Bench : 2026-06-30. Efforts différents : max chez Terminal-Bench, xhigh chez LiveBench. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
IC à 95 % publié par la source, erreur standard par tâche : 9,80 à 15,04 %
Test extérieur
Grok Build 1.0.5. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.5. Date de sortie déclarée par Terminal-Bench : 2026-07-16. Écart conservé avec la date du catalogue Origin : 2026-07-08. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
IC à 95 % publié par la source, erreur standard par tâche : 8,76 à 13,66 %
Test extérieur
mini-SWE-agent 2.4.6. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.7-flash. Date de sortie déclarée par Terminal-Bench : 2026-08-13. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
SWE-bench. Échelle réelle de 0 à 100. Plus haut est meilleur.
Origine d’exécution non vérifiée
mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.
Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 379 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Origine d’exécution non vérifiée
mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.
Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 378 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Valeur révisée de 75,4 à 75,6 % le 18 février 2026 : https://github.com/SWE-bench/experiments/commit/36905bfeb728dadd82a75bb169ed612aac634551. Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Origine d’exécution non vérifiée
mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.
Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 364 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Origine d’exécution non vérifiée
mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.
Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 354 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
LiveBench. Échelle réelle de 0 à 100. Plus haut est meilleur.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Vals AI. Échelle réelle de 0 à 100. Plus haut est meilleur.
Erreur standard publiée : 4,216 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-6-astra. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,371 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,605 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,812 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,353 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,28 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,176 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,164 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.5. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,479 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.6. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,244 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,246 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,289 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.3. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,22 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,301 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,138 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,382 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,143 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.2. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,141 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.5. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,184 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,113 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,225 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,068 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.1. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,068 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,023 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.2. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,144 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,104 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,037 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-pro-20260423/endpoints. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,087 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.1. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,161 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,309 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,127 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,207 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/vlm/glm-5.3-flash. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 3,944 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 3,933 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,101 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,025 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-nano. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 3,687 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 4,189 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/qwen/qwen3.8-27b-20260814/endpoints. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 3,81 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 2,858 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 3,641 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-mini. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 2,931 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 3,396 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 1,312 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 1,786 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 1,056 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 1,29 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/moonshotai/kimi-k2.5-0127/endpoints. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 1,195 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.3. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 1,093 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 1,708 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 1,369 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.mistral.ai/models/mistral-medium-3-5-26-04. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 1,589 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://build.nvidia.com/nvidia/nemotron-3-ultra-550b-a55b. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 1,069 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 0,951 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 0,11 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.20-0309-reasoning. Dossier complet : /benchmarks/vals-2026-09.json
Erreur standard publiée : 0 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints. Dossier complet : /benchmarks/vals-2026-09.json
Aucune moyenne entre les usages. Chaque ligne reprend le classement disponible pour cet usage.
| Usage | En tête | Solidité | Sources |
|---|---|---|---|
| Raisonnement général | Claude Fable 5.1 | ★★☆ Une équipe extérieure, confirmation manquante | LiveBench : raisonnement |
| Missions longues | Claude Fable 5.1 | ★★☆ Une équipe extérieure, confirmation manquante | LiveBench : code autonome |
| Développement logiciel | Claude Fable 5.1 | ★★★ 3 organismes couvrent au moins 5 modèles ; 3 requis pour une preuve solide | 3 sources indépendantes |
| Juridique | GPT-6 Astra | ★★☆ Une équipe extérieure, confirmation manquante | APEX-Agents Corporate Lawyer, moyenne des critères |
| Finance et comptabilité | Claude Fable 5.1 | ★★☆ Une équipe extérieure, confirmation manquante | APEX-Agents Investment Banking Analyst, moyenne des critères |
| Santé | Chiffres fabricant seulement | ☆☆☆ Chiffres du fabricant seulement | HealthBench Professional |
| Maths et sciences | Claude Fable 5.1 | ★★☆ Une équipe extérieure, confirmation manquante | LiveBench : mathématiques |
| Usage d’ordinateur | Personne n’a mesuré | ☆☆☆ Aucune mesure disponible | Aucun test public |
| Contexte long | Personne n’a mesuré | ☆☆☆ Aucune mesure disponible | Aucun test public |
| Exactitude factuelle | GPT-6 Astra | ★★☆ Une équipe extérieure, confirmation manquante | AA-Omniscience, réponses inventées |
| Vision | Personne n’a mesuré | ☆☆☆ Aucune mesure disponible | Aucun test public |
| Voix | Personne n’a mesuré | ☆☆☆ Aucune mesure disponible | Aucun test public |
| Éducation | Personne n’a mesuré | ☆☆☆ Aucune mesure disponible | Aucun test public |
| Cybersécurité | Personne n’a mesuré | ☆☆☆ Aucune mesure disponible | Aucun test public |
| Efficacité | Personne n’a mesuré | ☆☆☆ Aucune mesure disponible | Aucun test public |
Aucune moyenne entre les usages.
Note Origin disponible pour 17 modèles sur 2 tests de 2 équipes indépendantes, édition origin-coding-2026-09-04-v1. Claude Fable 5.1 et Claude Fable 5 hors note : Politique de repli non documentée entre les évaluateurs.
GPT-5.6 Sol : 97/100, position relative, pas un taux de réussite, 2 tests, 2 équipes, édition origin-coding-2026-09-04-v1 arrêtée au 2026-09-04, selon les tests 94 à 100.
Claude Opus 5 : 88/100, position relative, pas un taux de réussite, 2 tests, 2 équipes, édition origin-coding-2026-09-04-v1 arrêtée au 2026-09-04, selon les tests 75 à 100.
Claude Opus 4.8 : 81/100, position relative, pas un taux de réussite, 2 tests, 2 équipes, édition origin-coding-2026-09-04-v1 arrêtée au 2026-09-04, selon les tests 81 à 81.
Quel modèle pour raisonner sur des sujets variés ?
Une seule équipe porte ce podium. Les autres tests de raisonnement général restent affichés séparément.
★★☆ Une équipe extérieure, confirmation manquanteNote Origin indisponible : couverture actuelle, 4 tests au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.
Agrégation en attente de couverture, 2 modèles communs sur 49.
Agrégation en attente de couverture, 2 modèles communs sur 49.
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.
Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.
Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.
Échelle réelle de 0 à 100. Plus haut est meilleur
Ce graphique ne contient aucune note Origin. Il garde le score et l’échelle du test affiché.
Échelle logarithmique des prix : chaque graduation multiplie le tarif par dix. Sortie et entrée restent séparées.
Ronds : API directe. Carrés : prix OpenRouter. Les numéros décalés sont reliés à leur position exacte. Chaque numéro renvoie au modèle et à ses conditions ci-dessous.
| Modèle et service | Échelle réelle de 0 à 100 | Entrée / sortie USD par million | Date, source et conditions |
|---|---|---|---|
| 1. Claude Fable 5.1API Anthropic★☆☆ : solidité de la preuve | 91,7 % | 10 / 50 | Anthropic, source tarifaire Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 2. GPT-5.6 SolAPI OpenAI★☆☆ : solidité de la preuve | 91,7 % | 4 / 20 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 3. Claude Opus 5API Anthropic★☆☆ : solidité de la preuve | 91,2 % | 5 / 25 | Anthropic, source tarifaire Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 4. GPT-5.6 TerraAPI OpenAI★☆☆ : solidité de la preuve | 90,6 % | 2 / 12 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 5. Muse Spark 1.2prix OpenRouter★☆☆ : solidité de la preuve | 90,0 % | 1,25 / 4,25 | OpenRouter, source tarifaire Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 6. GPT-5.5API OpenAI★☆☆ : solidité de la preuve | 89,7 % | 5 / 30 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 10 USD en entrée et 45 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 7. Gemini 3.8 FlashAPI Google★☆☆ : solidité de la preuve | 89,3 % | 0,75 / 3,75 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 8. Claude Opus 4.8API Anthropic★☆☆ : solidité de la preuve | 89,2 % | 5 / 25 | Anthropic, source tarifaire Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 9. GPT-5.4API OpenAI★☆☆ : solidité de la preuve | 88,1 % | 2,5 / 15 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 5 USD en entrée et 22.5 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 10. Gemini 3.7 FlashAPI Google★☆☆ : solidité de la preuve | 87,8 % | 0,75 / 3,75 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 11. Muse Spark 1.1prix OpenRouter★☆☆ : solidité de la preuve | 87,7 % | 1,25 / 4,25 | OpenRouter, source tarifaire Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 12. GPT-5.6 LunaAPI OpenAI★☆☆ : solidité de la preuve | 85,6 % | 0,2 / 1,2 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 0.4 USD en entrée et 1.8 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 13. Gemini 3.6 FlashAPI Google★☆☆ : solidité de la preuve | 85,1 % | 0,75 / 3,75 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 14. Gemini 3.1 Pro PreviewAPI Google★☆☆ : solidité de la preuve | 84,0 % | 2 / 12 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 200 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 15. Gemini 3.5 FlashAPI Google★☆☆ : solidité de la preuve | 82,0 % | 1,5 / 9 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 16. GPT-5.4 miniAPI OpenAI★☆☆ : solidité de la preuve | 71,3 % | 0,75 / 4,5 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 17. Gemini 3.5 Flash-LiteAPI Google★☆☆ : solidité de la preuve | 60,2 % | 0,3 / 2,5 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
Claude Fable 5, Claude Opus 4.6, Claude Opus 4.7, Claude Sonnet 4.6, Claude Sonnet 5, DeepSeek V4 Flash, DeepSeek V4 Pro, GLM 5.2, GPT-5.4 nano, Grok 4.3, Grok 4.5, Grok Build 0.1, Kimi K2.6, Kimi K2.7 Code, MiniMax M3, Qwen 3.6 27B, Qwen 3.6 Plus, Qwen 3.7 Max, Kimi K3, Inkling, DeepSeek V4 Flash 0731, Qwen 3.8 Max, Smaug-Agentic, DeepSeek V4 Pro 0813, Grok 4.6, Qwen 3.8 27B, DeepSeek V4 Flash Vision Exp, GLM 5.3, GLM 5.3 Flash, Qwen 3.8 Flash Next, Nemotron 3 Ultra 550B A55B, Muse Spark 1.3. Ils ne sont pas représentés à zéro.
Rang sur LiveBench : raisonnement
| Rang | Note sur 100 | Modèle | Fabricant | Solidité | Artificial Analysis Intelligence Index v4.1.1 | Epoch Capabilities Index | LiveBench : raisonnement | LiveBench : analyse de données | LiveBench : langue | LiveBench : suivi des consignes |
|---|---|---|---|---|---|---|---|---|---|---|
| Non classé sur ce test | Pas de référence | GPT-6 Astra | OpenAI | ★★☆ Une équipe extérieure | 61 points | 169 points Epoch | Non mesuré | Non mesuré | Non mesuré | Non mesuré |
| 1er | Pas de référence | Claude Fable 5.1 | Anthropic | ★★☆ Une équipe extérieure | 66 points | 163 points Epoch | 91,7 % | 80,3 % | 89,5 % | 73,0 % |
| 10e ex aequo | Pas de référence | Claude Fable 5 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 89,7 % | 80,5 % | 90,7 % | 75,8 % |
| 3e | Pas de référence | Claude Opus 5 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 91,2 % | 74,6 % | 88,7 % | 63,8 % |
| 2e | Pas de référence | GPT-5.6 Sol | OpenAI | ★★☆ Une équipe extérieure | 61 points | 162 points Epoch | 91,7 % | 79,8 % | 87,7 % | 71,8 % |
| Non classé sur ce test | Pas de référence | MiniMax M2.5 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré |
| 15e | Pas de référence | Claude Opus 4.6 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 88,7 % | 69,9 % | 83,3 % | 63,3 % |
| Non classé sur ce test | Pas de référence | GLM 5 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K2.5 | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré |
| 21e | Pas de référence | Claude Opus 4.7 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 87,2 % | 78,3 % | 77,9 % | 66,7 % |
| 29e | Pas de référence | Claude Sonnet 4.6 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 84,8 % | 77,9 % | 76,1 % | 63,2 % |
| 14e | Pas de référence | Claude Sonnet 5 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 88,7 % | 71,7 % | 75,0 % | 63,9 % |
| 47e | Pas de référence | DeepSeek V4 Flash | DeepSeek | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 70,6 % | 68,0 % | 70,1 % | 63,1 % |
| 33e | Pas de référence | DeepSeek V4 Pro | DeepSeek | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 82,7 % | 74,5 % | 78,1 % | 62,4 % |
| 30e | Pas de référence | Gemini 3.1 Pro Preview | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 84,0 % | 78,5 % | 85,4 % | 79,1 % | |
| 34e | Pas de référence | Gemini 3.5 Flash | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 82,0 % | 64,9 % | 84,6 % | 75,6 % | |
| 38e | Pas de référence | GLM 5.2 | Z.ai | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 78,6 % | 73,7 % | 76,2 % | 62,3 % |
| 45e | Pas de référence | GPT-5.4 mini | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 71,3 % | 70,8 % | 71,0 % | 59,8 % |
| 35e | Pas de référence | GPT-5.4 nano | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 81,1 % | 67,6 % | 62,5 % | 67,2 % |
| 17e | Pas de référence | GPT-5.4 | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 88,1 % | 79,3 % | 82,6 % | 70,2 % |
| 10e ex aequo | Pas de référence | GPT-5.5 | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 89,7 % | 81,6 % | 87,4 % | 70,7 % |
| 46e | Pas de référence | Grok 4.3 | xAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 70,8 % | 55,8 % | 73,6 % | 62,8 % |
| 22e | Pas de référence | Grok 4.5 | xAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 87,2 % | 73,0 % | 82,8 % | 71,5 % |
| 41e | Pas de référence | Grok Build 0.1 | xAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 76,4 % | 70,8 % | 72,5 % | 65,2 % |
| 37e | Pas de référence | Kimi K2.6 | Moonshot AI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 79,4 % | 65,1 % | 75,1 % | 64,4 % |
| 32e | Pas de référence | Kimi K2.7 Code | Moonshot AI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 82,8 % | 62,7 % | 77,9 % | 56,3 % |
| 44e | Pas de référence | MiniMax M3 | MiniMax | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 74,5 % | 76,2 % | 76,8 % | 57,5 % |
| 48e | Pas de référence | Qwen 3.6 27B | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 70,3 % | 70,4 % | 63,3 % | 53,2 % |
| 42e | Pas de référence | Qwen 3.6 Plus | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 75,8 % | 69,9 % | 75,0 % | 58,3 % |
| 31e | Pas de référence | Qwen 3.7 Max | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 83,3 % | 71,8 % | 79,7 % | 74,0 % |
| 5e | Pas de référence | GPT-5.6 Terra | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 90,6 % | 79,3 % | 82,9 % | 64,6 % |
| 26e | Pas de référence | GPT-5.6 Luna | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 85,6 % | 78,0 % | 72,6 % | 60,1 % |
| 19e | Pas de référence | Muse Spark 1.1 | Meta | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 87,7 % | 72,5 % | 74,3 % | 69,6 % |
| 4e | Pas de référence | Kimi K3 | Moonshot AI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 90,7 % | 78,7 % | 85,5 % | 71,4 % |
| 39e | Pas de référence | Inkling | Thinking Machines Lab | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 78,3 % | 72,8 % | 73,5 % | 70,1 % |
| 49e | Pas de référence | Gemini 3.5 Flash-Lite | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 60,2 % | 53,2 % | 71,8 % | 67,2 % | |
| 28e | Pas de référence | Gemini 3.6 Flash | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 85,1 % | 63,0 % | 83,9 % | 75,4 % | |
| 13e | Pas de référence | Claude Opus 4.8 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 89,2 % | 66,0 % | 79,7 % | 72,0 % |
| 23e | Pas de référence | DeepSeek V4 Flash 0731 | DeepSeek | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 86,6 % | 79,3 % | 79,2 % | 65,5 % |
| 16e | Pas de référence | Qwen 3.8 Max | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 88,2 % | 78,4 % | 79,7 % | 74,1 % |
| 8e | Pas de référence | Muse Spark 1.2 | Meta | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 90,0 % | 76,5 % | 78,6 % | 74,3 % |
| 7e | Pas de référence | Smaug-Agentic | Abacus.AI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 90,3 % | 79,9 % | 84,4 % | 71,0 % |
| 24e | Pas de référence | DeepSeek V4 Pro 0813 | DeepSeek | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 85,8 % | 79,2 % | 82,1 % | 67,7 % |
| 6e | Pas de référence | Grok 4.6 | xAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 90,5 % | 73,9 % | 83,7 % | 71,9 % |
| 18e | Pas de référence | Gemini 3.7 Flash | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 87,8 % | 68,0 % | 85,5 % | 79,9 % | |
| 36e | Pas de référence | Qwen 3.8 27B | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 80,0 % | 76,6 % | 74,3 % | 72,7 % |
| 27e | Pas de référence | DeepSeek V4 Flash Vision Exp | DeepSeek | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 85,4 % | 79,5 % | 80,4 % | 71,0 % |
| 25e | Pas de référence | GLM 5.3 | Z.ai | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 85,8 % | 70,2 % | 79,9 % | 69,3 % |
| 40e | Pas de référence | GLM 5.3 Flash | Z.ai | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 77,6 % | 76,4 % | 77,3 % | 52,8 % |
| 20e | Pas de référence | Qwen 3.8 Flash Next | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 87,4 % | 74,2 % | 74,6 % | 77,1 % |
| 43e | Pas de référence | Nemotron 3 Ultra 550B A55B | NVIDIA | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 74,7 % | 54,5 % | 70,8 % | 73,4 % |
| 12e | Pas de référence | Gemini 3.8 Flash | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 89,3 % | 54,0 % | 87,8 % | 81,4 % | |
| 10e ex aequo | Pas de référence | Muse Spark 1.3 | Meta | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 89,7 % | 79,6 % | 82,8 % | 78,0 % |
| Non classé sur ce test | Pas de référence | GLM 5.1 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | MiMo V2.5 Pro | Xiaomi | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | MiMo V2.5 | Xiaomi | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Inkling Small | Thinking Machines Lab | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.7 Plus | Alibaba | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | MiniMax M2.7 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Haiku 4.5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3 Flash Preview | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | |
| Non classé sur ce test | Pas de référence | Mistral Medium 3.5 | Mistral AI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.1 Flash Lite Preview | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | |
| Non classé sur ce test | Pas de référence | Nemotron 3.5 Lightning | NVIDIA | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.20 0309 Reasoning | xAI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Ling 3.0 Flash 2607, version non confirmée | Ant Group | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré | Non mesuré |
Quel modèle pour mener une mission longue ?
Une seule équipe porte ce podium. Les autres tests de missions longues restent affichés séparément.
★★☆ Une équipe extérieure, confirmation manquanteNote Origin indisponible : couverture actuelle, 1 test au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.
Agrégation en attente de couverture, 0 modèles communs sur 49.
Agrégation en attente de couverture, 0 modèles communs sur 49.
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.
Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.
Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.
Échelle réelle de 0 à 100. Plus haut est meilleur
Ce graphique ne contient aucune note Origin. Il garde le score et l’échelle du test affiché.
Échelle logarithmique des prix : chaque graduation multiplie le tarif par dix. Sortie et entrée restent séparées.
Ronds : API directe. Carrés : prix OpenRouter. Les numéros décalés sont reliés à leur position exacte. Chaque numéro renvoie au modèle et à ses conditions ci-dessous.
| Modèle et service | Échelle réelle de 0 à 100 | Entrée / sortie USD par million | Date, source et conditions |
|---|---|---|---|
| 1. Claude Fable 5.1API Anthropic★☆☆ : solidité de la preuve | 66,1 % | 10 / 50 | Anthropic, source tarifaire Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 2. Claude Opus 5API Anthropic★☆☆ : solidité de la preuve | 65,2 % | 5 / 25 | Anthropic, source tarifaire Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 3. Muse Spark 1.1prix OpenRouter★☆☆ : solidité de la preuve | 58,5 % | 1,25 / 4,25 | OpenRouter, source tarifaire Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 4. Gemini 3.7 FlashAPI Google★☆☆ : solidité de la preuve | 58,3 % | 0,75 / 3,75 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 5. Muse Spark 1.2prix OpenRouter★☆☆ : solidité de la preuve | 57,6 % | 1,25 / 4,25 | OpenRouter, source tarifaire Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 6. GPT-5.6 SolAPI OpenAI★☆☆ : solidité de la preuve | 56,2 % | 4 / 20 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 7. GPT-5.6 TerraAPI OpenAI★☆☆ : solidité de la preuve | 54,9 % | 2 / 12 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 8. Gemini 3.8 FlashAPI Google★☆☆ : solidité de la preuve | 54,2 % | 0,75 / 3,75 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 9. GPT-5.5API OpenAI★☆☆ : solidité de la preuve | 54,0 % | 5 / 30 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 10 USD en entrée et 45 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 10. GPT-5.4API OpenAI★☆☆ : solidité de la preuve | 53,8 % | 2,5 / 15 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 5 USD en entrée et 22.5 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 11. Claude Opus 4.8API Anthropic★☆☆ : solidité de la preuve | 50,5 % | 5 / 25 | Anthropic, source tarifaire Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 12. Gemini 3.5 FlashAPI Google★☆☆ : solidité de la preuve | 49,0 % | 1,5 / 9 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 13. GPT-5.6 LunaAPI OpenAI★☆☆ : solidité de la preuve | 48,4 % | 0,2 / 1,2 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 0.4 USD en entrée et 1.8 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 14. Gemini 3.5 Flash-LiteAPI Google★☆☆ : solidité de la preuve | 45,3 % | 0,3 / 2,5 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 15. Gemini 3.1 Pro PreviewAPI Google★☆☆ : solidité de la preuve | 44,1 % | 2 / 12 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 200 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 16. Gemini 3.6 FlashAPI Google★☆☆ : solidité de la preuve | 43,4 % | 0,75 / 3,75 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 17. GPT-5.4 miniAPI OpenAI★☆☆ : solidité de la preuve | 41,7 % | 0,75 / 4,5 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
Claude Fable 5, Claude Opus 4.6, Claude Opus 4.7, Claude Sonnet 4.6, Claude Sonnet 5, DeepSeek V4 Flash, DeepSeek V4 Pro, GLM 5.2, GPT-5.4 nano, Grok 4.3, Grok 4.5, Grok Build 0.1, Kimi K2.6, Kimi K2.7 Code, MiniMax M3, Qwen 3.6 27B, Qwen 3.6 Plus, Qwen 3.7 Max, Kimi K3, Inkling, DeepSeek V4 Flash 0731, Qwen 3.8 Max, Smaug-Agentic, DeepSeek V4 Pro 0813, Grok 4.6, Qwen 3.8 27B, DeepSeek V4 Flash Vision Exp, GLM 5.3, GLM 5.3 Flash, Qwen 3.8 Flash Next, Nemotron 3 Ultra 550B A55B, Muse Spark 1.3. Ils ne sont pas représentés à zéro.
Rang sur LiveBench : code autonome
| Rang | Note sur 100 | Modèle | Fabricant | Solidité | ARC-AGI-3, tâches partiellement cachées, configuration standard | APEX-Agents | LiveBench : code autonome |
|---|---|---|---|---|---|---|---|
| Non classé sur ce test | Pas de référence | GPT-6 Astra | OpenAI | ★★☆ Une équipe extérieure | 99,9 %, 62,7 % | 62,4 % | Non mesuré |
| 1er | Pas de référence | Claude Fable 5.1 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | 62,0 % | 66,1 % |
| 7e ex aequo | Pas de référence | Claude Fable 5 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 62,2 % |
| 2e | Pas de référence | Claude Opus 5 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 65,2 % |
| 19e | Pas de référence | GPT-5.6 Sol | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 56,2 % |
| Non classé sur ce test | Pas de référence | MiniMax M2.5 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré |
| 29e ex aequo | Pas de référence | Claude Opus 4.6 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 49,0 % |
| Non classé sur ce test | Pas de référence | GLM 5 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K2.5 | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré |
| 26e | Pas de référence | Claude Opus 4.7 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 50,7 % |
| 41e ex aequo | Pas de référence | Claude Sonnet 4.6 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 42,6 % |
| 12e | Pas de référence | Claude Sonnet 5 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 59,4 % |
| 48e | Pas de référence | DeepSeek V4 Flash | DeepSeek | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 37,6 % |
| 41e ex aequo | Pas de référence | DeepSeek V4 Pro | DeepSeek | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 42,6 % |
| 38e | Pas de référence | Gemini 3.1 Pro Preview | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 44,1 % | |
| 29e ex aequo | Pas de référence | Gemini 3.5 Flash | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 49,0 % | |
| 25e | Pas de référence | GLM 5.2 | Z.ai | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 51,8 % |
| 43e | Pas de référence | GPT-5.4 mini | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 41,7 % |
| 33e ex aequo | Pas de référence | GPT-5.4 nano | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 46,8 % |
| 24e | Pas de référence | GPT-5.4 | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 53,8 % |
| 23e | Pas de référence | GPT-5.5 | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 54,0 % |
| 49e | Pas de référence | Grok 4.3 | xAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 18,5 % |
| 18e | Pas de référence | Grok 4.5 | xAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 56,5 % |
| 35e | Pas de référence | Grok Build 0.1 | xAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 45,8 % |
| 32e | Pas de référence | Kimi K2.6 | Moonshot AI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 46,9 % |
| 36e | Pas de référence | Kimi K2.7 Code | Moonshot AI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 45,7 % |
| 45e | Pas de référence | MiniMax M3 | MiniMax | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 40,7 % |
| 46e | Pas de référence | Qwen 3.6 27B | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 39,3 % |
| 44e | Pas de référence | Qwen 3.6 Plus | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 41,4 % |
| 39e | Pas de référence | Qwen 3.7 Max | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 43,6 % |
| 20e ex aequo | Pas de référence | GPT-5.6 Terra | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 54,9 % |
| 31e | Pas de référence | GPT-5.6 Luna | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 48,4 % |
| 13e | Pas de référence | Muse Spark 1.1 | Meta | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 58,5 % |
| 7e ex aequo | Pas de référence | Kimi K3 | Moonshot AI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 62,2 % |
| 28e | Pas de référence | Inkling | Thinking Machines Lab | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 49,4 % |
| 37e | Pas de référence | Gemini 3.5 Flash-Lite | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 45,3 % | |
| 40e | Pas de référence | Gemini 3.6 Flash | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 43,4 % | |
| 27e | Pas de référence | Claude Opus 4.8 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 50,5 % |
| 33e ex aequo | Pas de référence | DeepSeek V4 Flash 0731 | DeepSeek | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 46,8 % |
| 4e ex aequo | Pas de référence | Qwen 3.8 Max | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 64,6 % |
| 15e | Pas de référence | Muse Spark 1.2 | Meta | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 57,6 % |
| 4e ex aequo | Pas de référence | Smaug-Agentic | Abacus.AI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 64,6 % |
| 20e ex aequo | Pas de référence | DeepSeek V4 Pro 0813 | DeepSeek | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 54,9 % |
| 16e | Pas de référence | Grok 4.6 | xAI | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 57,0 % |
| 14e | Pas de référence | Gemini 3.7 Flash | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 58,3 % | |
| 10e | Pas de référence | Qwen 3.8 27B | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 61,4 % |
| 3e | Pas de référence | DeepSeek V4 Flash Vision Exp | DeepSeek | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 65,1 % |
| 11e | Pas de référence | GLM 5.3 | Z.ai | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 60,9 % |
| 17e | Pas de référence | GLM 5.3 Flash | Z.ai | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 56,8 % |
| 9e | Pas de référence | Qwen 3.8 Flash Next | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 61,6 % |
| 47e | Pas de référence | Nemotron 3 Ultra 550B A55B | NVIDIA | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 38,7 % |
| 22e | Pas de référence | Gemini 3.8 Flash | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 54,2 % | |
| 6e | Pas de référence | Muse Spark 1.3 | Meta | ★★☆ Une équipe extérieure | Non mesuré | Non mesuré | 64,1 % |
| Non classé sur ce test | Pas de référence | GLM 5.1 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | MiMo V2.5 Pro | Xiaomi | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | MiMo V2.5 | Xiaomi | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Inkling Small | Thinking Machines Lab | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.7 Plus | Alibaba | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | MiniMax M2.7 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Haiku 4.5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3 Flash Preview | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | |
| Non classé sur ce test | Pas de référence | Mistral Medium 3.5 | Mistral AI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.1 Flash Lite Preview | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré | |
| Non classé sur ce test | Pas de référence | Nemotron 3.5 Lightning | NVIDIA | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.20 0309 Reasoning | xAI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Ling 3.0 Flash 2607, version non confirmée | Ant Group | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | Non mesuré |
Quel modèle pour préparer un travail juridique ?
Une seule équipe publie ces deux lectures. Aucune moyenne ne les réunit.
★★☆ Une équipe extérieure, confirmation manquanteNote Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.
Une seule équipe sur ce test : confirmation extérieure manquante.
Agrégation en attente de couverture, 0 modèles communs sur 3.
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.
Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.
Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.
Échelle réelle de 0 à 100. Plus haut est meilleur
Ce graphique ne contient aucune note Origin. Il garde le score et l’échelle du test affiché.
Échelle logarithmique des prix : chaque graduation multiplie le tarif par dix. Sortie et entrée restent séparées.
Ronds : API directe. Carrés : prix OpenRouter. Les numéros décalés sont reliés à leur position exacte. Chaque numéro renvoie au modèle et à ses conditions ci-dessous.
| Modèle et service | Échelle réelle de 0 à 100 | Entrée / sortie USD par million | Date, source et conditions |
|---|---|---|---|
| 1. GPT-6 AstraAPI OpenAI★☆☆ : solidité de la preuve | 67,9 % des critères réussis | 10 / 50 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 20 USD en entrée et 75 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 2. Claude Fable 5.1API Anthropic★☆☆ : solidité de la preuve | 64,8 % des critères réussis | 10 / 50 | Anthropic, source tarifaire Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 3. GPT-5.6 SolAPI OpenAI★☆☆ : solidité de la preuve | 63,4 % des critères réussis | 4 / 20 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
Rang sur APEX-Agents Corporate Lawyer, moyenne des critères
| Rang | Note sur 100 | Modèle | Fabricant | Solidité | APEX-Agents Corporate Lawyer, moyenne des critères | APEX-Agents Corporate Lawyer, tâches sans erreur |
|---|---|---|---|---|---|---|
| 1er | Pas de référence | GPT-6 Astra | OpenAI | ★★☆ Une équipe extérieure | 67,9 % des critères réussis | 40,5 % des tâches entièrement réussies |
| 2e | Pas de référence | Claude Fable 5.1 | Anthropic | ★★☆ Une équipe extérieure | 64,8 % des critères réussis | 41,9 % des tâches entièrement réussies |
| Non classé sur ce test | Pas de référence | Claude Fable 5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Opus 5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| 3e | Pas de référence | GPT-5.6 Sol | OpenAI | ★★☆ Une équipe extérieure | 63,4 % des critères réussis | 35,6 % des tâches entièrement réussies |
| Non classé sur ce test | Pas de référence | MiniMax M2.5 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Opus 4.6 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | GLM 5 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K2.5 | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Opus 4.7 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Sonnet 4.6 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Sonnet 5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Flash | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Pro | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.1 Pro Preview | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | |
| Non classé sur ce test | Pas de référence | Gemini 3.5 Flash | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | |
| Non classé sur ce test | Pas de référence | GLM 5.2 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.4 mini | OpenAI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.4 nano | OpenAI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.4 | OpenAI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.5 | OpenAI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.3 | xAI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.5 | xAI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok Build 0.1 | xAI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K2.6 | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K2.7 Code | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | MiniMax M3 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.6 27B | Alibaba | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.6 Plus | Alibaba | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.7 Max | Alibaba | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.6 Terra | OpenAI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.6 Luna | OpenAI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Muse Spark 1.1 | Meta | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K3 | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Inkling | Thinking Machines Lab | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.5 Flash-Lite | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | |
| Non classé sur ce test | Pas de référence | Gemini 3.6 Flash | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | |
| Non classé sur ce test | Pas de référence | Claude Opus 4.8 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Flash 0731 | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.8 Max | Alibaba | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Muse Spark 1.2 | Meta | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Smaug-Agentic | Abacus.AI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Pro 0813 | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.6 | xAI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.7 Flash | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | |
| Non classé sur ce test | Pas de référence | Qwen 3.8 27B | Alibaba | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Flash Vision Exp | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | GLM 5.3 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | GLM 5.3 Flash | Z.ai | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.8 Flash Next | Alibaba | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Nemotron 3 Ultra 550B A55B | NVIDIA | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.8 Flash | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | |
| Non classé sur ce test | Pas de référence | Muse Spark 1.3 | Meta | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | GLM 5.1 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | MiMo V2.5 Pro | Xiaomi | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | MiMo V2.5 | Xiaomi | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Inkling Small | Thinking Machines Lab | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.7 Plus | Alibaba | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | MiniMax M2.7 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Haiku 4.5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3 Flash Preview | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | |
| Non classé sur ce test | Pas de référence | Mistral Medium 3.5 | Mistral AI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.1 Flash Lite Preview | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | |
| Non classé sur ce test | Pas de référence | Nemotron 3.5 Lightning | NVIDIA | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.20 0309 Reasoning | xAI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Ling 3.0 Flash 2607, version non confirmée | Ant Group | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
Quel modèle pour produire une analyse financière ?
Une seule équipe porte ce podium. Les autres tests de finance et comptabilité restent affichés séparément.
★★☆ Une équipe extérieure, confirmation manquanteNote Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.
Une seule équipe sur ce test : confirmation extérieure manquante.
Agrégation en attente de couverture, 0 modèles communs sur 3.
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.
Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.
Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.
Échelle réelle de 0 à 100. Plus haut est meilleur
Ce graphique ne contient aucune note Origin. Il garde le score et l’échelle du test affiché.
Échelle logarithmique des prix : chaque graduation multiplie le tarif par dix. Sortie et entrée restent séparées.
Ronds : API directe. Carrés : prix OpenRouter. Les numéros décalés sont reliés à leur position exacte. Chaque numéro renvoie au modèle et à ses conditions ci-dessous.
| Modèle et service | Échelle réelle de 0 à 100 | Entrée / sortie USD par million | Date, source et conditions |
|---|---|---|---|
| 1. Claude Fable 5.1API Anthropic★☆☆ : solidité de la preuve | 55,7 % des critères réussis | 10 / 50 | Anthropic, source tarifaire Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 2. GPT-6 AstraAPI OpenAI★☆☆ : solidité de la preuve | 52,0 % des critères réussis | 10 / 50 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 20 USD en entrée et 75 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 3. GPT-5.6 SolAPI OpenAI★☆☆ : solidité de la preuve | 46,6 % des critères réussis | 4 / 20 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
Rang sur APEX-Agents Investment Banking Analyst, moyenne des critères
| Rang | Note sur 100 | Modèle | Fabricant | Solidité | APEX-Agents Investment Banking Analyst, moyenne des critères |
|---|---|---|---|---|---|
| 2e | Pas de référence | GPT-6 Astra | OpenAI | ★★☆ Une équipe extérieure | 52,0 % des critères réussis |
| 1er | Pas de référence | Claude Fable 5.1 | Anthropic | ★★☆ Une équipe extérieure | 55,7 % des critères réussis |
| Non classé sur ce test | Pas de référence | Claude Fable 5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Opus 5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| 3e | Pas de référence | GPT-5.6 Sol | OpenAI | ★★☆ Une équipe extérieure | 46,6 % des critères réussis |
| Non classé sur ce test | Pas de référence | MiniMax M2.5 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Opus 4.6 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GLM 5 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K2.5 | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Opus 4.7 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Sonnet 4.6 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Sonnet 5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Flash | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Pro | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.1 Pro Preview | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Gemini 3.5 Flash | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | GLM 5.2 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.4 mini | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.4 nano | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.4 | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.5 | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.3 | xAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.5 | xAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok Build 0.1 | xAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K2.6 | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K2.7 Code | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | MiniMax M3 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.6 27B | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.6 Plus | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.7 Max | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.6 Terra | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.6 Luna | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Muse Spark 1.1 | Meta | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K3 | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Inkling | Thinking Machines Lab | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.5 Flash-Lite | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Gemini 3.6 Flash | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Claude Opus 4.8 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Flash 0731 | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.8 Max | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Muse Spark 1.2 | Meta | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Smaug-Agentic | Abacus.AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Pro 0813 | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.6 | xAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.7 Flash | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Qwen 3.8 27B | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Flash Vision Exp | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GLM 5.3 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GLM 5.3 Flash | Z.ai | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.8 Flash Next | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Nemotron 3 Ultra 550B A55B | NVIDIA | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.8 Flash | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Muse Spark 1.3 | Meta | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GLM 5.1 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | MiMo V2.5 Pro | Xiaomi | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | MiMo V2.5 | Xiaomi | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Inkling Small | Thinking Machines Lab | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.7 Plus | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | MiniMax M2.7 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Haiku 4.5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3 Flash Preview | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Mistral Medium 3.5 | Mistral AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.1 Flash Lite Preview | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Nemotron 3.5 Lightning | NVIDIA | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.20 0309 Reasoning | xAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Ling 3.0 Flash 2607, version non confirmée | Ant Group | ☆☆☆ Aucune mesure | Non mesuré |
Quel modèle pour répondre à une question médicale ?
Les nombres restent visibles, sans rang ni médaille, jusqu’à une mesure extérieure.
☆☆☆ Chiffres du fabricant seulementNote Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.
Une seule équipe sur ce test : confirmation extérieure manquante.
Agrégation en attente de couverture, 0 modèles communs sur 0.
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.
Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.
Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.
Aucun couple mesure et tarif documenté pour cet usage. Aucun point estimé.
Rang sur HealthBench Professional
| Rang | Note sur 100 | Modèle | Fabricant | Solidité | HealthBench Professional |
|---|---|---|---|---|---|
| Sans classement | Pas de référence | GPT-6 Astra | OpenAI | ☆☆☆ Seulement le fabricant | 63,4 % |
| Non classé sur ce test | Pas de référence | Claude Fable 5.1 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Fable 5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Opus 5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Sans classement | Pas de référence | GPT-5.6 Sol | OpenAI | ☆☆☆ Seulement le fabricant | 60,5 % |
| Non classé sur ce test | Pas de référence | MiniMax M2.5 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Opus 4.6 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GLM 5 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K2.5 | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Opus 4.7 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Sonnet 4.6 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Sonnet 5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Flash | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Pro | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.1 Pro Preview | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Gemini 3.5 Flash | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | GLM 5.2 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.4 mini | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.4 nano | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.4 | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.5 | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.3 | xAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.5 | xAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok Build 0.1 | xAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K2.6 | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K2.7 Code | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | MiniMax M3 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.6 27B | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.6 Plus | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.7 Max | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.6 Terra | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.6 Luna | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Muse Spark 1.1 | Meta | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K3 | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Inkling | Thinking Machines Lab | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.5 Flash-Lite | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Gemini 3.6 Flash | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Claude Opus 4.8 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Flash 0731 | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.8 Max | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Muse Spark 1.2 | Meta | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Smaug-Agentic | Abacus.AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Pro 0813 | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.6 | xAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.7 Flash | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Qwen 3.8 27B | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Flash Vision Exp | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GLM 5.3 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GLM 5.3 Flash | Z.ai | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.8 Flash Next | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Nemotron 3 Ultra 550B A55B | NVIDIA | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.8 Flash | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Muse Spark 1.3 | Meta | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GLM 5.1 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | MiMo V2.5 Pro | Xiaomi | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | MiMo V2.5 | Xiaomi | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Inkling Small | Thinking Machines Lab | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.7 Plus | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | MiniMax M2.7 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Haiku 4.5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3 Flash Preview | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Mistral Medium 3.5 | Mistral AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.1 Flash Lite Preview | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Nemotron 3.5 Lightning | NVIDIA | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.20 0309 Reasoning | xAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Ling 3.0 Flash 2607, version non confirmée | Ant Group | ☆☆☆ Aucune mesure | Non mesuré |
Quel modèle pour résoudre un problème scientifique difficile ?
Une seule équipe porte ce podium. Les autres tests de maths et sciences restent affichés séparément.
★★☆ Une équipe extérieure, confirmation manquanteNote Origin indisponible : couverture actuelle, 1 test au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.
Agrégation en attente de couverture, 2 modèles communs sur 49.
Agrégation en attente de couverture, 2 modèles communs sur 49.
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.
Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.
Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.
Échelle réelle de 0 à 100. Plus haut est meilleur
Ce graphique ne contient aucune note Origin. Il garde le score et l’échelle du test affiché.
Échelle logarithmique des prix : chaque graduation multiplie le tarif par dix. Sortie et entrée restent séparées.
Ronds : API directe. Carrés : prix OpenRouter. Les numéros décalés sont reliés à leur position exacte. Chaque numéro renvoie au modèle et à ses conditions ci-dessous.
| Modèle et service | Échelle réelle de 0 à 100 | Entrée / sortie USD par million | Date, source et conditions |
|---|---|---|---|
| 1. Claude Fable 5.1API Anthropic★☆☆ : solidité de la preuve | 97,0 % | 10 / 50 | Anthropic, source tarifaire Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 2. GPT-5.6 SolAPI OpenAI★☆☆ : solidité de la preuve | 96,2 % | 4 / 20 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 3. GPT-5.5API OpenAI★☆☆ : solidité de la preuve | 95,9 % | 5 / 30 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 10 USD en entrée et 45 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 4. Claude Opus 5API Anthropic★☆☆ : solidité de la preuve | 95,7 % | 5 / 25 | Anthropic, source tarifaire Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 5. GPT-5.6 TerraAPI OpenAI★☆☆ : solidité de la preuve | 94,9 % | 2 / 12 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 6. Claude Opus 4.8API Anthropic★☆☆ : solidité de la preuve | 94,3 % | 5 / 25 | Anthropic, source tarifaire Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 7. GPT-5.4API OpenAI★☆☆ : solidité de la preuve | 94,1 % | 2,5 / 15 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 5 USD en entrée et 22.5 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 8. Gemini 3.7 FlashAPI Google★☆☆ : solidité de la preuve | 93,5 % | 0,75 / 3,75 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 9. Gemini 3.8 FlashAPI Google★☆☆ : solidité de la preuve | 91,6 % | 0,75 / 3,75 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 10. Muse Spark 1.2prix OpenRouter★☆☆ : solidité de la preuve | 91,2 % | 1,25 / 4,25 | OpenRouter, source tarifaire Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 11. Gemini 3.1 Pro PreviewAPI Google★☆☆ : solidité de la preuve | 91,0 % | 2 / 12 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 200 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 12. Gemini 3.5 FlashAPI Google★☆☆ : solidité de la preuve | 88,2 % | 1,5 / 9 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 13. GPT-5.6 LunaAPI OpenAI★☆☆ : solidité de la preuve | 87,2 % | 0,2 / 1,2 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 0.4 USD en entrée et 1.8 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 14. Muse Spark 1.1prix OpenRouter★☆☆ : solidité de la preuve | 87,1 % | 1,25 / 4,25 | OpenRouter, source tarifaire Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 15. Gemini 3.6 FlashAPI Google★☆☆ : solidité de la preuve | 86,4 % | 0,75 / 3,75 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 16. GPT-5.4 miniAPI OpenAI★☆☆ : solidité de la preuve | 78,5 % | 0,75 / 4,5 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 17. Gemini 3.5 Flash-LiteAPI Google★☆☆ : solidité de la preuve | 73,7 % | 0,3 / 2,5 | Google, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
Claude Fable 5, Claude Opus 4.6, Claude Opus 4.7, Claude Sonnet 4.6, Claude Sonnet 5, DeepSeek V4 Flash, DeepSeek V4 Pro, GLM 5.2, GPT-5.4 nano, Grok 4.3, Grok 4.5, Grok Build 0.1, Kimi K2.6, Kimi K2.7 Code, MiniMax M3, Qwen 3.6 27B, Qwen 3.6 Plus, Qwen 3.7 Max, Kimi K3, Inkling, DeepSeek V4 Flash 0731, Qwen 3.8 Max, Smaug-Agentic, DeepSeek V4 Pro 0813, Grok 4.6, Qwen 3.8 27B, DeepSeek V4 Flash Vision Exp, GLM 5.3, GLM 5.3 Flash, Qwen 3.8 Flash Next, Nemotron 3 Ultra 550B A55B, Muse Spark 1.3. Ils ne sont pas représentés à zéro.
Rang sur LiveBench : mathématiques
| Rang | Note sur 100 | Modèle | Fabricant | Solidité | FrontierMath Erdős | LiveBench : mathématiques |
|---|---|---|---|---|---|---|
| Non classé sur ce test | Pas de référence | GPT-6 Astra | OpenAI | ★★☆ Une équipe extérieure | 3 % | Non mesuré |
| 1er | Pas de référence | Claude Fable 5.1 | Anthropic | ★★☆ Une équipe extérieure | 0 % | 97,0 % |
| 3e | Pas de référence | Claude Fable 5 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | 96,0 % |
| 6e | Pas de référence | Claude Opus 5 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | 95,7 % |
| 2e | Pas de référence | GPT-5.6 Sol | OpenAI | ★★☆ Une équipe extérieure | 0 % | 96,2 % |
| Non classé sur ce test | Pas de référence | MiniMax M2.5 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| 23e | Pas de référence | Claude Opus 4.6 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | 89,3 % |
| Non classé sur ce test | Pas de référence | GLM 5 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K2.5 | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| 13e | Pas de référence | Claude Opus 4.7 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | 92,9 % |
| 31e | Pas de référence | Claude Sonnet 4.6 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | 87,0 % |
| 12e | Pas de référence | Claude Sonnet 5 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | 92,9 % |
| 44e | Pas de référence | DeepSeek V4 Flash | DeepSeek | ★★☆ Une équipe extérieure | Non mesuré | 79,6 % |
| 21e | Pas de référence | DeepSeek V4 Pro | DeepSeek | ★★☆ Une équipe extérieure | Non mesuré | 90,7 % |
| 18e | Pas de référence | Gemini 3.1 Pro Preview | ★★☆ Une équipe extérieure | Non mesuré | 91,0 % | |
| 26e | Pas de référence | Gemini 3.5 Flash | ★★☆ Une équipe extérieure | Non mesuré | 88,2 % | |
| 22e | Pas de référence | GLM 5.2 | Z.ai | ★★☆ Une équipe extérieure | Non mesuré | 89,8 % |
| 46e | Pas de référence | GPT-5.4 mini | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | 78,5 % |
| 19e | Pas de référence | GPT-5.4 nano | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | 91,0 % |
| 10e | Pas de référence | GPT-5.4 | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | 94,1 % |
| 5e | Pas de référence | GPT-5.5 | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | 95,9 % |
| 38e | Pas de référence | Grok 4.3 | xAI | ★★☆ Une équipe extérieure | Non mesuré | 84,3 % |
| 20e | Pas de référence | Grok 4.5 | xAI | ★★☆ Une équipe extérieure | Non mesuré | 90,8 % |
| 47e | Pas de référence | Grok Build 0.1 | xAI | ★★☆ Une équipe extérieure | Non mesuré | 78,4 % |
| 39e | Pas de référence | Kimi K2.6 | Moonshot AI | ★★☆ Une équipe extérieure | Non mesuré | 84,3 % |
| 45e | Pas de référence | Kimi K2.7 Code | Moonshot AI | ★★☆ Une équipe extérieure | Non mesuré | 79,6 % |
| 48e | Pas de référence | MiniMax M3 | MiniMax | ★★☆ Une équipe extérieure | Non mesuré | 76,9 % |
| 43e | Pas de référence | Qwen 3.6 27B | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | 79,9 % |
| 41e | Pas de référence | Qwen 3.6 Plus | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | 83,7 % |
| 36e | Pas de référence | Qwen 3.7 Max | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | 85,2 % |
| 8e | Pas de référence | GPT-5.6 Terra | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | 94,9 % |
| 29e | Pas de référence | GPT-5.6 Luna | OpenAI | ★★☆ Une équipe extérieure | Non mesuré | 87,2 % |
| 30e | Pas de référence | Muse Spark 1.1 | Meta | ★★☆ Une équipe extérieure | Non mesuré | 87,1 % |
| 37e | Pas de référence | Kimi K3 | Moonshot AI | ★★☆ Une équipe extérieure | Non mesuré | 84,4 % |
| 25e | Pas de référence | Inkling | Thinking Machines Lab | ★★☆ Une équipe extérieure | Non mesuré | 88,4 % |
| 49e | Pas de référence | Gemini 3.5 Flash-Lite | ★★☆ Une équipe extérieure | Non mesuré | 73,7 % | |
| 33e | Pas de référence | Gemini 3.6 Flash | ★★☆ Une équipe extérieure | Non mesuré | 86,4 % | |
| 9e | Pas de référence | Claude Opus 4.8 | Anthropic | ★★☆ Une équipe extérieure | Non mesuré | 94,3 % |
| 32e | Pas de référence | DeepSeek V4 Flash 0731 | DeepSeek | ★★☆ Une équipe extérieure | Non mesuré | 86,8 % |
| 16e | Pas de référence | Qwen 3.8 Max | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | 91,3 % |
| 17e | Pas de référence | Muse Spark 1.2 | Meta | ★★☆ Une équipe extérieure | Non mesuré | 91,2 % |
| 40e | Pas de référence | Smaug-Agentic | Abacus.AI | ★★☆ Une équipe extérieure | Non mesuré | 83,9 % |
| 7e | Pas de référence | DeepSeek V4 Pro 0813 | DeepSeek | ★★☆ Une équipe extérieure | Non mesuré | 95,1 % |
| 14e | Pas de référence | Grok 4.6 | xAI | ★★☆ Une équipe extérieure | Non mesuré | 92,6 % |
| 11e | Pas de référence | Gemini 3.7 Flash | ★★☆ Une équipe extérieure | Non mesuré | 93,5 % | |
| 34e | Pas de référence | Qwen 3.8 27B | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | 86,2 % |
| 28e | Pas de référence | DeepSeek V4 Flash Vision Exp | DeepSeek | ★★☆ Une équipe extérieure | Non mesuré | 87,8 % |
| 27e | Pas de référence | GLM 5.3 | Z.ai | ★★☆ Une équipe extérieure | Non mesuré | 87,9 % |
| 42e | Pas de référence | GLM 5.3 Flash | Z.ai | ★★☆ Une équipe extérieure | Non mesuré | 81,2 % |
| 35e | Pas de référence | Qwen 3.8 Flash Next | Alibaba | ★★☆ Une équipe extérieure | Non mesuré | 85,8 % |
| 24e | Pas de référence | Nemotron 3 Ultra 550B A55B | NVIDIA | ★★☆ Une équipe extérieure | Non mesuré | 88,7 % |
| 15e | Pas de référence | Gemini 3.8 Flash | ★★☆ Une équipe extérieure | Non mesuré | 91,6 % | |
| 4e | Pas de référence | Muse Spark 1.3 | Meta | ★★☆ Une équipe extérieure | Non mesuré | 96,0 % |
| Non classé sur ce test | Pas de référence | GLM 5.1 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | MiMo V2.5 Pro | Xiaomi | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | MiMo V2.5 | Xiaomi | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Inkling Small | Thinking Machines Lab | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.7 Plus | Alibaba | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | MiniMax M2.7 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Haiku 4.5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3 Flash Preview | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | |
| Non classé sur ce test | Pas de référence | Mistral Medium 3.5 | Mistral AI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.1 Flash Lite Preview | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré | |
| Non classé sur ce test | Pas de référence | Nemotron 3.5 Lightning | NVIDIA | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.20 0309 Reasoning | xAI | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
| Non classé sur ce test | Pas de référence | Ling 3.0 Flash 2607, version non confirmée | Ant Group | ☆☆☆ Aucune mesure | Non mesuré | Non mesuré |
Quel modèle pour utiliser plusieurs logiciels ?
Aucun score n’est estimé pour les modèles non mesurés.
☆☆☆ Aucune mesure disponibleNote Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.
Aucun test public dans le registre.
Agrégation en attente de couverture, 0 modèles communs sur 0.
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.
Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.
Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.
Aucun couple mesure et tarif documenté pour cet usage. Aucun point estimé.
Aucune mesure publiée pour cet usage. Aucun score estimé.
Quel modèle pour analyser beaucoup de documents ?
Aucun score n’est estimé pour les modèles non mesurés.
☆☆☆ Aucune mesure disponibleNote Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.
Aucun test public dans le registre.
Agrégation en attente de couverture, 0 modèles communs sur 0.
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.
Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.
Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.
Aucun couple mesure et tarif documenté pour cet usage. Aucun point estimé.
Aucune mesure publiée pour cet usage. Aucun score estimé.
Quel modèle pour répondre sans inventer ?
Une seule équipe porte ce podium. Les autres tests de exactitude factuelle restent affichés séparément.
★★☆ Une équipe extérieure, confirmation manquanteNote Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.
Une seule équipe sur ce test : confirmation extérieure manquante.
Agrégation en attente de couverture, 0 modèles communs sur 2.
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.
Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.
Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.
Échelle réelle de 0 à 100. Plus bas est meilleur
Ce graphique ne contient aucune note Origin. Il garde le score et l’échelle du test affiché.
Échelle logarithmique des prix : chaque graduation multiplie le tarif par dix. Sortie et entrée restent séparées.
Ronds : API directe. Carrés : prix OpenRouter. Les numéros décalés sont reliés à leur position exacte. Chaque numéro renvoie au modèle et à ses conditions ci-dessous.
| Modèle et service | Échelle réelle de 0 à 100 | Entrée / sortie USD par million | Date, source et conditions |
|---|---|---|---|
| 1. GPT-6 AstraAPI OpenAI★☆☆ : solidité de la preuve | 51 % de réponses inventées | 10 / 50 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 20 USD en entrée et 75 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
| 2. GPT-5.6 SolAPI OpenAI★☆☆ : solidité de la preuve | 92 % de réponses inventées | 4 / 20 | OpenAI, source tarifaire Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée. |
Rang sur AA-Omniscience, réponses inventées
| Rang | Note sur 100 | Modèle | Fabricant | Solidité | AA-Omniscience, réponses inventées |
|---|---|---|---|---|---|
| 1er | Pas de référence | GPT-6 Astra | OpenAI | ★★☆ Une équipe extérieure | 51 % de réponses inventées |
| Non classé sur ce test | Pas de référence | Claude Fable 5.1 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Fable 5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Opus 5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| 2e | Pas de référence | GPT-5.6 Sol | OpenAI | ★★☆ Une équipe extérieure | 92 % de réponses inventées |
| Non classé sur ce test | Pas de référence | MiniMax M2.5 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Opus 4.6 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GLM 5 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K2.5 | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Opus 4.7 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Sonnet 4.6 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Sonnet 5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Flash | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Pro | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.1 Pro Preview | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Gemini 3.5 Flash | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | GLM 5.2 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.4 mini | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.4 nano | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.4 | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.5 | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.3 | xAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.5 | xAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok Build 0.1 | xAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K2.6 | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K2.7 Code | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | MiniMax M3 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.6 27B | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.6 Plus | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.7 Max | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.6 Terra | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GPT-5.6 Luna | OpenAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Muse Spark 1.1 | Meta | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Kimi K3 | Moonshot AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Inkling | Thinking Machines Lab | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.5 Flash-Lite | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Gemini 3.6 Flash | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Claude Opus 4.8 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Flash 0731 | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.8 Max | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Muse Spark 1.2 | Meta | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Smaug-Agentic | Abacus.AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Pro 0813 | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.6 | xAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.7 Flash | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Qwen 3.8 27B | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | DeepSeek V4 Flash Vision Exp | DeepSeek | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GLM 5.3 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GLM 5.3 Flash | Z.ai | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.8 Flash Next | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Nemotron 3 Ultra 550B A55B | NVIDIA | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.8 Flash | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Muse Spark 1.3 | Meta | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | GLM 5.1 | Z.ai | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | MiMo V2.5 Pro | Xiaomi | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | MiMo V2.5 | Xiaomi | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Inkling Small | Thinking Machines Lab | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Qwen 3.7 Plus | Alibaba | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | MiniMax M2.7 | MiniMax | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Claude Haiku 4.5 | Anthropic | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3 Flash Preview | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Mistral Medium 3.5 | Mistral AI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Gemini 3.1 Flash Lite Preview | ☆☆☆ Aucune mesure | Non mesuré | |
| Non classé sur ce test | Pas de référence | Nemotron 3.5 Lightning | NVIDIA | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Grok 4.20 0309 Reasoning | xAI | ☆☆☆ Aucune mesure | Non mesuré |
| Non classé sur ce test | Pas de référence | Ling 3.0 Flash 2607, version non confirmée | Ant Group | ☆☆☆ Aucune mesure | Non mesuré |
Quel modèle pour comprendre des images et des documents ?
Aucun score n’est estimé pour les modèles non mesurés.
☆☆☆ Aucune mesure disponibleNote Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.
Aucun test public dans le registre.
Agrégation en attente de couverture, 0 modèles communs sur 0.
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.
Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.
Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.
Aucun couple mesure et tarif documenté pour cet usage. Aucun point estimé.
Aucune mesure publiée pour cet usage. Aucun score estimé.
Quel modèle pour une interaction vocale ?
Aucun score n’est estimé pour les modèles non mesurés.
☆☆☆ Aucune mesure disponibleNote Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.
Aucun test public dans le registre.
Agrégation en attente de couverture, 0 modèles communs sur 0.
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.
Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.
Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.
Aucun couple mesure et tarif documenté pour cet usage. Aucun point estimé.
Aucune mesure publiée pour cet usage. Aucun score estimé.
Quel modèle pour expliquer et enseigner ?
Aucun score n’est estimé pour les modèles non mesurés.
☆☆☆ Aucune mesure disponibleNote Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.
Aucun test public dans le registre.
Agrégation en attente de couverture, 0 modèles communs sur 0.
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.
Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.
Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.
Aucun couple mesure et tarif documenté pour cet usage. Aucun point estimé.
Aucune mesure publiée pour cet usage. Aucun score estimé.
Quel modèle pour chercher des failles en environnement contrôlé ?
Aucun score n’est estimé pour les modèles non mesurés.
☆☆☆ Aucune mesure disponibleNote Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.
Aucun test public dans le registre.
Agrégation en attente de couverture, 0 modèles communs sur 0.
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.
Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.
Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.
Aucun couple mesure et tarif documenté pour cet usage. Aucun point estimé.
Aucune mesure publiée pour cet usage. Aucun score estimé.
Quel modèle pour maîtriser le coût ?
Aucun score n’est estimé pour les modèles non mesurés.
☆☆☆ Aucune mesure disponibleNote Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.
Aucun test public dans le registre.
Agrégation en attente de couverture, 0 modèles communs sur 0.
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.
Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.
Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.
Aucun couple mesure et tarif documenté pour cet usage. Aucun point estimé.
Aucune mesure publiée pour cet usage. Aucun score estimé.
Chaque chiffre conserve sa source, sa date, son protocole et sa limite. Une absence reste une absence.
Date de sortie : 2026-09-03
API OpenAI, tarif public : 10 $ en entrée, 50 $ en sortie par million de tokens (unités de texte), en USD.
OpenAI, tarif consulté le 2026-09-06
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 20 USD en entrée et 75 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
44,36 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Marge annoncée à 95 % : moins de ±1 point
Organisme commercial extérieur
Outils et réglages propres à chacun des neuf tests. Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %.
Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.
Organisme commercial extérieur
Agent Codex. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.
Le score mesure GPT-6 Astra avec un agent précis. Changer cet agent peut changer le résultat.
Fourchette probable à 90 % : 165 à 174
Sources mélangées
Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants. Calcul tenant compte du niveau de difficulté de chaque test.
Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.
Test extérieur
Interface minimale commune, notes visibles gérées par le modèle. Objectifs atteints dans des environnements inconnus.
Mesure ciblée d’apprentissage de règles nouvelles. Elle ne mesure pas un pourcentage d’intelligence générale.
Test extérieur
État de raisonnement opaque conservé et contexte compacté par le fournisseur. Objectifs atteints dans des environnements inconnus.
Même série de tâches que la configuration standard. Ce résultat ne constitue pas une seconde confirmation indépendante.
± 3,6 points
Organisme commercial extérieur
Agent en boucle d’actions utilisant plusieurs applications de travail. Part moyenne des critères réussis.
Les tâches et critères viennent de professionnels, mais une partie de la correction repose sur un autre modèle d’IA.
Organisme commercial extérieur
Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.
Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.
Organisme commercial extérieur
Agent en boucle d’actions avec outils et documents professionnels. Part des tâches dont tous les critères passent.
Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.
Organisme commercial extérieur
Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.
Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.
Test extérieur
Agent sans internet, budget de 300 $ et 72 heures par problème. Preuve ou réfutation acceptée par Lean, un vérificateur mathématique.
Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.
Chiffre du fabricant · Sans médaille
Réponses produites dans HealthBench Professional. Score corrigé pour réduire l’avantage des réponses longues.
OpenAI publie ce résultat sur ses propres modèles. Sans test extérieur, il ne suffit pas pour choisir un modèle en santé.
Organisme commercial extérieur
Outils de l’Artificial Analysis Intelligence Index v4.1.1. Réponse incorrecte donnée au lieu d’une abstention.
Le résultat dépend des questions choisies et d’une correction par un autre modèle d’IA. Il ne mesure pas toutes les formes d’erreur factuelle.
Erreur standard publiée : 4,216 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-6-astra. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-09-01
API Anthropic, tarif public : 10 $ en entrée, 50 $ en sortie par million de tokens (unités de texte), en USD.
Anthropic, tarif consulté le 2026-09-06
Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
70,97 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Marge annoncée à 95 % : moins de ±1 point
Organisme commercial extérieur
Outils et réglages propres à chacun des neuf tests. Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %.
Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.
Organisme commercial extérieur
Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.
Le score mesure Claude Fable 5.1 avec un agent précis. Changer cet agent peut changer le résultat.
IC à 95 % publié par la source, erreur standard par tâche : 54,12 à 61,64 %
Test extérieur
Claude Code 2.1.257. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5-1. Date de sortie déclarée par Terminal-Bench : 2026-09-01. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Fourchette probable à 90 % : 160 à 166
Sources mélangées
Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants. Calcul tenant compte du niveau de difficulté de chaque test.
Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.
± 3,5 points
Organisme commercial extérieur
Agent en boucle d’actions utilisant plusieurs applications de travail. Part moyenne des critères réussis.
Les tâches et critères viennent de professionnels, mais une partie de la correction repose sur un autre modèle d’IA.
Organisme commercial extérieur
Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.
Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.
Organisme commercial extérieur
Agent en boucle d’actions avec outils et documents professionnels. Part des tâches dont tous les critères passent.
Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.
Organisme commercial extérieur
Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.
Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.
Test extérieur
Agent sans internet, budget de 300 $ et 72 heures par problème. Preuve ou réfutation acceptée par Lean, un vérificateur mathématique.
Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,812 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-06-09
Tarif public non renseigné dans le registre.
112,1 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Organisme commercial extérieur
Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.
Le score mesure Claude Fable 5 avec un agent précis. Changer cet agent peut changer le résultat.
IC à 95 % publié par la source, erreur standard par tâche : 40,70 à 48,40 %
Test extérieur
Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5. Date de sortie déclarée par Terminal-Bench : 2026-06-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,605 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-07-24
API Anthropic, tarif public : 5 $ en entrée, 25 $ en sortie par million de tokens (unités de texte), en USD.
Anthropic, tarif consulté le 2026-09-06
Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
60,51 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Organisme commercial extérieur
Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.
Le score mesure Claude Opus 5 avec un agent précis. Changer cet agent peut changer le résultat.
IC à 95 % publié par la source, erreur standard par tâche : 48,43 à 55,21 %
Test extérieur
Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-5. Date de sortie déclarée par Terminal-Bench : 2026-07-24. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,371 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-07-09
API OpenAI, tarif public : 4 $ en entrée, 20 $ en sortie par million de tokens (unités de texte), en USD.
OpenAI, tarif consulté le 2026-09-06
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
24,54 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Marge annoncée à 95 % : moins de ±1 point
Organisme commercial extérieur
Outils et réglages propres à chacun des neuf tests. Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %.
Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.
Organisme commercial extérieur
Agent Codex. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.
Le score mesure GPT-5.6 Sol avec un agent précis. Changer cet agent peut changer le résultat.
IC à 95 % publié par la source, erreur standard par tâche : 33,49 à 41,05 %
Test extérieur
Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-sol. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Fourchette probable à 90 % : 160 à 165
Sources mélangées
Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants. Calcul tenant compte du niveau de difficulté de chaque test.
Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.
Organisme commercial extérieur
Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.
Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.
Organisme commercial extérieur
Agent en boucle d’actions avec outils et documents professionnels. Part des tâches dont tous les critères passent.
Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.
Organisme commercial extérieur
Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.
Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.
Test extérieur
Agent sans internet, budget de 300 $ et 72 heures par problème. Preuve ou réfutation acceptée par Lean, un vérificateur mathématique.
Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.
Chiffre du fabricant · Sans médaille
Réponses produites dans HealthBench Professional. Score corrigé pour réduire l’avantage des réponses longues.
OpenAI publie ce résultat sur ses propres modèles. Sans test extérieur, il ne suffit pas pour choisir un modèle en santé.
Organisme commercial extérieur
Outils de l’Artificial Analysis Intelligence Index v4.1.1. Réponse incorrecte donnée au lieu d’une abstention.
Le résultat dépend des questions choisies et d’une correction par un autre modèle d’IA. Il ne mesure pas toutes les formes d’erreur factuelle.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,353 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-02-12
Tarif public non renseigné dans le registre.
Origine d’exécution non vérifiée
mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.
Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 379 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Date de sortie : 2026-02-05
Tarif public non renseigné dans le registre.
Origine d’exécution non vérifiée
mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.
Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 378 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Valeur révisée de 75,4 à 75,6 % le 18 février 2026 : https://github.com/SWE-bench/experiments/commit/36905bfeb728dadd82a75bb169ed612aac634551. Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Date de sortie : 2026-02-12
Tarif public non renseigné dans le registre.
Origine d’exécution non vérifiée
mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.
Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 364 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Date de sortie : 2026-01-27
Tarif public non renseigné dans le registre.
0,93 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Origine d’exécution non vérifiée
mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.
Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 354 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Erreur standard publiée : 1,29 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/moonshotai/kimi-k2.5-0127/endpoints. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-04-16
Tarif public non renseigné dans le registre.
36,39 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,22 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-02-17
Tarif public non renseigné dans le registre.
38,51 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,138 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-06-30
Tarif public non renseigné dans le registre.
52,97 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
IC à 95 % publié par la source, erreur standard par tâche : 9,36 à 15,48 %
Test extérieur
Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-sonnet-5. Date de sortie déclarée par Terminal-Bench : 2026-06-30. Efforts différents : max chez Terminal-Bench, xhigh chez LiveBench. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,246 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-04-24
Tarif public non renseigné dans le registre.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Date de sortie : 2026-04-24
Tarif public non renseigné dans le registre.
1,07 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,037 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-pro-20260423/endpoints. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-02-19
API Google, tarif public : 2 $ en entrée, 12 $ en sortie par million de tokens (unités de texte), en USD.
Google, tarif consulté le 2026-09-06
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 200 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
1,61 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 3,933 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-05-19
API Google, tarif public : 1.5 $ en entrée, 9 $ en sortie par million de tokens (unités de texte), en USD.
Google, tarif consulté le 2026-09-06
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
5,73 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,104 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-06-17
Tarif public non renseigné dans le registre.
12,64 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,143 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.2. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-03-17
API OpenAI, tarif public : 0.75 $ en entrée, 4.5 $ en sortie par million de tokens (unités de texte), en USD.
OpenAI, tarif consulté le 2026-09-06
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
1,95 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 3,641 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-mini. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-03-17
Tarif public non renseigné dans le registre.
0,42 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,025 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-nano. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-03-05
API OpenAI, tarif public : 2.5 $ en entrée, 15 $ en sortie par million de tokens (unités de texte), en USD.
OpenAI, tarif consulté le 2026-09-06
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 5 USD en entrée et 22.5 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
7,76 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,113 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-04-23
API OpenAI, tarif public : 5 $ en entrée, 30 $ en sortie par million de tokens (unités de texte), en USD.
OpenAI, tarif consulté le 2026-09-06
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 10 USD en entrée et 45 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
6,44 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,164 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.5. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-05-15
Tarif public non renseigné dans le registre.
0,42 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 1,195 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.3. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-07-08
Tarif public non renseigné dans le registre.
3,37 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
IC à 95 % publié par la source, erreur standard par tâche : 9,80 à 15,04 %
Test extérieur
Grok Build 1.0.5. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.5. Date de sortie déclarée par Terminal-Bench : 2026-07-16. Écart conservé avec la date du catalogue Origin : 2026-07-08. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,141 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.5. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-05-19
Tarif public non renseigné dans le registre.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Date de sortie : 2026-04-20
Tarif public non renseigné dans le registre.
5,11 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,144 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-06-12
Tarif public non renseigné dans le registre.
5,04 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,161 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-06-01
Tarif public non renseigné dans le registre.
7,07 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 3,944 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-04-21
Tarif public non renseigné dans le registre.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Date de sortie : 2026-04-02
Tarif public non renseigné dans le registre.
4,78 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 1,312 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-06-08
Tarif public non renseigné dans le registre.
1,93 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 2,858 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-07-09
API OpenAI, tarif public : 2 $ en entrée, 12 $ en sortie par million de tokens (unités de texte), en USD.
OpenAI, tarif consulté le 2026-09-06
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
8,13 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
IC à 95 % publié par la source, erreur standard par tâche : 18,27 à 24,77 %
Test extérieur
Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-terra. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,28 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-07-09
API OpenAI, tarif public : 0.2 $ en entrée, 1.2 $ en sortie par million de tokens (unités de texte), en USD.
OpenAI, tarif consulté le 2026-09-06
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 0.4 USD en entrée et 1.8 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
1,88 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
IC à 95 % publié par la source, erreur standard par tâche : 14,42 à 20,12 %
Test extérieur
Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-luna. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,244 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-07-09
prix OpenRouter, tarif public : 1.25 $ en entrée, 4.25 $ en sortie par million de tokens (unités de texte), en USD.
OpenRouter, tarif consulté le 2026-09-06
Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
4,56 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,068 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.1. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-07-16
Tarif public non renseigné dans le registre.
13,87 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,101 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-07-15
Tarif public non renseigné dans le registre.
3,01 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 3,396 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-07-21
API Google, tarif public : 0.3 $ en entrée, 2.5 $ en sortie par million de tokens (unités de texte), en USD.
Google, tarif consulté le 2026-09-06
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
0,53 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 1,708 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-07-21
API Google, tarif public : 0.75 $ en entrée, 3.75 $ en sortie par million de tokens (unités de texte), en USD.
Google, tarif consulté le 2026-09-06
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
8,93 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,068 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-05-28
API Anthropic, tarif public : 5 $ en entrée, 25 $ en sortie par million de tokens (unités de texte), en USD.
Anthropic, tarif consulté le 2026-09-06
Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
30,51 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
IC à 95 % publié par la source, erreur standard par tâche : 20,08 à 27,20 %
Test extérieur
Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-4-8. Date de sortie déclarée par Terminal-Bench : 2026-05-28. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,176 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-07-31
Tarif public non renseigné dans le registre.
3,61 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,382 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-08-02
Tarif public non renseigné dans le registre.
10,54 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,309 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-08-05
prix OpenRouter, tarif public : 1.25 $ en entrée, 4.25 $ en sortie par million de tokens (unités de texte), en USD.
OpenRouter, tarif consulté le 2026-09-06
Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
3,78 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,023 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.2. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-08-10
Tarif public non renseigné dans le registre.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Date de sortie : 2026-08-13
Tarif public non renseigné dans le registre.
18,58 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,301 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-08-12
Tarif public non renseigné dans le registre.
14,58 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
IC à 95 % publié par la source, erreur standard par tâche : 17,21 à 23,39 %
Test extérieur
Grok Build 1.0.5. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.6. Date de sortie déclarée par Terminal-Bench : 2026-08-12. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,479 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.6. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-08-13
API Google, tarif public : 0.75 $ en entrée, 3.75 $ en sortie par million de tokens (unités de texte), en USD.
Google, tarif consulté le 2026-09-06
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
21,46 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
IC à 95 % publié par la source, erreur standard par tâche : 8,76 à 13,66 %
Test extérieur
mini-SWE-agent 2.4.6. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.7-flash. Date de sortie déclarée par Terminal-Bench : 2026-08-13. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,225 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-08-14
Tarif public non renseigné dans le registre.
21,68 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,189 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/qwen/qwen3.8-27b-20260814/endpoints. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-08-21
Tarif public non renseigné dans le registre.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Date de sortie : 2026-08-14
Tarif public non renseigné dans le registre.
24,91 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
IC à 95 % publié par la source, erreur standard par tâche : 38,59 à 45,05 %
Test extérieur
Claude Code 2.1.207. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/glm-5.3. Date de sortie déclarée par Terminal-Bench : 2026-08-14. Fabricant Z.ai ; préfixe source anthropic/, fournisseur du point d’accès non publié. Effort max chez Terminal-Bench ; effort LiveBench non publié. Aucune équivalence supposée. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,289 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.3. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-08-26
Tarif public non renseigné dans le registre.
3,13 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,207 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/vlm/glm-5.3-flash. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-08-26
Tarif public non renseigné dans le registre.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Date de sortie : 2026-06-04
Tarif public non renseigné dans le registre.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 1,589 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://build.nvidia.com/nvidia/nemotron-3-ultra-550b-a55b. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-09-02
API Google, tarif public : 0.75 $ en entrée, 3.75 $ en sortie par million de tokens (unités de texte), en USD.
Google, tarif consulté le 2026-09-06
Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.
18,49 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
IC à 95 % publié par la source, erreur standard par tâche : 15,73 à 22,45 %
Test extérieur
mini-SWE-agent 2.4.6. Part des essais réussis sur 330, les erreurs comptent comme des échecs.
Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.8-flash. Date de sortie déclarée par Terminal-Bench : 2026-09-02. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Erreur standard publiée : 4,184 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : 2026-09-02
Tarif public non renseigné dans le registre.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Test extérieur
Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.
Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.
Date de sortie : Date de sortie non publiée
Tarif public non renseigné dans le registre.
5,7 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Erreur standard publiée : 4,087 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.1. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : Date de sortie non publiée
Tarif public non renseigné dans le registre.
0,24 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Erreur standard publiée : 4,127 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : Date de sortie non publiée
Tarif public non renseigné dans le registre.
0,1 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Erreur standard publiée : 3,687 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : Date de sortie non publiée
Tarif public non renseigné dans le registre.
0,6 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Erreur standard publiée : 3,81 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : Date de sortie non publiée
Tarif public non renseigné dans le registre.
0,42 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Erreur standard publiée : 2,931 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : Date de sortie non publiée
Tarif public non renseigné dans le registre.
0,59 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Erreur standard publiée : 1,786 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : Date de sortie non publiée
Tarif public non renseigné dans le registre.
0,98 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Erreur standard publiée : 1,056 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : Date de sortie non publiée
Tarif public non renseigné dans le registre.
0,34 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Erreur standard publiée : 1,093 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : Date de sortie non publiée
Tarif public non renseigné dans le registre.
18,62 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Erreur standard publiée : 1,369 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.mistral.ai/models/mistral-medium-3-5-26-04. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : Date de sortie non publiée
Tarif public non renseigné dans le registre.
0,05 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Erreur standard publiée : 1,069 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : Date de sortie non publiée
Tarif public non renseigné dans le registre.
0,27 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Erreur standard publiée : 0,951 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : Date de sortie non publiée
Tarif public non renseigné dans le registre.
0,29 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Erreur standard publiée : 0,11 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.20-0309-reasoning. Dossier complet : /benchmarks/vals-2026-09.json
Date de sortie : Date de sortie non publiée
Tarif public non renseigné dans le registre.
0,06 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.
Erreur standard publiée : 0 points. Pas un intervalle de confiance.
Organisme commercial extérieur
Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..
Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints. Dossier complet : /benchmarks/vals-2026-09.json