Copilote des modèles IA · 66 modèles · 447 résultats · mise à jour 2026-09-04

Quel modèle choisir pour votre usage ?

Choisissez un travail. Le cockpit montre les scores réels, leur solidité et ce qui manque encore.

Quel modèle pour développer un logiciel ?

Claude Fable 5.1 arrive en tête. Analyse élargie, 3 organismes, 41 modèles.

Proximité des classements, Kendall W : 0,8, fourchette à 95 % de 0,8 à 1. Couverture : Terminal-Bench : 13 modèles du panel, 5 requis ; compte vers la preuve solide. LiveBench : 41 modèles du panel, 5 requis ; compte vers la preuve solide. Vals AI : 41 modèles du panel, 5 requis ; compte vers la preuve solide.

★★★ 3 organismes couvrent au moins 5 modèles ; 3 requis pour une preuve solide

Les étoiles notent la preuve, jamais le modèle.

Lire la méthode

Podium combiné

3 sources indépendantes

1er, rang moyen 1,83

Claude Fable 5.1

Rang moyen 1,8333

★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.

2e, rang moyen 2,67

Claude Fable 5

Rang moyen 2,6667

★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.

3e ex aequo, rang moyen 3,67

Claude Opus 5

Rang moyen 3,6667

★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. Fourchettes publiées recouvrantes dans un test retenu.

3e ex aequo, rang moyen 3,67

GPT-5.6 Sol

Rang moyen 3,6667

★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. Fourchettes publiées recouvrantes dans un test retenu.

Note sur 100

Note Origin disponible pour 17 modèles sur 2 tests de 2 équipes indépendantes, édition origin-coding-2026-09-04-v1. Claude Fable 5.1 et Claude Fable 5 hors note : Politique de repli non documentée entre les évaluateurs.

Position relative, pas un taux de réussite. La note utilise une référence figée, les mêmes tests pour tous les modèles, au moins 15 modèles communs et 2 équipes indépendantes. Le meilleur seul vaut 100 ; des modèles à égalité en tête peuvent recevoir moins. Le seuil de 15 est une règle pratique du produit.

Capacité et prix

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.

Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.

16 tarifs renseignés sur 17 modèles de l’édition. Tarif absent ou échu : Inkling.

Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.

Note Origin de l’édition du 2026-09-04 contre tarif

Note Origin sur 100. Plus haut : meilleure position relative dans l’édition, pas un taux de réussite.

Édition figée au 2026-09-04. Les prix ne participent pas à la note ni aux étoiles.

Échelle logarithmique des prix : chaque graduation multiplie le tarif par dix. Sortie et entrée restent séparées.

Note Origin sur 1000255075100110100USD par million de tokens en sortie1. GPT-5.6 Sol, API OpenAI, 97/100, 20 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.2. Claude Opus 5, API Anthropic, 88/100, 25 USD par million en sortie. Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.3. Claude Opus 4.8, API Anthropic, 81/100, 25 USD par million en sortie. Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.4. GPT-5.5, API OpenAI, 81/100, 30 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 10 USD en entrée et 45 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.5. GPT-5.6 Luna, API OpenAI, 81/100, 1,2 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 0.4 USD en entrée et 1.8 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.6. GPT-5.6 Terra, API OpenAI, 75/100, 12 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.7. Gemini 3.7 Flash, API Google, 59/100, 3,75 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.8. GPT-5.4, API OpenAI, 48/100, 15 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 5 USD en entrée et 22.5 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.9. Gemini 3.6 Flash, API Google, 44/100, 3,75 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.10. Gemini 3.5 Flash, API Google, 41/100, 9 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.11. Gemini 3.8 Flash, API Google, 38/100, 3,75 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.12. Muse Spark 1.1, prix OpenRouter, 38/100, 4,25 USD par million en sortie. Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.13. Muse Spark 1.2, prix OpenRouter, 36/100, 4,25 USD par million en sortie. Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.14. Gemini 3.1 Pro Preview, API Google, 22/100, 12 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 200 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.15. Gemini 3.5 Flash-Lite, API Google, 9/100, 2,5 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.16. GPT-5.4 mini, API OpenAI, 9/100, 4,5 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

Ronds : API directe. Carrés : prix OpenRouter. Les numéros décalés sont reliés à leur position exacte. Chaque numéro renvoie au modèle et à ses conditions ci-dessous.

  1. 1. GPT-5.6 Sol · API OpenAI · promotion au 2026-11-21
  2. 2. Claude Opus 5 · API Anthropic
  3. 3. Claude Opus 4.8 · API Anthropic
  4. 4. GPT-5.5 · API OpenAI
  5. 5. GPT-5.6 Luna · API OpenAI
  6. 6. GPT-5.6 Terra · API OpenAI
  7. 7. Gemini 3.7 Flash · API Google · promotion au 2026-12-31
  8. 8. GPT-5.4 · API OpenAI
  9. 9. Gemini 3.6 Flash · API Google · promotion au 2026-12-31
  10. 10. Gemini 3.5 Flash · API Google
  11. 11. Gemini 3.8 Flash · API Google · promotion au 2026-12-31
  12. 12. Muse Spark 1.1 · prix OpenRouter
  13. 13. Muse Spark 1.2 · prix OpenRouter
  14. 14. Gemini 3.1 Pro Preview · API Google
  15. 15. Gemini 3.5 Flash-Lite · API Google
  16. 16. GPT-5.4 mini · API OpenAI
Valeurs exactes et conditions : Note Origin de l’édition du 2026-09-04 contre tarif
Modèle et serviceNote Origin sur 100Entrée / sortie
USD par million
Date, source et conditions
1. GPT-5.6 SolAPI OpenAI★★☆ : solidité de la preuve97/1004 / 20OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

2. Claude Opus 5API Anthropic★★☆ : solidité de la preuve88/1005 / 25Anthropic, source tarifaire

Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

3. Claude Opus 4.8API Anthropic★★☆ : solidité de la preuve81/1005 / 25Anthropic, source tarifaire

Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

4. GPT-5.5API OpenAI★★☆ : solidité de la preuve81/1005 / 30OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 10 USD en entrée et 45 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

5. GPT-5.6 LunaAPI OpenAI★★☆ : solidité de la preuve81/1000,2 / 1,2OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 0.4 USD en entrée et 1.8 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

6. GPT-5.6 TerraAPI OpenAI★★☆ : solidité de la preuve75/1002 / 12OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

7. Gemini 3.7 FlashAPI Google★★☆ : solidité de la preuve59/1000,75 / 3,75Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

8. GPT-5.4API OpenAI★☆☆ : solidité de la preuve48/1002,5 / 15OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 5 USD en entrée et 22.5 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

9. Gemini 3.6 FlashAPI Google★★☆ : solidité de la preuve44/1000,75 / 3,75Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

10. Gemini 3.5 FlashAPI Google★★☆ : solidité de la preuve41/1001,5 / 9Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

11. Gemini 3.8 FlashAPI Google★★☆ : solidité de la preuve38/1000,75 / 3,75Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

12. Muse Spark 1.1prix OpenRouter★☆☆ : solidité de la preuve38/1001,25 / 4,25OpenRouter, source tarifaire

Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

13. Muse Spark 1.2prix OpenRouter★☆☆ : solidité de la preuve36/1001,25 / 4,25OpenRouter, source tarifaire

Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

14. Gemini 3.1 Pro PreviewAPI Google★★☆ : solidité de la preuve22/1002 / 12Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 200 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

15. Gemini 3.5 Flash-LiteAPI Google★★☆ : solidité de la preuve9/1000,3 / 2,5Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

16. GPT-5.4 miniAPI OpenAI★★☆ : solidité de la preuve9/1000,75 / 4,5OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

Score du test affiché contre tarif : Vals Code Migration : réécrire un programme · Vals AI · ★☆☆

Échelle réelle de 0 à 100. Plus haut est meilleur

Ce graphique ne contient aucune note Origin. Il garde le score et l’échelle du test affiché.

Échelle logarithmique des prix : chaque graduation multiplie le tarif par dix. Sortie et entrée restent séparées.

Ronds : API directe. Carrés : prix OpenRouter. Les numéros décalés sont reliés à leur position exacte. Chaque numéro renvoie au modèle et à ses conditions ci-dessous.

  1. 1. GPT-6 Astra · API OpenAI
  2. 2. Claude Fable 5.1 · API Anthropic
Valeurs exactes et conditions : Score du test affiché contre tarif : Vals Code Migration : réécrire un programme · Vals AI · ★☆☆
Modèle et serviceÉchelle réelle de 0 à 100Entrée / sortie
USD par million
Date, source et conditions
1. GPT-6 AstraAPI OpenAI★☆☆ : solidité de la preuve67,74 %10 / 50OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 20 USD en entrée et 75 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

2. Claude Fable 5.1API Anthropic★☆☆ : solidité de la preuve54,607 %10 / 50Anthropic, source tarifaire

Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

Modèles mesurés sans tarif utilisable (48)

Claude Fable 5, MiniMax M2.5, Claude Opus 4.6, GLM 5, Kimi K2.5, Claude Opus 4.7, Claude Sonnet 4.6, Claude Sonnet 5, DeepSeek V4 Flash, DeepSeek V4 Pro, GLM 5.2, GPT-5.4 nano, Grok 4.3, Grok 4.5, Grok Build 0.1, Kimi K2.6, Kimi K2.7 Code, MiniMax M3, Qwen 3.6 27B, Qwen 3.6 Plus, Qwen 3.7 Max, Kimi K3, Inkling, DeepSeek V4 Flash 0731, Qwen 3.8 Max, Smaug-Agentic, DeepSeek V4 Pro 0813, Grok 4.6, Qwen 3.8 27B, DeepSeek V4 Flash Vision Exp, GLM 5.3, GLM 5.3 Flash, Qwen 3.8 Flash Next, Nemotron 3 Ultra 550B A55B, Muse Spark 1.3, GLM 5.1, MiMo V2.5 Pro, MiMo V2.5, Inkling Small, Qwen 3.7 Plus, MiniMax M2.7, Claude Haiku 4.5, Gemini 3 Flash Preview, Mistral Medium 3.5, Gemini 3.1 Flash Lite Preview, Nemotron 3.5 Lightning, Grok 4.20 0309 Reasoning, Ling 3.0 Flash 2607, version non confirmée. Ils ne sont pas représentés à zéro.

Tableau comparatif

Analyse élargie, 3 organismes, 41 modèles. Rang moyen sur 3 sources

RangNote sur 100ModèleFabricantSoliditéArtificial Analysis Coding Agent Index v1.4Terminal-Bench 4.0SWE-bench VerifiedLiveBench : codeVals Code Migration : réécrire un programme
Non classé dans l’agrégationMesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre.GPT-6 AstraOpenAI★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.67 pointsNon mesuréNon mesuréNon mesuré67,74 %
1er, rang moyen 1,83Mesures partielles, 2 tests sur 2, hors note Origin. Politique de repli non documentée entre les évaluateurs.Claude Fable 5.1Anthropic★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.70 points57,88 %Non mesuré86,4 %54,607 %
2e, rang moyen 2,67Mesures partielles, 2 tests sur 2, hors note Origin. Politique de repli non documentée entre les évaluateurs.Claude Fable 5Anthropic★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.67 points44,55 %Non mesuré86,0 %55,065 %
3e ex aequo, rang moyen 3,6788/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 75 à 100Claude Opus 5Anthropic★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. Fourchettes publiées recouvrantes dans un test retenu.68 points51,82 %Non mesuré81,4 %57,473 %
3e ex aequo, rang moyen 3,6797/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 94 à 100GPT-5.6 SolOpenAI★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. Fourchettes publiées recouvrantes dans un test retenu.65 points37,27 %Non mesuré83,9 %52,916 %
Non classé dans l’agrégationPas de référenceMiniMax M2.5MiniMax★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuré75,8 %Non mesuréNon mesuré
Non classé dans l’agrégationHors catalogue de cette édition, 1 tests sur 2, hors note Origin. Version ou effort non publié et documenté dans au moins un test.Claude Opus 4.6Anthropic★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuré75,6 %78,2 %Non mesuré
Non classé dans l’agrégationPas de référenceGLM 5Z.ai★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuré72,8 %Non mesuréNon mesuré
Non classé dans l’agrégationMesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre.Kimi K2.5Moonshot AI★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuré70,8 %Non mesuré6,962 %
8e, rang moyen 9Mesures partielles, 2 tests sur 2, hors note Origin. Efforts différents entre Vals et LiveBench.Claude Opus 4.7Anthropic★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré82,1 %43,878 %
12e, rang moyen 13Mesures partielles, 2 tests sur 2, hors note Origin. Efforts différents entre Vals et LiveBench.Claude Sonnet 4.6Anthropic★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré79,3 %39,892 %
10e, rang moyen 9,83Mesures partielles, 2 tests sur 2, hors note Origin. Efforts différents entre Vals et LiveBench.Claude Sonnet 5Anthropic★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.Non mesuré12,42 %Non mesuré80,7 %44,392 %
Non classé dans l’agrégationHors catalogue de cette édition, 1 tests sur 2, hors note Origin. Version ou effort non publié et documenté dans au moins un test.DeepSeek V4 FlashDeepSeek★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuré69,2 %Non mesuré
33e, rang moyen 32Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.DeepSeek V4 ProDeepSeek★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré70,0 %26,201 %
29e, rang moyen 28,522/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 19 à 25Gemini 3.1 Pro PreviewGoogle★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré76,5 %17,313 %
23e, rang moyen 21,7541/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 25 à 56Gemini 3.5 FlashGoogle★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré78,2 %26,745 %
13e, rang moyen 13,5Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.GLM 5.2Z.ai★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré79,7 %37,87 %
37e, rang moyen 359/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 6 à 13GPT-5.4 miniOpenAI★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré71,6 %12,936 %
36e, rang moyen 34,5Mesures partielles, 2 tests sur 2, hors note Origin. Efforts différents entre Vals et LiveBench.GPT-5.4 nanoOpenAI★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré70,8 %14,467 %
19e ex aequo, rang moyen 20,2548/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 41 à 56GPT-5.4OpenAI★☆☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen.Non mesuréNon mesuréNon mesuré77,5 %34,984 %
5e, rang moyen 681/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 75 à 88GPT-5.5OpenAI★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré82,1 %45,161 %
40e ex aequo, rang moyen 39Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.Grok 4.3xAI★☆☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen.Non mesuréNon mesuréNon mesuré69,9 %6,795 %
25e, rang moyen 22,17Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.Grok 4.5xAI★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.Non mesuré12,42 %Non mesuré68,6 %36,596 %
Non classé dans l’agrégationHors catalogue de cette édition, 1 tests sur 2, hors note Origin. Version ou effort non publié et documenté dans au moins un test.Grok Build 0.1xAI★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuré65,4 %Non mesuré
17e, rang moyen 20Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.Kimi K2.6Moonshot AI★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré78,6 %27,768 %
30e, rang moyen 29Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.Kimi K2.7 CodeMoonshot AI★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré74,0 %25,392 %
38e, rang moyen 35,5Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.MiniMax M3MiniMax★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré68,2 %19,925 %
Non classé dans l’agrégationHors catalogue de cette édition, 1 tests sur 2, hors note Origin. Version ou effort non publié et documenté dans au moins un test.Qwen 3.6 27BAlibaba★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuré71,8 %Non mesuré
28e, rang moyen 28,25Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.Qwen 3.6 PlusAlibaba★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré78,2 %11,102 %
34e, rang moyen 32,5Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.Qwen 3.7 MaxAlibaba★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré74,2 %13,069 %
11e, rang moyen 10,575/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 63 à 88GPT-5.6 TerraOpenAI★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.Non mesuré21,52 %Non mesuré78,2 %47,804 %
6e ex aequo, rang moyen 7,581/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 69 à 94GPT-5.6 LunaOpenAI★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. Fourchettes publiées recouvrantes dans un test retenu.Non mesuré17,27 %Non mesuré82,9 %44,55 %
26e ex aequo, rang moyen 22,2538/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 31 à 44Muse Spark 1.1Meta★☆☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen.Non mesuréNon mesuréNon mesuré77,2 %31,115 %
19e ex aequo, rang moyen 20,25Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.Kimi K3Moonshot AI★☆☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen.Non mesuréNon mesuréNon mesuré81,4 %16,099 %
39e, rang moyen 363/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 0 à 6InklingThinking Machines Lab★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré71,0 %11,79 %
35e, rang moyen 33,59/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 0 à 19Gemini 3.5 Flash-LiteGoogle★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré76,1 %6,148 %
21e, rang moyen 2144/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 38 à 50Gemini 3.6 FlashGoogle★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré77,9 %30,928 %
6e ex aequo, rang moyen 7,581/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 81 à 81Claude Opus 4.8Anthropic★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. Fourchettes publiées recouvrantes dans un test retenu.Non mesuré23,64 %Non mesuré81,8 %47,25 %
24e, rang moyen 22Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.DeepSeek V4 Flash 0731DeepSeek★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré75,0 %38,631 %
31e, rang moyen 30Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.Qwen 3.8 MaxAlibaba★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré72,9 %23,958 %
26e ex aequo, rang moyen 22,2536/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 31 à 41Muse Spark 1.2Meta★☆☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen.Non mesuréNon mesuréNon mesuré77,5 %29,954 %
Non classé dans l’agrégationHors catalogue de cette édition, 1 tests sur 2, hors note Origin. Version ou effort non publié et documenté dans au moins un test.Smaug-AgenticAbacus.AI★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuré82,5 %Non mesuré
16e, rang moyen 18,25Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.DeepSeek V4 Pro 0813DeepSeek★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré77,2 %41,54 %
14e, rang moyen 14,17Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.Grok 4.6xAI★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.Non mesuré20,30 %Non mesuré76,8 %44,572 %
15e, rang moyen 14,8359/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 50 à 69Gemini 3.7 FlashGoogle★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.Non mesuré11,21 %Non mesuré78,9 %34,8 %
32e, rang moyen 31Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.Qwen 3.8 27BAlibaba★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré75,7 %14,157 %
Non classé dans l’agrégationHors catalogue de cette édition, 1 tests sur 2, hors note Origin. Version ou effort non publié et documenté dans au moins un test.DeepSeek V4 Flash Vision ExpDeepSeek★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuré68,2 %Non mesuré
9e, rang moyen 9,5Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.GLM 5.3Z.ai★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.Non mesuré41,82 %Non mesuré79,0 %44,222 %
22e, rang moyen 21,25Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.GLM 5.3 FlashZ.ai★★☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.Non mesuréNon mesuréNon mesuré79,0 %20,515 %
Non classé dans l’agrégationHors catalogue de cette édition, 1 tests sur 2, hors note Origin. Version ou effort non publié et documenté dans au moins un test.Qwen 3.8 Flash NextAlibaba★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuré72,6 %Non mesuré
40e ex aequo, rang moyen 39Mesures partielles, 2 tests sur 2, hors note Origin. Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.Nemotron 3 Ultra 550B A55BNVIDIA★☆☆ 2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen.Non mesuréNon mesuréNon mesuré70,7 %4,905 %
18e, rang moyen 20,1738/100, 2 tests, 2 équipes, position relative, pas un taux de réussite, selon les tests 13 à 63Gemini 3.8 FlashGoogle★★☆ 3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.Non mesuré19,09 %Non mesuré72,5 %36,546 %
Non classé dans l’agrégationHors catalogue de cette édition, 1 tests sur 2, hors note Origin. Version ou effort non publié et documenté dans au moins un test.Muse Spark 1.3Meta★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuré81,1 %Non mesuré
Non classé dans l’agrégationMesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre.GLM 5.1Z.ai★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuréNon mesuré25,768 %
Non classé dans l’agrégationMesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre.MiMo V2.5 ProXiaomi★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuréNon mesuré21,557 %
Non classé dans l’agrégationMesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre.MiMo V2.5Xiaomi★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuréNon mesuré14,228 %
Non classé dans l’agrégationMesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre.Inkling SmallThinking Machines Lab★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuréNon mesuré13,675 %
Non classé dans l’agrégationMesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre.Qwen 3.7 PlusAlibaba★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuréNon mesuré12,856 %
Non classé dans l’agrégationMesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre.MiniMax M2.7MiniMax★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuréNon mesuré8,685 %
Non classé dans l’agrégationMesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre.Claude Haiku 4.5Anthropic★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuréNon mesuré7,551 %
Non classé dans l’agrégationMesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre.Gemini 3 Flash PreviewGoogle★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuréNon mesuré6,391 %
Non classé dans l’agrégationMesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre.Mistral Medium 3.5Mistral AI★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuréNon mesuré5,127 %
Non classé dans l’agrégationHors catalogue de cette édition, 1 tests sur 2, hors note Origin. Disponibilité de cette version non vérifiée ; mesure historique conservée.Gemini 3.1 Flash Lite PreviewGoogle★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuréNon mesuré4,609 %
Non classé dans l’agrégationMesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre.Nemotron 3.5 LightningNVIDIA★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuréNon mesuré2,951 %
Non classé dans l’agrégationMesures partielles, 1 tests sur 2, hors note Origin. Aucune mesure LiveBench code pour cette version dans le registre.Grok 4.20 0309 ReasoningxAI★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuréNon mesuré0,314 %
Non classé dans l’agrégationHors catalogue de cette édition, 1 tests sur 2, hors note Origin. Disponibilité de cette version non vérifiée ; mesure historique conservée.Ling 3.0 Flash 2607, version non confirméeAnt Group★☆☆ Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.Non mesuréNon mesuréNon mesuréNon mesuré0 %

Méta-analyse par agrégation de rangs, 3 sources, 41 modèles, W = 0,8012. Fourchette à 95 % : 0,8 à 1. Sensibilité : Noyau strict, 2 organismes, 13 modèles. Accord des classements (W) : 0,82. Autre podium : Claude Fable 5.1 (1er), Claude Fable 5 (2e), GPT-5.6 Sol (3e). Écarts de podium : Claude Opus 5 : 3e ex aequo dans l’analyse affichée, 4e dans cette autre analyse ; GPT-5.6 Sol : 3e ex aequo dans l’analyse affichée, 3e dans cette autre analyse. Les deux analyses restent séparées, sans moyenne.

Voir les égalités et les sources écartées

Claude Fable 5.1 et Claude Opus 5 : Les fourchettes publiées se recouvrent.

Claude Fable 5 et GLM 5.3 et GPT-5.6 Sol : Les fourchettes publiées se recouvrent.

Claude Opus 4.8 et GPT-5.6 Terra et Grok 4.6 et Gemini 3.8 Flash et GPT-5.6 Luna et Claude Sonnet 5 et Grok 4.5 et Gemini 3.7 Flash : Les fourchettes publiées se recouvrent.

Kimi K3 et Claude Opus 5 : Les scores publiés sont identiques.

GLM 5.3 et GLM 5.3 Flash : Les scores publiés sont identiques.

Gemini 3.5 Flash et Qwen 3.6 Plus : Les scores publiés sont identiques.

GPT-5.4 et Muse Spark 1.2 : Les scores publiés sont identiques.

DeepSeek V4 Pro 0813 et Muse Spark 1.1 : Les scores publiés sont identiques.

Claude Opus 5 et GPT-5.6 Sol : Même rang moyen après combinaison des sources.

Claude Opus 4.8 et GPT-5.6 Luna : Même rang moyen après combinaison des sources.

GPT-5.4 et Kimi K3 : Même rang moyen après combinaison des sources.

Muse Spark 1.1 et Muse Spark 1.2 : Même rang moyen après combinaison des sources.

Grok 4.3 et Nemotron 3 Ultra 550B A55B : Même rang moyen après combinaison des sources.

SWE-bench : Origine d’exécution non vérifiée : résultat publié mais non compté, la soumission ne prouve pas le contrôle par l’équipe.

Artificial Analysis : Dépend d’une autre source retenue, Terminal-Bench 4.0. Écartée pour éviter de compter deux fois la même famille de tâches.

Scores à leur échelle réelle

Artificial Analysis Coding Agent Index v1.4

Artificial Analysis. Valeurs exactes, sans barre. Plus haut est meilleur.

Claude Fable 5.1 : 70 points

Organisme commercial extérieur

Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.

Le score mesure Claude Fable 5.1 avec un agent précis. Changer cet agent peut changer le résultat.

Source, consultée le 2026-09-04

Claude Opus 5 : 68 points

Organisme commercial extérieur

Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.

Le score mesure Claude Opus 5 avec un agent précis. Changer cet agent peut changer le résultat.

Source, consultée le 2026-09-04

GPT-6 Astra : 67 points

Organisme commercial extérieur

Agent Codex. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.

Le score mesure GPT-6 Astra avec un agent précis. Changer cet agent peut changer le résultat.

Source, consultée le 2026-09-04

Claude Fable 5 : 67 points

Organisme commercial extérieur

Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.

Le score mesure Claude Fable 5 avec un agent précis. Changer cet agent peut changer le résultat.

Source, consultée le 2026-09-04

GPT-5.6 Sol : 65 points

Organisme commercial extérieur

Agent Codex. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.

Le score mesure GPT-5.6 Sol avec un agent précis. Changer cet agent peut changer le résultat.

Source, consultée le 2026-09-04

Terminal-Bench 4.0

Terminal-Bench. Échelle réelle de 0 à 100. Plus haut est meilleur.

Claude Fable 5.1 : 57,88 %

IC à 95 % publié par la source, erreur standard par tâche : 54,12 à 61,64 %

Test extérieur

Claude Code 2.1.257. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5-1. Date de sortie déclarée par Terminal-Bench : 2026-09-01. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Claude Opus 5 : 51,82 %

IC à 95 % publié par la source, erreur standard par tâche : 48,43 à 55,21 %

Test extérieur

Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-5. Date de sortie déclarée par Terminal-Bench : 2026-07-24. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Claude Fable 5 : 44,55 %

IC à 95 % publié par la source, erreur standard par tâche : 40,70 à 48,40 %

Test extérieur

Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5. Date de sortie déclarée par Terminal-Bench : 2026-06-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

GLM 5.3 : 41,82 %

IC à 95 % publié par la source, erreur standard par tâche : 38,59 à 45,05 %

Test extérieur

Claude Code 2.1.207. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/glm-5.3. Date de sortie déclarée par Terminal-Bench : 2026-08-14. Fabricant Z.ai ; préfixe source anthropic/, fournisseur du point d’accès non publié. Effort max chez Terminal-Bench ; effort LiveBench non publié. Aucune équivalence supposée. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

GPT-5.6 Sol : 37,27 %

IC à 95 % publié par la source, erreur standard par tâche : 33,49 à 41,05 %

Test extérieur

Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-sol. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Claude Opus 4.8 : 23,64 %

IC à 95 % publié par la source, erreur standard par tâche : 20,08 à 27,20 %

Test extérieur

Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-4-8. Date de sortie déclarée par Terminal-Bench : 2026-05-28. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

GPT-5.6 Terra : 21,52 %

IC à 95 % publié par la source, erreur standard par tâche : 18,27 à 24,77 %

Test extérieur

Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-terra. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Grok 4.6 : 20,30 %

IC à 95 % publié par la source, erreur standard par tâche : 17,21 à 23,39 %

Test extérieur

Grok Build 1.0.5. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.6. Date de sortie déclarée par Terminal-Bench : 2026-08-12. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Gemini 3.8 Flash : 19,09 %

IC à 95 % publié par la source, erreur standard par tâche : 15,73 à 22,45 %

Test extérieur

mini-SWE-agent 2.4.6. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.8-flash. Date de sortie déclarée par Terminal-Bench : 2026-09-02. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

GPT-5.6 Luna : 17,27 %

IC à 95 % publié par la source, erreur standard par tâche : 14,42 à 20,12 %

Test extérieur

Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-luna. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Claude Sonnet 5 : 12,42 %

IC à 95 % publié par la source, erreur standard par tâche : 9,36 à 15,48 %

Test extérieur

Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-sonnet-5. Date de sortie déclarée par Terminal-Bench : 2026-06-30. Efforts différents : max chez Terminal-Bench, xhigh chez LiveBench. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Grok 4.5 : 12,42 %

IC à 95 % publié par la source, erreur standard par tâche : 9,80 à 15,04 %

Test extérieur

Grok Build 1.0.5. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.5. Date de sortie déclarée par Terminal-Bench : 2026-07-16. Écart conservé avec la date du catalogue Origin : 2026-07-08. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Gemini 3.7 Flash : 11,21 %

IC à 95 % publié par la source, erreur standard par tâche : 8,76 à 13,66 %

Test extérieur

mini-SWE-agent 2.4.6. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.7-flash. Date de sortie déclarée par Terminal-Bench : 2026-08-13. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

SWE-bench Verified

SWE-bench. Échelle réelle de 0 à 100. Plus haut est meilleur.

MiniMax M2.5 : 75,8 %

Origine d’exécution non vérifiée

mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.

Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 379 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-04

Claude Opus 4.6 : 75,6 %

Origine d’exécution non vérifiée

mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.

Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 378 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Valeur révisée de 75,4 à 75,6 % le 18 février 2026 : https://github.com/SWE-bench/experiments/commit/36905bfeb728dadd82a75bb169ed612aac634551. Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-04

GLM 5 : 72,8 %

Origine d’exécution non vérifiée

mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.

Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 364 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-04

Kimi K2.5 : 70,8 %

Origine d’exécution non vérifiée

mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.

Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 354 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-04

LiveBench : code

LiveBench. Échelle réelle de 0 à 100. Plus haut est meilleur.

Claude Fable 5.1 : 86,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Claude Fable 5 : 86,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

GPT-5.6 Sol : 83,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

GPT-5.6 Luna : 82,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Smaug-Agentic : 82,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

GPT-5.5 : 82,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Claude Opus 4.7 : 82,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Claude Opus 4.8 : 81,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Kimi K3 : 81,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Claude Opus 5 : 81,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Muse Spark 1.3 : 81,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Claude Sonnet 5 : 80,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

GLM 5.2 : 79,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Claude Sonnet 4.6 : 79,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

GLM 5.3 : 79,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

GLM 5.3 Flash : 79,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Gemini 3.7 Flash : 78,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Kimi K2.6 : 78,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

GPT-5.6 Terra : 78,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Claude Opus 4.6 : 78,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Gemini 3.5 Flash : 78,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Qwen 3.6 Plus : 78,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Gemini 3.6 Flash : 77,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

GPT-5.4 : 77,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Muse Spark 1.2 : 77,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Muse Spark 1.1 : 77,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

DeepSeek V4 Pro 0813 : 77,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Grok 4.6 : 76,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Gemini 3.1 Pro Preview : 76,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Gemini 3.5 Flash-Lite : 76,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Qwen 3.8 27B : 75,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

DeepSeek V4 Flash 0731 : 75,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Qwen 3.7 Max : 74,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Kimi K2.7 Code : 74,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Qwen 3.8 Max : 72,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Qwen 3.8 Flash Next : 72,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Gemini 3.8 Flash : 72,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Qwen 3.6 27B : 71,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

GPT-5.4 mini : 71,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Inkling : 71,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

GPT-5.4 nano : 70,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Nemotron 3 Ultra 550B A55B : 70,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

DeepSeek V4 Pro : 70,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Grok 4.3 : 69,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

DeepSeek V4 Flash : 69,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Grok 4.5 : 68,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

MiniMax M3 : 68,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

DeepSeek V4 Flash Vision Exp : 68,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Grok Build 0.1 : 65,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Vals Code Migration : réécrire un programme

Vals AI. Échelle réelle de 0 à 100. Plus haut est meilleur.

GPT-6 Astra : 67,74 %

Erreur standard publiée : 4,216 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-6-astra. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Claude Opus 5 : 57,473 %

Erreur standard publiée : 4,371 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Claude Fable 5 : 55,065 %

Erreur standard publiée : 4,605 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Claude Fable 5.1 : 54,607 %

Erreur standard publiée : 4,812 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GPT-5.6 Sol : 52,916 %

Erreur standard publiée : 4,353 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GPT-5.6 Terra : 47,804 %

Erreur standard publiée : 4,28 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Claude Opus 4.8 : 47,25 %

Erreur standard publiée : 4,176 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GPT-5.5 : 45,161 %

Erreur standard publiée : 4,164 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.5. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Grok 4.6 : 44,572 %

Erreur standard publiée : 4,479 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.6. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GPT-5.6 Luna : 44,55 %

Erreur standard publiée : 4,244 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Claude Sonnet 5 : 44,392 %

Erreur standard publiée : 4,246 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GLM 5.3 : 44,222 %

Erreur standard publiée : 4,289 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.3. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Claude Opus 4.7 : 43,878 %

Erreur standard publiée : 4,22 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

DeepSeek V4 Pro 0813 : 41,54 %

Erreur standard publiée : 4,301 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Claude Sonnet 4.6 : 39,892 %

Erreur standard publiée : 4,138 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

DeepSeek V4 Flash 0731 : 38,631 %

Erreur standard publiée : 4,382 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GLM 5.2 : 37,87 %

Erreur standard publiée : 4,143 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.2. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Grok 4.5 : 36,596 %

Erreur standard publiée : 4,141 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.5. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Gemini 3.8 Flash : 36,546 %

Erreur standard publiée : 4,184 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GPT-5.4 : 34,984 %

Erreur standard publiée : 4,113 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Gemini 3.7 Flash : 34,8 %

Erreur standard publiée : 4,225 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Muse Spark 1.1 : 31,115 %

Erreur standard publiée : 4,068 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.1. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Gemini 3.6 Flash : 30,928 %

Erreur standard publiée : 4,068 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Muse Spark 1.2 : 29,954 %

Erreur standard publiée : 4,023 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.2. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Kimi K2.6 : 27,768 %

Erreur standard publiée : 4,144 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Gemini 3.5 Flash : 26,745 %

Erreur standard publiée : 4,104 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

DeepSeek V4 Pro : 26,201 %

Erreur standard publiée : 4,037 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-pro-20260423/endpoints. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GLM 5.1 : 25,768 %

Erreur standard publiée : 4,087 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.1. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Kimi K2.7 Code : 25,392 %

Erreur standard publiée : 4,161 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Qwen 3.8 Max : 23,958 %

Erreur standard publiée : 4,309 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

MiMo V2.5 Pro : 21,557 %

Erreur standard publiée : 4,127 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GLM 5.3 Flash : 20,515 %

Erreur standard publiée : 4,207 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/vlm/glm-5.3-flash. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

MiniMax M3 : 19,925 %

Erreur standard publiée : 3,944 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Gemini 3.1 Pro Preview : 17,313 %

Erreur standard publiée : 3,933 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Kimi K3 : 16,099 %

Erreur standard publiée : 4,101 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GPT-5.4 nano : 14,467 %

Erreur standard publiée : 4,025 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-nano. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

MiMo V2.5 : 14,228 %

Erreur standard publiée : 3,687 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Qwen 3.8 27B : 14,157 %

Erreur standard publiée : 4,189 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/qwen/qwen3.8-27b-20260814/endpoints. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Inkling Small : 13,675 %

Erreur standard publiée : 3,81 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Qwen 3.7 Max : 13,069 %

Erreur standard publiée : 2,858 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GPT-5.4 mini : 12,936 %

Erreur standard publiée : 3,641 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-mini. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Qwen 3.7 Plus : 12,856 %

Erreur standard publiée : 2,931 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Inkling : 11,79 %

Erreur standard publiée : 3,396 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Qwen 3.6 Plus : 11,102 %

Erreur standard publiée : 1,312 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

MiniMax M2.7 : 8,685 %

Erreur standard publiée : 1,786 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Claude Haiku 4.5 : 7,551 %

Erreur standard publiée : 1,056 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Kimi K2.5 : 6,962 %

Erreur standard publiée : 1,29 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/moonshotai/kimi-k2.5-0127/endpoints. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Grok 4.3 : 6,795 %

Erreur standard publiée : 1,195 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.3. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Gemini 3 Flash Preview : 6,391 %

Erreur standard publiée : 1,093 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Gemini 3.5 Flash-Lite : 6,148 %

Erreur standard publiée : 1,708 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Mistral Medium 3.5 : 5,127 %

Erreur standard publiée : 1,369 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.mistral.ai/models/mistral-medium-3-5-26-04. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Nemotron 3 Ultra 550B A55B : 4,905 %

Erreur standard publiée : 1,589 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://build.nvidia.com/nvidia/nemotron-3-ultra-550b-a55b. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Gemini 3.1 Flash Lite Preview : 4,609 %

Erreur standard publiée : 1,069 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Nemotron 3.5 Lightning : 2,951 %

Erreur standard publiée : 0,951 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Grok 4.20 0309 Reasoning : 0,314 %

Erreur standard publiée : 0,11 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.20-0309-reasoning. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Ling 3.0 Flash 2607, version non confirmée : 0 %

Erreur standard publiée : 0 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Matrice des 15 usages

Aucune moyenne entre les usages. Chaque ligne reprend le classement disponible pour cet usage.

UsageEn têteSoliditéSources
Raisonnement généralClaude Fable 5.1★★☆ Une équipe extérieure, confirmation manquanteLiveBench : raisonnement
Missions longuesClaude Fable 5.1★★☆ Une équipe extérieure, confirmation manquanteLiveBench : code autonome
Développement logicielClaude Fable 5.1★★★ 3 organismes couvrent au moins 5 modèles ; 3 requis pour une preuve solide3 sources indépendantes
JuridiqueGPT-6 Astra★★☆ Une équipe extérieure, confirmation manquanteAPEX-Agents Corporate Lawyer, moyenne des critères
Finance et comptabilitéClaude Fable 5.1★★☆ Une équipe extérieure, confirmation manquanteAPEX-Agents Investment Banking Analyst, moyenne des critères
SantéChiffres fabricant seulement☆☆☆ Chiffres du fabricant seulementHealthBench Professional
Maths et sciencesClaude Fable 5.1★★☆ Une équipe extérieure, confirmation manquanteLiveBench : mathématiques
Usage d’ordinateurPersonne n’a mesuré☆☆☆ Aucune mesure disponibleAucun test public
Contexte longPersonne n’a mesuré☆☆☆ Aucune mesure disponibleAucun test public
Exactitude factuelleGPT-6 Astra★★☆ Une équipe extérieure, confirmation manquanteAA-Omniscience, réponses inventées
VisionPersonne n’a mesuré☆☆☆ Aucune mesure disponibleAucun test public
VoixPersonne n’a mesuré☆☆☆ Aucune mesure disponibleAucun test public
ÉducationPersonne n’a mesuré☆☆☆ Aucune mesure disponibleAucun test public
CybersécuritéPersonne n’a mesuré☆☆☆ Aucune mesure disponibleAucun test public
EfficacitéPersonne n’a mesuré☆☆☆ Aucune mesure disponibleAucun test public
Notes sur 100 disponibles

Aucune moyenne entre les usages.

Développement logiciel

Note Origin disponible pour 17 modèles sur 2 tests de 2 équipes indépendantes, édition origin-coding-2026-09-04-v1. Claude Fable 5.1 et Claude Fable 5 hors note : Politique de repli non documentée entre les évaluateurs.

GPT-5.6 Sol : 97/100, position relative, pas un taux de réussite, 2 tests, 2 équipes, édition origin-coding-2026-09-04-v1 arrêtée au 2026-09-04, selon les tests 94 à 100.

Claude Opus 5 : 88/100, position relative, pas un taux de réussite, 2 tests, 2 équipes, édition origin-coding-2026-09-04-v1 arrêtée au 2026-09-04, selon les tests 75 à 100.

Claude Opus 4.8 : 81/100, position relative, pas un taux de réussite, 2 tests, 2 équipes, édition origin-coding-2026-09-04-v1 arrêtée au 2026-09-04, selon les tests 81 à 81.

Consulter les autres usages

Raisonnement général

Quel modèle pour raisonner sur des sujets variés ?

Claude Fable 5.1 arrive en tête sur LiveBench : raisonnement.

Une seule équipe porte ce podium. Les autres tests de raisonnement général restent affichés séparément.

★★☆ Une équipe extérieure, confirmation manquante

Note Origin indisponible : couverture actuelle, 4 tests au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.

Agrégation en attente de couverture, 2 modèles communs sur 49.

Agrégation en attente de couverture, 2 modèles communs sur 49.

Capacité et prix

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.

Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.

Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.

Score du test affiché contre tarif : LiveBench : raisonnement · LiveBench · ★☆☆

Échelle réelle de 0 à 100. Plus haut est meilleur

Ce graphique ne contient aucune note Origin. Il garde le score et l’échelle du test affiché.

Échelle logarithmique des prix : chaque graduation multiplie le tarif par dix. Sortie et entrée restent séparées.

Échelle réelle de 0 à 100022,9245,8568,7791,69110100USD par million de tokens en sortie1. Claude Fable 5.1, API Anthropic, 91,7 %, 50 USD par million en sortie. Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.2. GPT-5.6 Sol, API OpenAI, 91,7 %, 20 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.3. Claude Opus 5, API Anthropic, 91,2 %, 25 USD par million en sortie. Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.4. GPT-5.6 Terra, API OpenAI, 90,6 %, 12 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.5. Muse Spark 1.2, prix OpenRouter, 90,0 %, 4,25 USD par million en sortie. Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.6. GPT-5.5, API OpenAI, 89,7 %, 30 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 10 USD en entrée et 45 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.7. Gemini 3.8 Flash, API Google, 89,3 %, 3,75 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.8. Claude Opus 4.8, API Anthropic, 89,2 %, 25 USD par million en sortie. Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.9. GPT-5.4, API OpenAI, 88,1 %, 15 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 5 USD en entrée et 22.5 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.10. Gemini 3.7 Flash, API Google, 87,8 %, 3,75 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.11. Muse Spark 1.1, prix OpenRouter, 87,7 %, 4,25 USD par million en sortie. Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.12. GPT-5.6 Luna, API OpenAI, 85,6 %, 1,2 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 0.4 USD en entrée et 1.8 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.13. Gemini 3.6 Flash, API Google, 85,1 %, 3,75 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.14. Gemini 3.1 Pro Preview, API Google, 84,0 %, 12 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 200 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.15. Gemini 3.5 Flash, API Google, 82,0 %, 9 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.16. GPT-5.4 mini, API OpenAI, 71,3 %, 4,5 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.17. Gemini 3.5 Flash-Lite, API Google, 60,2 %, 2,5 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

Ronds : API directe. Carrés : prix OpenRouter. Les numéros décalés sont reliés à leur position exacte. Chaque numéro renvoie au modèle et à ses conditions ci-dessous.

  1. 1. Claude Fable 5.1 · API Anthropic
  2. 2. GPT-5.6 Sol · API OpenAI · promotion au 2026-11-21
  3. 3. Claude Opus 5 · API Anthropic
  4. 4. GPT-5.6 Terra · API OpenAI
  5. 5. Muse Spark 1.2 · prix OpenRouter
  6. 6. GPT-5.5 · API OpenAI
  7. 7. Gemini 3.8 Flash · API Google · promotion au 2026-12-31
  8. 8. Claude Opus 4.8 · API Anthropic
  9. 9. GPT-5.4 · API OpenAI
  10. 10. Gemini 3.7 Flash · API Google · promotion au 2026-12-31
  11. 11. Muse Spark 1.1 · prix OpenRouter
  12. 12. GPT-5.6 Luna · API OpenAI
  13. 13. Gemini 3.6 Flash · API Google · promotion au 2026-12-31
  14. 14. Gemini 3.1 Pro Preview · API Google
  15. 15. Gemini 3.5 Flash · API Google
  16. 16. GPT-5.4 mini · API OpenAI
  17. 17. Gemini 3.5 Flash-Lite · API Google
Valeurs exactes et conditions : Score du test affiché contre tarif : LiveBench : raisonnement · LiveBench · ★☆☆
Modèle et serviceÉchelle réelle de 0 à 100Entrée / sortie
USD par million
Date, source et conditions
1. Claude Fable 5.1API Anthropic★☆☆ : solidité de la preuve91,7 %10 / 50Anthropic, source tarifaire

Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

2. GPT-5.6 SolAPI OpenAI★☆☆ : solidité de la preuve91,7 %4 / 20OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

3. Claude Opus 5API Anthropic★☆☆ : solidité de la preuve91,2 %5 / 25Anthropic, source tarifaire

Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

4. GPT-5.6 TerraAPI OpenAI★☆☆ : solidité de la preuve90,6 %2 / 12OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

5. Muse Spark 1.2prix OpenRouter★☆☆ : solidité de la preuve90,0 %1,25 / 4,25OpenRouter, source tarifaire

Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

6. GPT-5.5API OpenAI★☆☆ : solidité de la preuve89,7 %5 / 30OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 10 USD en entrée et 45 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

7. Gemini 3.8 FlashAPI Google★☆☆ : solidité de la preuve89,3 %0,75 / 3,75Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

8. Claude Opus 4.8API Anthropic★☆☆ : solidité de la preuve89,2 %5 / 25Anthropic, source tarifaire

Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

9. GPT-5.4API OpenAI★☆☆ : solidité de la preuve88,1 %2,5 / 15OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 5 USD en entrée et 22.5 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

10. Gemini 3.7 FlashAPI Google★☆☆ : solidité de la preuve87,8 %0,75 / 3,75Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

11. Muse Spark 1.1prix OpenRouter★☆☆ : solidité de la preuve87,7 %1,25 / 4,25OpenRouter, source tarifaire

Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

12. GPT-5.6 LunaAPI OpenAI★☆☆ : solidité de la preuve85,6 %0,2 / 1,2OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 0.4 USD en entrée et 1.8 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

13. Gemini 3.6 FlashAPI Google★☆☆ : solidité de la preuve85,1 %0,75 / 3,75Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

14. Gemini 3.1 Pro PreviewAPI Google★☆☆ : solidité de la preuve84,0 %2 / 12Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 200 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

15. Gemini 3.5 FlashAPI Google★☆☆ : solidité de la preuve82,0 %1,5 / 9Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

16. GPT-5.4 miniAPI OpenAI★☆☆ : solidité de la preuve71,3 %0,75 / 4,5OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

17. Gemini 3.5 Flash-LiteAPI Google★☆☆ : solidité de la preuve60,2 %0,3 / 2,5Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

Modèles mesurés sans tarif utilisable (32)

Claude Fable 5, Claude Opus 4.6, Claude Opus 4.7, Claude Sonnet 4.6, Claude Sonnet 5, DeepSeek V4 Flash, DeepSeek V4 Pro, GLM 5.2, GPT-5.4 nano, Grok 4.3, Grok 4.5, Grok Build 0.1, Kimi K2.6, Kimi K2.7 Code, MiniMax M3, Qwen 3.6 27B, Qwen 3.6 Plus, Qwen 3.7 Max, Kimi K3, Inkling, DeepSeek V4 Flash 0731, Qwen 3.8 Max, Smaug-Agentic, DeepSeek V4 Pro 0813, Grok 4.6, Qwen 3.8 27B, DeepSeek V4 Flash Vision Exp, GLM 5.3, GLM 5.3 Flash, Qwen 3.8 Flash Next, Nemotron 3 Ultra 550B A55B, Muse Spark 1.3. Ils ne sont pas représentés à zéro.

Tableau comparatif

Rang sur LiveBench : raisonnement

RangNote sur 100ModèleFabricantSoliditéArtificial Analysis Intelligence Index v4.1.1Epoch Capabilities IndexLiveBench : raisonnementLiveBench : analyse de donnéesLiveBench : langueLiveBench : suivi des consignes
Non classé sur ce testPas de référenceGPT-6 AstraOpenAI★★☆ Une équipe extérieure61 points169 points EpochNon mesuréNon mesuréNon mesuréNon mesuré
1erPas de référenceClaude Fable 5.1Anthropic★★☆ Une équipe extérieure66 points163 points Epoch91,7 %80,3 %89,5 %73,0 %
10e ex aequoPas de référenceClaude Fable 5Anthropic★★☆ Une équipe extérieureNon mesuréNon mesuré89,7 %80,5 %90,7 %75,8 %
3ePas de référenceClaude Opus 5Anthropic★★☆ Une équipe extérieureNon mesuréNon mesuré91,2 %74,6 %88,7 %63,8 %
2ePas de référenceGPT-5.6 SolOpenAI★★☆ Une équipe extérieure61 points162 points Epoch91,7 %79,8 %87,7 %71,8 %
Non classé sur ce testPas de référenceMiniMax M2.5MiniMax☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuréNon mesuréNon mesuréNon mesuré
15ePas de référenceClaude Opus 4.6Anthropic★★☆ Une équipe extérieureNon mesuréNon mesuré88,7 %69,9 %83,3 %63,3 %
Non classé sur ce testPas de référenceGLM 5Z.ai☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuréNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceKimi K2.5Moonshot AI☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuréNon mesuréNon mesuréNon mesuré
21ePas de référenceClaude Opus 4.7Anthropic★★☆ Une équipe extérieureNon mesuréNon mesuré87,2 %78,3 %77,9 %66,7 %
29ePas de référenceClaude Sonnet 4.6Anthropic★★☆ Une équipe extérieureNon mesuréNon mesuré84,8 %77,9 %76,1 %63,2 %
14ePas de référenceClaude Sonnet 5Anthropic★★☆ Une équipe extérieureNon mesuréNon mesuré88,7 %71,7 %75,0 %63,9 %
47ePas de référenceDeepSeek V4 FlashDeepSeek★★☆ Une équipe extérieureNon mesuréNon mesuré70,6 %68,0 %70,1 %63,1 %
33ePas de référenceDeepSeek V4 ProDeepSeek★★☆ Une équipe extérieureNon mesuréNon mesuré82,7 %74,5 %78,1 %62,4 %
30ePas de référenceGemini 3.1 Pro PreviewGoogle★★☆ Une équipe extérieureNon mesuréNon mesuré84,0 %78,5 %85,4 %79,1 %
34ePas de référenceGemini 3.5 FlashGoogle★★☆ Une équipe extérieureNon mesuréNon mesuré82,0 %64,9 %84,6 %75,6 %
38ePas de référenceGLM 5.2Z.ai★★☆ Une équipe extérieureNon mesuréNon mesuré78,6 %73,7 %76,2 %62,3 %
45ePas de référenceGPT-5.4 miniOpenAI★★☆ Une équipe extérieureNon mesuréNon mesuré71,3 %70,8 %71,0 %59,8 %
35ePas de référenceGPT-5.4 nanoOpenAI★★☆ Une équipe extérieureNon mesuréNon mesuré81,1 %67,6 %62,5 %67,2 %
17ePas de référenceGPT-5.4OpenAI★★☆ Une équipe extérieureNon mesuréNon mesuré88,1 %79,3 %82,6 %70,2 %
10e ex aequoPas de référenceGPT-5.5OpenAI★★☆ Une équipe extérieureNon mesuréNon mesuré89,7 %81,6 %87,4 %70,7 %
46ePas de référenceGrok 4.3xAI★★☆ Une équipe extérieureNon mesuréNon mesuré70,8 %55,8 %73,6 %62,8 %
22ePas de référenceGrok 4.5xAI★★☆ Une équipe extérieureNon mesuréNon mesuré87,2 %73,0 %82,8 %71,5 %
41ePas de référenceGrok Build 0.1xAI★★☆ Une équipe extérieureNon mesuréNon mesuré76,4 %70,8 %72,5 %65,2 %
37ePas de référenceKimi K2.6Moonshot AI★★☆ Une équipe extérieureNon mesuréNon mesuré79,4 %65,1 %75,1 %64,4 %
32ePas de référenceKimi K2.7 CodeMoonshot AI★★☆ Une équipe extérieureNon mesuréNon mesuré82,8 %62,7 %77,9 %56,3 %
44ePas de référenceMiniMax M3MiniMax★★☆ Une équipe extérieureNon mesuréNon mesuré74,5 %76,2 %76,8 %57,5 %
48ePas de référenceQwen 3.6 27BAlibaba★★☆ Une équipe extérieureNon mesuréNon mesuré70,3 %70,4 %63,3 %53,2 %
42ePas de référenceQwen 3.6 PlusAlibaba★★☆ Une équipe extérieureNon mesuréNon mesuré75,8 %69,9 %75,0 %58,3 %
31ePas de référenceQwen 3.7 MaxAlibaba★★☆ Une équipe extérieureNon mesuréNon mesuré83,3 %71,8 %79,7 %74,0 %
5ePas de référenceGPT-5.6 TerraOpenAI★★☆ Une équipe extérieureNon mesuréNon mesuré90,6 %79,3 %82,9 %64,6 %
26ePas de référenceGPT-5.6 LunaOpenAI★★☆ Une équipe extérieureNon mesuréNon mesuré85,6 %78,0 %72,6 %60,1 %
19ePas de référenceMuse Spark 1.1Meta★★☆ Une équipe extérieureNon mesuréNon mesuré87,7 %72,5 %74,3 %69,6 %
4ePas de référenceKimi K3Moonshot AI★★☆ Une équipe extérieureNon mesuréNon mesuré90,7 %78,7 %85,5 %71,4 %
39ePas de référenceInklingThinking Machines Lab★★☆ Une équipe extérieureNon mesuréNon mesuré78,3 %72,8 %73,5 %70,1 %
49ePas de référenceGemini 3.5 Flash-LiteGoogle★★☆ Une équipe extérieureNon mesuréNon mesuré60,2 %53,2 %71,8 %67,2 %
28ePas de référenceGemini 3.6 FlashGoogle★★☆ Une équipe extérieureNon mesuréNon mesuré85,1 %63,0 %83,9 %75,4 %
13ePas de référenceClaude Opus 4.8Anthropic★★☆ Une équipe extérieureNon mesuréNon mesuré89,2 %66,0 %79,7 %72,0 %
23ePas de référenceDeepSeek V4 Flash 0731DeepSeek★★☆ Une équipe extérieureNon mesuréNon mesuré86,6 %79,3 %79,2 %65,5 %
16ePas de référenceQwen 3.8 MaxAlibaba★★☆ Une équipe extérieureNon mesuréNon mesuré88,2 %78,4 %79,7 %74,1 %
8ePas de référenceMuse Spark 1.2Meta★★☆ Une équipe extérieureNon mesuréNon mesuré90,0 %76,5 %78,6 %74,3 %
7ePas de référenceSmaug-AgenticAbacus.AI★★☆ Une équipe extérieureNon mesuréNon mesuré90,3 %79,9 %84,4 %71,0 %
24ePas de référenceDeepSeek V4 Pro 0813DeepSeek★★☆ Une équipe extérieureNon mesuréNon mesuré85,8 %79,2 %82,1 %67,7 %
6ePas de référenceGrok 4.6xAI★★☆ Une équipe extérieureNon mesuréNon mesuré90,5 %73,9 %83,7 %71,9 %
18ePas de référenceGemini 3.7 FlashGoogle★★☆ Une équipe extérieureNon mesuréNon mesuré87,8 %68,0 %85,5 %79,9 %
36ePas de référenceQwen 3.8 27BAlibaba★★☆ Une équipe extérieureNon mesuréNon mesuré80,0 %76,6 %74,3 %72,7 %
27ePas de référenceDeepSeek V4 Flash Vision ExpDeepSeek★★☆ Une équipe extérieureNon mesuréNon mesuré85,4 %79,5 %80,4 %71,0 %
25ePas de référenceGLM 5.3Z.ai★★☆ Une équipe extérieureNon mesuréNon mesuré85,8 %70,2 %79,9 %69,3 %
40ePas de référenceGLM 5.3 FlashZ.ai★★☆ Une équipe extérieureNon mesuréNon mesuré77,6 %76,4 %77,3 %52,8 %
20ePas de référenceQwen 3.8 Flash NextAlibaba★★☆ Une équipe extérieureNon mesuréNon mesuré87,4 %74,2 %74,6 %77,1 %
43ePas de référenceNemotron 3 Ultra 550B A55BNVIDIA★★☆ Une équipe extérieureNon mesuréNon mesuré74,7 %54,5 %70,8 %73,4 %
12ePas de référenceGemini 3.8 FlashGoogle★★☆ Une équipe extérieureNon mesuréNon mesuré89,3 %54,0 %87,8 %81,4 %
10e ex aequoPas de référenceMuse Spark 1.3Meta★★☆ Une équipe extérieureNon mesuréNon mesuré89,7 %79,6 %82,8 %78,0 %
Non classé sur ce testPas de référenceGLM 5.1Z.ai☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuréNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceMiMo V2.5 ProXiaomi☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuréNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceMiMo V2.5Xiaomi☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuréNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceInkling SmallThinking Machines Lab☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuréNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceQwen 3.7 PlusAlibaba☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuréNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceMiniMax M2.7MiniMax☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuréNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceClaude Haiku 4.5Anthropic☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuréNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceGemini 3 Flash PreviewGoogle☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuréNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceMistral Medium 3.5Mistral AI☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuréNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceGemini 3.1 Flash Lite PreviewGoogle☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuréNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceNemotron 3.5 LightningNVIDIA☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuréNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceGrok 4.20 0309 ReasoningxAI☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuréNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceLing 3.0 Flash 2607, version non confirméeAnt Group☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuréNon mesuréNon mesuréNon mesuré
Missions longues

Quel modèle pour mener une mission longue ?

Claude Fable 5.1 arrive en tête sur LiveBench : code autonome.

Une seule équipe porte ce podium. Les autres tests de missions longues restent affichés séparément.

★★☆ Une équipe extérieure, confirmation manquante

Note Origin indisponible : couverture actuelle, 1 test au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.

Agrégation en attente de couverture, 0 modèles communs sur 49.

Agrégation en attente de couverture, 0 modèles communs sur 49.

Capacité et prix

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.

Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.

Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.

Score du test affiché contre tarif : LiveBench : code autonome · LiveBench · ★☆☆

Échelle réelle de 0 à 100. Plus haut est meilleur

Ce graphique ne contient aucune note Origin. Il garde le score et l’échelle du test affiché.

Échelle logarithmique des prix : chaque graduation multiplie le tarif par dix. Sortie et entrée restent séparées.

Échelle réelle de 0 à 100016,5233,0349,5566,06110100USD par million de tokens en sortie1. Claude Fable 5.1, API Anthropic, 66,1 %, 50 USD par million en sortie. Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.2. Claude Opus 5, API Anthropic, 65,2 %, 25 USD par million en sortie. Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.3. Muse Spark 1.1, prix OpenRouter, 58,5 %, 4,25 USD par million en sortie. Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.4. Gemini 3.7 Flash, API Google, 58,3 %, 3,75 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.5. Muse Spark 1.2, prix OpenRouter, 57,6 %, 4,25 USD par million en sortie. Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.6. GPT-5.6 Sol, API OpenAI, 56,2 %, 20 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.7. GPT-5.6 Terra, API OpenAI, 54,9 %, 12 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.8. Gemini 3.8 Flash, API Google, 54,2 %, 3,75 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.9. GPT-5.5, API OpenAI, 54,0 %, 30 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 10 USD en entrée et 45 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.10. GPT-5.4, API OpenAI, 53,8 %, 15 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 5 USD en entrée et 22.5 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.11. Claude Opus 4.8, API Anthropic, 50,5 %, 25 USD par million en sortie. Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.12. Gemini 3.5 Flash, API Google, 49,0 %, 9 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.13. GPT-5.6 Luna, API OpenAI, 48,4 %, 1,2 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 0.4 USD en entrée et 1.8 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.14. Gemini 3.5 Flash-Lite, API Google, 45,3 %, 2,5 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.15. Gemini 3.1 Pro Preview, API Google, 44,1 %, 12 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 200 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.16. Gemini 3.6 Flash, API Google, 43,4 %, 3,75 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.17. GPT-5.4 mini, API OpenAI, 41,7 %, 4,5 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

Ronds : API directe. Carrés : prix OpenRouter. Les numéros décalés sont reliés à leur position exacte. Chaque numéro renvoie au modèle et à ses conditions ci-dessous.

  1. 1. Claude Fable 5.1 · API Anthropic
  2. 2. Claude Opus 5 · API Anthropic
  3. 3. Muse Spark 1.1 · prix OpenRouter
  4. 4. Gemini 3.7 Flash · API Google · promotion au 2026-12-31
  5. 5. Muse Spark 1.2 · prix OpenRouter
  6. 6. GPT-5.6 Sol · API OpenAI · promotion au 2026-11-21
  7. 7. GPT-5.6 Terra · API OpenAI
  8. 8. Gemini 3.8 Flash · API Google · promotion au 2026-12-31
  9. 9. GPT-5.5 · API OpenAI
  10. 10. GPT-5.4 · API OpenAI
  11. 11. Claude Opus 4.8 · API Anthropic
  12. 12. Gemini 3.5 Flash · API Google
  13. 13. GPT-5.6 Luna · API OpenAI
  14. 14. Gemini 3.5 Flash-Lite · API Google
  15. 15. Gemini 3.1 Pro Preview · API Google
  16. 16. Gemini 3.6 Flash · API Google · promotion au 2026-12-31
  17. 17. GPT-5.4 mini · API OpenAI
Valeurs exactes et conditions : Score du test affiché contre tarif : LiveBench : code autonome · LiveBench · ★☆☆
Modèle et serviceÉchelle réelle de 0 à 100Entrée / sortie
USD par million
Date, source et conditions
1. Claude Fable 5.1API Anthropic★☆☆ : solidité de la preuve66,1 %10 / 50Anthropic, source tarifaire

Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

2. Claude Opus 5API Anthropic★☆☆ : solidité de la preuve65,2 %5 / 25Anthropic, source tarifaire

Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

3. Muse Spark 1.1prix OpenRouter★☆☆ : solidité de la preuve58,5 %1,25 / 4,25OpenRouter, source tarifaire

Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

4. Gemini 3.7 FlashAPI Google★☆☆ : solidité de la preuve58,3 %0,75 / 3,75Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

5. Muse Spark 1.2prix OpenRouter★☆☆ : solidité de la preuve57,6 %1,25 / 4,25OpenRouter, source tarifaire

Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

6. GPT-5.6 SolAPI OpenAI★☆☆ : solidité de la preuve56,2 %4 / 20OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

7. GPT-5.6 TerraAPI OpenAI★☆☆ : solidité de la preuve54,9 %2 / 12OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

8. Gemini 3.8 FlashAPI Google★☆☆ : solidité de la preuve54,2 %0,75 / 3,75Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

9. GPT-5.5API OpenAI★☆☆ : solidité de la preuve54,0 %5 / 30OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 10 USD en entrée et 45 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

10. GPT-5.4API OpenAI★☆☆ : solidité de la preuve53,8 %2,5 / 15OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 5 USD en entrée et 22.5 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

11. Claude Opus 4.8API Anthropic★☆☆ : solidité de la preuve50,5 %5 / 25Anthropic, source tarifaire

Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

12. Gemini 3.5 FlashAPI Google★☆☆ : solidité de la preuve49,0 %1,5 / 9Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

13. GPT-5.6 LunaAPI OpenAI★☆☆ : solidité de la preuve48,4 %0,2 / 1,2OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 0.4 USD en entrée et 1.8 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

14. Gemini 3.5 Flash-LiteAPI Google★☆☆ : solidité de la preuve45,3 %0,3 / 2,5Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

15. Gemini 3.1 Pro PreviewAPI Google★☆☆ : solidité de la preuve44,1 %2 / 12Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 200 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

16. Gemini 3.6 FlashAPI Google★☆☆ : solidité de la preuve43,4 %0,75 / 3,75Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

17. GPT-5.4 miniAPI OpenAI★☆☆ : solidité de la preuve41,7 %0,75 / 4,5OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

Modèles mesurés sans tarif utilisable (32)

Claude Fable 5, Claude Opus 4.6, Claude Opus 4.7, Claude Sonnet 4.6, Claude Sonnet 5, DeepSeek V4 Flash, DeepSeek V4 Pro, GLM 5.2, GPT-5.4 nano, Grok 4.3, Grok 4.5, Grok Build 0.1, Kimi K2.6, Kimi K2.7 Code, MiniMax M3, Qwen 3.6 27B, Qwen 3.6 Plus, Qwen 3.7 Max, Kimi K3, Inkling, DeepSeek V4 Flash 0731, Qwen 3.8 Max, Smaug-Agentic, DeepSeek V4 Pro 0813, Grok 4.6, Qwen 3.8 27B, DeepSeek V4 Flash Vision Exp, GLM 5.3, GLM 5.3 Flash, Qwen 3.8 Flash Next, Nemotron 3 Ultra 550B A55B, Muse Spark 1.3. Ils ne sont pas représentés à zéro.

Tableau comparatif

Rang sur LiveBench : code autonome

RangNote sur 100ModèleFabricantSoliditéARC-AGI-3, tâches partiellement cachées, configuration standardAPEX-AgentsLiveBench : code autonome
Non classé sur ce testPas de référenceGPT-6 AstraOpenAI★★☆ Une équipe extérieure99,9 %, 62,7 %62,4 %Non mesuré
1erPas de référenceClaude Fable 5.1Anthropic★★☆ Une équipe extérieureNon mesuré62,0 %66,1 %
7e ex aequoPas de référenceClaude Fable 5Anthropic★★☆ Une équipe extérieureNon mesuréNon mesuré62,2 %
2ePas de référenceClaude Opus 5Anthropic★★☆ Une équipe extérieureNon mesuréNon mesuré65,2 %
19ePas de référenceGPT-5.6 SolOpenAI★★☆ Une équipe extérieureNon mesuréNon mesuré56,2 %
Non classé sur ce testPas de référenceMiniMax M2.5MiniMax☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuré
29e ex aequoPas de référenceClaude Opus 4.6Anthropic★★☆ Une équipe extérieureNon mesuréNon mesuré49,0 %
Non classé sur ce testPas de référenceGLM 5Z.ai☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceKimi K2.5Moonshot AI☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuré
26ePas de référenceClaude Opus 4.7Anthropic★★☆ Une équipe extérieureNon mesuréNon mesuré50,7 %
41e ex aequoPas de référenceClaude Sonnet 4.6Anthropic★★☆ Une équipe extérieureNon mesuréNon mesuré42,6 %
12ePas de référenceClaude Sonnet 5Anthropic★★☆ Une équipe extérieureNon mesuréNon mesuré59,4 %
48ePas de référenceDeepSeek V4 FlashDeepSeek★★☆ Une équipe extérieureNon mesuréNon mesuré37,6 %
41e ex aequoPas de référenceDeepSeek V4 ProDeepSeek★★☆ Une équipe extérieureNon mesuréNon mesuré42,6 %
38ePas de référenceGemini 3.1 Pro PreviewGoogle★★☆ Une équipe extérieureNon mesuréNon mesuré44,1 %
29e ex aequoPas de référenceGemini 3.5 FlashGoogle★★☆ Une équipe extérieureNon mesuréNon mesuré49,0 %
25ePas de référenceGLM 5.2Z.ai★★☆ Une équipe extérieureNon mesuréNon mesuré51,8 %
43ePas de référenceGPT-5.4 miniOpenAI★★☆ Une équipe extérieureNon mesuréNon mesuré41,7 %
33e ex aequoPas de référenceGPT-5.4 nanoOpenAI★★☆ Une équipe extérieureNon mesuréNon mesuré46,8 %
24ePas de référenceGPT-5.4OpenAI★★☆ Une équipe extérieureNon mesuréNon mesuré53,8 %
23ePas de référenceGPT-5.5OpenAI★★☆ Une équipe extérieureNon mesuréNon mesuré54,0 %
49ePas de référenceGrok 4.3xAI★★☆ Une équipe extérieureNon mesuréNon mesuré18,5 %
18ePas de référenceGrok 4.5xAI★★☆ Une équipe extérieureNon mesuréNon mesuré56,5 %
35ePas de référenceGrok Build 0.1xAI★★☆ Une équipe extérieureNon mesuréNon mesuré45,8 %
32ePas de référenceKimi K2.6Moonshot AI★★☆ Une équipe extérieureNon mesuréNon mesuré46,9 %
36ePas de référenceKimi K2.7 CodeMoonshot AI★★☆ Une équipe extérieureNon mesuréNon mesuré45,7 %
45ePas de référenceMiniMax M3MiniMax★★☆ Une équipe extérieureNon mesuréNon mesuré40,7 %
46ePas de référenceQwen 3.6 27BAlibaba★★☆ Une équipe extérieureNon mesuréNon mesuré39,3 %
44ePas de référenceQwen 3.6 PlusAlibaba★★☆ Une équipe extérieureNon mesuréNon mesuré41,4 %
39ePas de référenceQwen 3.7 MaxAlibaba★★☆ Une équipe extérieureNon mesuréNon mesuré43,6 %
20e ex aequoPas de référenceGPT-5.6 TerraOpenAI★★☆ Une équipe extérieureNon mesuréNon mesuré54,9 %
31ePas de référenceGPT-5.6 LunaOpenAI★★☆ Une équipe extérieureNon mesuréNon mesuré48,4 %
13ePas de référenceMuse Spark 1.1Meta★★☆ Une équipe extérieureNon mesuréNon mesuré58,5 %
7e ex aequoPas de référenceKimi K3Moonshot AI★★☆ Une équipe extérieureNon mesuréNon mesuré62,2 %
28ePas de référenceInklingThinking Machines Lab★★☆ Une équipe extérieureNon mesuréNon mesuré49,4 %
37ePas de référenceGemini 3.5 Flash-LiteGoogle★★☆ Une équipe extérieureNon mesuréNon mesuré45,3 %
40ePas de référenceGemini 3.6 FlashGoogle★★☆ Une équipe extérieureNon mesuréNon mesuré43,4 %
27ePas de référenceClaude Opus 4.8Anthropic★★☆ Une équipe extérieureNon mesuréNon mesuré50,5 %
33e ex aequoPas de référenceDeepSeek V4 Flash 0731DeepSeek★★☆ Une équipe extérieureNon mesuréNon mesuré46,8 %
4e ex aequoPas de référenceQwen 3.8 MaxAlibaba★★☆ Une équipe extérieureNon mesuréNon mesuré64,6 %
15ePas de référenceMuse Spark 1.2Meta★★☆ Une équipe extérieureNon mesuréNon mesuré57,6 %
4e ex aequoPas de référenceSmaug-AgenticAbacus.AI★★☆ Une équipe extérieureNon mesuréNon mesuré64,6 %
20e ex aequoPas de référenceDeepSeek V4 Pro 0813DeepSeek★★☆ Une équipe extérieureNon mesuréNon mesuré54,9 %
16ePas de référenceGrok 4.6xAI★★☆ Une équipe extérieureNon mesuréNon mesuré57,0 %
14ePas de référenceGemini 3.7 FlashGoogle★★☆ Une équipe extérieureNon mesuréNon mesuré58,3 %
10ePas de référenceQwen 3.8 27BAlibaba★★☆ Une équipe extérieureNon mesuréNon mesuré61,4 %
3ePas de référenceDeepSeek V4 Flash Vision ExpDeepSeek★★☆ Une équipe extérieureNon mesuréNon mesuré65,1 %
11ePas de référenceGLM 5.3Z.ai★★☆ Une équipe extérieureNon mesuréNon mesuré60,9 %
17ePas de référenceGLM 5.3 FlashZ.ai★★☆ Une équipe extérieureNon mesuréNon mesuré56,8 %
9ePas de référenceQwen 3.8 Flash NextAlibaba★★☆ Une équipe extérieureNon mesuréNon mesuré61,6 %
47ePas de référenceNemotron 3 Ultra 550B A55BNVIDIA★★☆ Une équipe extérieureNon mesuréNon mesuré38,7 %
22ePas de référenceGemini 3.8 FlashGoogle★★☆ Une équipe extérieureNon mesuréNon mesuré54,2 %
6ePas de référenceMuse Spark 1.3Meta★★☆ Une équipe extérieureNon mesuréNon mesuré64,1 %
Non classé sur ce testPas de référenceGLM 5.1Z.ai☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceMiMo V2.5 ProXiaomi☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceMiMo V2.5Xiaomi☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceInkling SmallThinking Machines Lab☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceQwen 3.7 PlusAlibaba☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceMiniMax M2.7MiniMax☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceClaude Haiku 4.5Anthropic☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceGemini 3 Flash PreviewGoogle☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceMistral Medium 3.5Mistral AI☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceGemini 3.1 Flash Lite PreviewGoogle☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceNemotron 3.5 LightningNVIDIA☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceGrok 4.20 0309 ReasoningxAI☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuré
Non classé sur ce testPas de référenceLing 3.0 Flash 2607, version non confirméeAnt Group☆☆☆ Aucune mesureNon mesuréNon mesuréNon mesuré
Finance et comptabilité

Quel modèle pour produire une analyse financière ?

Claude Fable 5.1 arrive en tête sur APEX-Agents Investment Banking Analyst, moyenne des critères.

Une seule équipe porte ce podium. Les autres tests de finance et comptabilité restent affichés séparément.

★★☆ Une équipe extérieure, confirmation manquante

Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.

Une seule équipe sur ce test : confirmation extérieure manquante.

Agrégation en attente de couverture, 0 modèles communs sur 3.

Capacité et prix

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.

Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.

Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.

Score du test affiché contre tarif : APEX-Agents Investment Banking Analyst, moyenne des critères · Mercor · ★☆☆

Échelle réelle de 0 à 100. Plus haut est meilleur

Ce graphique ne contient aucune note Origin. Il garde le score et l’échelle du test affiché.

Échelle logarithmique des prix : chaque graduation multiplie le tarif par dix. Sortie et entrée restent séparées.

Échelle réelle de 0 à 100013,9327,8541,7855,710100USD par million de tokens en sortie1. Claude Fable 5.1, API Anthropic, 55,7 % des critères réussis, 50 USD par million en sortie. Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.2. GPT-6 Astra, API OpenAI, 52,0 % des critères réussis, 50 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 20 USD en entrée et 75 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.3. GPT-5.6 Sol, API OpenAI, 46,6 % des critères réussis, 20 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

Ronds : API directe. Carrés : prix OpenRouter. Les numéros décalés sont reliés à leur position exacte. Chaque numéro renvoie au modèle et à ses conditions ci-dessous.

  1. 1. Claude Fable 5.1 · API Anthropic
  2. 2. GPT-6 Astra · API OpenAI
  3. 3. GPT-5.6 Sol · API OpenAI · promotion au 2026-11-21
Valeurs exactes et conditions : Score du test affiché contre tarif : APEX-Agents Investment Banking Analyst, moyenne des critères · Mercor · ★☆☆
Modèle et serviceÉchelle réelle de 0 à 100Entrée / sortie
USD par million
Date, source et conditions
1. Claude Fable 5.1API Anthropic★☆☆ : solidité de la preuve55,7 % des critères réussis10 / 50Anthropic, source tarifaire

Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

2. GPT-6 AstraAPI OpenAI★☆☆ : solidité de la preuve52,0 % des critères réussis10 / 50OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 20 USD en entrée et 75 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

3. GPT-5.6 SolAPI OpenAI★☆☆ : solidité de la preuve46,6 % des critères réussis4 / 20OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

Tableau comparatif

Rang sur APEX-Agents Investment Banking Analyst, moyenne des critères

RangNote sur 100ModèleFabricantSoliditéAPEX-Agents Investment Banking Analyst, moyenne des critères
2ePas de référenceGPT-6 AstraOpenAI★★☆ Une équipe extérieure52,0 % des critères réussis
1erPas de référenceClaude Fable 5.1Anthropic★★☆ Une équipe extérieure55,7 % des critères réussis
Non classé sur ce testPas de référenceClaude Fable 5Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Opus 5Anthropic☆☆☆ Aucune mesureNon mesuré
3ePas de référenceGPT-5.6 SolOpenAI★★☆ Une équipe extérieure46,6 % des critères réussis
Non classé sur ce testPas de référenceMiniMax M2.5MiniMax☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Opus 4.6Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGLM 5Z.ai☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceKimi K2.5Moonshot AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Opus 4.7Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Sonnet 4.6Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Sonnet 5Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceDeepSeek V4 FlashDeepSeek☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceDeepSeek V4 ProDeepSeek☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.1 Pro PreviewGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.5 FlashGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGLM 5.2Z.ai☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.4 miniOpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.4 nanoOpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.4OpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.5OpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGrok 4.3xAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGrok 4.5xAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGrok Build 0.1xAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceKimi K2.6Moonshot AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceKimi K2.7 CodeMoonshot AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMiniMax M3MiniMax☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.6 27BAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.6 PlusAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.7 MaxAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.6 TerraOpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.6 LunaOpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMuse Spark 1.1Meta☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceKimi K3Moonshot AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceInklingThinking Machines Lab☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.5 Flash-LiteGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.6 FlashGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Opus 4.8Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceDeepSeek V4 Flash 0731DeepSeek☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.8 MaxAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMuse Spark 1.2Meta☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceSmaug-AgenticAbacus.AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceDeepSeek V4 Pro 0813DeepSeek☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGrok 4.6xAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.7 FlashGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.8 27BAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceDeepSeek V4 Flash Vision ExpDeepSeek☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGLM 5.3Z.ai☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGLM 5.3 FlashZ.ai☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.8 Flash NextAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceNemotron 3 Ultra 550B A55BNVIDIA☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.8 FlashGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMuse Spark 1.3Meta☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGLM 5.1Z.ai☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMiMo V2.5 ProXiaomi☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMiMo V2.5Xiaomi☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceInkling SmallThinking Machines Lab☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.7 PlusAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMiniMax M2.7MiniMax☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Haiku 4.5Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3 Flash PreviewGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMistral Medium 3.5Mistral AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.1 Flash Lite PreviewGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceNemotron 3.5 LightningNVIDIA☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGrok 4.20 0309 ReasoningxAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceLing 3.0 Flash 2607, version non confirméeAnt Group☆☆☆ Aucune mesureNon mesuré
Santé

Quel modèle pour répondre à une question médicale ?

Des scores existent, mais ils viennent du fabricant et ne constituent pas un classement.

Les nombres restent visibles, sans rang ni médaille, jusqu’à une mesure extérieure.

☆☆☆ Chiffres du fabricant seulement

Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.

Une seule équipe sur ce test : confirmation extérieure manquante.

Agrégation en attente de couverture, 0 modèles communs sur 0.

Capacité et prix

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.

Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.

Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.

Aucun couple mesure et tarif documenté pour cet usage. Aucun point estimé.

Tableau comparatif

Rang sur HealthBench Professional

RangNote sur 100ModèleFabricantSoliditéHealthBench Professional
Sans classementPas de référenceGPT-6 AstraOpenAI☆☆☆ Seulement le fabricant63,4 %
Non classé sur ce testPas de référenceClaude Fable 5.1Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Fable 5Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Opus 5Anthropic☆☆☆ Aucune mesureNon mesuré
Sans classementPas de référenceGPT-5.6 SolOpenAI☆☆☆ Seulement le fabricant60,5 %
Non classé sur ce testPas de référenceMiniMax M2.5MiniMax☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Opus 4.6Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGLM 5Z.ai☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceKimi K2.5Moonshot AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Opus 4.7Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Sonnet 4.6Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Sonnet 5Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceDeepSeek V4 FlashDeepSeek☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceDeepSeek V4 ProDeepSeek☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.1 Pro PreviewGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.5 FlashGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGLM 5.2Z.ai☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.4 miniOpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.4 nanoOpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.4OpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.5OpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGrok 4.3xAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGrok 4.5xAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGrok Build 0.1xAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceKimi K2.6Moonshot AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceKimi K2.7 CodeMoonshot AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMiniMax M3MiniMax☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.6 27BAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.6 PlusAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.7 MaxAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.6 TerraOpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.6 LunaOpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMuse Spark 1.1Meta☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceKimi K3Moonshot AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceInklingThinking Machines Lab☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.5 Flash-LiteGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.6 FlashGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Opus 4.8Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceDeepSeek V4 Flash 0731DeepSeek☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.8 MaxAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMuse Spark 1.2Meta☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceSmaug-AgenticAbacus.AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceDeepSeek V4 Pro 0813DeepSeek☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGrok 4.6xAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.7 FlashGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.8 27BAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceDeepSeek V4 Flash Vision ExpDeepSeek☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGLM 5.3Z.ai☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGLM 5.3 FlashZ.ai☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.8 Flash NextAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceNemotron 3 Ultra 550B A55BNVIDIA☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.8 FlashGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMuse Spark 1.3Meta☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGLM 5.1Z.ai☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMiMo V2.5 ProXiaomi☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMiMo V2.5Xiaomi☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceInkling SmallThinking Machines Lab☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.7 PlusAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMiniMax M2.7MiniMax☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Haiku 4.5Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3 Flash PreviewGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMistral Medium 3.5Mistral AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.1 Flash Lite PreviewGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceNemotron 3.5 LightningNVIDIA☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGrok 4.20 0309 ReasoningxAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceLing 3.0 Flash 2607, version non confirméeAnt Group☆☆☆ Aucune mesureNon mesuré
Maths et sciences

Quel modèle pour résoudre un problème scientifique difficile ?

Claude Fable 5.1 arrive en tête sur LiveBench : mathématiques.

Une seule équipe porte ce podium. Les autres tests de maths et sciences restent affichés séparément.

★★☆ Une équipe extérieure, confirmation manquante

Note Origin indisponible : couverture actuelle, 1 test au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.

Agrégation en attente de couverture, 2 modèles communs sur 49.

Agrégation en attente de couverture, 2 modèles communs sur 49.

Capacité et prix

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.

Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.

Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.

Score du test affiché contre tarif : LiveBench : mathématiques · LiveBench · ★☆☆

Échelle réelle de 0 à 100. Plus haut est meilleur

Ce graphique ne contient aucune note Origin. Il garde le score et l’échelle du test affiché.

Échelle logarithmique des prix : chaque graduation multiplie le tarif par dix. Sortie et entrée restent séparées.

Échelle réelle de 0 à 100024,2548,572,7697,01110100USD par million de tokens en sortie1. Claude Fable 5.1, API Anthropic, 97,0 %, 50 USD par million en sortie. Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.2. GPT-5.6 Sol, API OpenAI, 96,2 %, 20 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.3. GPT-5.5, API OpenAI, 95,9 %, 30 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 10 USD en entrée et 45 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.4. Claude Opus 5, API Anthropic, 95,7 %, 25 USD par million en sortie. Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.5. GPT-5.6 Terra, API OpenAI, 94,9 %, 12 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.6. Claude Opus 4.8, API Anthropic, 94,3 %, 25 USD par million en sortie. Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.7. GPT-5.4, API OpenAI, 94,1 %, 15 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 5 USD en entrée et 22.5 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.8. Gemini 3.7 Flash, API Google, 93,5 %, 3,75 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.9. Gemini 3.8 Flash, API Google, 91,6 %, 3,75 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.10. Muse Spark 1.2, prix OpenRouter, 91,2 %, 4,25 USD par million en sortie. Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.11. Gemini 3.1 Pro Preview, API Google, 91,0 %, 12 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 200 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.12. Gemini 3.5 Flash, API Google, 88,2 %, 9 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.13. GPT-5.6 Luna, API OpenAI, 87,2 %, 1,2 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 0.4 USD en entrée et 1.8 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.14. Muse Spark 1.1, prix OpenRouter, 87,1 %, 4,25 USD par million en sortie. Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.15. Gemini 3.6 Flash, API Google, 86,4 %, 3,75 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.16. GPT-5.4 mini, API OpenAI, 78,5 %, 4,5 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.17. Gemini 3.5 Flash-Lite, API Google, 73,7 %, 2,5 USD par million en sortie. Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

Ronds : API directe. Carrés : prix OpenRouter. Les numéros décalés sont reliés à leur position exacte. Chaque numéro renvoie au modèle et à ses conditions ci-dessous.

  1. 1. Claude Fable 5.1 · API Anthropic
  2. 2. GPT-5.6 Sol · API OpenAI · promotion au 2026-11-21
  3. 3. GPT-5.5 · API OpenAI
  4. 4. Claude Opus 5 · API Anthropic
  5. 5. GPT-5.6 Terra · API OpenAI
  6. 6. Claude Opus 4.8 · API Anthropic
  7. 7. GPT-5.4 · API OpenAI
  8. 8. Gemini 3.7 Flash · API Google · promotion au 2026-12-31
  9. 9. Gemini 3.8 Flash · API Google · promotion au 2026-12-31
  10. 10. Muse Spark 1.2 · prix OpenRouter
  11. 11. Gemini 3.1 Pro Preview · API Google
  12. 12. Gemini 3.5 Flash · API Google
  13. 13. GPT-5.6 Luna · API OpenAI
  14. 14. Muse Spark 1.1 · prix OpenRouter
  15. 15. Gemini 3.6 Flash · API Google · promotion au 2026-12-31
  16. 16. GPT-5.4 mini · API OpenAI
  17. 17. Gemini 3.5 Flash-Lite · API Google
Valeurs exactes et conditions : Score du test affiché contre tarif : LiveBench : mathématiques · LiveBench · ★☆☆
Modèle et serviceÉchelle réelle de 0 à 100Entrée / sortie
USD par million
Date, source et conditions
1. Claude Fable 5.1API Anthropic★☆☆ : solidité de la preuve97,0 %10 / 50Anthropic, source tarifaire

Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

2. GPT-5.6 SolAPI OpenAI★☆☆ : solidité de la preuve96,2 %4 / 20OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

3. GPT-5.5API OpenAI★☆☆ : solidité de la preuve95,9 %5 / 30OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 10 USD en entrée et 45 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

4. Claude Opus 5API Anthropic★☆☆ : solidité de la preuve95,7 %5 / 25Anthropic, source tarifaire

Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

5. GPT-5.6 TerraAPI OpenAI★☆☆ : solidité de la preuve94,9 %2 / 12OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

6. Claude Opus 4.8API Anthropic★☆☆ : solidité de la preuve94,3 %5 / 25Anthropic, source tarifaire

Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

7. GPT-5.4API OpenAI★☆☆ : solidité de la preuve94,1 %2,5 / 15OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 5 USD en entrée et 22.5 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

8. Gemini 3.7 FlashAPI Google★☆☆ : solidité de la preuve93,5 %0,75 / 3,75Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

9. Gemini 3.8 FlashAPI Google★☆☆ : solidité de la preuve91,6 %0,75 / 3,75Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

10. Muse Spark 1.2prix OpenRouter★☆☆ : solidité de la preuve91,2 %1,25 / 4,25OpenRouter, source tarifaire

Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

11. Gemini 3.1 Pro PreviewAPI Google★☆☆ : solidité de la preuve91,0 %2 / 12Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 200 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

12. Gemini 3.5 FlashAPI Google★☆☆ : solidité de la preuve88,2 %1,5 / 9Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

13. GPT-5.6 LunaAPI OpenAI★☆☆ : solidité de la preuve87,2 %0,2 / 1,2OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 0.4 USD en entrée et 1.8 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

14. Muse Spark 1.1prix OpenRouter★☆☆ : solidité de la preuve87,1 %1,25 / 4,25OpenRouter, source tarifaire

Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

15. Gemini 3.6 FlashAPI Google★☆☆ : solidité de la preuve86,4 %0,75 / 3,75Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

16. GPT-5.4 miniAPI OpenAI★☆☆ : solidité de la preuve78,5 %0,75 / 4,5OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

17. Gemini 3.5 Flash-LiteAPI Google★☆☆ : solidité de la preuve73,7 %0,3 / 2,5Google, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

Modèles mesurés sans tarif utilisable (32)

Claude Fable 5, Claude Opus 4.6, Claude Opus 4.7, Claude Sonnet 4.6, Claude Sonnet 5, DeepSeek V4 Flash, DeepSeek V4 Pro, GLM 5.2, GPT-5.4 nano, Grok 4.3, Grok 4.5, Grok Build 0.1, Kimi K2.6, Kimi K2.7 Code, MiniMax M3, Qwen 3.6 27B, Qwen 3.6 Plus, Qwen 3.7 Max, Kimi K3, Inkling, DeepSeek V4 Flash 0731, Qwen 3.8 Max, Smaug-Agentic, DeepSeek V4 Pro 0813, Grok 4.6, Qwen 3.8 27B, DeepSeek V4 Flash Vision Exp, GLM 5.3, GLM 5.3 Flash, Qwen 3.8 Flash Next, Nemotron 3 Ultra 550B A55B, Muse Spark 1.3. Ils ne sont pas représentés à zéro.

Tableau comparatif

Rang sur LiveBench : mathématiques

RangNote sur 100ModèleFabricantSoliditéFrontierMath ErdősLiveBench : mathématiques
Non classé sur ce testPas de référenceGPT-6 AstraOpenAI★★☆ Une équipe extérieure3 %Non mesuré
1erPas de référenceClaude Fable 5.1Anthropic★★☆ Une équipe extérieure0 %97,0 %
3ePas de référenceClaude Fable 5Anthropic★★☆ Une équipe extérieureNon mesuré96,0 %
6ePas de référenceClaude Opus 5Anthropic★★☆ Une équipe extérieureNon mesuré95,7 %
2ePas de référenceGPT-5.6 SolOpenAI★★☆ Une équipe extérieure0 %96,2 %
Non classé sur ce testPas de référenceMiniMax M2.5MiniMax☆☆☆ Aucune mesureNon mesuréNon mesuré
23ePas de référenceClaude Opus 4.6Anthropic★★☆ Une équipe extérieureNon mesuré89,3 %
Non classé sur ce testPas de référenceGLM 5Z.ai☆☆☆ Aucune mesureNon mesuréNon mesuré
Non classé sur ce testPas de référenceKimi K2.5Moonshot AI☆☆☆ Aucune mesureNon mesuréNon mesuré
13ePas de référenceClaude Opus 4.7Anthropic★★☆ Une équipe extérieureNon mesuré92,9 %
31ePas de référenceClaude Sonnet 4.6Anthropic★★☆ Une équipe extérieureNon mesuré87,0 %
12ePas de référenceClaude Sonnet 5Anthropic★★☆ Une équipe extérieureNon mesuré92,9 %
44ePas de référenceDeepSeek V4 FlashDeepSeek★★☆ Une équipe extérieureNon mesuré79,6 %
21ePas de référenceDeepSeek V4 ProDeepSeek★★☆ Une équipe extérieureNon mesuré90,7 %
18ePas de référenceGemini 3.1 Pro PreviewGoogle★★☆ Une équipe extérieureNon mesuré91,0 %
26ePas de référenceGemini 3.5 FlashGoogle★★☆ Une équipe extérieureNon mesuré88,2 %
22ePas de référenceGLM 5.2Z.ai★★☆ Une équipe extérieureNon mesuré89,8 %
46ePas de référenceGPT-5.4 miniOpenAI★★☆ Une équipe extérieureNon mesuré78,5 %
19ePas de référenceGPT-5.4 nanoOpenAI★★☆ Une équipe extérieureNon mesuré91,0 %
10ePas de référenceGPT-5.4OpenAI★★☆ Une équipe extérieureNon mesuré94,1 %
5ePas de référenceGPT-5.5OpenAI★★☆ Une équipe extérieureNon mesuré95,9 %
38ePas de référenceGrok 4.3xAI★★☆ Une équipe extérieureNon mesuré84,3 %
20ePas de référenceGrok 4.5xAI★★☆ Une équipe extérieureNon mesuré90,8 %
47ePas de référenceGrok Build 0.1xAI★★☆ Une équipe extérieureNon mesuré78,4 %
39ePas de référenceKimi K2.6Moonshot AI★★☆ Une équipe extérieureNon mesuré84,3 %
45ePas de référenceKimi K2.7 CodeMoonshot AI★★☆ Une équipe extérieureNon mesuré79,6 %
48ePas de référenceMiniMax M3MiniMax★★☆ Une équipe extérieureNon mesuré76,9 %
43ePas de référenceQwen 3.6 27BAlibaba★★☆ Une équipe extérieureNon mesuré79,9 %
41ePas de référenceQwen 3.6 PlusAlibaba★★☆ Une équipe extérieureNon mesuré83,7 %
36ePas de référenceQwen 3.7 MaxAlibaba★★☆ Une équipe extérieureNon mesuré85,2 %
8ePas de référenceGPT-5.6 TerraOpenAI★★☆ Une équipe extérieureNon mesuré94,9 %
29ePas de référenceGPT-5.6 LunaOpenAI★★☆ Une équipe extérieureNon mesuré87,2 %
30ePas de référenceMuse Spark 1.1Meta★★☆ Une équipe extérieureNon mesuré87,1 %
37ePas de référenceKimi K3Moonshot AI★★☆ Une équipe extérieureNon mesuré84,4 %
25ePas de référenceInklingThinking Machines Lab★★☆ Une équipe extérieureNon mesuré88,4 %
49ePas de référenceGemini 3.5 Flash-LiteGoogle★★☆ Une équipe extérieureNon mesuré73,7 %
33ePas de référenceGemini 3.6 FlashGoogle★★☆ Une équipe extérieureNon mesuré86,4 %
9ePas de référenceClaude Opus 4.8Anthropic★★☆ Une équipe extérieureNon mesuré94,3 %
32ePas de référenceDeepSeek V4 Flash 0731DeepSeek★★☆ Une équipe extérieureNon mesuré86,8 %
16ePas de référenceQwen 3.8 MaxAlibaba★★☆ Une équipe extérieureNon mesuré91,3 %
17ePas de référenceMuse Spark 1.2Meta★★☆ Une équipe extérieureNon mesuré91,2 %
40ePas de référenceSmaug-AgenticAbacus.AI★★☆ Une équipe extérieureNon mesuré83,9 %
7ePas de référenceDeepSeek V4 Pro 0813DeepSeek★★☆ Une équipe extérieureNon mesuré95,1 %
14ePas de référenceGrok 4.6xAI★★☆ Une équipe extérieureNon mesuré92,6 %
11ePas de référenceGemini 3.7 FlashGoogle★★☆ Une équipe extérieureNon mesuré93,5 %
34ePas de référenceQwen 3.8 27BAlibaba★★☆ Une équipe extérieureNon mesuré86,2 %
28ePas de référenceDeepSeek V4 Flash Vision ExpDeepSeek★★☆ Une équipe extérieureNon mesuré87,8 %
27ePas de référenceGLM 5.3Z.ai★★☆ Une équipe extérieureNon mesuré87,9 %
42ePas de référenceGLM 5.3 FlashZ.ai★★☆ Une équipe extérieureNon mesuré81,2 %
35ePas de référenceQwen 3.8 Flash NextAlibaba★★☆ Une équipe extérieureNon mesuré85,8 %
24ePas de référenceNemotron 3 Ultra 550B A55BNVIDIA★★☆ Une équipe extérieureNon mesuré88,7 %
15ePas de référenceGemini 3.8 FlashGoogle★★☆ Une équipe extérieureNon mesuré91,6 %
4ePas de référenceMuse Spark 1.3Meta★★☆ Une équipe extérieureNon mesuré96,0 %
Non classé sur ce testPas de référenceGLM 5.1Z.ai☆☆☆ Aucune mesureNon mesuréNon mesuré
Non classé sur ce testPas de référenceMiMo V2.5 ProXiaomi☆☆☆ Aucune mesureNon mesuréNon mesuré
Non classé sur ce testPas de référenceMiMo V2.5Xiaomi☆☆☆ Aucune mesureNon mesuréNon mesuré
Non classé sur ce testPas de référenceInkling SmallThinking Machines Lab☆☆☆ Aucune mesureNon mesuréNon mesuré
Non classé sur ce testPas de référenceQwen 3.7 PlusAlibaba☆☆☆ Aucune mesureNon mesuréNon mesuré
Non classé sur ce testPas de référenceMiniMax M2.7MiniMax☆☆☆ Aucune mesureNon mesuréNon mesuré
Non classé sur ce testPas de référenceClaude Haiku 4.5Anthropic☆☆☆ Aucune mesureNon mesuréNon mesuré
Non classé sur ce testPas de référenceGemini 3 Flash PreviewGoogle☆☆☆ Aucune mesureNon mesuréNon mesuré
Non classé sur ce testPas de référenceMistral Medium 3.5Mistral AI☆☆☆ Aucune mesureNon mesuréNon mesuré
Non classé sur ce testPas de référenceGemini 3.1 Flash Lite PreviewGoogle☆☆☆ Aucune mesureNon mesuréNon mesuré
Non classé sur ce testPas de référenceNemotron 3.5 LightningNVIDIA☆☆☆ Aucune mesureNon mesuréNon mesuré
Non classé sur ce testPas de référenceGrok 4.20 0309 ReasoningxAI☆☆☆ Aucune mesureNon mesuréNon mesuré
Non classé sur ce testPas de référenceLing 3.0 Flash 2607, version non confirméeAnt Group☆☆☆ Aucune mesureNon mesuréNon mesuré
Usage d’ordinateur

Quel modèle pour utiliser plusieurs logiciels ?

Aucune équipe n’a encore publié de mesure comparable pour cet usage.

Aucun score n’est estimé pour les modèles non mesurés.

☆☆☆ Aucune mesure disponible

Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.

Aucun test public dans le registre.

Agrégation en attente de couverture, 0 modèles communs sur 0.

Capacité et prix

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.

Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.

Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.

Aucun couple mesure et tarif documenté pour cet usage. Aucun point estimé.

Aucune mesure publiée pour cet usage. Aucun score estimé.

Contexte long

Quel modèle pour analyser beaucoup de documents ?

Aucune équipe n’a encore publié de mesure comparable pour cet usage.

Aucun score n’est estimé pour les modèles non mesurés.

☆☆☆ Aucune mesure disponible

Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.

Aucun test public dans le registre.

Agrégation en attente de couverture, 0 modèles communs sur 0.

Capacité et prix

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.

Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.

Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.

Aucun couple mesure et tarif documenté pour cet usage. Aucun point estimé.

Aucune mesure publiée pour cet usage. Aucun score estimé.

Exactitude factuelle

Quel modèle pour répondre sans inventer ?

GPT-6 Astra arrive en tête sur AA-Omniscience, réponses inventées.

Une seule équipe porte ce podium. Les autres tests de exactitude factuelle restent affichés séparément.

★★☆ Une équipe extérieure, confirmation manquante

Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.

Une seule équipe sur ce test : confirmation extérieure manquante.

Agrégation en attente de couverture, 0 modèles communs sur 2.

Capacité et prix

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.

Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.

Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.

Score du test affiché contre tarif : AA-Omniscience, réponses inventées · Artificial Analysis · ★☆☆

Échelle réelle de 0 à 100. Plus bas est meilleur

Ce graphique ne contient aucune note Origin. Il garde le score et l’échelle du test affiché.

Échelle logarithmique des prix : chaque graduation multiplie le tarif par dix. Sortie et entrée restent séparées.

Ronds : API directe. Carrés : prix OpenRouter. Les numéros décalés sont reliés à leur position exacte. Chaque numéro renvoie au modèle et à ses conditions ci-dessous.

  1. 1. GPT-6 Astra · API OpenAI
  2. 2. GPT-5.6 Sol · API OpenAI · promotion au 2026-11-21
Valeurs exactes et conditions : Score du test affiché contre tarif : AA-Omniscience, réponses inventées · Artificial Analysis · ★☆☆
Modèle et serviceÉchelle réelle de 0 à 100Entrée / sortie
USD par million
Date, source et conditions
1. GPT-6 AstraAPI OpenAI★☆☆ : solidité de la preuve51 % de réponses inventées10 / 50OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 20 USD en entrée et 75 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

2. GPT-5.6 SolAPI OpenAI★☆☆ : solidité de la preuve92 % de réponses inventées4 / 20OpenAI, source tarifaire

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

Tableau comparatif

Rang sur AA-Omniscience, réponses inventées

RangNote sur 100ModèleFabricantSoliditéAA-Omniscience, réponses inventées
1erPas de référenceGPT-6 AstraOpenAI★★☆ Une équipe extérieure51 % de réponses inventées
Non classé sur ce testPas de référenceClaude Fable 5.1Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Fable 5Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Opus 5Anthropic☆☆☆ Aucune mesureNon mesuré
2ePas de référenceGPT-5.6 SolOpenAI★★☆ Une équipe extérieure92 % de réponses inventées
Non classé sur ce testPas de référenceMiniMax M2.5MiniMax☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Opus 4.6Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGLM 5Z.ai☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceKimi K2.5Moonshot AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Opus 4.7Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Sonnet 4.6Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Sonnet 5Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceDeepSeek V4 FlashDeepSeek☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceDeepSeek V4 ProDeepSeek☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.1 Pro PreviewGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.5 FlashGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGLM 5.2Z.ai☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.4 miniOpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.4 nanoOpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.4OpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.5OpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGrok 4.3xAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGrok 4.5xAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGrok Build 0.1xAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceKimi K2.6Moonshot AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceKimi K2.7 CodeMoonshot AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMiniMax M3MiniMax☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.6 27BAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.6 PlusAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.7 MaxAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.6 TerraOpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGPT-5.6 LunaOpenAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMuse Spark 1.1Meta☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceKimi K3Moonshot AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceInklingThinking Machines Lab☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.5 Flash-LiteGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.6 FlashGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Opus 4.8Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceDeepSeek V4 Flash 0731DeepSeek☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.8 MaxAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMuse Spark 1.2Meta☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceSmaug-AgenticAbacus.AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceDeepSeek V4 Pro 0813DeepSeek☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGrok 4.6xAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.7 FlashGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.8 27BAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceDeepSeek V4 Flash Vision ExpDeepSeek☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGLM 5.3Z.ai☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGLM 5.3 FlashZ.ai☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.8 Flash NextAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceNemotron 3 Ultra 550B A55BNVIDIA☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.8 FlashGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMuse Spark 1.3Meta☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGLM 5.1Z.ai☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMiMo V2.5 ProXiaomi☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMiMo V2.5Xiaomi☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceInkling SmallThinking Machines Lab☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceQwen 3.7 PlusAlibaba☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMiniMax M2.7MiniMax☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceClaude Haiku 4.5Anthropic☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3 Flash PreviewGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceMistral Medium 3.5Mistral AI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGemini 3.1 Flash Lite PreviewGoogle☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceNemotron 3.5 LightningNVIDIA☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceGrok 4.20 0309 ReasoningxAI☆☆☆ Aucune mesureNon mesuré
Non classé sur ce testPas de référenceLing 3.0 Flash 2607, version non confirméeAnt Group☆☆☆ Aucune mesureNon mesuré
Vision

Quel modèle pour comprendre des images et des documents ?

Aucune équipe n’a encore publié de mesure comparable pour cet usage.

Aucun score n’est estimé pour les modèles non mesurés.

☆☆☆ Aucune mesure disponible

Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.

Aucun test public dans le registre.

Agrégation en attente de couverture, 0 modèles communs sur 0.

Capacité et prix

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.

Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.

Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.

Aucun couple mesure et tarif documenté pour cet usage. Aucun point estimé.

Aucune mesure publiée pour cet usage. Aucun score estimé.

Voix

Quel modèle pour une interaction vocale ?

Aucune équipe n’a encore publié de mesure comparable pour cet usage.

Aucun score n’est estimé pour les modèles non mesurés.

☆☆☆ Aucune mesure disponible

Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.

Aucun test public dans le registre.

Agrégation en attente de couverture, 0 modèles communs sur 0.

Capacité et prix

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.

Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.

Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.

Aucun couple mesure et tarif documenté pour cet usage. Aucun point estimé.

Aucune mesure publiée pour cet usage. Aucun score estimé.

Éducation

Quel modèle pour expliquer et enseigner ?

Aucune équipe n’a encore publié de mesure comparable pour cet usage.

Aucun score n’est estimé pour les modèles non mesurés.

☆☆☆ Aucune mesure disponible

Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.

Aucun test public dans le registre.

Agrégation en attente de couverture, 0 modèles communs sur 0.

Capacité et prix

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.

Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.

Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.

Aucun couple mesure et tarif documenté pour cet usage. Aucun point estimé.

Aucune mesure publiée pour cet usage. Aucun score estimé.

Cybersécurité

Quel modèle pour chercher des failles en environnement contrôlé ?

Aucune équipe n’a encore publié de mesure comparable pour cet usage.

Aucun score n’est estimé pour les modèles non mesurés.

☆☆☆ Aucune mesure disponible

Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.

Aucun test public dans le registre.

Agrégation en attente de couverture, 0 modèles communs sur 0.

Capacité et prix

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.

Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.

Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.

Aucun couple mesure et tarif documenté pour cet usage. Aucun point estimé.

Aucune mesure publiée pour cet usage. Aucun score estimé.

Efficacité

Quel modèle pour maîtriser le coût ?

Aucune équipe n’a encore publié de mesure comparable pour cet usage.

Aucun score n’est estimé pour les modèles non mesurés.

☆☆☆ Aucune mesure disponible

Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.

Aucun test public dans le registre.

Agrégation en attente de couverture, 0 modèles communs sur 0.

Capacité et prix

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens (unités de texte). Le prix d’un million de tokens ne prédit pas le coût d’une tâche.

Relevé tarifaire distinct de la date des tests. Vérification manuelle hebdomadaire et à chaque échéance promotionnelle ; une promotion échue est retirée du graphique jusqu’à sa revérification.

Graphique en sortie. Les deux tarifs sont disponibles dans chaque tableau.

Aucun couple mesure et tarif documenté pour cet usage. Aucun point estimé.

Aucune mesure publiée pour cet usage. Aucun score estimé.

Tous les résultats publiés, modèle par modèle

Chaque chiffre conserve sa source, sa date, son protocole et sa limite. Une absence reste une absence.

GPT-6 Astra · OpenAI · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-09-03

API OpenAI, tarif public : 10 $ en entrée, 50 $ en sortie par million de tokens (unités de texte), en USD.

OpenAI, tarif consulté le 2026-09-06

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 20 USD en entrée et 75 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

44,36 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · Artificial Analysis Intelligence Index v4.1.1 : 61 points

Marge annoncée à 95 % : moins de ±1 point

Organisme commercial extérieur

Outils et réglages propres à chacun des neuf tests. Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %.

Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.

Source, consultée le 2026-09-04

Développement logiciel · Artificial Analysis Coding Agent Index v1.4 : 67 points

Organisme commercial extérieur

Agent Codex. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.

Le score mesure GPT-6 Astra avec un agent précis. Changer cet agent peut changer le résultat.

Source, consultée le 2026-09-04

Raisonnement général · Epoch Capabilities Index : 169 points Epoch

Fourchette probable à 90 % : 165 à 174

Sources mélangées

Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants. Calcul tenant compte du niveau de difficulté de chaque test.

Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.

Source, consultée le 2026-09-04

Missions longues · ARC-AGI-3, tâches partiellement cachées, configuration standard : 62,7 %

Test extérieur

Interface minimale commune, notes visibles gérées par le modèle. Objectifs atteints dans des environnements inconnus.

Mesure ciblée d’apprentissage de règles nouvelles. Elle ne mesure pas un pourcentage d’intelligence générale.

Source, consultée le 2026-09-04

Missions longues · ARC-AGI-3, tâches partiellement cachées, configuration fournisseur : 99,9 %

Test extérieur

État de raisonnement opaque conservé et contexte compacté par le fournisseur. Objectifs atteints dans des environnements inconnus.

Même série de tâches que la configuration standard. Ce résultat ne constitue pas une seconde confirmation indépendante.

Source, consultée le 2026-09-04

Missions longues · APEX-Agents : 62,4 %

± 3,6 points

Organisme commercial extérieur

Agent en boucle d’actions utilisant plusieurs applications de travail. Part moyenne des critères réussis.

Les tâches et critères viennent de professionnels, mais une partie de la correction repose sur un autre modèle d’IA.

Source, consultée le 2026-09-04

Juridique · APEX-Agents Corporate Lawyer, moyenne des critères : 67,9 % des critères réussis

Organisme commercial extérieur

Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.

Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.

Source, consultée le 2026-09-04

Juridique · APEX-Agents Corporate Lawyer, tâches sans erreur : 40,5 % des tâches entièrement réussies

Organisme commercial extérieur

Agent en boucle d’actions avec outils et documents professionnels. Part des tâches dont tous les critères passent.

Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.

Source, consultée le 2026-09-04

Finance et comptabilité · APEX-Agents Investment Banking Analyst, moyenne des critères : 52,0 % des critères réussis

Organisme commercial extérieur

Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.

Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.

Source, consultée le 2026-09-04

Maths et sciences · FrontierMath Erdős : 3 %

Test extérieur

Agent sans internet, budget de 300 $ et 72 heures par problème. Preuve ou réfutation acceptée par Lean, un vérificateur mathématique.

Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.

Source, consultée le 2026-09-04

Santé · HealthBench Professional : 63,4 %

Chiffre du fabricant · Sans médaille

Réponses produites dans HealthBench Professional. Score corrigé pour réduire l’avantage des réponses longues.

OpenAI publie ce résultat sur ses propres modèles. Sans test extérieur, il ne suffit pas pour choisir un modèle en santé.

Source, consultée le 2026-09-04

Exactitude factuelle · AA-Omniscience, réponses inventées : 51 % de réponses inventées

Organisme commercial extérieur

Outils de l’Artificial Analysis Intelligence Index v4.1.1. Réponse incorrecte donnée au lieu d’une abstention.

Le résultat dépend des questions choisies et d’une correction par un autre modèle d’IA. Il ne mesure pas toutes les formes d’erreur factuelle.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 67,74 %

Erreur standard publiée : 4,216 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-6-astra. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Claude Fable 5.1 · Anthropic · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-09-01

API Anthropic, tarif public : 10 $ en entrée, 50 $ en sortie par million de tokens (unités de texte), en USD.

Anthropic, tarif consulté le 2026-09-06

Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

70,97 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · Artificial Analysis Intelligence Index v4.1.1 : 66 points

Marge annoncée à 95 % : moins de ±1 point

Organisme commercial extérieur

Outils et réglages propres à chacun des neuf tests. Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %.

Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.

Source, consultée le 2026-09-04

Développement logiciel · Artificial Analysis Coding Agent Index v1.4 : 70 points

Organisme commercial extérieur

Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.

Le score mesure Claude Fable 5.1 avec un agent précis. Changer cet agent peut changer le résultat.

Source, consultée le 2026-09-04

Développement logiciel · Terminal-Bench 4.0 : 57,88 %

IC à 95 % publié par la source, erreur standard par tâche : 54,12 à 61,64 %

Test extérieur

Claude Code 2.1.257. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5-1. Date de sortie déclarée par Terminal-Bench : 2026-09-01. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Raisonnement général · Epoch Capabilities Index : 163 points Epoch

Fourchette probable à 90 % : 160 à 166

Sources mélangées

Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants. Calcul tenant compte du niveau de difficulté de chaque test.

Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.

Source, consultée le 2026-09-04

Missions longues · APEX-Agents : 62,0 %

± 3,5 points

Organisme commercial extérieur

Agent en boucle d’actions utilisant plusieurs applications de travail. Part moyenne des critères réussis.

Les tâches et critères viennent de professionnels, mais une partie de la correction repose sur un autre modèle d’IA.

Source, consultée le 2026-09-04

Juridique · APEX-Agents Corporate Lawyer, moyenne des critères : 64,8 % des critères réussis

Organisme commercial extérieur

Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.

Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.

Source, consultée le 2026-09-04

Juridique · APEX-Agents Corporate Lawyer, tâches sans erreur : 41,9 % des tâches entièrement réussies

Organisme commercial extérieur

Agent en boucle d’actions avec outils et documents professionnels. Part des tâches dont tous les critères passent.

Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.

Source, consultée le 2026-09-04

Finance et comptabilité · APEX-Agents Investment Banking Analyst, moyenne des critères : 55,7 % des critères réussis

Organisme commercial extérieur

Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.

Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.

Source, consultée le 2026-09-04

Maths et sciences · FrontierMath Erdős : 0 %

Test extérieur

Agent sans internet, budget de 300 $ et 72 heures par problème. Preuve ou réfutation acceptée par Lean, un vérificateur mathématique.

Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : raisonnement : 91,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 86,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 66,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 97,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 80,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 89,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 73,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 54,607 %

Erreur standard publiée : 4,812 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Claude Fable 5 · Anthropic · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-06-09

Tarif public non renseigné dans le registre.

112,1 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Artificial Analysis Coding Agent Index v1.4 : 67 points

Organisme commercial extérieur

Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.

Le score mesure Claude Fable 5 avec un agent précis. Changer cet agent peut changer le résultat.

Source, consultée le 2026-09-04

Développement logiciel · Terminal-Bench 4.0 : 44,55 %

IC à 95 % publié par la source, erreur standard par tâche : 40,70 à 48,40 %

Test extérieur

Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5. Date de sortie déclarée par Terminal-Bench : 2026-06-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Raisonnement général · LiveBench : raisonnement : 89,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 86,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 62,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 96,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 80,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 90,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 75,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 55,065 %

Erreur standard publiée : 4,605 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Claude Opus 5 · Anthropic · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-07-24

API Anthropic, tarif public : 5 $ en entrée, 25 $ en sortie par million de tokens (unités de texte), en USD.

Anthropic, tarif consulté le 2026-09-06

Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

60,51 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Artificial Analysis Coding Agent Index v1.4 : 68 points

Organisme commercial extérieur

Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.

Le score mesure Claude Opus 5 avec un agent précis. Changer cet agent peut changer le résultat.

Source, consultée le 2026-09-04

Développement logiciel · Terminal-Bench 4.0 : 51,82 %

IC à 95 % publié par la source, erreur standard par tâche : 48,43 à 55,21 %

Test extérieur

Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-5. Date de sortie déclarée par Terminal-Bench : 2026-07-24. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Raisonnement général · LiveBench : raisonnement : 91,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 81,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 65,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 95,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 74,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 88,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 63,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 57,473 %

Erreur standard publiée : 4,371 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GPT-5.6 Sol · OpenAI · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-07-09

API OpenAI, tarif public : 4 $ en entrée, 20 $ en sortie par million de tokens (unités de texte), en USD.

OpenAI, tarif consulté le 2026-09-06

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-11-21 ; tarif après cette date non garanti. Au-delà de 272 000 tokens : 8 USD en entrée et 30 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

24,54 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · Artificial Analysis Intelligence Index v4.1.1 : 61 points

Marge annoncée à 95 % : moins de ±1 point

Organisme commercial extérieur

Outils et réglages propres à chacun des neuf tests. Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %.

Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.

Source, consultée le 2026-09-04

Développement logiciel · Artificial Analysis Coding Agent Index v1.4 : 65 points

Organisme commercial extérieur

Agent Codex. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.

Le score mesure GPT-5.6 Sol avec un agent précis. Changer cet agent peut changer le résultat.

Source, consultée le 2026-09-04

Développement logiciel · Terminal-Bench 4.0 : 37,27 %

IC à 95 % publié par la source, erreur standard par tâche : 33,49 à 41,05 %

Test extérieur

Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-sol. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Raisonnement général · Epoch Capabilities Index : 162 points Epoch

Fourchette probable à 90 % : 160 à 165

Sources mélangées

Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants. Calcul tenant compte du niveau de difficulté de chaque test.

Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.

Source, consultée le 2026-09-04

Juridique · APEX-Agents Corporate Lawyer, moyenne des critères : 63,4 % des critères réussis

Organisme commercial extérieur

Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.

Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.

Source, consultée le 2026-09-04

Juridique · APEX-Agents Corporate Lawyer, tâches sans erreur : 35,6 % des tâches entièrement réussies

Organisme commercial extérieur

Agent en boucle d’actions avec outils et documents professionnels. Part des tâches dont tous les critères passent.

Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.

Source, consultée le 2026-09-04

Finance et comptabilité · APEX-Agents Investment Banking Analyst, moyenne des critères : 46,6 % des critères réussis

Organisme commercial extérieur

Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.

Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.

Source, consultée le 2026-09-04

Maths et sciences · FrontierMath Erdős : 0 %

Test extérieur

Agent sans internet, budget de 300 $ et 72 heures par problème. Preuve ou réfutation acceptée par Lean, un vérificateur mathématique.

Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.

Source, consultée le 2026-09-04

Santé · HealthBench Professional : 60,5 %

Chiffre du fabricant · Sans médaille

Réponses produites dans HealthBench Professional. Score corrigé pour réduire l’avantage des réponses longues.

OpenAI publie ce résultat sur ses propres modèles. Sans test extérieur, il ne suffit pas pour choisir un modèle en santé.

Source, consultée le 2026-09-04

Exactitude factuelle · AA-Omniscience, réponses inventées : 92 % de réponses inventées

Organisme commercial extérieur

Outils de l’Artificial Analysis Intelligence Index v4.1.1. Réponse incorrecte donnée au lieu d’une abstention.

Le résultat dépend des questions choisies et d’une correction par un autre modèle d’IA. Il ne mesure pas toutes les formes d’erreur factuelle.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : raisonnement : 91,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 83,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 56,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 96,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 79,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 87,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 71,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 52,916 %

Erreur standard publiée : 4,353 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

MiniMax M2.5 · MiniMax · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-02-12

Tarif public non renseigné dans le registre.

Développement logiciel · SWE-bench Verified : 75,8 %

Origine d’exécution non vérifiée

mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.

Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 379 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-04

Claude Opus 4.6 · Anthropic · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-02-05

Tarif public non renseigné dans le registre.

Développement logiciel · SWE-bench Verified : 75,6 %

Origine d’exécution non vérifiée

mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.

Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 378 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Valeur révisée de 75,4 à 75,6 % le 18 février 2026 : https://github.com/SWE-bench/experiments/commit/36905bfeb728dadd82a75bb169ed612aac634551. Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : raisonnement : 88,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 78,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 49,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 89,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 69,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 83,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 63,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

GLM 5 · Z.ai · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-02-12

Tarif public non renseigné dans le registre.

Développement logiciel · SWE-bench Verified : 72,8 %

Origine d’exécution non vérifiée

mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.

Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 364 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-04

Kimi K2.5 · Moonshot AI · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-01-27

Tarif public non renseigné dans le registre.

0,93 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · SWE-bench Verified : 70,8 %

Origine d’exécution non vérifiée

mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.

Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 354 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 6,962 %

Erreur standard publiée : 1,29 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/moonshotai/kimi-k2.5-0127/endpoints. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Claude Opus 4.7 · Anthropic · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-04-16

Tarif public non renseigné dans le registre.

36,39 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 87,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 82,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 50,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 92,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 78,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 77,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 66,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 43,878 %

Erreur standard publiée : 4,22 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Claude Sonnet 4.6 · Anthropic · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-02-17

Tarif public non renseigné dans le registre.

38,51 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 84,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 79,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 42,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 87,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 77,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 76,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 63,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 39,892 %

Erreur standard publiée : 4,138 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Claude Sonnet 5 · Anthropic · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-06-30

Tarif public non renseigné dans le registre.

52,97 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Terminal-Bench 4.0 : 12,42 %

IC à 95 % publié par la source, erreur standard par tâche : 9,36 à 15,48 %

Test extérieur

Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-sonnet-5. Date de sortie déclarée par Terminal-Bench : 2026-06-30. Efforts différents : max chez Terminal-Bench, xhigh chez LiveBench. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Raisonnement général · LiveBench : raisonnement : 88,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 80,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 59,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 92,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 71,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 75,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 63,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 44,392 %

Erreur standard publiée : 4,246 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

DeepSeek V4 Flash · DeepSeek · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-04-24

Tarif public non renseigné dans le registre.

Raisonnement général · LiveBench : raisonnement : 70,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 69,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 37,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 79,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 68,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 70,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 63,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

DeepSeek V4 Pro · DeepSeek · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-04-24

Tarif public non renseigné dans le registre.

1,07 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 82,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 70,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 42,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 90,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 74,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 78,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 62,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 26,201 %

Erreur standard publiée : 4,037 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-pro-20260423/endpoints. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Gemini 3.1 Pro Preview · Google · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-02-19

API Google, tarif public : 2 $ en entrée, 12 $ en sortie par million de tokens (unités de texte), en USD.

Google, tarif consulté le 2026-09-06

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 200 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

1,61 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 84,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 76,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 44,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 91,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 78,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 85,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 79,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 17,313 %

Erreur standard publiée : 3,933 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Gemini 3.5 Flash · Google · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-05-19

API Google, tarif public : 1.5 $ en entrée, 9 $ en sortie par million de tokens (unités de texte), en USD.

Google, tarif consulté le 2026-09-06

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

5,73 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 82,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 78,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 49,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 88,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 64,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 84,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 75,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 26,745 %

Erreur standard publiée : 4,104 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GLM 5.2 · Z.ai · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-06-17

Tarif public non renseigné dans le registre.

12,64 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 78,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 79,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 51,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 89,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 73,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 76,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 62,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 37,87 %

Erreur standard publiée : 4,143 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.2. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GPT-5.4 mini · OpenAI · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-03-17

API OpenAI, tarif public : 0.75 $ en entrée, 4.5 $ en sortie par million de tokens (unités de texte), en USD.

OpenAI, tarif consulté le 2026-09-06

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

1,95 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 71,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 71,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 41,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 78,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 70,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 71,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 59,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 12,936 %

Erreur standard publiée : 3,641 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-mini. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GPT-5.4 nano · OpenAI · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-03-17

Tarif public non renseigné dans le registre.

0,42 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 81,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 70,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 46,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 91,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 67,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 62,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 67,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 14,467 %

Erreur standard publiée : 4,025 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-nano. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GPT-5.4 · OpenAI · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-03-05

API OpenAI, tarif public : 2.5 $ en entrée, 15 $ en sortie par million de tokens (unités de texte), en USD.

OpenAI, tarif consulté le 2026-09-06

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 5 USD en entrée et 22.5 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

7,76 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 88,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 77,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 53,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 94,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 79,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 82,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 70,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 34,984 %

Erreur standard publiée : 4,113 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GPT-5.5 · OpenAI · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-04-23

API OpenAI, tarif public : 5 $ en entrée, 30 $ en sortie par million de tokens (unités de texte), en USD.

OpenAI, tarif consulté le 2026-09-06

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 10 USD en entrée et 45 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

6,44 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 89,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 82,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 54,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 95,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 81,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 87,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 70,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 45,161 %

Erreur standard publiée : 4,164 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.5. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Grok 4.3 · xAI · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-05-15

Tarif public non renseigné dans le registre.

0,42 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 70,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 69,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 18,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 84,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 55,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 73,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 62,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 6,795 %

Erreur standard publiée : 1,195 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.3. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Grok 4.5 · xAI · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-07-08

Tarif public non renseigné dans le registre.

3,37 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Terminal-Bench 4.0 : 12,42 %

IC à 95 % publié par la source, erreur standard par tâche : 9,80 à 15,04 %

Test extérieur

Grok Build 1.0.5. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.5. Date de sortie déclarée par Terminal-Bench : 2026-07-16. Écart conservé avec la date du catalogue Origin : 2026-07-08. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Raisonnement général · LiveBench : raisonnement : 87,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 68,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 56,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 90,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 73,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 82,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 71,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 36,596 %

Erreur standard publiée : 4,141 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.5. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Grok Build 0.1 · xAI · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-05-19

Tarif public non renseigné dans le registre.

Raisonnement général · LiveBench : raisonnement : 76,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 65,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 45,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 78,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 70,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 72,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 65,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Kimi K2.6 · Moonshot AI · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-04-20

Tarif public non renseigné dans le registre.

5,11 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 79,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 78,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 46,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 84,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 65,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 75,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 64,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 27,768 %

Erreur standard publiée : 4,144 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Kimi K2.7 Code · Moonshot AI · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-06-12

Tarif public non renseigné dans le registre.

5,04 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 82,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 74,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 45,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 79,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 62,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 77,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 56,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 25,392 %

Erreur standard publiée : 4,161 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

MiniMax M3 · MiniMax · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-06-01

Tarif public non renseigné dans le registre.

7,07 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 74,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 68,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 40,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 76,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 76,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 76,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 57,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 19,925 %

Erreur standard publiée : 3,944 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Qwen 3.6 27B · Alibaba · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-04-21

Tarif public non renseigné dans le registre.

Raisonnement général · LiveBench : raisonnement : 70,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 71,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 39,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 79,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 70,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 63,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 53,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Qwen 3.6 Plus · Alibaba · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-04-02

Tarif public non renseigné dans le registre.

4,78 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 75,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 78,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 41,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 83,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 69,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 75,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 58,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 11,102 %

Erreur standard publiée : 1,312 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Qwen 3.7 Max · Alibaba · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-06-08

Tarif public non renseigné dans le registre.

1,93 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 83,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 74,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 43,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 85,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 71,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 79,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 74,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 13,069 %

Erreur standard publiée : 2,858 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GPT-5.6 Terra · OpenAI · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-07-09

API OpenAI, tarif public : 2 $ en entrée, 12 $ en sortie par million de tokens (unités de texte), en USD.

OpenAI, tarif consulté le 2026-09-06

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 4 USD en entrée et 18 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

8,13 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Terminal-Bench 4.0 : 21,52 %

IC à 95 % publié par la source, erreur standard par tâche : 18,27 à 24,77 %

Test extérieur

Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-terra. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Raisonnement général · LiveBench : raisonnement : 90,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 78,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 54,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 94,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 79,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 82,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 64,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 47,804 %

Erreur standard publiée : 4,28 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GPT-5.6 Luna · OpenAI · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-07-09

API OpenAI, tarif public : 0.2 $ en entrée, 1.2 $ en sortie par million de tokens (unités de texte), en USD.

OpenAI, tarif consulté le 2026-09-06

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Au-delà de 272 000 tokens : 0.4 USD en entrée et 1.8 USD en sortie par million. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

1,88 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Terminal-Bench 4.0 : 17,27 %

IC à 95 % publié par la source, erreur standard par tâche : 14,42 à 20,12 %

Test extérieur

Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-luna. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Raisonnement général · LiveBench : raisonnement : 85,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 82,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 48,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 87,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 78,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 72,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 60,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 44,55 %

Erreur standard publiée : 4,244 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Muse Spark 1.1 · Meta · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-07-09

prix OpenRouter, tarif public : 1.25 $ en entrée, 4.25 $ en sortie par million de tokens (unités de texte), en USD.

OpenRouter, tarif consulté le 2026-09-06

Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

4,56 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 87,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 77,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 58,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 87,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 72,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 74,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 69,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 31,115 %

Erreur standard publiée : 4,068 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.1. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Kimi K3 · Moonshot AI · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-07-16

Tarif public non renseigné dans le registre.

13,87 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 90,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 81,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 62,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 84,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 78,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 85,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 71,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 16,099 %

Erreur standard publiée : 4,101 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Inkling · Thinking Machines Lab · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-07-15

Tarif public non renseigné dans le registre.

3,01 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 78,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 71,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 49,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 88,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 72,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 73,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 70,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 11,79 %

Erreur standard publiée : 3,396 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Gemini 3.5 Flash-Lite · Google · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-07-21

API Google, tarif public : 0.3 $ en entrée, 2.5 $ en sortie par million de tokens (unités de texte), en USD.

Google, tarif consulté le 2026-09-06

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

0,53 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 60,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 76,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 45,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 73,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 53,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 71,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 67,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 6,148 %

Erreur standard publiée : 1,708 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Gemini 3.6 Flash · Google · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-07-21

API Google, tarif public : 0.75 $ en entrée, 3.75 $ en sortie par million de tokens (unités de texte), en USD.

Google, tarif consulté le 2026-09-06

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

8,93 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 85,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 77,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 43,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 86,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 63,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 83,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 75,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 30,928 %

Erreur standard publiée : 4,068 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Claude Opus 4.8 · Anthropic · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-05-28

API Anthropic, tarif public : 5 $ en entrée, 25 $ en sortie par million de tokens (unités de texte), en USD.

Anthropic, tarif consulté le 2026-09-06

Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

30,51 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Terminal-Bench 4.0 : 23,64 %

IC à 95 % publié par la source, erreur standard par tâche : 20,08 à 27,20 %

Test extérieur

Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-4-8. Date de sortie déclarée par Terminal-Bench : 2026-05-28. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Raisonnement général · LiveBench : raisonnement : 89,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 81,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 50,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 94,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 66,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 79,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 72,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 47,25 %

Erreur standard publiée : 4,176 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

DeepSeek V4 Flash 0731 · DeepSeek · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-07-31

Tarif public non renseigné dans le registre.

3,61 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 86,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 75,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 46,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 86,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 79,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 79,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 65,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 38,631 %

Erreur standard publiée : 4,382 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Qwen 3.8 Max · Alibaba · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-08-02

Tarif public non renseigné dans le registre.

10,54 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 88,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 72,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 64,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 91,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 78,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 79,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 74,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 23,958 %

Erreur standard publiée : 4,309 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Muse Spark 1.2 · Meta · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-08-05

prix OpenRouter, tarif public : 1.25 $ en entrée, 4.25 $ en sortie par million de tokens (unités de texte), en USD.

OpenRouter, tarif consulté le 2026-09-06

Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée. Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles. Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

3,78 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 90,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 77,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 57,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 91,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 76,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 78,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 74,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 29,954 %

Erreur standard publiée : 4,023 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.2. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Smaug-Agentic · Abacus.AI · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-08-10

Tarif public non renseigné dans le registre.

Raisonnement général · LiveBench : raisonnement : 90,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 82,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 64,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 83,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 79,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 84,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 71,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

DeepSeek V4 Pro 0813 · DeepSeek · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-08-13

Tarif public non renseigné dans le registre.

18,58 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 85,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 77,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 54,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 95,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 79,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 82,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 67,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 41,54 %

Erreur standard publiée : 4,301 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Grok 4.6 · xAI · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-08-12

Tarif public non renseigné dans le registre.

14,58 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Terminal-Bench 4.0 : 20,30 %

IC à 95 % publié par la source, erreur standard par tâche : 17,21 à 23,39 %

Test extérieur

Grok Build 1.0.5. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.6. Date de sortie déclarée par Terminal-Bench : 2026-08-12. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Raisonnement général · LiveBench : raisonnement : 90,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 76,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 57,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 92,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 73,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 83,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 71,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 44,572 %

Erreur standard publiée : 4,479 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.6. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Gemini 3.7 Flash · Google · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-08-13

API Google, tarif public : 0.75 $ en entrée, 3.75 $ en sortie par million de tokens (unités de texte), en USD.

Google, tarif consulté le 2026-09-06

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

21,46 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Terminal-Bench 4.0 : 11,21 %

IC à 95 % publié par la source, erreur standard par tâche : 8,76 à 13,66 %

Test extérieur

mini-SWE-agent 2.4.6. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.7-flash. Date de sortie déclarée par Terminal-Bench : 2026-08-13. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Raisonnement général · LiveBench : raisonnement : 87,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 78,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 58,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 93,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 68,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 85,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 79,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 34,8 %

Erreur standard publiée : 4,225 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Qwen 3.8 27B · Alibaba · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-08-14

Tarif public non renseigné dans le registre.

21,68 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 80,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 75,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 61,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 86,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 76,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 74,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 72,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 14,157 %

Erreur standard publiée : 4,189 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/qwen/qwen3.8-27b-20260814/endpoints. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

DeepSeek V4 Flash Vision Exp · DeepSeek · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-08-21

Tarif public non renseigné dans le registre.

Raisonnement général · LiveBench : raisonnement : 85,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 68,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 65,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 87,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 79,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 80,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 71,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

GLM 5.3 · Z.ai · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-08-14

Tarif public non renseigné dans le registre.

24,91 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Terminal-Bench 4.0 : 41,82 %

IC à 95 % publié par la source, erreur standard par tâche : 38,59 à 45,05 %

Test extérieur

Claude Code 2.1.207. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/glm-5.3. Date de sortie déclarée par Terminal-Bench : 2026-08-14. Fabricant Z.ai ; préfixe source anthropic/, fournisseur du point d’accès non publié. Effort max chez Terminal-Bench ; effort LiveBench non publié. Aucune équivalence supposée. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Raisonnement général · LiveBench : raisonnement : 85,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 79,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 60,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 87,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 70,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 79,9 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 69,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 44,222 %

Erreur standard publiée : 4,289 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.3. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

GLM 5.3 Flash · Z.ai · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-08-26

Tarif public non renseigné dans le registre.

3,13 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Raisonnement général · LiveBench : raisonnement : 77,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 79,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 56,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 81,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 76,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 77,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 52,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 20,515 %

Erreur standard publiée : 4,207 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/vlm/glm-5.3-flash. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Qwen 3.8 Flash Next · Alibaba · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-08-26

Tarif public non renseigné dans le registre.

Raisonnement général · LiveBench : raisonnement : 87,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 72,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 61,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 85,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 74,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 74,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 77,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Nemotron 3 Ultra 550B A55B · NVIDIA · Poids ouverts

Source pour l'accès aux poids

Date de sortie : 2026-06-04

Tarif public non renseigné dans le registre.

Raisonnement général · LiveBench : raisonnement : 74,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 70,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 38,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 88,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 54,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 70,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 73,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 4,905 %

Erreur standard publiée : 1,589 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://build.nvidia.com/nvidia/nemotron-3-ultra-550b-a55b. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Gemini 3.8 Flash · Google · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-09-02

API Google, tarif public : 0.75 $ en entrée, 3.75 $ en sortie par million de tokens (unités de texte), en USD.

Google, tarif consulté le 2026-09-06

Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Promotion annoncée jusqu’au 2026-12-31 ; ensuite 1.5 USD en entrée et 7.5 USD en sortie par million. Les tokens de réflexion sont inclus dans les tokens facturés en sortie. Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément. Vérifié le 2026-09-06. Tarif à revérifier : échéance de contrôle dépassée.

18,49 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Terminal-Bench 4.0 : 19,09 %

IC à 95 % publié par la source, erreur standard par tâche : 15,73 à 22,45 %

Test extérieur

mini-SWE-agent 2.4.6. Part des essais réussis sur 330, les erreurs comptent comme des échecs.

Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.8-flash. Date de sortie déclarée par Terminal-Bench : 2026-09-02. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.

Source, consultée le 2026-09-05

Raisonnement général · LiveBench : raisonnement : 89,3 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 72,5 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 54,2 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 91,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 54,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 87,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 81,4 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · Vals Code Migration : réécrire un programme : 36,546 %

Erreur standard publiée : 4,184 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Muse Spark 1.3 · Meta · Poids fermés

Source pour l'accès aux poids

Date de sortie : 2026-09-02

Tarif public non renseigné dans le registre.

Raisonnement général · LiveBench : raisonnement : 89,7 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Développement logiciel · LiveBench : code : 81,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Missions longues · LiveBench : code autonome : 64,1 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Maths et sciences · LiveBench : mathématiques : 96,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : analyse de données : 79,6 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : langue : 82,8 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

Raisonnement général · LiveBench : suivi des consignes : 78,0 %

Test extérieur

Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.

Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.

Source, consultée le 2026-09-04

GLM 5.1 · Z.ai · Accès aux poids non renseigné

Source pour l'accès aux poids

Date de sortie : Date de sortie non publiée

Tarif public non renseigné dans le registre.

5,7 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Vals Code Migration : réécrire un programme : 25,768 %

Erreur standard publiée : 4,087 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.1. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

MiMo V2.5 Pro · Xiaomi · Accès aux poids non renseigné

Source pour l'accès aux poids

Date de sortie : Date de sortie non publiée

Tarif public non renseigné dans le registre.

0,24 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Vals Code Migration : réécrire un programme : 21,557 %

Erreur standard publiée : 4,127 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

MiMo V2.5 · Xiaomi · Accès aux poids non renseigné

Source pour l'accès aux poids

Date de sortie : Date de sortie non publiée

Tarif public non renseigné dans le registre.

0,1 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Vals Code Migration : réécrire un programme : 14,228 %

Erreur standard publiée : 3,687 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Inkling Small · Thinking Machines Lab · Accès aux poids non renseigné

Source pour l'accès aux poids

Date de sortie : Date de sortie non publiée

Tarif public non renseigné dans le registre.

0,6 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Vals Code Migration : réécrire un programme : 13,675 %

Erreur standard publiée : 3,81 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Qwen 3.7 Plus · Alibaba · Accès aux poids non renseigné

Source pour l'accès aux poids

Date de sortie : Date de sortie non publiée

Tarif public non renseigné dans le registre.

0,42 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Vals Code Migration : réécrire un programme : 12,856 %

Erreur standard publiée : 2,931 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

MiniMax M2.7 · MiniMax · Accès aux poids non renseigné

Source pour l'accès aux poids

Date de sortie : Date de sortie non publiée

Tarif public non renseigné dans le registre.

0,59 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Vals Code Migration : réécrire un programme : 8,685 %

Erreur standard publiée : 1,786 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Claude Haiku 4.5 · Anthropic · Accès aux poids non renseigné

Source pour l'accès aux poids

Date de sortie : Date de sortie non publiée

Tarif public non renseigné dans le registre.

0,98 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Vals Code Migration : réécrire un programme : 7,551 %

Erreur standard publiée : 1,056 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Gemini 3 Flash Preview · Google · Accès aux poids non renseigné

Source pour l'accès aux poids

Date de sortie : Date de sortie non publiée

Tarif public non renseigné dans le registre.

0,34 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Vals Code Migration : réécrire un programme : 6,391 %

Erreur standard publiée : 1,093 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Mistral Medium 3.5 · Mistral AI · Accès aux poids non renseigné

Source pour l'accès aux poids

Date de sortie : Date de sortie non publiée

Tarif public non renseigné dans le registre.

18,62 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Vals Code Migration : réécrire un programme : 5,127 %

Erreur standard publiée : 1,369 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.mistral.ai/models/mistral-medium-3-5-26-04. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Gemini 3.1 Flash Lite Preview · Google · Accès aux poids non renseigné

Source pour l'accès aux poids

Date de sortie : Date de sortie non publiée

Tarif public non renseigné dans le registre.

0,05 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Vals Code Migration : réécrire un programme : 4,609 %

Erreur standard publiée : 1,069 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Nemotron 3.5 Lightning · NVIDIA · Accès aux poids non renseigné

Source pour l'accès aux poids

Date de sortie : Date de sortie non publiée

Tarif public non renseigné dans le registre.

0,27 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Vals Code Migration : réécrire un programme : 2,951 %

Erreur standard publiée : 0,951 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Grok 4.20 0309 Reasoning · xAI · Accès aux poids non renseigné

Source pour l'accès aux poids

Date de sortie : Date de sortie non publiée

Tarif public non renseigné dans le registre.

0,29 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Vals Code Migration : réécrire un programme : 0,314 %

Erreur standard publiée : 0,11 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.20-0309-reasoning. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Ling 3.0 Flash 2607, version non confirmée · Ant Group · Accès aux poids non renseigné

Source pour l'accès aux poids

Date de sortie : Date de sortie non publiée

Tarif public non renseigné dans le registre.

0,06 USD/test : coût par test mesuré par Vals, base de calcul non publiée. Source Vals, consultée le 2026-09-04. Distinct du tarif par token, hors graphique.

Développement logiciel · Vals Code Migration : réécrire un programme : 0 %

Erreur standard publiée : 0 points. Pas un intervalle de confiance.

Organisme commercial extérieur

Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..

Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints. Dossier complet : /benchmarks/vals-2026-09.json

Source, consultée le 2026-09-04

Limites

  • Aucune note globale entre usages.
  • Aucune moyenne de scores bruts de nature différente.
  • Aucun gagnant entre deux fourchettes qui se recouvrent.
  • Aucun score estimé pour un modèle non mesuré.