Méthode publique · mise à jour 2026-09-06

Méthode du registre de preuves. Chaque conclusion doit pouvoir être vérifiée.

Les règles publiques utilisées par Origin Labs pour combiner les classements IA sans mélanger leurs scores, éviter les doubles comptes et montrer l’incertitude.

Développement logiciel : 17 configurations comparables, deux équipes pour la note.

La note combine LiveBench code et Vals Code Migration sur une référence figée de dix-sept configurations documentées. Les 56 résultats Vals restent visibles, dont ceux exclus de la note. Le classement de rangs plus large peut utiliser des réglages différents, publiés avec chaque mesure ; il ne définit pas la référence de la note.

Sources actuellement combinées : Terminal-Bench, LiveBench, Vals AI.

Nos engagements de collecte

Origin Labs n’exécute aucun benchmark.

Nous compilons des mesures publiées par d’autres organismes. Nous n’avons donc aucun résultat maison à favoriser.

Origin Labs ne demande aucune donnée non publique.

Chaque constat doit pouvoir être refait avec les mêmes fichiers publics, sans accès privilégié.

L’organisme et l’origine de la mesure sont distincts

« Test extérieur » désigne une équipe qui ne vend pas le résultat et ne fabrique pas les modèles ; financements déclarés affichés sur sa fiche. « Organisme commercial extérieur » désigne une entreprise qui ne fabrique pas le modèle testé. Le niveau décrit l’organisme, pas qui a exécuté chaque mesure. « Origine d’exécution non vérifiée » signifie que le résultat reste visible mais hors calcul. Pour les quatre mesures SWE-bench : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Aucun statut fabricant ou partenaire n’en est déduit. SWE-bench remercie Open Philanthropy, AWS, Modal, Andreessen Horowitz, OpenAI et Anthropic pour leur soutien (page primaire consultée le 5 septembre 2026). La relation exacte reste non publiée : aucun contrat commercial décrit par la source. Ces soutiens déclarés ne prouvent ni un biais ni l’opérateur d’une mesure et ne changent aucun poids ni score.

Trois statuts, aucun classement caché

Le statut décrit la solidité du dossier sur une capacité. Il ne désigne pas automatiquement le meilleur modèle.

  1. Preuve solide

    Au moins trois organismes indépendants doivent chacun classer cinq modèles du panel pour une preuve solide. Chaque modèle doit être mesuré par trois de ces organismes ; une égalité ou des fourchettes recouvrantes retirent une étoile. Les petites sources restent dans le calcul descriptif.

    Le résultat peut guider une comparaison, avec ses limites affichées.

  2. À confirmer

    Un score réel existe, mais le domaine reste sous le seuil de trois sources ou cinq modèles communs. Dans un domaine avec un classement combiné, un modèle hors du classement combiné garde une solidité plafonnée à une étoile : son absence ne peut donner plus d’étoiles que le minimum possible dans ce classement, égalités comprises. Sans mesure ou avec seulement des chiffres fabricant, il reste à zéro étoile. Les usages sans classement combiné conservent leurs règles propres ; ce plafond ne garantit pas la continuité des étoiles si le classement combiné entier devient indisponible.

    Le signal mérite un test sur votre propre travail avant de choisir.

  3. Pas assez de preuves

    Le registre ne contient aucun test extérieur actif dans ce domaine.

    Les modèles ne sont pas départagés.

Le domaine est l’unité de comparaison.

Chaque équipe classe les modèles qu’elle a testés. Origin combine ensuite leurs places moyennes dans un même domaine. Le coefficient Kendall W montre si ces classements sont proches, sans moyenne entre domaines. Le cockpit affiche, parmi les analyses disponibles, celle qui classe le plus de modèles. À couverture égale, le noyau strict est affiché. L’autre analyse reste publiée comme sensibilité : nombre d’organismes, de modèles, accord des classements (W) et écarts de podium. Le verdict, les rangs, les étoiles et la couverture suivent tous l’analyse affichée. Aucune moyenne ne réunit les deux analyses.

La note sur 100 utilise une référence figée.

Pour chaque usage et chaque édition, le socle nomme les tests retenus avant le calcul. La référence est leur intersection exacte : au moins quinze modèles mesurés dans les mêmes tests par au moins deux équipes indépendantes. Seuls ces modèles reçoivent une note Origin. Les autres résultats restent visibles avec N tests sur M et leur motif, hors classement. La note indique une position relative, pas un taux de réussite. Le meilleur seul vaut 100 ; des modèles à égalité en tête peuvent recevoir moins. Le seuil de quinze est une règle pratique du produit, pas une garantie scientifique.

Six questions séparées, jamais une note de qualité

Risque de biais (erreur systématique possible) : chaque question montre ce qu’elle protège et ce qu’elle ne protège pas.

Qui mène le test
Protège : Repère un intérêt commercial direct dans le résultat.
Ne protège pas : Une équipe indépendante peut encore utiliser un mauvais protocole.
Tâches publiques ou cachées
Protège : Réduit le risque que le modèle ait déjà vu les réponses.
Ne protège pas : Des tâches cachées peuvent mesurer un travail peu utile.
Mode de vérification
Protège : Distingue un test automatique, un expert humain et un autre modèle d’IA.
Ne protège pas : Une correction automatique ne prouve pas que la tâche est bien choisie.
Conditions exactes du test
Protège : Conserve le modèle servi, l’outil, l’effort et le nombre de tentatives.
Ne protège pas : Des réglages bien décrits ne rendent pas deux tâches comparables.
Classement public complet
Protège : Permet de refaire les rangs sans demander de données privées.
Ne protège pas : Un classement publié ne révèle pas toutes les erreurs tâche par tâche.
Travail réellement mesuré
Protège : Empêche de réunir deux tests qui portent le même nom mais pas sur le même travail.
Ne protège pas : Un test ciblé ne résume jamais toutes les capacités d’un modèle.

La taille du test ne rachète pas une mauvaise méthode

La précision et la rigueur répondent à deux questions différentes.

La précision (marge d’incertitude) indique à quel point un nombre est stable. La rigueur indique si le protocole risque de pousser ce nombre dans une mauvaise direction. Plus de tâches améliore la précision, pas la rigueur.

Aucun coefficient maison ne récompense la qualité.

Jüni et ses coauteurs ont montré que la conclusion pouvait changer selon l’échelle de qualité choisie. Cochrane recommande d’examiner séparément chaque risque d’erreur au lieu de les fondre dans une note unique.

Analyse principale (noyau le plus strict)

Elle retient les instituts publics, les universités et les équipes de recherche extérieures aux fabricants.

Analyse élargie (sources moins complètes)

Elle ajoute les évaluateurs commerciaux extérieurs. Le changement éventuel de classement est publié, jamais caché dans un poids maison.

Une preuve ne compte qu’une fois

  • Une preuve ne compte qu’une fois, même si elle apparaît dans un classement combiné et dans ses sous-tests.
  • Deux réglages sur les mêmes tâches ne deviennent pas deux confirmations indépendantes.
  • Un produit complet et le modèle qu’il contient ne sont pas le même objet testé.
  • Un résultat absent ne devient jamais une égalité, une moyenne ou un rang supposé.

Une exclusion est un résultat documenté

  • Un chiffre du fabricant reste visible, mais ne produit aucun rang dans le classement combiné.
  • Un modèle dont la version, l’outil ou les réglages changent entre deux sources n’est pas traité comme une condition identique.
  • Un modèle présent chez une seule équipe reste visible, sans rang moyen estimé.
  • Les exclusions défavorables à notre conclusion restent documentées avec leur motif.

Le nom affiché ne suffit pas

Sur 182 exécutions SWE-bench Verified auditées, 60 portent le symbole de vérification de l’équipe, 103 ne le portent pas et 19 ne déclarent rien.

Deux listes publiques annoncent Qwen3-Coder-480B-A35B-Instruct, présenté comme un modèle à poids ouverts (fichiers du modèle). Leurs trajectoires nomment pourtant Qwen3-Coder-Max-0721, un modèle propriétaire servi à distance. La soumission Verified ne porte pas le symbole de vérification.

Un nom commercial ne prouve pas une condition expérimentale identique. Ce croisement contient aussi un seul modèle commun, aucun écart entre modèles ne peut donc être calculé.

Claude Sonnet 4 apparaît dans SWE-bench Verified et SWE-bench Pro avec le même agent, mais la version d’exécution, le plafond d’appels et la température diffèrent. Ces deux conditions ne sont pas interchangeables.

Lire la règle de vérification SWE-bench

Données et reproduction

L’API (accès automatisé) publie chaque score séparément, les rangs combinés, le manifeste daté de chaque note sur 100, les tests, les équipes, les résultats partiels, l’empreinte des données figées, Kendall W, sa fourchette à 95 %, les égalités et toutes les sources écartées.

Fondements scientifiques

Travaux antérieurs

Les autres approches sont citées sans jugement.

  • Artificial Analysis. Publie des indices qui combinent plusieurs familles de tests.
  • Vals AI. Publie des comparaisons par métier et par type de tâche.
  • Epoch AI, ECI. Place de nombreux tests sur une échelle générale commune.

Journal des changements

2026-09-06
Dans un domaine encore agrégé, les modèles hors du classement combiné sont plafonnés à une étoile avec un motif visible. Perdre une confirmation ne peut plus améliorer leur solidité par ce repli. Les usages monosource, les rangs et les notes sur 100 ne changent pas.
2026-09-05
Le cockpit affiche l’analyse disponible qui couvre le plus de modèles, le noyau strict à couverture égale. L’autre reste visible comme sensibilité. Les modèles du podium hors note sur 100 sont nommés avec leur motif ; aucun moteur ni score n’est modifié.
2026-09-04
Ajout du moteur de note sur 100 par usage et édition figée. Aucune note réelle tant que quinze modèles communs ne sont pas couverts par deux équipes indépendantes.
2026-09-04
Ajout de l’agrégation de rangs par domaine, de Kendall W avec fourchette à 95 %, et des analyses principale et élargie.
2026-09-04
Publication de la méthode, des règles de collecte et du constat de couverture publique.