Origin Labs n’exécute aucun benchmark.
Nous compilons des mesures publiées par d’autres organismes. Nous n’avons donc aucun résultat maison à favoriser.
Méthode publique · mise à jour 2026-09-06
Les règles publiques utilisées par Origin Labs pour combiner les classements IA sans mélanger leurs scores, éviter les doubles comptes et montrer l’incertitude.
La note combine LiveBench code et Vals Code Migration sur une référence figée de dix-sept configurations documentées. Les 56 résultats Vals restent visibles, dont ceux exclus de la note. Le classement de rangs plus large peut utiliser des réglages différents, publiés avec chaque mesure ; il ne définit pas la référence de la note.
Sources actuellement combinées : Terminal-Bench, LiveBench, Vals AI.
Nous compilons des mesures publiées par d’autres organismes. Nous n’avons donc aucun résultat maison à favoriser.
Chaque constat doit pouvoir être refait avec les mêmes fichiers publics, sans accès privilégié.
« Test extérieur » désigne une équipe qui ne vend pas le résultat et ne fabrique pas les modèles ; financements déclarés affichés sur sa fiche. « Organisme commercial extérieur » désigne une entreprise qui ne fabrique pas le modèle testé. Le niveau décrit l’organisme, pas qui a exécuté chaque mesure. « Origine d’exécution non vérifiée » signifie que le résultat reste visible mais hors calcul. Pour les quatre mesures SWE-bench : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Aucun statut fabricant ou partenaire n’en est déduit. SWE-bench remercie Open Philanthropy, AWS, Modal, Andreessen Horowitz, OpenAI et Anthropic pour leur soutien (page primaire consultée le 5 septembre 2026). La relation exacte reste non publiée : aucun contrat commercial décrit par la source. Ces soutiens déclarés ne prouvent ni un biais ni l’opérateur d’une mesure et ne changent aucun poids ni score.
Le statut décrit la solidité du dossier sur une capacité. Il ne désigne pas automatiquement le meilleur modèle.
Au moins trois organismes indépendants doivent chacun classer cinq modèles du panel pour une preuve solide. Chaque modèle doit être mesuré par trois de ces organismes ; une égalité ou des fourchettes recouvrantes retirent une étoile. Les petites sources restent dans le calcul descriptif.
Le résultat peut guider une comparaison, avec ses limites affichées.
Un score réel existe, mais le domaine reste sous le seuil de trois sources ou cinq modèles communs. Dans un domaine avec un classement combiné, un modèle hors du classement combiné garde une solidité plafonnée à une étoile : son absence ne peut donner plus d’étoiles que le minimum possible dans ce classement, égalités comprises. Sans mesure ou avec seulement des chiffres fabricant, il reste à zéro étoile. Les usages sans classement combiné conservent leurs règles propres ; ce plafond ne garantit pas la continuité des étoiles si le classement combiné entier devient indisponible.
Le signal mérite un test sur votre propre travail avant de choisir.
Le registre ne contient aucun test extérieur actif dans ce domaine.
Les modèles ne sont pas départagés.
Chaque équipe classe les modèles qu’elle a testés. Origin combine ensuite leurs places moyennes dans un même domaine. Le coefficient Kendall W montre si ces classements sont proches, sans moyenne entre domaines. Le cockpit affiche, parmi les analyses disponibles, celle qui classe le plus de modèles. À couverture égale, le noyau strict est affiché. L’autre analyse reste publiée comme sensibilité : nombre d’organismes, de modèles, accord des classements (W) et écarts de podium. Le verdict, les rangs, les étoiles et la couverture suivent tous l’analyse affichée. Aucune moyenne ne réunit les deux analyses.
Pour chaque usage et chaque édition, le socle nomme les tests retenus avant le calcul. La référence est leur intersection exacte : au moins quinze modèles mesurés dans les mêmes tests par au moins deux équipes indépendantes. Seuls ces modèles reçoivent une note Origin. Les autres résultats restent visibles avec N tests sur M et leur motif, hors classement. La note indique une position relative, pas un taux de réussite. Le meilleur seul vaut 100 ; des modèles à égalité en tête peuvent recevoir moins. Le seuil de quinze est une règle pratique du produit, pas une garantie scientifique.
Risque de biais (erreur systématique possible) : chaque question montre ce qu’elle protège et ce qu’elle ne protège pas.
La précision (marge d’incertitude) indique à quel point un nombre est stable. La rigueur indique si le protocole risque de pousser ce nombre dans une mauvaise direction. Plus de tâches améliore la précision, pas la rigueur.
Jüni et ses coauteurs ont montré que la conclusion pouvait changer selon l’échelle de qualité choisie. Cochrane recommande d’examiner séparément chaque risque d’erreur au lieu de les fondre dans une note unique.
Elle retient les instituts publics, les universités et les équipes de recherche extérieures aux fabricants.
Elle ajoute les évaluateurs commerciaux extérieurs. Le changement éventuel de classement est publié, jamais caché dans un poids maison.
Sur 182 exécutions SWE-bench Verified auditées, 60 portent le symbole de vérification de l’équipe, 103 ne le portent pas et 19 ne déclarent rien.
Deux listes publiques annoncent Qwen3-Coder-480B-A35B-Instruct, présenté comme un modèle à poids ouverts (fichiers du modèle). Leurs trajectoires nomment pourtant Qwen3-Coder-Max-0721, un modèle propriétaire servi à distance. La soumission Verified ne porte pas le symbole de vérification.
Un nom commercial ne prouve pas une condition expérimentale identique. Ce croisement contient aussi un seul modèle commun, aucun écart entre modèles ne peut donc être calculé.
Claude Sonnet 4 apparaît dans SWE-bench Verified et SWE-bench Pro avec le même agent, mais la version d’exécution, le plafond d’appels et la température diffèrent. Ces deux conditions ne sont pas interchangeables.
L’API (accès automatisé) publie chaque score séparément, les rangs combinés, le manifeste daté de chaque note sur 100, les tests, les équipes, les résultats partiels, l’empreinte des données figées, Kendall W, sa fourchette à 95 %, les égalités et toutes les sources écartées.
Les autres approches sont citées sans jugement.