# Audit de disponibilité des données de benchmarks, septembre 2026

Date de l'audit : 2026-09-04.

## Verdict

La première méta-analyse du panel **GPT-6 Astra, Claude Fable 5.1 et GPT-5.6 Sol n'est pas calculable avec les données publiques disponibles**.

Le blocage principal n'est pas l'absence de jeux de test. Il manque des résultats tâche par tâche pour les trois modèles, exécutés sur la même version et avec des réglages déclarés. Une absence de résultat n'est jamais remplacée par une égalité, une moyenne ou un rang supposé.

Origin Labs compile uniquement les évaluations publiées par des organismes tiers. Origin Labs ne fait jamais tourner les benchmarks et ne complète jamais une case manquante par une estimation. Un résultat `Non calculable` est donc un livrable définitif tant qu'une source externe ne publie pas les données nécessaires.

## Politique de collecte

Origin Labs n'exécute aucun benchmark et ne demande aucune donnée non publique. L'audit lit, contrôle et relie uniquement les fichiers déjà accessibles à tous. Une donnée gardée privée reste absente du calcul, sans démarche d'accès ni hypothèse de remplacement.

## Règle de décision

Une sous-capacité est classée :

- **Calculable maintenant** si au moins deux tests indépendants mesurent la même sous-capacité, publient les résultats tâche par tâche pour tout le panel et décrivent les réglages.
- **Non calculable** si un modèle du panel manque dans les résultats existants ou si les unités mesurées ne sont pas comparables.

`Non vérifié` signifie que la source consultée ne permet pas d'établir le fait. Ce libellé n'est pas remplacé par une supposition.

## Panel et champs audités

- Modèles : GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol.
- Réglages : version exacte du modèle, niveau de raisonnement, agent ou harnais, nombre de tentatives et version du test.
- Données nécessaires : identifiant de tâche, résultat de chaque tentative, réglages, date d'exécution et règle de correction.
- Les nombres de tâches ou de tentatives ci-dessous décrivent le protocole. Aucune valeur de performance n'est recopiée.

## Développement logiciel

| Benchmark | Source et version consultées | Résultats disponibles | Licence | Couverture exacte du panel | Décision |
|---|---|---|---|---|---|
| SWE-bench Verified | [Dépôt des expériences, dossier `evaluation/verified`](https://github.com/SWE-bench/experiments/tree/main/evaluation/verified), [format officiel](https://github.com/SWE-bench/experiments/blob/main/README.md), consultés le 2026-09-04. Jeu Verified de 500 tâches. | Oui, prédictions, journaux et `results.json` par exécution, avec listes par instance. | Licence du dépôt de résultats : non déclarée. Code principal SWE-bench : MIT. | Astra : absent. Fable 5.1 : absent. Sol : absent. Les anciens dépôts publient leur agent et leurs métadonnées propres, sans réglage commun au panel. | Non calculable, panel absent des résultats publiés. |
| SWE-bench Pro | [Trajectoires officielles](https://github.com/scaleapi/SWE-bench_Pro-os/tree/main/traj), [dépôt](https://github.com/scaleapi/SWE-bench_Pro-os), consultés le 2026-09-04. Version ouverte courante, sans étiquette de publication dans les dossiers de trajectoires. | Oui, `eval_results.json` par exécution et résultats par instance. | MIT. | Sol : GPT-5, dossier daté du 2025-10-13, réglage détaillé dans sa trajectoire. Astra et Fable 5.1 : absents. | Non calculable, panel incomplet dans les résultats publiés. |
| SWE-bench Live | [Dépôt officiel](https://github.com/microsoft/SWE-bench-Live), [soumissions](https://github.com/SWE-bench-Live/submission/tree/main/submissions), [leaderboard](https://swe-bench-live.github.io/), consultés le 2026-09-04. Versions Lite, Multilang et Windows publiées séparément. | Oui pour les soumissions publiées, avec prédictions et résultats par instance. | MIT. | Astra, Fable 5.1 et Sol : absents des soumissions publiques. Les soumissions présentes concernent des agents de recherche et portent leurs propres réglages. | Non calculable, panel absent des résultats publiés. |
| Terminal-Bench | [Terminal-Bench 4.0](https://github.com/harbor-framework/terminal-bench/tree/main/leaderboard/submissions), [exemple Fable 5.1](https://github.com/harbor-framework/terminal-bench/blob/main/leaderboard/submissions/2026-09-02-anthropic-claude-fable-5-1-max-claude-code.json), [exemple Sol](https://github.com/harbor-framework/terminal-bench/blob/main/leaderboard/submissions/2026-08-26-openai-gpt-5-6-sol-max-codex.json), consultés le 2026-09-04. [Version 2.1](https://github.com/harbor-framework/terminal-bench-2-1) auditée séparément. | Oui, chaque soumission 4.0 référence ses essais Harbor et publie les identifiants des tâches. Les pages de job exposent les essais. | Apache-2.0 pour 4.0 et 2.1. | 4.0 : Fable 5.1 avec Claude Code 2.1.257, effort max, et Sol avec Codex 0.149.1, effort max. Astra : absent. 2.1 : Sol avec Codex 0.144.0, effort max. Astra et Fable 5.1 : absents. | Non calculable, panel incomplet. Les versions 2.1 et 4.0 ne sont pas fusionnées. |
| LiveCodeBench | [Code officiel](https://github.com/LiveCodeBench/LiveCodeBench), [exports officiels](https://github.com/LiveCodeBench/submissions), consultés le 2026-09-04. Dernière fenêtre publiée dans ce dépôt : release v6. | Oui, fichiers JSON par modèle avec résultat par problème, scénario, température et nombre d'échantillons dans le nom de fichier. | MIT pour le code et les exports. | Aucun des trois modèles du panel dans le dépôt de soumissions. | Non calculable, panel absent des résultats publiés. |
| Aider Polyglot | [Jeu de tâches](https://github.com/Aider-AI/polyglot-benchmark), [données du leaderboard](https://github.com/Aider-AI/aider/blob/main/aider/website/_data/polyglot_leaderboard.yml), consultés le 2026-09-04. Version courante de 225 exercices, sans publication figée du jeu dans les lignes du leaderboard. | Non. Le YAML publie des agrégats et la commande Aider, sans résultat par exercice. | Code Aider : Apache-2.0. Jeu Polyglot : licence racine non déclarée, licences variables par exercice. | Astra, Fable 5.1 et Sol : absents. Les lignes disponibles indiquent version Aider, modèle, format d'édition et commande pour les modèles présents. | Non calculable, faute d'export par exercice et de panel publié. |

## Agents et missions professionnelles

| Benchmark | Source et version consultées | Résultats disponibles | Licence | Couverture exacte du panel | Décision |
|---|---|---|---|---|---|
| OSWorld 2.0 | [Dépôt officiel](https://github.com/xlang-ai/OSWorld-V2), [manifest 2026.08.08](https://github.com/xlang-ai/OSWorld-V2/blob/main/benchmark_releases/osworld-v2-2026.08.08.json), [trajectoires](https://huggingface.co/datasets/xlangai/osworld2.0-trajectory), consultés le 2026-09-04. Version auditée : `osworld-v2-2026.08.08`. | Oui, archives de trajectoires par exécution et fichiers de démonstration par tâche. L'accès aux tâches passe par un jeu Hugging Face à approbation automatique. | Code et tâches : Apache-2.0. Licence des archives de trajectoires : non déclarée. | Sol : archive publiée. Astra et Fable 5.1 : absents. Réglage exact de l'archive Sol : non vérifié dans la fiche du jeu de trajectoires. | Non calculable, panel incomplet. |
| GAIA | [Jeu officiel](https://huggingface.co/datasets/gaia-benchmark/GAIA), [résultats publics](https://huggingface.co/datasets/gaia-benchmark/results_public), [format de soumission](https://huggingface.co/spaces/gaia-benchmark/leaderboard/blob/main/content.py), consultés le 2026-09-04. Version 2023, validation publique et test à réponses cachées. | Non pour les résultats publics : le jeu `results_public` contient une ligne agrégée par modèle et date. Le format de soumission est bien tâche par tâche, mais les fichiers soumis ne sont pas publiés. | Licence du jeu et des résultats : non déclarée dans les fiches consultées. | Couverture et réglages exacts d'Astra, Fable 5.1 et Sol : non vérifiés dans l'export public. | Non calculable avec les données publiées. |
| APEX-Agents | [Jeu officiel](https://huggingface.co/datasets/mercor/apex-agents), [méthode](https://www.mercor.com/blog/introducing-apex-agents/), [leaderboard juridique](https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/?harness=w:t&pass=pass-1), consultés le 2026-09-04. Version de 480 tâches, dont des sous-ensembles métier. | Partiel. Les tâches, documents et rubriques sont publics. Le site publie quelques exemples et trajectoires, pas la matrice complète des résultats du panel tâche par tâche. | Jeu : CC-BY-4.0. | Panel présent sur le leaderboard général et les vues métier consultées. Corporate Lawyer : Fable 5.1 max, Astra xHigh, Sol max, harnais Loop. Les réglages complets et le nombre de tentatives par modèle ne sont pas exportés avec chaque tâche. | Non calculable, sorties complètes et réglages absents des données publiques. |

Les volets Corporate Lawyer, Investment Banking Analyst et Management Consultant sont des sous-ensembles d'APEX-Agents. Ils ne constituent pas des études indépendantes du total APEX-Agents.

## Droit, santé et finance

| Benchmark | Source et version consultées | Résultats disponibles | Licence | Couverture exacte du panel | Décision |
|---|---|---|---|---|---|
| LegalBench | [Dépôt officiel](https://github.com/HazyResearch/legalbench), [évaluation Vals](https://www.vals.ai/benchmarks/legal_bench), consultés le 2026-09-04. Version du dépôt non figée, Vals mise à jour le 2026-09-01. | Les tâches sont publiques. Le dépôt ne publie pas les sorties des modèles du panel. Vals publie des agrégats et des exemples, sans export complet par tâche. | Licence racine non déclarée. Les tâches conservent des licences propres à leurs sources. | Vals affiche une sélection de modèles, mais la présence et les réglages exacts des trois modèles du panel ne sont pas établis par un export public : non vérifié. | Non calculable, sorties complètes et réglages absents des données publiques. |
| MedHELM | [Téléchargement officiel](https://medhelm.org/downloading_raw_results), [reproduction](https://medhelm.org/reproducing_leaderboards), [code HELM](https://github.com/stanford-crfm/helm), consultés le 2026-09-04. Dernière archive publique observée : v4.0.0 du 2026-01-19. | Oui. Chaque exécution publie notamment `instances.json`, `per_instance_stats.json`, `display_predictions.json` et `run_spec.json`. | Code HELM : Apache-2.0. Les licences des jeux médicaux restent celles de chaque source. | Astra, Fable 5.1 et Sol : absents de l'archive v4.0.0. Les modèles présents ont un `run_spec.json` détaillé. | Non calculable, panel absent de l'archive publiée. |
| FinanceBench | [Dépôt officiel](https://github.com/patronus-ai/financebench), [exports](https://github.com/patronus-ai/financebench/tree/main/results), consultés le 2026-09-04. Échantillon public de 150 cas, distinct du jeu privé complet. | Oui, JSONL par modèle avec identifiant de cas, mode d'évaluation, température, réponse attendue, réponse du modèle et décision. | Licence racine non déclarée dans le dépôt. | Aucun modèle du panel. Les exports couvrent uniquement des générations antérieures avec leur mode d'évaluation. | Non calculable, panel absent des résultats publiés. |
| Finance Agent v2 | [Page officielle](https://www.vals.ai/benchmarks/fabv2), [code](https://github.com/vals-ai/finance-agent-v2), consultés le 2026-09-04. Version 2, jeu privé de 450 tâches, trois passages annoncés par modèle. | Non publiés. Le code écrit des journaux par question lors d'une exécution locale, mais le leaderboard ne donne pas les journaux officiels. | Code : MIT. Jeu de test : privé, licence de réutilisation non publique. Un petit jeu public de développement est fourni dans le dépôt. | Astra, Fable 5.1 et Sol sont listés. Identifiants fournisseur, effort de raisonnement et configuration exacte de chaque passage : non vérifiés publiquement. | Non calculable, journaux officiels, identifiants exacts et réglages absents des données publiques. |

## Mathématiques, connaissances et contexte long

| Benchmark | Source et version consultées | Résultats disponibles | Licence | Couverture exacte du panel | Décision |
|---|---|---|---|---|---|
| FrontierMath | [Tiers 1 à 4](https://epoch.ai/frontiermath/tiers-1-4/about), [FrontierMath Erdős](https://epoch.ai/latest/announcing-frontiermath-erdos), [page Erdős](https://epoch.ai/benchmarks/frontiermath-erdos), consultés le 2026-09-04. Versions distinctes, à ne pas fusionner. | Tiers 1 à 4 : problèmes privés et résultats agrégés. Erdős : l'article nomme les problèmes résolus et décrit le sort des autres tentatives, sans export machine complet. | Jeux privés, licence de réutilisation non publiée. | Erdős : Astra prépublication, Fable 5.1 max et Sol max, une tentative par problème, même agent, 72 heures et budget identique par tentative. Tiers 1 à 4 : réglages exacts du panel non vérifiés. | Non calculable comme méta-analyse : une seule étude sur le construit Erdős. Les deux familles FrontierMath ne sont pas interchangeables. |
| Humanity's Last Exam, HLE | [Dépôt officiel](https://github.com/centerforaisafety/hle), [jeu officiel](https://huggingface.co/datasets/cais/hle), [leaderboard Scale](https://labs.scale.com/leaderboard/humanitys_last_exam), consultés le 2026-09-04. Version publique finalisée de 2 500 questions. | Le jeu et le format JSON de prédiction sont publics. Le leaderboard ne publie pas les fichiers de prédictions officiels par question. | MIT. | Présence du panel et réglages exacts sur le leaderboard Scale : non vérifiés dans un export public. Artificial Analysis évalue HLE dans son index, sans publier ses sorties par question. | Non calculable avec les données publiées. |
| GPQA Diamond | [Dépôt officiel](https://github.com/idavidrein/gpqa), [résultats de référence](https://github.com/idavidrein/gpqa/tree/main/baseline_results), consultés le 2026-09-04. Sous-ensemble Diamond de 198 questions. | Oui pour les anciens modèles de référence, sous forme de CSV par question. | MIT. | Astra, Fable 5.1 et Sol : absents. Les réglages des anciens modèles sont documentés dans les noms de fichiers et scripts associés. | Non calculable, panel absent des résultats publiés. |
| ARC-AGI | [Dépôt officiel](https://github.com/arcprize/ARC-AGI), [leaderboard officiel](https://arcprize.org/leaderboard), consultés le 2026-09-04. ARC-AGI-1, ARC-AGI-2 et ARC-AGI-3 sont des versions distinctes. | Les tâches statiques des versions 1 et 2 sont ouvertes. Pour ARC-AGI-3, les scorecards et exemples sont publics, pas la matrice complète des niveaux et tentatives des fournisseurs. | Code et jeux ouverts : MIT. Jeu semi-privé ARC-AGI-3 : conditions de réutilisation non publiées avec un export. | ARC-AGI-3 : Astra avec harnais standard et Provider Adapter. Couverture et réglages comparables de Fable 5.1 et Sol : non vérifiés. | Non calculable, panel commun absent. Les deux harnais Astra sont deux conditions d'une même étude, pas deux preuves. |
| AA-Omniscience | [Méthode](https://artificialanalysis.ai/evaluations/omniscience), [échantillon public](https://huggingface.co/datasets/ArtificialAnalysis/AA-Omniscience-Public), [article Astra](https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra), consultés le 2026-09-04. Version principale privée de 6 000 questions, échantillon public de 600 questions. | Non pour les exécutions du leaderboard. Seules les mesures agrégées sont publiées. Les questions de l'échantillon public ne contiennent pas les sorties officielles des modèles. | Échantillon public : Apache-2.0. Jeu principal : privé, licence non publiée. | Panel évalué par Artificial Analysis. Astra max, Fable 5.1 max avec mécanisme de repli serveur, Sol max. Les sorties par question et les identifiants exacts des appels ne sont pas publics. | Non calculable, sorties officielles absentes et seconde étude indépendante manquante. |
| AA-LCR | [Présentation officielle](https://artificialanalysis.ai/articles/announcing-aa-lcr), [méthode](https://artificialanalysis.ai/evaluations/artificial-analysis-long-context-reasoning), [jeu public](https://huggingface.co/datasets/ArtificialAnalysis/AA-LCR), consultés le 2026-09-04. Version publique de 100 questions, trois passages annoncés. | Non pour les exécutions du leaderboard. Le jeu et les documents sont publics, mais pas les sorties par question des modèles évalués. | Apache-2.0. | Panel évalué par Artificial Analysis. Astra max, Fable 5.1 max avec mécanisme de repli serveur, Sol max. Les sorties et détails d'appel par passage ne sont pas publics. | Non calculable. Les sorties officielles manquent et ce test ne peut pas être compté en plus de l'Intelligence Index qui le contient. |
| LongBench v2 | [Dépôt officiel](https://github.com/THUDM/LongBench), [jeu officiel](https://huggingface.co/datasets/THUDM/LongBench-v2), consultés le 2026-09-04. Version v2 de 503 questions. | Le lanceur produit des prédictions et décisions par question, mais le dépôt officiel ne publie pas les fichiers des modèles du leaderboard. | MIT. | Astra, Fable 5.1 et Sol : absents du leaderboard public daté du 2025-05-06. Les modèles présents utilisent des conditions avec ou sans chaîne de raisonnement, non interchangeables. | Non calculable, panel absent du leaderboard publié. |

## Cybersécurité et préférence humaine

| Benchmark | Source et version consultées | Résultats disponibles | Licence | Couverture exacte du panel | Décision |
|---|---|---|---|---|---|
| Cybench | [Dépôt officiel](https://github.com/andyzorigin/cybench), [sorties d'exemple](https://github.com/andyzorigin/cybench/tree/main/agent/outputs/benchmark), consultés le 2026-09-04. Version courante du dépôt, sans publication de jeu figée dans les sorties. | Partiel. Le harnais produit des résultats par tâche et sous-tâche, mais le dépôt ne fournit que des exemples, pas les exécutions complètes du leaderboard. | Apache-2.0. | Astra, Fable 5.1 et Sol : absents des sorties publiques. Les modèles de l'article utilisent le harnais agent du dépôt. | Non calculable, panel absent des sorties publiées. |
| CyberGym | [Dépôt officiel](https://github.com/sunblaze-ucb/cybergym), [jeu officiel](https://huggingface.co/datasets/sunblaze-ucb/cybergym), [site](https://www.cybergym.io/), consultés le 2026-09-04. CyberGym et CyberGym-E2E sont des variantes distinctes. | Le jeu de vulnérabilités est public. Aucun export officiel complet des résultats par vulnérabilité n'a été trouvé. | Apache-2.0. | Présence et réglages exacts du panel : non vérifiés dans un export public. | Non calculable. CyberGym et CyberGym-E2E ne sont pas regroupés. |
| Arena | [Méthode Arena-Rank](https://github.com/lmarena/arena-rank), [instantanés agrégés](https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset), [ancien jeu de votes](https://huggingface.co/datasets/lmarena-ai/arena-human-preference-140k), consultés le 2026-09-04. | Les instantanés courants sont agrégés. Un ancien corpus publie des votes individuels, mais sur d'autres modèles et une autre période. Les prompts ne forment pas un jeu fixe partagé entre toutes les paires. | Méthode : Apache-2.0. Jeux Hugging Face cités : CC-BY-4.0. | Couverture courante possible du panel sur la page en ligne, mais versions exactes, réglages et batailles brutes communes : non vérifiés publiquement. | Non calculable dans une méta-analyse par tâche. Arena mesure une préférence par paire sur des prompts variables, pas une réussite sur les mêmes tâches. |

## Balayage rétrospectif des fichiers publics

L'[inventaire complet des exécutions publiques](./inventaire-public-par-tache-2026-09.tsv) fige, sans recopier leurs performances, les modèles, agents, versions de test, tentatives et réglages déclarés. Une exécution qui déclare plusieurs modèles occupe une ligne par modèle. Une information absente du fichier source reste `non vérifié`.

Les dépôts ont été figés aux révisions publiques suivantes : [SWE-bench Verified `40f164d`](https://github.com/SWE-bench/experiments/tree/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified), [SWE-bench Pro `ca10a60`](https://github.com/scaleapi/SWE-bench_Pro-os/tree/ca10a60a5fcae51e6948ffe1485d4153d421e6c5/traj), [SWE-bench Live `0506be0`](https://github.com/SWE-bench-Live/submission/tree/0506be0e9476f0d888ce49bf97d5c1cc62c90645/submissions), [Terminal-Bench `83c7a61`](https://github.com/harbor-framework/terminal-bench/tree/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions), [LiveCodeBench `6ca212e`](https://github.com/LiveCodeBench/submissions/tree/6ca212e9c2039373f6e5069d37ffa9db66e23736), [GPQA `56686c0`](https://github.com/idavidrein/gpqa/tree/56686c06f5e19865c153de0fdb11be3890014df7/baseline_results) et [FinanceBench `cc39aeb`](https://github.com/patronus-ai/financebench/tree/cc39aeb4afdf33909ee1412188bf89035950c2eb/results). MedHELM est figé par sa publication v4.0.0. L'archive S3 de SWE-bench Pro n'est pas versionnée, son contenu est celui observé à la date de l'audit.

Les listes ont été relevées directement dans les emplacements publics suivants :

- **SWE-bench Verified** : les dossiers d'exécution et leur `metadata.yaml` dans le [dépôt officiel](https://github.com/SWE-bench/experiments/tree/main/evaluation/verified). Le nom exact du modèle, l'agent, le nombre de tentatives, la version de mini-SWE-agent et l'effort sont repris quand ils sont déclarés.
- **SWE-bench Pro** : les exécutions visibles dans l'[archive publique](https://scaleapi-results.s3.amazonaws.com/?list-type=2&prefix=swe-bench-pro/&delimiter=/) et les règles communes du [dossier des trajectoires](https://github.com/scaleapi/SWE-bench_Pro-os/tree/main/traj). Les libellés de dossiers sont conservés tels quels. L'identifiant fournisseur reste `non vérifié` lorsqu'il n'est pas publié dans le manifeste.
- **SWE-bench Live** : chaque fichier `preds.json` des variantes [Lite, Multilang et Windows](https://github.com/SWE-bench-Live/submission/tree/main/submissions). Le chemin public est conservé comme identifiant d'exécution. Un réglage absent du fichier ou de son README reste `non vérifié`.
- **Terminal-Bench 4.0** : les [soumissions JSON](https://github.com/harbor-framework/terminal-bench/tree/main/leaderboard/submissions). Elles déclarent directement le modèle, l'agent, sa version, l'effort et les identifiants d'essai.
- **LiveCodeBench** : tous les [exports JSON](https://github.com/LiveCodeBench/submissions). Le dossier donne le modèle et le nom du fichier encode le scénario, le nombre d'échantillons, la température et la version publiée.
- **GPQA** : tous les CSV par question du dossier [baseline_results](https://github.com/idavidrein/gpqa/tree/main/baseline_results), sauf `merged.csv` qui est un assemblage. Le fichier donne le modèle et la méthode de réponse. Une révision non nommée, comme `gpt-4`, reste non vérifiée.
- **FinanceBench** : tous les [exports JSONL](https://github.com/patronus-ai/financebench/tree/main/results). Chaque ligne déclare le modèle, le mode d'évaluation et la température.
- **MedHELM** : la [publication v4.0.0](https://storage.googleapis.com/storage/v1/b/crfm-helm-public/o?prefix=medhelm/benchmark_output/releases/v4.0.0/&delimiter=/) et ses `run_spec.json`, selon le [format officiel](https://medhelm.org/downloading_raw_results). Le modèle et son déploiement exact sont relevés pour chaque scénario.

### Vérification annoncée par SWE-bench

[SWE-bench distingue](https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/README.md#result-verification) les soumissions qui ont reçu son symbole de vérification après un nouveau contrôle sur un échantillon. Sur les 182 dossiers Verified audités, 60 portent `checked: true`, 103 portent `checked: false` et 19 ne déclarent pas ce champ. L'inventaire conserve cette information dans une colonne propre, séparée des réglages. `checked: false` ne rend pas les fichiers privés, mais interdit de présenter le résultat comme recontrôlé par l'équipe SWE-bench.

### Croisements contrôlés

Deux recouvrements approchent les conditions requises pour la réparation de bugs dans un dépôt réel, mais aucun ne permet le calcul comparatif prévu :

- **Qwen3-Coder avec OpenHands 0.35.0** apparaît dans SWE-bench Verified et SWE-bench Live Lite, avec une tentative. Les deux pages annoncent `Qwen3-Coder-480B-A35B-Instruct`. Pourtant, les [réglages Verified](https://swe-bench-submissions.s3.amazonaws.com/verified/20250805-openhands-Qwen3-Coder-480B-A35B-Instruct/trajs/astropy__astropy-12907/trajectory.json) et la [trajectoire Live](https://raw.githubusercontent.com/SWE-bench-Live/submission/main/submissions/lite/20250725-openhands-Qwen3-Coder-480B-A35B/trajs/AgentOps-AI__agentops-1005/trajectory.json) nomment tous deux le modèle réellement servi `Qwen3-Coder-Max-0721`. L'inventaire sépare donc le modèle annoncé du modèle servi. La soumission Verified porte aussi `checked: false`, elle n'a pas le symbole de vérification SWE-bench. Enfin, la comparaison des champs `instance_id` des jeux publics [Verified](https://huggingface.co/datasets/princeton-nlp/SWE-bench_Verified) et [Live Lite](https://huggingface.co/datasets/SWE-bench-Live/SWE-bench-Live) ne trouve aucun identifiant commun. Ce modèle est seul dans ce croisement contrôlé, il manque donc un second modèle commun pour calculer un écart entre modèles.
- **Claude Sonnet 4 du 2025-05-14 avec SWE-agent 1.1.0** apparaît dans SWE-bench Verified et SWE-bench Pro. La comparaison des champs `instance_id` des jeux publics Verified et [Pro](https://huggingface.co/datasets/ScaleAI/SWE-bench_Pro) ne trouve aucun identifiant commun. Les réglages diffèrent toutefois : Verified utilise SWE-rex 1.2.1, 150 appels maximum et une température nulle, tandis que [Pro](https://scaleapi-results.s3.amazonaws.com/swe-bench-pro/claude-4sonnet-10132025/traj/instance_NodeBB__NodeBB-00c70ce7b0541cfc94afe567921d7668cdc8f4ac-vnan/instance_NodeBB__NodeBB-00c70ce7b0541cfc94afe567921d7668cdc8f4ac-vnan.traj) utilise SWE-rex 1.2.2, 250 appels maximum et une température de 1. Ce réglage n'est pas interchangeable, et aucun second modèle commun n'a été trouvé avec un protocole contrôlé dans les deux sources.

Les autres noms communs entre SWE-bench Verified, Pro et Live sont écartés lorsque la révision exacte du modèle, l'agent ou son réglage change. Un même nom commercial ne prouve pas une même condition expérimentale.

### Paires non indépendantes écartées

- Les modes d'un même export FinanceBench réutilisent les mêmes cas financiers.
- Les méthodes de réponse GPQA réutilisent les mêmes questions.
- Les fichiers LiveCodeBench sont des exécutions du même jeu, pas des études indépendantes.
- Les scénarios d'une même publication MedHELM restent dans une seule famille d'évaluation. Ils ne sont pas transformés en réplications indépendantes.
- Terminal-Bench 2.1 et 4.0 sont deux versions d'une même famille. Elles ne sont pas comptées comme deux organismes indépendants.
- SWE-bench Verified, Pro et Live partagent une forme de tâche, mais leurs jeux publics auditables n'ont aucun identifiant de tâche commun. Ils peuvent donc être croisés seulement lorsque les modèles et leurs conditions sont eux aussi comparables.

### Verdict rétrospectif

**Aucun couple de modèles ne dispose aujourd'hui de deux tests publics, indépendants, tâche par tâche, sur la même sous-capacité et avec des conditions suffisamment contrôlées pour calculer un écart mis en commun.**

Le moteur de mise en commun ne peut donc pas être alimenté sans changer la méthode arrêtée. Les deux recouvrements ci-dessus restent des pistes de couverture, pas des résultats calculables.

## Dépendances et doubles comptes

- **SWE-bench Verified, Pro et Live** viennent de la même famille de tâches issues de tickets et correctifs GitHub. La comparaison de leurs champs `instance_id` ne trouve aucun identifiant partagé entre les trois jeux publics audités. Des versions ou agents différents restent toutefois des conditions distinctes, jamais des lignes interchangeables.
- **APEX-Agents et ses volets métier** partagent le même corpus de 480 tâches. Le total et Corporate Lawyer, Investment Banking Analyst ou Management Consultant ne doivent pas être comptés ensemble comme preuves indépendantes.
- **LegalBench et Vals LegalBench** utilisent le même corpus source. Vals est une nouvelle exécution, pas un nouveau jeu de tâches.
- **AA Intelligence Index v4.1.1** contient AA-Omniscience, AA-LCR, HLE, GPQA Diamond et Terminal-Bench 2.1. L'index ne doit jamais être ajouté à ses composants dans un même calcul.
- **AA Coding Agent Index** contient notamment Terminal-Bench 2.1, DeepSWE et SWE-Atlas-QnA. Il ne doit jamais être ajouté à l'un de ces composants dans un même calcul.
- **FrontierMath Tiers 1 à 4 et FrontierMath Erdős** sont deux corpus et deux protocoles distincts. Ils ne deviennent pas indépendants par le seul fait de partager une marque.
- **ARC-AGI-1, ARC-AGI-2 et ARC-AGI-3** n'ont ni les mêmes tâches ni le même mode d'interaction. Le harnais standard et le Provider Adapter d'ARC-AGI-3 sont deux conditions de la même évaluation.
- **CyberGym et CyberGym-E2E** ciblent des étapes différentes d'une attaque. Ils ne sont pas mis en commun sans nouvelle validation de ce qu'ils mesurent.
- **Arena** ne partage pas une matrice fixe modèle par tâche avec les tests de réussite. Ses votes ne sont pas convertis en scores de tâche.

## Conclusion par sous-capacité

| Sous-capacité | Calculable avec les données publiques | Motif |
|---|---|---|
| Réparer un bug dans un dépôt réel | Non | Verified, Pro et Live publient des données par tâche, mais aucun couple de modèles n'est commun dans des conditions suffisamment contrôlées. |
| Exécuter des tâches dans un terminal | Non | Terminal-Bench publie Fable 5.1 et Sol dans une version commune, pas Astra, et aucune seconde source indépendante comparable. |
| Programmer à partir d'un énoncé | Non | LiveCodeBench et Aider Polyglot n'ont pas le panel commun, Aider ne publie pas les résultats par exercice. |
| Utiliser un ordinateur | Non | OSWorld 2.0 ne publie pas le panel commun. |
| Résoudre une mission générale avec des outils | Non | GAIA ne publie pas les soumissions tâche par tâche. |
| Réaliser un travail professionnel multi-application | Non | APEX-Agents ne publie pas la matrice complète ni tous les réglages. |
| Travail d'analyste financier | Non | APEX Investment Banking et Finance Agent v2 ne publient pas leurs matrices officielles complètes. |
| Raisonnement juridique | Non | LegalBench et Vals ne publient pas les sorties complètes du panel avec leurs réglages. |
| Raisonnement médical | Non | MedHELM n'a pas le panel commun et aucune seconde source indépendante par tâche ne couvre ses anciens modèles. |
| Mathématiques de recherche vérifiables | Non | FrontierMath Erdős est une seule étude. |
| Connaissances expertes | Non | HLE ne publie pas les sorties du panel et GPQA Diamond ne couvre que des modèles antérieurs dans ses fichiers par question. |
| Fiabilité factuelle | Non | AA-Omniscience ne publie pas ses sorties officielles et aucune seconde étude indépendante comparable n'est disponible. |
| Raisonnement sur de longs documents | Non | AA-LCR ne publie pas ses sorties officielles et LongBench v2 ne publie pas le panel. |
| Cybersécurité | Non | Cybench et CyberGym ne publient ni le panel ni les résultats complets. |
| Préférence humaine générale | Non | Arena n'utilise pas des tâches fixes et communes. |

**Liste des sous-capacités calculables sur le panel actuel : aucune.**

**Liste des couples de modèles calculables rétrospectivement : aucune.**

La publication peut donc expliquer cette absence de données publiques comparables. Elle ne doit publier ni moyenne de scores agrégés ni classement de remplacement.
