# Collecte Vals Code Migration, 4 septembre 2026

Les 56 résultats publiés sont conservés : aucune exclusion de mesure. Le registre passe de 382 à 438 observations et de 53 à 66 modèles. Les 56 lignes ont une instruction de disponibilité : 54 documentées, deux versions non vérifiées. Ce constat documentaire ne repose sur aucun appel de modèle.

## Note Origin

17 configurations communes documentées entre LiveBench code et Vals entrent dans la note. Les 39 autres lignes Vals restent visibles avec leur motif. La note exprime une position relative parmi ces dix-sept modèles, pas un taux de réussite ni une probabilité de supériorité. Le seuil de quinze est une règle pratique du produit.

Les deux tests mesurent des tâches différentes : génération de code et migration de programmes. La décision de les comparer au niveau du domaine ne prouve pas leur équivalence expérimentale. Les rangs sont calculés sur les mêmes dix-sept modèles et les mêmes deux tests, sans pondération de qualité. Les étoiles et le classement de rangs plus large du cockpit suivent leur contrat séparé, autorisant des réglages différents ; ils ne définissent pas le panel strict de la note.

La référence était candidate à seize rapprochements. Inkling est ajouté après vérification de la correspondance officielle xhigh = 0,99. GPT-5.4 et mini sont inclus : LiveBench déclare respectivement les versions 2026-03-05 et 2026-03-17, identiques aux snapshots Vals, avec xhigh des deux côtés. Les pages officielles OpenAI datées sont conservées dans les pièces. Une nouvelle version impose une nouvelle édition ; aucune identité exacte des serveurs historiques n’est prétendue. Aucun rapprochement n'est décidé selon le score. Fable et ses replis restent exclus de la note. Un effort absent ou divergent retire le modèle de la référence ; à quatorze, aucune note n'est calculée.

## Données et protocole

- [Classement primaire Vals](https://www.vals.ai/benchmarks/code-migration), version 1, mis à jour le 3 septembre, consulté le 4 septembre 2026.
- [Méthode générale](https://www.vals.ai/methodology), date de publication non renseignée, consultation le 4 septembre.
- 40 dépôts pondérés également : 30 CLI et 10 COBOL. Chaque dépôt CLI est migré dans quatre langues cibles ; les 120 migrations ne sont pas 120 dépôts.
- Le score est une part de tests de comportement réussis, avec contrôle anti-triche. CLI, COBOL et qualité sont des diagnostics de cette source, pas trois confirmations supplémentaires.
- Les 56 erreurs standard publiées sont conservées en points. Aucune conversion en intervalle de confiance ni en égalité statistique n'est faite.
- Le champ harness est nul sur les 56 lignes. La description de l'environnement isolé vient du texte de méthode. Les dates des exécutions et les répétitions restent non publiées.
- Effort : compute_effort chez Anthropic, reasoning_effort ailleurs. 39 lignes publient une valeur, 17 n'en publient aucune. Le chiffre préparatoire de 24 absences provenait d'une lecture incomplète des champs.
- Vals est commercial et extérieur aux fabricants. La relation commerciale avec les modèles classés est not-disclosed, sans présomption de neutralité économique.

## Disponibilité et limites

Les catalogues fournisseurs ou opérateurs établissent une disponibilité documentaire. OpenRouter ne sert que de source de son propre service, jamais de benchmark. Pour Meta, les identifiants Vals avec underscores restent des alias de l'évaluateur ; les routes OpenRouter nomment Meta, sans prouver que Vals les a employées. Kimi K2.5 reste proposé par des tiers malgré son retrait direct. DeepSeek initial et 0813 ne sont pas fusionnés. NVIDIA est le fabricant de Nemotron Lightning, Fireworks son opérateur.

Ant 2607 n'a pas de correspondance exacte démontrée. Gemini 3.1 Flash Lite Preview présente une contradiction entre retrait Google et routes opérateur ; sa mesure historique reste visible, hors catalogue admissible. Les dates de sortie ou droits sur les poids non qualifiés ne sont pas inventés.

## Pièces reproductibles

- [Données et dossier des 56 disponibilités](/benchmarks/vals-2026-09.json).
- Le dépôt conserve les props sérialisées de la page Vals, indépendantes du module d'import, pour contrôler chaque score et paramètre.
- La capture HTML préparatoire porte SHA-256 54062dfeec5fa589d42653315e523913b8509e7b0866b8128b5c653ecc7e627e ; le HTML relu porte 347d4783849cf24cfe8bb37cc2eacf176d0355e7d0abeffc4304594386c72da3. Malgré des changements de page, les 56 objets overall sont strictement identiques.
- Les pièces préparatoires de disponibilité passent leurs deux manifestes SHA-256. Les liens et limites propres à chaque ligne sont conservés dans le JSON public.
- LiveBench : [CSV figé](https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv) et [identités/configurations](https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js).
- Inkling : [correspondance officielle des efforts](https://tinker-docs.thinkingmachines.ai/cookbook/inkling/thinking-effort/).
- Captures officielles OpenAI du 4 septembre 2026, format Markdown : [GPT-5.4](https://developers.openai.com/api/docs/models/gpt-5.4.md), SHA-256 1cb49c3be21fced4a7a0308aaa4ef5b0546158411c12a03d1729fbf08bc90002 ; [GPT-5.4 mini](https://developers.openai.com/api/docs/models/gpt-5.4-mini.md), SHA-256 b389a5ecdefd8480355632ddfc0268cddce7a8d804d8f8472f47b5675f53b74b. Pièces intégrales conservées dans docs/benchmarks/sources/. Elles confirment les versions déclarées par LiveBench, pas le serveur ayant traité chaque appel historique.
- L'API 1.9 expose collections.vals, les 438 observations, le manifeste nommé origin-coding-2026-09-04-v1 et son empreinte. Les correspondances de configuration sont figées avec les mesures ; une modification de réglage invalide leur preuve.

## Instruction des 56 lignes

| Identifiant Vals | Modèle du registre | Effort publié | Note Origin |
| --- | --- | --- | --- |
| openai/gpt-6-astra | astra | max (reasoning_effort) | Aucune mesure LiveBench code pour cette version dans le registre. |
| anthropic/claude-opus-5 | opus-5 | max (compute_effort) | Retenu, version nominale et effort documentés |
| anthropic/claude-fable-5 | fable-5 | max (compute_effort) | Politique de repli non documentée entre les évaluateurs. |
| anthropic/claude-fable-5-1 | fable-5-1 | max (compute_effort) | Politique de repli non documentée entre les évaluateurs. |
| openai/gpt-5.6-sol | sol | max (reasoning_effort) | Retenu, version nominale et effort documentés |
| openai/gpt-5.6-terra | terra | max (reasoning_effort) | Retenu, version nominale et effort documentés |
| anthropic/claude-opus-4-8 | claude-opus-4-8 | max (compute_effort) | Retenu, version nominale et effort documentés |
| openai/gpt-5.5 | gpt-5-5 | xhigh (reasoning_effort) | Retenu, version nominale et effort documentés |
| grok/grok-4.6 | grok-4-6 | high (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| openai/gpt-5.6-luna | luna | max (reasoning_effort) | Retenu, version nominale et effort documentés |
| anthropic/claude-sonnet-5 | claude-sonnet-5 | max (compute_effort) | Efforts différents entre Vals et LiveBench. |
| zai/glm-5.3 | glm-5-3 | max (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| anthropic/claude-opus-4-7 | claude-opus-4-7 | max (compute_effort) | Efforts différents entre Vals et LiveBench. |
| deepseek/deepseek-v4-pro-0813 | deepseek-v4-pro-0813 | max (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| anthropic/claude-sonnet-4-6 | claude-sonnet-4-6 | max (compute_effort) | Efforts différents entre Vals et LiveBench. |
| deepseek/deepseek-v4-flash-0731 | deepseek-v4-flash-0731 | high (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| zai/glm-5.2 | glm-5-2 | max (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| grok/grok-4.5 | grok-4-5 | high (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| google/gemini-3.8-flash | gemini-3-8-flash | high (reasoning_effort) | Retenu, version nominale et effort documentés |
| openai/gpt-5.4-2026-03-05 | gpt-5-4 | xhigh (reasoning_effort) | Référence, version datée et effort xhigh concordants. |
| google/gemini-3.7-flash | gemini-3-7-flash | high (reasoning_effort) | Retenu, version nominale et effort documentés |
| meta/muse_spark_1_1 | muse-spark-1-1 | xhigh (reasoning_effort) | Retenu, version nominale et effort documentés |
| google/gemini-3.6-flash | gemini-3-6-flash | high (reasoning_effort) | Retenu, version nominale et effort documentés |
| meta/muse_spark_1_2 | muse-spark-1-2 | xhigh (reasoning_effort) | Retenu, version nominale et effort documentés |
| kimi/kimi-k2.6 | kimi-k2-6 | Non publié (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| google/gemini-3.5-flash | gemini-3-5-flash | high (reasoning_effort) | Retenu, version nominale et effort documentés |
| deepseek/deepseek-v4-pro | deepseek-v4-pro | max (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| zai/glm-5.1 | glm-5-1 | Non publié (reasoning_effort) | Aucune mesure LiveBench code pour cette version dans le registre. |
| kimi/kimi-k2.7-code | kimi-k2-7-code | Non publié (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| alibaba/qwen3.8-max | qwen3-8-max | Non publié (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| xiaomi/mimo-v2.5-pro | mimo-v2-5-pro | Non publié (reasoning_effort) | Aucune mesure LiveBench code pour cette version dans le registre. |
| zai/glm-5.3-flash | glm-5-3-flash | max (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| minimax/MiniMax-M3 | minimax-m3 | Non publié (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| google/gemini-3.1-pro-preview | gemini-3-1-pro-preview | high (reasoning_effort) | Retenu, version nominale et effort documentés |
| kimi/kimi-k3 | kimi-k3 | max (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| openai/gpt-5.4-nano-2026-03-17 | gpt-5-4-nano | high (reasoning_effort) | Efforts différents entre Vals et LiveBench. |
| xiaomi/mimo-v2.5 | mimo-v2-5 | Non publié (reasoning_effort) | Aucune mesure LiveBench code pour cette version dans le registre. |
| alibaba/qwen3.8-27b | qwen3-8-27b | xhigh (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| thinkingmachines/inkling-small | inkling-small | 0.99 (reasoning_effort) | Aucune mesure LiveBench code pour cette version dans le registre. |
| alibaba/qwen3.7-max | qwen3-7-max | Non publié (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| openai/gpt-5.4-mini-2026-03-17 | gpt-5-4-mini | xhigh (reasoning_effort) | Référence, version datée et effort xhigh concordants. |
| alibaba/qwen3.7-plus | qwen3-7-plus | Non publié (reasoning_effort) | Aucune mesure LiveBench code pour cette version dans le registre. |
| thinkingmachines/inkling | inkling | 0.99 (reasoning_effort) | Retenu, version nominale et effort documentés |
| alibaba/qwen3.6-plus | qwen3-6-plus | Non publié (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| minimax/MiniMax-M2.7 | minimax-m2-7 | Non publié (reasoning_effort) | Aucune mesure LiveBench code pour cette version dans le registre. |
| anthropic/claude-haiku-4-5-20251001-thinking | claude-haiku-4-5 | Non publié (compute_effort) | Aucune mesure LiveBench code pour cette version dans le registre. |
| kimi/kimi-k2.5-thinking | kimi-k2-5 | Non publié (reasoning_effort) | Aucune mesure LiveBench code pour cette version dans le registre. |
| grok/grok-4.3 | grok-4-3 | high (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| google/gemini-3-flash-preview | gemini-3-flash-preview | high (reasoning_effort) | Aucune mesure LiveBench code pour cette version dans le registre. |
| google/gemini-3.5-flash-lite | gemini-3-5-flash-lite | high (reasoning_effort) | Retenu, version nominale et effort documentés |
| mistralai/mistral-medium-3.5 | mistral-medium-3-5 | high (reasoning_effort) | Aucune mesure LiveBench code pour cette version dans le registre. |
| nvidia/nemotron-3-ultra-550b-a55b | nemotron-3-ultra | Non publié (reasoning_effort) | Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. |
| google/gemini-3.1-flash-lite-preview | gemini-3-1-flash-lite-preview | high (reasoning_effort) | Disponibilité de cette version non vérifiée ; mesure historique conservée. |
| fireworks/nemotron-lightning-3p5-30b-a3b | nemotron-lightning-3-5 | Non publié (reasoning_effort) | Aucune mesure LiveBench code pour cette version dans le registre. |
| grok/grok-4.20-0309-reasoning | grok-4-20-0309-reasoning | Non publié (reasoning_effort) | Aucune mesure LiveBench code pour cette version dans le registre. |
| ant/ling-3.0-flash-2607 | ling-3-0-flash-2607 | Non publié (reasoning_effort) | Disponibilité de cette version non vérifiée ; mesure historique conservée. |
