{"version":"1.9","updatedAt":"2026-09-04","method":{"established":"Au moins trois organismes indépendants couvrant chacun cinq modèles du panel ; chaque modèle doit avoir trois confirmations parmi eux, avant pénalité pour égalité ou fourchettes recouvrantes. Les petites sources restent descriptives.","provisional":"Un résultat réel existe, mais le domaine reste sous le seuil de trois sources ou cinq modèles communs.","insufficient":"Aucun test indépendant vérifié dans le registre.","deduplication":"Un indice composite ou deux réglages sur les mêmes tâches ne comptent qu’une fois.","grading":"Les étiquettes A, B et C sont calculées à partir de critères publics. Aucun coefficient de qualité n’est appliqué.","sourceIndependence":"Niveau 1 : recherche, université ou institut public. Niveau 2 : évaluateur commercial qui ne fabrique pas de modèle. Niveau 3 : fabricant de modèles.","resultOrigin":"Le niveau décrit l’organisme, pas l’opérateur de chaque exécution. Une origine non vérifiée reste visible, hors calcul ; une soumission acceptée ne prouve pas un contrôle de l’équipe. Aucun statut fabricant ou partenaire n’en est déduit.","declaredSupport":"Les soutiens déclarés sont des faits sourcés et datés, sans poids ni effet sur les scores. « not-disclosed » signifie aucun contrat commercial décrit par la source, pas absence certaine de relation.","coverage":"Chaque source déclare le nombre d’entrées publiées et retenues, ou indique que la couverture n’a pas encore été évaluée. Une couverture partielle exige un motif.","vitality":"Une source active peut être comptée. Une source en pause, en maintenance ou abandonnée reste dans le registre et demeure non comptée.","rankAggregation":"Dans chaque domaine, chaque source classe les modèles. Origin combine uniquement leurs rangs, jamais leurs scores bruts.","concordance":"Kendall W mesure la proximité des classements. La valeur et sa fourchette sont publiées sans seuil automatique.","normalizedScore":"La note sur 100 indique une position relative, jamais un taux de réussite. Elle utilise une référence figée, une observation choisie par modèle et par test, les mêmes tests pour tous les modèles, et au moins deux équipes indépendantes identifiées sans doublon. Le meilleur seul vaut 100. Les exclusions et leurs motifs restent visibles."},"models":[{"id":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","announcement":{"url":"https://openai.com/index/safety-overview-gpt-6-astra/","publishedAt":"2026-09-03","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","accessedAt":"2026-09-04"},"reading":"Deux signaux extérieurs sont prometteurs, mais ils mesurent des capacités différentes. Un test métier reste nécessaire.","independentSourceCount":5},{"id":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","announcement":{"url":"https://www.anthropic.com/claude-fable-and-mythos-5-1","publishedAt":"2026-09-01","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","accessedAt":"2026-09-04"},"reading":"Très bon point de comparaison pour le raisonnement, le développement logiciel et le travail professionnel.","independentSourceCount":6},{"id":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","announcement":{"url":"https://www.anthropic.com/news/claude-fable-5-mythos-5","publishedAt":"2026-06-09","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","accessedAt":"2026-09-04"},"reading":"Présent dans les deux premières sources publiques retenues pour le développement logiciel.","independentSourceCount":4},{"id":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","announcement":{"url":"https://www.anthropic.com/news/claude-opus-5","publishedAt":"2026-07-24","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://www.anthropic.com/news/claude-opus-5","accessedAt":"2026-09-04"},"reading":"Présent dans les deux premières sources publiques retenues pour le développement logiciel.","independentSourceCount":4},{"id":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","announcement":{"url":"https://openai.com/index/gpt-5-6/","publishedAt":"2026-07-09","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://openai.com/index/gpt-5-6/","accessedAt":"2026-09-04"},"reading":"Point de comparaison direct pour mesurer le progrès réel depuis la génération précédente.","independentSourceCount":6},{"id":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","announcement":{"url":"https://www.minimax.io/blog/minimax-m25","publishedAt":"2026-02-12","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://www.minimax.io/models/text","accessedAt":"2026-09-04"},"reading":"Une mesure extérieure est disponible pour la réparation de bugs dans un dépôt. Une seconde équipe doit encore la confirmer.","independentSourceCount":0},{"id":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","announcement":{"url":"https://www.anthropic.com/news/claude-opus-4-6","publishedAt":"2026-02-05","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","accessedAt":"2026-09-04"},"reading":"Une mesure extérieure est disponible pour la réparation de bugs dans un dépôt. Une seconde équipe doit encore la confirmer.","independentSourceCount":1},{"id":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","announcement":{"url":"https://docs.z.ai/release-notes/new-released","publishedAt":"2026-02-12","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://docs.z.ai/guides/llm/glm-5","accessedAt":"2026-09-04"},"reading":"Une mesure extérieure est disponible pour la réparation de bugs dans un dépôt. Une seconde équipe doit encore la confirmer.","independentSourceCount":0},{"id":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","announcement":{"url":"https://www.kimi.com/en/blog/kimi-k2-5","publishedAt":"2026-01-27","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","accessedAt":"2026-09-04"},"reading":"Une mesure extérieure est disponible pour la réparation de bugs dans un dépôt. Une seconde équipe doit encore la confirmer.","independentSourceCount":1},{"id":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","announcement":{"url":"https://www.anthropic.com/news/claude-opus-4-7","publishedAt":"2026-04-16","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","announcement":{"url":"https://www.anthropic.com/news/claude-sonnet-4-6","publishedAt":"2026-02-17","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","announcement":{"url":"https://www.anthropic.com/news/claude-sonnet-5","publishedAt":"2026-06-30","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":3},{"id":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","announcement":{"url":"https://api-docs.deepseek.com/updates/","publishedAt":"2026-04-24","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":1},{"id":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","announcement":{"url":"https://api-docs.deepseek.com/updates/","publishedAt":"2026-04-24","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","announcement":{"url":"https://ai.google.dev/gemini-api/docs/deprecations","publishedAt":"2026-02-19","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","announcement":{"url":"https://ai.google.dev/gemini-api/docs/deprecations","publishedAt":"2026-05-19","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","announcement":{"url":"https://huggingface.co/blog/zai-org/glm-52-blog","publishedAt":"2026-06-17","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/zai-org/GLM-5.2","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","announcement":{"url":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","publishedAt":"2026-03-17","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","announcement":{"url":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","publishedAt":"2026-03-17","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","announcement":{"url":"https://openai.com/index/introducing-gpt-5-4/","publishedAt":"2026-03-05","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://openai.com/index/introducing-gpt-5-4/","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","announcement":{"url":"https://platform.openai.com/docs/models/gpt-5.5","publishedAt":"2026-04-23","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","announcement":{"url":"https://docs.x.ai/developers/migration/may-15-retirement","publishedAt":"2026-05-15","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","announcement":{"url":"https://docs.x.ai/developers/release-notes","publishedAt":"2026-07-08","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://docs.x.ai/developers/release-notes","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":3},{"id":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","announcement":{"url":"https://docs.x.ai/developers/release-notes","publishedAt":"2026-05-19","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://docs.x.ai/developers/release-notes","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":1},{"id":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","announcement":{"url":"https://www.kimi.com/en/help/agent/agent-overview","publishedAt":"2026-04-20","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","announcement":{"url":"https://www.kimi.com/code/docs/en/kimi-code/whats-new.html","publishedAt":"2026-06-12","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","announcement":{"url":"https://www.minimax.io/blog/minimax-m3","publishedAt":"2026-06-01","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://www.minimax.io/blog/minimax-m3","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","announcement":{"url":"https://qwen.ai/blog?id=qwen3.6-27b","publishedAt":"2026-04-21","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":1},{"id":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","announcement":{"url":"https://qwen.ai/blog?id=qwen3.6/","publishedAt":"2026-04-02","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://qwen.ai/blog?id=qwen3.6/","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","announcement":{"url":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","publishedAt":"2026-06-08","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","announcement":{"url":"https://openai.com/index/gpt-5-6/","publishedAt":"2026-07-09","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://openai.com/index/gpt-5-6/","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":3},{"id":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","announcement":{"url":"https://openai.com/index/gpt-5-6/","publishedAt":"2026-07-09","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://openai.com/index/gpt-5-6/","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":3},{"id":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","announcement":{"url":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","publishedAt":"2026-07-09","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","announcement":{"url":"https://www.kimi.com/en/blog/kimi-k3","publishedAt":"2026-07-16","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","announcement":{"url":"https://thinkingmachines.ai/news/introducing-inkling/","publishedAt":"2026-07-15","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/thinkingmachines/Inkling","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","announcement":{"url":"https://ai.google.dev/gemini-api/docs/deprecations","publishedAt":"2026-07-21","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","announcement":{"url":"https://ai.google.dev/gemini-api/docs/deprecations","publishedAt":"2026-07-21","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","announcement":{"url":"https://www.anthropic.com/news/claude-opus-4-8","publishedAt":"2026-05-28","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":3},{"id":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","announcement":{"url":"https://api-docs.deepseek.com/updates/","publishedAt":"2026-07-31","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","announcement":{"url":"https://qwen.ai/blog?id=qwen3.8","publishedAt":"2026-08-02","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","announcement":{"url":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","publishedAt":"2026-08-05","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","announcement":{"url":"https://huggingface.co/abacusai/Smaug-Agentic","publishedAt":"2026-08-10","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":1},{"id":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","announcement":{"url":"https://api-docs.deepseek.com/updates/","publishedAt":"2026-08-13","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","announcement":{"url":"https://x.ai/news/grok-4-6","publishedAt":"2026-08-12","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://x.ai/news/grok-4-6","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":3},{"id":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","announcement":{"url":"https://ai.google.dev/gemini-api/docs/deprecations","publishedAt":"2026-08-13","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":3},{"id":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","announcement":{"url":"https://github.com/QwenLM/Qwen3.8","publishedAt":"2026-08-14","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","announcement":{"url":"https://api-docs.deepseek.com/updates/","publishedAt":"2026-08-21","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":1},{"id":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","announcement":{"url":"https://zcode.z.ai/en/changelog","publishedAt":"2026-08-14","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/zai-org/GLM-5.3","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":3},{"id":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","announcement":{"url":"https://zcode.z.ai/en/changelog","publishedAt":"2026-08-26","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","announcement":{"url":"https://qwen.ai/blog?id=qwen3.8-flash-next","publishedAt":"2026-08-26","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":1},{"id":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","announcement":{"url":"https://research.nvidia.com/labs/nemotron/files/NVIDIA-Nemotron-3-Ultra-Technical-Report.pdf","publishedAt":"2026-06-04","accessedAt":"2026-09-04"},"weights":{"availability":"open","sourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":2},{"id":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","announcement":{"url":"https://ai.google.dev/gemini-api/docs/deprecations","publishedAt":"2026-09-02","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":3},{"id":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","announcement":{"url":"https://research.meta.ai/blog/introducing-muse-spark-1-3","publishedAt":"2026-09-02","accessedAt":"2026-09-04"},"weights":{"availability":"closed","sourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","accessedAt":"2026-09-04"},"reading":"LiveBench publie des résultats séparés dans sept capacités. Une autre équipe doit encore les confirmer.","independentSourceCount":1},{"id":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"not-published","announcement":{"url":"https://docs.z.ai/guides/llm/glm-5.1","publishedAt":"not-published","accessedAt":"2026-09-04"},"weights":{"availability":"not-published","sourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","accessedAt":"2026-09-04"},"availability":{"status":"documented","checkedAt":"2026-09-04","sourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","limitation":"Aucune mesure LiveBench code pour cette version dans le registre."},"reading":"Mesure Vals publiée. Date exacte de sortie et accès aux poids non qualifiés dans ce registre.","independentSourceCount":1},{"id":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"not-published","announcement":{"url":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","publishedAt":"not-published","accessedAt":"2026-09-04"},"weights":{"availability":"not-published","sourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","accessedAt":"2026-09-04"},"availability":{"status":"documented","checkedAt":"2026-09-04","sourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","limitation":"Aucune mesure LiveBench code pour cette version dans le registre."},"reading":"Mesure Vals publiée. Date exacte de sortie et accès aux poids non qualifiés dans ce registre.","independentSourceCount":1},{"id":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"not-published","announcement":{"url":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","publishedAt":"not-published","accessedAt":"2026-09-04"},"weights":{"availability":"not-published","sourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","accessedAt":"2026-09-04"},"availability":{"status":"documented","checkedAt":"2026-09-04","sourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","limitation":"Aucune mesure LiveBench code pour cette version dans le registre."},"reading":"Mesure Vals publiée. Date exacte de sortie et accès aux poids non qualifiés dans ce registre.","independentSourceCount":1},{"id":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"not-published","announcement":{"url":"https://tinker-docs.thinkingmachines.ai/tinker/models/","publishedAt":"not-published","accessedAt":"2026-09-04"},"weights":{"availability":"not-published","sourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","accessedAt":"2026-09-04"},"availability":{"status":"documented","checkedAt":"2026-09-04","sourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","limitation":"Aucune mesure LiveBench code pour cette version dans le registre."},"reading":"Mesure Vals publiée. Date exacte de sortie et accès aux poids non qualifiés dans ce registre.","independentSourceCount":1},{"id":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"not-published","announcement":{"url":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","publishedAt":"not-published","accessedAt":"2026-09-04"},"weights":{"availability":"not-published","sourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","accessedAt":"2026-09-04"},"availability":{"status":"documented","checkedAt":"2026-09-04","sourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","limitation":"Aucune mesure LiveBench code pour cette version dans le registre."},"reading":"Mesure Vals publiée. Date exacte de sortie et accès aux poids non qualifiés dans ce registre.","independentSourceCount":1},{"id":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"not-published","announcement":{"url":"https://platform.minimax.io/docs/guides/models-intro","publishedAt":"not-published","accessedAt":"2026-09-04"},"weights":{"availability":"not-published","sourceUrl":"https://platform.minimax.io/docs/guides/models-intro","accessedAt":"2026-09-04"},"availability":{"status":"documented","checkedAt":"2026-09-04","sourceUrl":"https://platform.minimax.io/docs/guides/models-intro","limitation":"Aucune mesure LiveBench code pour cette version dans le registre."},"reading":"Mesure Vals publiée. Date exacte de sortie et accès aux poids non qualifiés dans ce registre.","independentSourceCount":1},{"id":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"not-published","announcement":{"url":"https://platform.claude.com/docs/en/about-claude/model-deprecations","publishedAt":"not-published","accessedAt":"2026-09-04"},"weights":{"availability":"not-published","sourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","accessedAt":"2026-09-04"},"availability":{"status":"documented","checkedAt":"2026-09-04","sourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","limitation":"Aucune mesure LiveBench code pour cette version dans le registre."},"reading":"Mesure Vals publiée. Date exacte de sortie et accès aux poids non qualifiés dans ce registre.","independentSourceCount":1},{"id":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"not-published","announcement":{"url":"https://ai.google.dev/gemini-api/docs/deprecations","publishedAt":"not-published","accessedAt":"2026-09-04"},"weights":{"availability":"not-published","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","accessedAt":"2026-09-04"},"availability":{"status":"documented","checkedAt":"2026-09-04","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","limitation":"Aucune mesure LiveBench code pour cette version dans le registre."},"reading":"Mesure Vals publiée. Date exacte de sortie et accès aux poids non qualifiés dans ce registre.","independentSourceCount":1},{"id":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"not-published","announcement":{"url":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","publishedAt":"not-published","accessedAt":"2026-09-04"},"weights":{"availability":"not-published","sourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","accessedAt":"2026-09-04"},"availability":{"status":"documented","checkedAt":"2026-09-04","sourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","limitation":"Aucune mesure LiveBench code pour cette version dans le registre."},"reading":"Mesure Vals publiée. Date exacte de sortie et accès aux poids non qualifiés dans ce registre.","independentSourceCount":1},{"id":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"not-published","announcement":{"url":"https://ai.google.dev/gemini-api/docs/deprecations","publishedAt":"not-published","accessedAt":"2026-09-04"},"weights":{"availability":"not-published","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","accessedAt":"2026-09-04"},"availability":{"status":"unverified","checkedAt":"2026-09-04","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","limitation":"Disponibilité de cette version non vérifiée ; mesure historique conservée."},"reading":"Mesure Vals publiée. Date exacte de sortie et accès aux poids non qualifiés dans ce registre.","independentSourceCount":1},{"id":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"not-published","announcement":{"url":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","publishedAt":"not-published","accessedAt":"2026-09-04"},"weights":{"availability":"not-published","sourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","accessedAt":"2026-09-04"},"availability":{"status":"documented","checkedAt":"2026-09-04","sourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","limitation":"Aucune mesure LiveBench code pour cette version dans le registre."},"reading":"Mesure Vals publiée. Date exacte de sortie et accès aux poids non qualifiés dans ce registre.","independentSourceCount":1},{"id":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"not-published","announcement":{"url":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","publishedAt":"not-published","accessedAt":"2026-09-04"},"weights":{"availability":"not-published","sourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","accessedAt":"2026-09-04"},"availability":{"status":"documented","checkedAt":"2026-09-04","sourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","limitation":"Aucune mesure LiveBench code pour cette version dans le registre."},"reading":"Mesure Vals publiée. Date exacte de sortie et accès aux poids non qualifiés dans ce registre.","independentSourceCount":1},{"id":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"not-published","announcement":{"url":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","publishedAt":"not-published","accessedAt":"2026-09-04"},"weights":{"availability":"not-published","sourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","accessedAt":"2026-09-04"},"availability":{"status":"unverified","checkedAt":"2026-09-04","sourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","limitation":"Disponibilité de cette version non vérifiée ; mesure historique conservée."},"reading":"Mesure Vals publiée. Date exacte de sortie et accès aux poids non qualifiés dans ce registre.","independentSourceCount":1}],"domains":[{"id":"general","label":"Raisonnement général","question":"Résout-il des problèmes variés, au-delà d’un domaine unique ?"},{"id":"agentic","label":"Missions longues","question":"Mène-t-il une mission longue avec outils, mémoire et décisions intermédiaires ?"},{"id":"coding","label":"Développement logiciel","question":"Comprend-il, modifie-t-il et reconstruit-il du logiciel vérifiable ?"},{"id":"legal","label":"Juridique","question":"Produit-il un travail juridique professionnel exact et exploitable ?"},{"id":"finance","label":"Finance et comptabilité","question":"Analyse-t-il et construit-il des livrables financiers fiables ?"},{"id":"healthcare","label":"Santé","question":"Raisonne-t-il correctement sur des tâches médicales professionnelles ?"},{"id":"mathScience","label":"Maths et sciences","question":"Résout-il des problèmes scientifiques difficiles avec une vérification forte ?"},{"id":"computerUse","label":"Usage d’ordinateur","question":"Utilise-t-il plusieurs logiciels pour terminer une mission réelle ?"},{"id":"longContext","label":"Contexte long","question":"Retrouve-t-il et relie-t-il correctement des faits dans de gros corpus ?"},{"id":"factuality","label":"Exactitude factuelle","question":"Répond-il juste sans inventer quand il ne sait pas ?"},{"id":"vision","label":"Vision","question":"Comprend-il des images, captures et documents visuels ?"},{"id":"voice","label":"Voix","question":"Comprend-il et conduit-il une interaction vocale fiable ?"},{"id":"education","label":"Éducation","question":"Explique-t-il, diagnostique-t-il et adapte-t-il un tutorat ?"},{"id":"cybersecurity","label":"Cybersécurité","question":"Identifie-t-il et exploite-t-il des vulnérabilités dans un cadre contrôlé ?"},{"id":"efficiency","label":"Efficacité","question":"Quel résultat obtient-il pour un coût, un temps et un volume de calcul donnés ?"}],"dependencyNodes":[{"id":"swe-bench-verified-2026-02","label":"SWE-bench Verified, cohorte mini-SWE-agent 2.0.0 de février 2026","sourceUrl":"https://github.com/SWE-bench/experiments/tree/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified"},{"id":"terminal-bench-family","label":"Famille Terminal-Bench, versions 2.1 et 4.0","sourceUrl":"https://github.com/harbor-framework/terminal-bench"},{"id":"terminal-bench-v2-1","label":"Terminal-Bench v2.1","sourceUrl":"https://www.tbench.ai/"},{"id":"terminal-bench-v4-0","label":"Terminal-Bench 4.0","sourceUrl":"https://github.com/harbor-framework/terminal-bench/tree/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions"},{"id":"aa-omniscience","label":"AA-Omniscience","sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra"},{"id":"aa-lcr","label":"AA-LCR","sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra"},{"id":"deepswe","label":"DeepSWE","sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra"},{"id":"swe-atlas-qna","label":"SWE-Atlas-QnA","sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra"},{"id":"multiple-upstream-benchmarks","label":"Plus de 50 tests repris par Epoch","sourceUrl":"https://epoch.ai/benchmarks/eci"},{"id":"apex-legal","label":"APEX-Agents Corporate Lawyer","sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/"},{"id":"apex-finance","label":"APEX-Agents Investment Banking Analyst","sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/investment-banking-analyst-agent/"},{"id":"apex-consulting","label":"APEX-Agents Management Consultant","sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/management-consultant-agent/"}],"sources":[{"id":"aa-intelligence-v4-1-1","organization":"Artificial Analysis","independenceLevel":2,"resultOrigin":"evaluator-run","commercialRelationshipWithRankedLabs":"not-disclosed","coverage":{"status":"not-assessed","publishedEntries":"not-assessed","includedEntries":3,"reason":"La couverture complète du classement n’a pas été relevée dans le corpus actuel."},"vitality":{"status":"active","checkedAt":"2026-09-04"},"context":""},{"id":"aa-coding-agent-v1-4","organization":"Artificial Analysis","independenceLevel":2,"resultOrigin":"evaluator-run","commercialRelationshipWithRankedLabs":"not-disclosed","coverage":{"status":"partial","publishedEntries":6,"includedEntries":5,"reason":"Muse Spark 1.3 n’est pas encore dans le panel actuel."},"vitality":{"status":"active","checkedAt":"2026-09-04"},"context":""},{"id":"terminal-bench-v4-0","organization":"Terminal-Bench","independenceLevel":1,"resultOrigin":"evaluator-run","resultOriginEvidence":{"description":"Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source.","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/SUBMIT.md","accessedAt":"2026-09-05"},"commercialRelationshipWithRankedLabs":"not-disclosed","declaredSupport":[{"party":"Harbor","role":"hébergement","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md","accessedAt":"2026-09-05"},{"party":"Laude Institute","role":"hébergement","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md","accessedAt":"2026-09-05"},{"party":"Modal","role":"sponsor de calcul","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md","accessedAt":"2026-09-05"},{"party":"Anthropic","role":"sponsor de calcul","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md","accessedAt":"2026-09-05"},{"party":"OpenAI","role":"sponsor de calcul","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md","accessedAt":"2026-09-05"},{"party":"Google","role":"sponsor de calcul","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md","accessedAt":"2026-09-05"},{"party":"ScaleAI","role":"partenaire de données","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md","accessedAt":"2026-09-05"},{"party":"Snorkel Open Benchmarks","role":"partenaire de données","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md","accessedAt":"2026-09-05"},{"party":"Turing","role":"partenaire de données","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md","accessedAt":"2026-09-05"},{"party":"gNucleus AI","role":"partenaire de données","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md","accessedAt":"2026-09-05"},{"party":"Boolean AI","role":"partenaire de données","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md","accessedAt":"2026-09-05"},{"party":"Ellamind","role":"partenaire de données","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md","accessedAt":"2026-09-05"}],"coverage":{"status":"complete","publishedEntries":13,"includedEntries":13,"reason":null},"vitality":{"status":"active","checkedAt":"2026-09-04"},"context":"Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score."},{"id":"swe-bench-verified-2026","organization":"SWE-bench","independenceLevel":1,"resultOrigin":"unverified","resultOriginEvidence":{"description":"Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test.","sourceUrl":"https://github.com/SWE-bench/experiments/pull/413","accessedAt":"2026-09-05"},"commercialRelationshipWithRankedLabs":"not-disclosed","declaredSupport":[{"party":"Open Philanthropy","role":"soutien déclaré","sourceUrl":"https://www.swebench.com/","accessedAt":"2026-09-05"},{"party":"AWS","role":"soutien déclaré","sourceUrl":"https://www.swebench.com/","accessedAt":"2026-09-05"},{"party":"Modal","role":"soutien déclaré","sourceUrl":"https://www.swebench.com/","accessedAt":"2026-09-05"},{"party":"Andreessen Horowitz","role":"soutien déclaré","sourceUrl":"https://www.swebench.com/","accessedAt":"2026-09-05"},{"party":"OpenAI","role":"soutien déclaré","sourceUrl":"https://www.swebench.com/","accessedAt":"2026-09-05"},{"party":"Anthropic","role":"soutien déclaré","sourceUrl":"https://www.swebench.com/","accessedAt":"2026-09-05"}],"coverage":{"status":"partial","publishedEntries":13,"includedEntries":4,"reason":"4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin."},"vitality":{"status":"active","checkedAt":"2026-09-04"},"context":"Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score."},{"id":"epoch-eci-2026-09","organization":"Epoch AI","independenceLevel":1,"resultOrigin":"mixed","commercialRelationshipWithRankedLabs":"no","coverage":{"status":"not-assessed","publishedEntries":"not-assessed","includedEntries":3,"reason":"La couverture complète du classement n’a pas été relevée dans le corpus actuel."},"vitality":{"status":"active","checkedAt":"2026-09-04"},"context":""},{"id":"arc-agi-3","organization":"ARC Prize","independenceLevel":1,"resultOrigin":"evaluator-run","commercialRelationshipWithRankedLabs":"no","coverage":{"status":"not-assessed","publishedEntries":"not-assessed","includedEntries":1,"reason":"Cette page ne constitue pas un classement de marché complet."},"vitality":{"status":"active","checkedAt":"2026-09-04"},"context":""},{"id":"mercor-apex-agents","organization":"Mercor","independenceLevel":2,"resultOrigin":"evaluator-run","commercialRelationshipWithRankedLabs":"yes","coverage":{"status":"not-assessed","publishedEntries":"not-assessed","includedEntries":2,"reason":"La couverture complète du classement n’a pas été relevée dans le corpus actuel."},"vitality":{"status":"active","checkedAt":"2026-09-04"},"context":""},{"id":"mercor-apex-legal","organization":"Mercor","independenceLevel":2,"resultOrigin":"evaluator-run","commercialRelationshipWithRankedLabs":"yes","coverage":{"status":"not-assessed","publishedEntries":"not-assessed","includedEntries":3,"reason":"La couverture complète du classement n’a pas été relevée dans le corpus actuel."},"vitality":{"status":"active","checkedAt":"2026-09-04"},"context":""},{"id":"mercor-apex-finance","organization":"Mercor","independenceLevel":2,"resultOrigin":"evaluator-run","commercialRelationshipWithRankedLabs":"yes","coverage":{"status":"not-assessed","publishedEntries":"not-assessed","includedEntries":3,"reason":"La couverture complète du classement n’a pas été relevée dans le corpus actuel."},"vitality":{"status":"active","checkedAt":"2026-09-04"},"context":""},{"id":"epoch-frontiermath-erdos","organization":"Epoch AI","independenceLevel":1,"resultOrigin":"evaluator-run","commercialRelationshipWithRankedLabs":"no","coverage":{"status":"not-assessed","publishedEntries":"not-assessed","includedEntries":3,"reason":"La couverture complète du classement n’a pas été relevée dans le corpus actuel."},"vitality":{"status":"active","checkedAt":"2026-09-04"},"context":""},{"id":"openai-healthbench-professional","organization":"OpenAI","independenceLevel":3,"resultOrigin":"manufacturer-reported","commercialRelationshipWithRankedLabs":"not-applicable","coverage":{"status":"not-assessed","publishedEntries":"not-assessed","includedEntries":2,"reason":"La couverture complète du tableau fabricant n’a pas été relevée dans le corpus actuel."},"vitality":{"status":"active","checkedAt":"2026-09-04"},"context":""},{"id":"aa-omniscience-2026-09","organization":"Artificial Analysis","independenceLevel":2,"resultOrigin":"evaluator-run","commercialRelationshipWithRankedLabs":"not-disclosed","coverage":{"status":"not-assessed","publishedEntries":"not-assessed","includedEntries":2,"reason":"La couverture complète du classement n’a pas été relevée dans le corpus actuel."},"vitality":{"status":"active","checkedAt":"2026-09-04"},"context":""},{"id":"livebench-2026-06-25","organization":"LiveBench","independenceLevel":1,"resultOrigin":"evaluator-run","commercialRelationshipWithRankedLabs":"no","coverage":{"status":"partial","publishedEntries":53,"includedEntries":49,"reason":"Trois entrées portent sur des modèles sortis en 2025. Une entrée anonyme ne possède pas d’annonce fabricant datée."},"vitality":{"status":"active","checkedAt":"2026-09-04"},"context":""},{"id":"vals-code-migration-v1-2026-09-03","organization":"Vals AI","organizationId":"vals-ai","independenceLevel":2,"resultOrigin":"evaluator-run","commercialRelationshipWithRankedLabs":"not-disclosed","coverage":{"status":"complete","publishedEntries":56,"includedEntries":56,"reason":null},"vitality":{"status":"active","checkedAt":"2026-09-04"},"context":""}],"collections":{"vals":{"sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","publishedAt":"2026-09-03","publishedEntries":56,"includedEntries":56,"missingEffortEntries":17,"mapping":[{"rawId":"openai/gpt-6-astra","modelId":"astra","effortField":"reasoning_effort","rawEffort":"max","effortState":"published","referenceEffort":null,"exclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://developers.openai.com/api/docs/models/gpt-6-astra","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"openai/gpt-6-astra","checked_at":"2026-09-04","vals_provider":"OpenAI","vals_reasoning_effort":"max","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"gpt-6-astra","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://developers.openai.com/api/docs/models/gpt-6-astra","additional_source_url":"","evidence":"Exact alias/snapshot currently listed with API support and tiers.","configuration_limit":"Nano high and Astra max preserved; Nano LiveBench xhigh mismatch not repaired by availability.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-openai-astra.html"}},{"rawId":"anthropic/claude-opus-5","modelId":"opus-5","effortField":"compute_effort","rawEffort":"max","effortState":"published","referenceEffort":"max","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"livebench_raw":"claude-opus-5-max-effort","vals_raw":"anthropic/claude-opus-5","effort":"max","checked_at":"2026-09-04","availability":"DOCUMENTED_AVAILABLE","availability_route":"direct_provider","provider_api_id":"claude-opus-5","operator_api_id":"","snapshot_or_alias":"exact currently active API ID","availability_source":"https://platform.claude.com/docs/en/about-claude/model-deprecations","effort_source":"https://platform.claude.com/docs/en/build-with-claude/effort","evidence":"Active; retirement not before 2027-07-24; max explicitly supported","limitations":"Max is explicit; default high is not equivalent. Vals compute_effort is an evaluator-library field","weights_license":"not_documented_in_consulted_sources; hosted_API"}},{"rawId":"anthropic/claude-fable-5","modelId":"fable-5","effortField":"compute_effort","rawEffort":"max","effortState":"published","referenceEffort":null,"exclusion":"Politique de repli non documentée entre les évaluateurs.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"anthropic/claude-fable-5","checked_at":"2026-09-04","vals_provider":"Anthropic","vals_reasoning_effort":"","vals_compute_effort":"max","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"claude-fable-5","operator_api_id":"","snapshot_or_alias":"","retirement_date":"2027-06-09","retirement_kind":"not_sooner_than_NOT_announced_shutdown","source_url":"https://platform.claude.com/docs/en/about-claude/model-deprecations","additional_source_url":"https://platform.claude.com/docs/en/build-with-claude/effort","evidence":"Exact native model ID Active in provider lifecycle table.","configuration_limit":"Model available; Vals max does not resolve LiveBench fallback. Keep excluded from cross-source reference until fallback reconciliation.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"anthropic-deprecations-web.txt"}},{"rawId":"anthropic/claude-fable-5-1","modelId":"fable-5-1","effortField":"compute_effort","rawEffort":"max","effortState":"published","referenceEffort":null,"exclusion":"Politique de repli non documentée entre les évaluateurs.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"anthropic/claude-fable-5-1","checked_at":"2026-09-04","vals_provider":"Anthropic","vals_reasoning_effort":"","vals_compute_effort":"max","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"claude-fable-5-1","operator_api_id":"","snapshot_or_alias":"","retirement_date":"2027-09-01","retirement_kind":"not_sooner_than_NOT_announced_shutdown","source_url":"https://platform.claude.com/docs/en/about-claude/model-deprecations","additional_source_url":"https://platform.claude.com/docs/en/build-with-claude/effort","evidence":"Exact native model ID Active in provider lifecycle table.","configuration_limit":"Model available; Vals max does not resolve LiveBench fallback. Keep excluded from cross-source reference until fallback reconciliation.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"anthropic-deprecations-web.txt"}},{"rawId":"openai/gpt-5.6-sol","modelId":"sol","effortField":"reasoning_effort","rawEffort":"max","effortState":"published","referenceEffort":"max","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://developers.openai.com/api/docs/models","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"livebench_raw":"gpt-5.6-sol-max","vals_raw":"openai/gpt-5.6-sol","effort":"max","checked_at":"2026-09-04","availability":"DOCUMENTED_AVAILABLE","availability_route":"direct_provider","provider_api_id":"gpt-5.6-sol","operator_api_id":"","snapshot_or_alias":"gpt-5.6-sol; gpt-5.6 is documented alias","availability_source":"https://developers.openai.com/api/docs/models","effort_source":"https://developers.openai.com/api/docs/models","evidence":"Currently available model/snapshot listed; requested effort explicitly supported","limitations":"Named version and effort concordant; exact historical backend not established. Catalog evidence, no paid API inference","weights_license":"not_documented_in_consulted_sources; hosted_API"}},{"rawId":"openai/gpt-5.6-terra","modelId":"terra","effortField":"reasoning_effort","rawEffort":"max","effortState":"published","referenceEffort":"max","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://developers.openai.com/api/docs/models","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"livebench_raw":"gpt-5.6-terra-max","vals_raw":"openai/gpt-5.6-terra","effort":"max","checked_at":"2026-09-04","availability":"DOCUMENTED_AVAILABLE","availability_route":"direct_provider","provider_api_id":"gpt-5.6-terra","operator_api_id":"","snapshot_or_alias":"gpt-5.6-terra","availability_source":"https://developers.openai.com/api/docs/models","effort_source":"https://developers.openai.com/api/docs/models","evidence":"Currently available model/snapshot listed; requested effort explicitly supported","limitations":"Named version and effort concordant; exact historical backend not established. Catalog evidence, no paid API inference","weights_license":"not_documented_in_consulted_sources; hosted_API"}},{"rawId":"anthropic/claude-opus-4-8","modelId":"claude-opus-4-8","effortField":"compute_effort","rawEffort":"max","effortState":"published","referenceEffort":"max","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"livebench_raw":"claude-opus-4-8-max-effort","vals_raw":"anthropic/claude-opus-4-8","effort":"max","checked_at":"2026-09-04","availability":"DOCUMENTED_AVAILABLE","availability_route":"direct_provider","provider_api_id":"claude-opus-4-8","operator_api_id":"","snapshot_or_alias":"exact currently active API ID","availability_source":"https://platform.claude.com/docs/en/about-claude/model-deprecations","effort_source":"https://platform.claude.com/docs/en/build-with-claude/effort","evidence":"Active; retirement not before 2027-05-28; max explicitly supported","limitations":"Max is explicit; default high is not equivalent. Vals compute_effort is an evaluator-library field","weights_license":"not_documented_in_consulted_sources; hosted_API"}},{"rawId":"openai/gpt-5.5","modelId":"gpt-5-5","effortField":"reasoning_effort","rawEffort":"xhigh","effortState":"published","referenceEffort":"xhigh","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://developers.openai.com/api/docs/models/gpt-5.5","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"livebench_raw":"gpt-5.5-xhigh","vals_raw":"openai/gpt-5.5","effort":"xhigh","checked_at":"2026-09-04","availability":"DOCUMENTED_AVAILABLE","availability_route":"direct_provider","provider_api_id":"gpt-5.5","operator_api_id":"","snapshot_or_alias":"gpt-5.5-2026-04-23","availability_source":"https://developers.openai.com/api/docs/models/gpt-5.5","effort_source":"https://developers.openai.com/api/docs/models/gpt-5.5","evidence":"Currently available model/snapshot listed; requested effort explicitly supported","limitations":"Named version and effort concordant; exact historical backend not established. Catalog evidence, no paid API inference","weights_license":"not_documented_in_consulted_sources; hosted_API"}},{"rawId":"grok/grok-4.6","modelId":"grok-4-6","effortField":"reasoning_effort","rawEffort":"high","effortState":"published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://docs.x.ai/developers/models/grok-4.6","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"grok/grok-4.6","checked_at":"2026-09-04","vals_provider":"SpaceXAI","vals_reasoning_effort":"high","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"grok-4.6","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://docs.x.ai/developers/models/grok-4.6","additional_source_url":"","evidence":"Exact model ID has provider service page, current regional pricing and API availability.","configuration_limit":"Preserve explicit reasoning identity/effort. Aliases differ from immutable dated ID; no multi-agent substitution.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-grok-models.html"}},{"rawId":"openai/gpt-5.6-luna","modelId":"luna","effortField":"reasoning_effort","rawEffort":"max","effortState":"published","referenceEffort":"max","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://developers.openai.com/api/docs/models","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"livebench_raw":"gpt-5.6-luna-max","vals_raw":"openai/gpt-5.6-luna","effort":"max","checked_at":"2026-09-04","availability":"DOCUMENTED_AVAILABLE","availability_route":"direct_provider","provider_api_id":"gpt-5.6-luna","operator_api_id":"","snapshot_or_alias":"gpt-5.6-luna","availability_source":"https://developers.openai.com/api/docs/models","effort_source":"https://developers.openai.com/api/docs/models","evidence":"Currently available model/snapshot listed; requested effort explicitly supported","limitations":"Named version and effort concordant; exact historical backend not established. Catalog evidence, no paid API inference","weights_license":"not_documented_in_consulted_sources; hosted_API"}},{"rawId":"anthropic/claude-sonnet-5","modelId":"claude-sonnet-5","effortField":"compute_effort","rawEffort":"max","effortState":"published","referenceEffort":null,"exclusion":"Efforts différents entre Vals et LiveBench.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"anthropic/claude-sonnet-5","checked_at":"2026-09-04","vals_provider":"Anthropic","vals_reasoning_effort":"","vals_compute_effort":"max","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"claude-sonnet-5","operator_api_id":"","snapshot_or_alias":"","retirement_date":"2027-06-30","retirement_kind":"not_sooner_than_NOT_announced_shutdown","source_url":"https://platform.claude.com/docs/en/about-claude/model-deprecations","additional_source_url":"https://platform.claude.com/docs/en/build-with-claude/effort","evidence":"Exact native model ID Active in provider lifecycle table.","configuration_limit":"Keep Vals max; observed LiveBench effort mismatch is unchanged. Availability does not repair mismatch.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"anthropic-deprecations-web.txt"}},{"rawId":"zai/glm-5.3","modelId":"glm-5-3","effortField":"reasoning_effort","rawEffort":"max","effortState":"published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://docs.z.ai/guides/llm/glm-5.3","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"zai/glm-5.3","checked_at":"2026-09-04","vals_provider":"Zhipu AI","vals_reasoning_effort":"max","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"glm-5.3","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://docs.z.ai/guides/llm/glm-5.3","additional_source_url":"","evidence":"Current official model API guide with exact model ID and service instructions.","configuration_limit":"Keep Vals effort exactly: max for 5.2/5.3/5.3-flash is documented; null for 5.1 remains unspecified. No turbo/fast swap.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-glm-53.html"}},{"rawId":"anthropic/claude-opus-4-7","modelId":"claude-opus-4-7","effortField":"compute_effort","rawEffort":"max","effortState":"published","referenceEffort":null,"exclusion":"Efforts différents entre Vals et LiveBench.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"anthropic/claude-opus-4-7","checked_at":"2026-09-04","vals_provider":"Anthropic","vals_reasoning_effort":"","vals_compute_effort":"max","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"claude-opus-4-7","operator_api_id":"","snapshot_or_alias":"","retirement_date":"2027-04-16","retirement_kind":"not_sooner_than_NOT_announced_shutdown","source_url":"https://platform.claude.com/docs/en/about-claude/model-deprecations","additional_source_url":"https://platform.claude.com/docs/en/build-with-claude/effort","evidence":"Exact native model ID Active in provider lifecycle table.","configuration_limit":"Keep Vals max; LiveBench xhigh mismatch unchanged. Availability does not repair effort mismatch.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"anthropic-deprecations-web.txt"}},{"rawId":"deepseek/deepseek-v4-pro-0813","modelId":"deepseek-v4-pro-0813","effortField":"reasoning_effort","rawEffort":"max","effortState":"published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://api-docs.deepseek.com/quick_start/pricing/","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"deepseek/deepseek-v4-pro-0813","checked_at":"2026-09-04","vals_provider":"DeepSeek","vals_reasoning_effort":"max","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"deepseek-v4-pro","operator_api_id":"","snapshot_or_alias":"deepseek-v4-pro-0813","retirement_date":"","retirement_kind":"","source_url":"https://api-docs.deepseek.com/quick_start/pricing/","additional_source_url":"https://openrouter.ai/deepseek/deepseek-v4-pro-0813","evidence":"Provider table explicitly maps native alias to the exact dated Vals version.","configuration_limit":"Dated Vals version is retained; native API ID is an updating alias, not the dated Vals display ID. Preserve high/max exactly.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-deepseek-pricing.html"}},{"rawId":"anthropic/claude-sonnet-4-6","modelId":"claude-sonnet-4-6","effortField":"compute_effort","rawEffort":"max","effortState":"published","referenceEffort":null,"exclusion":"Efforts différents entre Vals et LiveBench.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"anthropic/claude-sonnet-4-6","checked_at":"2026-09-04","vals_provider":"Anthropic","vals_reasoning_effort":"","vals_compute_effort":"max","vals_reasoning":"True","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"claude-sonnet-4-6","operator_api_id":"","snapshot_or_alias":"","retirement_date":"2027-02-17","retirement_kind":"not_sooner_than_NOT_announced_shutdown","source_url":"https://platform.claude.com/docs/en/about-claude/model-deprecations","additional_source_url":"https://platform.claude.com/docs/en/build-with-claude/effort","evidence":"Exact native model ID Active in provider lifecycle table.","configuration_limit":"Keep Vals max; observed LiveBench effort mismatch is unchanged. Availability does not repair mismatch.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"anthropic-deprecations-web.txt"}},{"rawId":"deepseek/deepseek-v4-flash-0731","modelId":"deepseek-v4-flash-0731","effortField":"reasoning_effort","rawEffort":"high","effortState":"published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://api-docs.deepseek.com/quick_start/pricing/","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"deepseek/deepseek-v4-flash-0731","checked_at":"2026-09-04","vals_provider":"DeepSeek","vals_reasoning_effort":"high","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"deepseek-v4-flash","operator_api_id":"","snapshot_or_alias":"deepseek-v4-flash-0731","retirement_date":"","retirement_kind":"","source_url":"https://api-docs.deepseek.com/quick_start/pricing/","additional_source_url":"https://openrouter.ai/deepseek/deepseek-v4-flash-0731","evidence":"Provider table explicitly maps native alias to the exact dated Vals version.","configuration_limit":"Dated Vals version is retained; native API ID is an updating alias, not the dated Vals display ID. Preserve high/max exactly.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-deepseek-pricing.html"}},{"rawId":"zai/glm-5.2","modelId":"glm-5-2","effortField":"reasoning_effort","rawEffort":"max","effortState":"published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://docs.z.ai/guides/llm/glm-5.2","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"zai/glm-5.2","checked_at":"2026-09-04","vals_provider":"Zhipu AI","vals_reasoning_effort":"max","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"glm-5.2","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://docs.z.ai/guides/llm/glm-5.2","additional_source_url":"","evidence":"Current official model API guide with exact model ID and service instructions.","configuration_limit":"Keep Vals effort exactly: max for 5.2/5.3/5.3-flash is documented; null for 5.1 remains unspecified. No turbo/fast swap.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-glm-52.html"}},{"rawId":"grok/grok-4.5","modelId":"grok-4-5","effortField":"reasoning_effort","rawEffort":"high","effortState":"published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://docs.x.ai/developers/models/grok-4.5","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"grok/grok-4.5","checked_at":"2026-09-04","vals_provider":"SpaceXAI","vals_reasoning_effort":"high","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"grok-4.5","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://docs.x.ai/developers/models/grok-4.5","additional_source_url":"","evidence":"Exact model ID has provider service page, current regional pricing and API availability.","configuration_limit":"Preserve explicit reasoning identity/effort. Aliases differ from immutable dated ID; no multi-agent substitution.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-grok-45.html"}},{"rawId":"google/gemini-3.8-flash","modelId":"gemini-3-8-flash","effortField":"reasoning_effort","rawEffort":"high","effortState":"published","referenceEffort":"high","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"livebench_raw":"gemini-3.8-flash-high","vals_raw":"google/gemini-3.8-flash","effort":"high","checked_at":"2026-09-04","availability":"DOCUMENTED_AVAILABLE","availability_route":"direct_provider","provider_api_id":"gemini-3.8-flash","operator_api_id":"","snapshot_or_alias":"gemini-3.8-flash","availability_source":"https://ai.google.dev/gemini-api/docs/deprecations","effort_source":"https://ai.google.dev/gemini-api/docs/thinking","evidence":"Exact ID named; no shutdown announced; high in supported levels","limitations":"Does not prove the exact historical backend served to both evaluators; Preview3.1 is not GA","weights_license":"not_documented_in_consulted_sources; hosted_API"}},{"rawId":"openai/gpt-5.4-2026-03-05","modelId":"gpt-5-4","effortField":"reasoning_effort","rawEffort":"xhigh","effortState":"published","referenceEffort":"xhigh","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://developers.openai.com/api/docs/models/gpt-5.4","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"livebench_raw":"gpt-5.4-xhigh","vals_raw":"openai/gpt-5.4-2026-03-05","effort":"xhigh","checked_at":"2026-09-04","availability":"DOCUMENTED_AVAILABLE","availability_route":"direct_provider","provider_api_id":"gpt-5.4-2026-03-05","operator_api_id":"","snapshot_or_alias":"gpt-5.4-2026-03-05","availability_source":"https://developers.openai.com/api/docs/models/gpt-5.4","effort_source":"https://developers.openai.com/api/docs/models/gpt-5.4","evidence":"Currently available model/snapshot listed; requested effort explicitly supported","limitations":"LiveBench alias versus Vals dated snapshot retained; exact historical backend not established. Catalog evidence, no paid API inference","weights_license":"not_documented_in_consulted_sources; hosted_API"}},{"rawId":"google/gemini-3.7-flash","modelId":"gemini-3-7-flash","effortField":"reasoning_effort","rawEffort":"high","effortState":"published","referenceEffort":"high","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"livebench_raw":"gemini-3.7-flash-high","vals_raw":"google/gemini-3.7-flash","effort":"high","checked_at":"2026-09-04","availability":"DOCUMENTED_AVAILABLE","availability_route":"direct_provider","provider_api_id":"gemini-3.7-flash","operator_api_id":"","snapshot_or_alias":"gemini-3.7-flash","availability_source":"https://ai.google.dev/gemini-api/docs/deprecations","effort_source":"https://ai.google.dev/gemini-api/docs/thinking","evidence":"Exact ID named; no shutdown announced; high in supported levels","limitations":"Does not prove the exact historical backend served to both evaluators; Preview3.1 is not GA","weights_license":"not_documented_in_consulted_sources; hosted_API"}},{"rawId":"meta/muse_spark_1_1","modelId":"muse-spark-1-1","effortField":"reasoning_effort","rawEffort":"xhigh","effortState":"published","referenceEffort":"xhigh","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://openrouter.ai/meta/muse-spark-1.1","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"livebench_raw":"muse-spark-1.1-xhigh","vals_raw":"meta/muse_spark_1_1","effort":"xhigh","checked_at":"2026-09-04","availability":"DOCUMENTED_AVAILABLE","availability_route":"OpenRouter serving Meta","provider_api_id":"UNVERIFIED_DIRECT_META_ID","operator_api_id":"meta/muse-spark-1.1","snapshot_or_alias":"meta/muse-spark-1.1-20260709","availability_source":"https://openrouter.ai/meta/muse-spark-1.1","effort_source":"https://openrouter.ai/api/v1/models","evidence":"Public catalog exact model; endpoint provider Meta; xhigh supported; Meta launch API announcement","limitations":"Vals underscore ID is evaluator-library alias. Direct Meta native ID not verified. Not Contributor. OpenRouter listing date for1.1 differs from Meta launch date","weights_license":"not_documented_in_consulted_sources; hosted_API"}},{"rawId":"google/gemini-3.6-flash","modelId":"gemini-3-6-flash","effortField":"reasoning_effort","rawEffort":"high","effortState":"published","referenceEffort":"high","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"livebench_raw":"gemini-3.6-flash-high","vals_raw":"google/gemini-3.6-flash","effort":"high","checked_at":"2026-09-04","availability":"DOCUMENTED_AVAILABLE","availability_route":"direct_provider","provider_api_id":"gemini-3.6-flash","operator_api_id":"","snapshot_or_alias":"gemini-3.6-flash","availability_source":"https://ai.google.dev/gemini-api/docs/deprecations","effort_source":"https://ai.google.dev/gemini-api/docs/thinking","evidence":"Exact ID named; no shutdown announced; high in supported levels","limitations":"Does not prove the exact historical backend served to both evaluators; Preview3.1 is not GA","weights_license":"not_documented_in_consulted_sources; hosted_API"}},{"rawId":"meta/muse_spark_1_2","modelId":"muse-spark-1-2","effortField":"reasoning_effort","rawEffort":"xhigh","effortState":"published","referenceEffort":"xhigh","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://openrouter.ai/meta/muse-spark-1.2","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"livebench_raw":"muse-spark-1.2-xhigh","vals_raw":"meta/muse_spark_1_2","effort":"xhigh","checked_at":"2026-09-04","availability":"DOCUMENTED_AVAILABLE","availability_route":"OpenRouter serving Meta","provider_api_id":"UNVERIFIED_DIRECT_META_ID","operator_api_id":"meta/muse-spark-1.2","snapshot_or_alias":"meta/muse-spark-1.2-20260805","availability_source":"https://openrouter.ai/meta/muse-spark-1.2","effort_source":"https://openrouter.ai/api/v1/models","evidence":"Public catalog exact model; endpoint provider Meta; xhigh supported; Meta launch API announcement","limitations":"Vals underscore ID is evaluator-library alias. Direct Meta native ID not verified. Not Contributor. OpenRouter listing date for1.1 differs from Meta launch date","weights_license":"not_documented_in_consulted_sources; hosted_API"}},{"rawId":"kimi/kimi-k2.6","modelId":"kimi-k2-6","effortField":"reasoning_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://platform.kimi.ai/docs/models","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"kimi/kimi-k2.6","checked_at":"2026-09-04","vals_provider":"Moonshot AI","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"kimi-k2.6","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://platform.kimi.ai/docs/models","additional_source_url":"","evidence":"Exact model ID appears in current API model list.","configuration_limit":"No highspeed/router substitution; preserve unspecified thinking for K2.6/K2.7. K3 max is explicitly supported in pricing docs.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-kimi-models.html"}},{"rawId":"google/gemini-3.5-flash","modelId":"gemini-3-5-flash","effortField":"reasoning_effort","rawEffort":"high","effortState":"published","referenceEffort":"high","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"livebench_raw":"gemini-3.5-flash-high","vals_raw":"google/gemini-3.5-flash","effort":"high","checked_at":"2026-09-04","availability":"DOCUMENTED_AVAILABLE","availability_route":"direct_provider","provider_api_id":"gemini-3.5-flash","operator_api_id":"","snapshot_or_alias":"gemini-3.5-flash","availability_source":"https://ai.google.dev/gemini-api/docs/deprecations","effort_source":"https://ai.google.dev/gemini-api/docs/thinking","evidence":"Exact ID named; no shutdown announced; high in supported levels","limitations":"Does not prove the exact historical backend served to both evaluators; Preview3.1 is not GA","weights_license":"not_documented_in_consulted_sources; hosted_API"}},{"rawId":"deepseek/deepseek-v4-pro","modelId":"deepseek-v4-pro","effortField":"reasoning_effort","rawEffort":"max","effortState":"published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-pro-20260423/endpoints","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"deepseek/deepseek-v4-pro","checked_at":"2026-09-04","vals_provider":"DeepSeek","vals_reasoning_effort":"max","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"operator_OpenRouter","provider_api_id":"","operator_api_id":"deepseek/deepseek-v4-pro","snapshot_or_alias":"OpenRouter canonical 20260423; direct DeepSeek alias points to 0813","retirement_date":"","retirement_kind":"","source_url":"https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-pro-20260423/endpoints","additional_source_url":"https://api-docs.deepseek.com/quick_start/pricing/","evidence":"0423 version still has 17 operator routes; current direct DeepSeek alias now means 0813.","configuration_limit":"Do not merge Vals original V4 Pro and V4 Pro 0813. Direct alias shifted; original historical Vals execution version remains to reconcile. Operator supported efforts high/xhigh do not establish max equivalence.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-endpoints-deepseek_deepseek-v4-pro.json"}},{"rawId":"zai/glm-5.1","modelId":"glm-5-1","effortField":"reasoning_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"zai/glm-5.1","checked_at":"2026-09-04","vals_provider":"Zhipu AI","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"glm-5.1","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://docs.z.ai/guides/llm/glm-5.1","additional_source_url":"","evidence":"Current official model API guide with exact model ID and service instructions.","configuration_limit":"Keep Vals effort exactly: max for 5.2/5.3/5.3-flash is documented; null for 5.1 remains unspecified. No turbo/fast swap.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-glm-51.html"}},{"rawId":"kimi/kimi-k2.7-code","modelId":"kimi-k2-7-code","effortField":"reasoning_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://platform.kimi.ai/docs/models","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"kimi/kimi-k2.7-code","checked_at":"2026-09-04","vals_provider":"Moonshot AI","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"kimi-k2.7-code","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://platform.kimi.ai/docs/models","additional_source_url":"","evidence":"Exact model ID appears in current API model list.","configuration_limit":"No highspeed/router substitution; preserve unspecified thinking for K2.6/K2.7. K3 max is explicitly supported in pricing docs.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-kimi-models.html"}},{"rawId":"alibaba/qwen3.8-max","modelId":"qwen3-8-max","effortField":"reasoning_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"alibaba/qwen3.8-max","checked_at":"2026-09-04","vals_provider":"Alibaba","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"qwen3.8-max","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","additional_source_url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing","evidence":"Exact model ID in provider current or legacy supported catalog; legacy is not a retirement.","configuration_limit":"Versioned family alias; date resolution varies. qwen3.7-max: max is part of model name, not effort.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-qwen-models.html"}},{"rawId":"xiaomi/mimo-v2.5-pro","modelId":"mimo-v2-5-pro","effortField":"reasoning_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"xiaomi/mimo-v2.5-pro","checked_at":"2026-09-04","vals_provider":"Xiaomi","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"mimo-v2.5-pro","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","additional_source_url":"https://platform.xiaomimimo.com/","evidence":"Provider documentation current supported-model section names both exact API IDs and supplies api.xiaomimimo.com/v1 examples.","configuration_limit":"Public search-rendered primary docs retained; direct page redirected to JS-only shell. Current default thinking enabled is not proof of historical Vals configuration.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-search40c1-web.txt"}},{"rawId":"zai/glm-5.3-flash","modelId":"glm-5-3-flash","effortField":"reasoning_effort","rawEffort":"max","effortState":"published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://docs.z.ai/guides/vlm/glm-5.3-flash","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"zai/glm-5.3-flash","checked_at":"2026-09-04","vals_provider":"Zhipu AI","vals_reasoning_effort":"max","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"glm-5.3-flash","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://docs.z.ai/guides/vlm/glm-5.3-flash","additional_source_url":"","evidence":"Current official model API guide with exact model ID and service instructions.","configuration_limit":"Keep Vals effort exactly: max for 5.2/5.3/5.3-flash is documented; null for 5.1 remains unspecified. No turbo/fast swap.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-glm-53flash.html"}},{"rawId":"minimax/MiniMax-M3","modelId":"minimax-m3","effortField":"reasoning_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://platform.minimax.io/docs/guides/models-intro","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"minimax/MiniMax-M3","checked_at":"2026-09-04","vals_provider":"MiniMax","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"MiniMax-M3","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://platform.minimax.io/docs/guides/models-intro","additional_source_url":"","evidence":"Exact model name in current language API catalog.","configuration_limit":"No highspeed variant substitution; unspecified Vals reasoning remains unspecified.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-minimax-models.html"}},{"rawId":"google/gemini-3.1-pro-preview","modelId":"gemini-3-1-pro-preview","effortField":"reasoning_effort","rawEffort":"high","effortState":"published","referenceEffort":"high","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"livebench_raw":"gemini-3.1-pro-preview-high","vals_raw":"google/gemini-3.1-pro-preview","effort":"high","checked_at":"2026-09-04","availability":"DOCUMENTED_AVAILABLE","availability_route":"direct_provider","provider_api_id":"gemini-3.1-pro-preview","operator_api_id":"","snapshot_or_alias":"gemini-3.1-pro-preview (preview)","availability_source":"https://ai.google.dev/gemini-api/docs/deprecations","effort_source":"https://ai.google.dev/gemini-api/docs/thinking","evidence":"Exact ID named; no shutdown announced; high in supported levels","limitations":"Does not prove the exact historical backend served to both evaluators; Preview3.1 is not GA","weights_license":"not_documented_in_consulted_sources; hosted_API"}},{"rawId":"kimi/kimi-k3","modelId":"kimi-k3","effortField":"reasoning_effort","rawEffort":"max","effortState":"published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://platform.kimi.ai/docs/models","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"kimi/kimi-k3","checked_at":"2026-09-04","vals_provider":"Moonshot AI","vals_reasoning_effort":"max","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"kimi-k3","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://platform.kimi.ai/docs/models","additional_source_url":"https://platform.kimi.ai/docs/pricing/chat-k3","evidence":"Exact model ID appears in current API model list.","configuration_limit":"No highspeed/router substitution; preserve unspecified thinking for K2.6/K2.7. K3 max is explicitly supported in pricing docs.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-kimi-models.html"}},{"rawId":"openai/gpt-5.4-nano-2026-03-17","modelId":"gpt-5-4-nano","effortField":"reasoning_effort","rawEffort":"high","effortState":"published","referenceEffort":null,"exclusion":"Efforts différents entre Vals et LiveBench.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://developers.openai.com/api/docs/models/gpt-5.4-nano","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"openai/gpt-5.4-nano-2026-03-17","checked_at":"2026-09-04","vals_provider":"OpenAI","vals_reasoning_effort":"high","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"gpt-5.4-nano-2026-03-17","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://developers.openai.com/api/docs/models/gpt-5.4-nano","additional_source_url":"","evidence":"Exact alias/snapshot currently listed with API support and tiers.","configuration_limit":"Nano high and Astra max preserved; Nano LiveBench xhigh mismatch not repaired by availability.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-openai-nano.html"}},{"rawId":"xiaomi/mimo-v2.5","modelId":"mimo-v2-5","effortField":"reasoning_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"xiaomi/mimo-v2.5","checked_at":"2026-09-04","vals_provider":"Xiaomi","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"mimo-v2.5","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","additional_source_url":"https://platform.xiaomimimo.com/","evidence":"Provider documentation current supported-model section names both exact API IDs and supplies api.xiaomimimo.com/v1 examples.","configuration_limit":"Public search-rendered primary docs retained; direct page redirected to JS-only shell. Current default thinking enabled is not proof of historical Vals configuration.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-search40c1-web.txt"}},{"rawId":"alibaba/qwen3.8-27b","modelId":"qwen3-8-27b","effortField":"reasoning_effort","rawEffort":"xhigh","effortState":"published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://openrouter.ai/api/v1/models/qwen/qwen3.8-27b-20260814/endpoints","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"alibaba/qwen3.8-27b","checked_at":"2026-09-04","vals_provider":"Alibaba","vals_reasoning_effort":"xhigh","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"operator_OpenRouter","provider_api_id":"","operator_api_id":"qwen/qwen3.8-27b","snapshot_or_alias":"qwen/qwen3.8-27b-20260814","retirement_date":"","retirement_kind":"","source_url":"https://openrouter.ai/api/v1/models/qwen/qwen3.8-27b-20260814/endpoints","additional_source_url":"https://huggingface.co/Qwen/Qwen3.8-27B","evidence":"Catalog and 13 serving endpoints name exact version; provider list includes Alibaba.","configuration_limit":"Availability is not exact historical backend identity; preserve Vals configuration unchanged.","weights_license":"Apache-2.0 (publisher model card)","snapshot_file":"remaining-endpoints-qwen_qwen3.8-27b.json"}},{"rawId":"thinkingmachines/inkling-small","modelId":"inkling-small","effortField":"reasoning_effort","rawEffort":"0.99","effortState":"published","referenceEffort":null,"exclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"thinkingmachines/inkling-small","checked_at":"2026-09-04","vals_provider":"Thinkingmachines","vals_reasoning_effort":"0.99","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider_Tinker_beta","provider_api_id":"thinkingmachines/Inkling-Small:peft:262144:sampling-nvfp4","operator_api_id":"","snapshot_or_alias":"thinkingmachines/Inkling-Small","retirement_date":"","retirement_kind":"","source_url":"https://tinker-docs.thinkingmachines.ai/tinker/models/","additional_source_url":"https://tinker-docs.thinkingmachines.ai/cookbook/inkling/thinking-effort/","evidence":"Both model versions listed for serverless inference beta with exact service IDs; weights also available.","configuration_limit":"Tinker beta 256K NVFP4 is service-specific configuration, not proof Vals used it. New official effort mapping xhigh=0.99 documented; no automatic cross-source admission or effort-rule change.","weights_license":"Apache-2.0","snapshot_file":"remaining-tinker-models.html"}},{"rawId":"alibaba/qwen3.7-max","modelId":"qwen3-7-max","effortField":"reasoning_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"alibaba/qwen3.7-max","checked_at":"2026-09-04","vals_provider":"Alibaba","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"qwen3.7-max","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","additional_source_url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing","evidence":"Exact model ID in provider current or legacy supported catalog; legacy is not a retirement.","configuration_limit":"Versioned family alias; date resolution varies. qwen3.7-max: max is part of model name, not effort.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-qwen-models.html"}},{"rawId":"openai/gpt-5.4-mini-2026-03-17","modelId":"gpt-5-4-mini","effortField":"reasoning_effort","rawEffort":"xhigh","effortState":"published","referenceEffort":"xhigh","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://developers.openai.com/api/docs/models/gpt-5.4-mini","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"livebench_raw":"gpt-5.4-mini-xhigh","vals_raw":"openai/gpt-5.4-mini-2026-03-17","effort":"xhigh","checked_at":"2026-09-04","availability":"DOCUMENTED_AVAILABLE","availability_route":"direct_provider","provider_api_id":"gpt-5.4-mini-2026-03-17","operator_api_id":"","snapshot_or_alias":"gpt-5.4-mini-2026-03-17","availability_source":"https://developers.openai.com/api/docs/models/gpt-5.4-mini","effort_source":"https://developers.openai.com/api/docs/models/gpt-5.4-mini","evidence":"Currently available model/snapshot listed; requested effort explicitly supported","limitations":"LiveBench alias versus Vals dated snapshot retained; exact historical backend not established. Catalog evidence, no paid API inference","weights_license":"not_documented_in_consulted_sources; hosted_API"}},{"rawId":"alibaba/qwen3.7-plus","modelId":"qwen3-7-plus","effortField":"reasoning_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"alibaba/qwen3.7-plus","checked_at":"2026-09-04","vals_provider":"Alibaba","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"qwen3.7-plus","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","additional_source_url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing","evidence":"Exact model ID in provider current or legacy supported catalog; legacy is not a retirement.","configuration_limit":"Versioned family alias; date resolution varies. qwen3.7-max: max is part of model name, not effort.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-qwen-models.html"}},{"rawId":"thinkingmachines/inkling","modelId":"inkling","effortField":"reasoning_effort","rawEffort":"0.99","effortState":"published","referenceEffort":"xhigh","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","configurationEvidenceUrl":"https://tinker-docs.thinkingmachines.ai/cookbook/inkling/thinking-effort/","availabilityEvidence":{"vals_raw":"thinkingmachines/inkling","checked_at":"2026-09-04","vals_provider":"Thinkingmachines","vals_reasoning_effort":"0.99","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider_Tinker_beta","provider_api_id":"thinkingmachines/Inkling:peft:262144:sampling-nvfp4","operator_api_id":"","snapshot_or_alias":"thinkingmachines/Inkling","retirement_date":"","retirement_kind":"","source_url":"https://tinker-docs.thinkingmachines.ai/tinker/models/","additional_source_url":"https://tinker-docs.thinkingmachines.ai/cookbook/inkling/thinking-effort/","evidence":"Both model versions listed for serverless inference beta with exact service IDs; weights also available.","configuration_limit":"Tinker beta 256K NVFP4 is service-specific configuration, not proof Vals used it. New official effort mapping xhigh=0.99 documented; no automatic cross-source admission or effort-rule change.","weights_license":"Apache-2.0","snapshot_file":"remaining-tinker-models.html"}},{"rawId":"alibaba/qwen3.6-plus","modelId":"qwen3-6-plus","effortField":"reasoning_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"alibaba/qwen3.6-plus","checked_at":"2026-09-04","vals_provider":"Alibaba","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"qwen3.6-plus","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","additional_source_url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing","evidence":"Exact model ID in provider current or legacy supported catalog; legacy is not a retirement.","configuration_limit":"Versioned family alias; date resolution varies. qwen3.7-max: max is part of model name, not effort.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-qwen-models.html"}},{"rawId":"minimax/MiniMax-M2.7","modelId":"minimax-m2-7","effortField":"reasoning_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://platform.minimax.io/docs/guides/models-intro","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"minimax/MiniMax-M2.7","checked_at":"2026-09-04","vals_provider":"MiniMax","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"MiniMax-M2.7","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://platform.minimax.io/docs/guides/models-intro","additional_source_url":"","evidence":"Exact model name in current language API catalog.","configuration_limit":"No highspeed variant substitution; unspecified Vals reasoning remains unspecified.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-minimax-models.html"}},{"rawId":"anthropic/claude-haiku-4-5-20251001-thinking","modelId":"claude-haiku-4-5","effortField":"compute_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"anthropic/claude-haiku-4-5-20251001-thinking","checked_at":"2026-09-04","vals_provider":"Anthropic","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"claude-haiku-4-5-20251001","operator_api_id":"","snapshot_or_alias":"","retirement_date":"2026-10-15","retirement_kind":"not_sooner_than_NOT_announced_shutdown","source_url":"https://platform.claude.com/docs/en/about-claude/model-deprecations","additional_source_url":"https://platform.claude.com/docs/en/build-with-claude/effort","evidence":"Exact native model ID Active in provider lifecycle table.","configuration_limit":"Native ID omits Vals -thinking suffix; preserve thinking as separate configuration; Vals null fields do not prove disabled thinking or default budget.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"anthropic-deprecations-web.txt"}},{"rawId":"kimi/kimi-k2.5-thinking","modelId":"kimi-k2-5","effortField":"reasoning_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://openrouter.ai/api/v1/models/moonshotai/kimi-k2.5-0127/endpoints","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"kimi/kimi-k2.5-thinking","checked_at":"2026-09-04","vals_provider":"Moonshot AI","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"operator_OpenRouter","provider_api_id":"","operator_api_id":"moonshotai/kimi-k2.5","snapshot_or_alias":"moonshotai/kimi-k2.5-0127","retirement_date":"2026-08-31","retirement_kind":"direct_provider_only","source_url":"https://openrouter.ai/api/v1/models/moonshotai/kimi-k2.5-0127/endpoints","additional_source_url":"https://platform.kimi.ai/docs/models","evidence":"Direct Kimi K2.5 retired 2026-08-31; still served by 8 third-party operator routes with version 0127.","configuration_limit":"Vals -thinking is a configuration suffix. Operator quantization varies int4/fp4/etc; no claim of same original Moonshot backend. Availability limited to third-party service.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-endpoints-moonshotai_kimi-k2.5.json"}},{"rawId":"grok/grok-4.3","modelId":"grok-4-3","effortField":"reasoning_effort","rawEffort":"high","effortState":"published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://docs.x.ai/developers/models/grok-4.3","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"grok/grok-4.3","checked_at":"2026-09-04","vals_provider":"SpaceXAI","vals_reasoning_effort":"high","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"grok-4.3","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://docs.x.ai/developers/models/grok-4.3","additional_source_url":"","evidence":"Exact model ID has provider service page, current regional pricing and API availability.","configuration_limit":"Preserve explicit reasoning identity/effort. Aliases differ from immutable dated ID; no multi-agent substitution.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-grok-43.html"}},{"rawId":"google/gemini-3-flash-preview","modelId":"gemini-3-flash-preview","effortField":"reasoning_effort","rawEffort":"high","effortState":"published","referenceEffort":null,"exclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"google/gemini-3-flash-preview","checked_at":"2026-09-04","vals_provider":"Google","vals_reasoning_effort":"high","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"gemini-3-flash-preview","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://ai.google.dev/gemini-api/docs/deprecations","additional_source_url":"https://ai.google.dev/gemini-api/docs/thinking","evidence":"Exact preview ID with no shutdown date announced; replacement recommendation does not mean retirement.","configuration_limit":"Availability is not exact historical backend identity; preserve Vals configuration unchanged.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"google-deprecations.html"}},{"rawId":"google/gemini-3.5-flash-lite","modelId":"gemini-3-5-flash-lite","effortField":"reasoning_effort","rawEffort":"high","effortState":"published","referenceEffort":"high","exclusion":null,"availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"livebench_raw":"gemini-3.5-flash-lite-high","vals_raw":"google/gemini-3.5-flash-lite","effort":"high","checked_at":"2026-09-04","availability":"DOCUMENTED_AVAILABLE","availability_route":"direct_provider","provider_api_id":"gemini-3.5-flash-lite","operator_api_id":"","snapshot_or_alias":"gemini-3.5-flash-lite","availability_source":"https://ai.google.dev/gemini-api/docs/deprecations","effort_source":"https://ai.google.dev/gemini-api/docs/thinking","evidence":"Exact ID named; no shutdown announced; high in supported levels","limitations":"Does not prove the exact historical backend served to both evaluators; Preview3.1 is not GA","weights_license":"not_documented_in_consulted_sources; hosted_API"}},{"rawId":"mistralai/mistral-medium-3.5","modelId":"mistral-medium-3-5","effortField":"reasoning_effort","rawEffort":"high","effortState":"published","referenceEffort":null,"exclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"mistralai/mistral-medium-3.5","checked_at":"2026-09-04","vals_provider":"Mistral AI","vals_reasoning_effort":"high","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"mistral-medium-3-5","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","additional_source_url":"","evidence":"GA v26.04 current model catalog, native ID and API functionality published.","configuration_limit":"Vals spelling uses 3.5, native ID uses 3-5; preserve Vals high. Native alias does not establish exact historical weights.","weights_license":"Modified MIT","snapshot_file":"remaining-mistral35.html"}},{"rawId":"nvidia/nemotron-3-ultra-550b-a55b","modelId":"nemotron-3-ultra","effortField":"reasoning_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://build.nvidia.com/nvidia/nemotron-3-ultra-550b-a55b","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"nvidia/nemotron-3-ultra-550b-a55b","checked_at":"2026-09-04","vals_provider":"Nvidia","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"nvidia/nemotron-3-ultra-550b-a55b","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://build.nvidia.com/nvidia/nemotron-3-ultra-550b-a55b","additional_source_url":"https://build.nvidia.com/nvidia/nemotron-3-ultra-550b-a55b/modelcard","evidence":"Free endpoint, partner endpoint and download marked Available; exact API request model ID.","configuration_limit":"Provider card names NVFP4 weights; Vals plain model ID does not document quantization or thinking flag. Do not infer from defaults.","weights_license":"OpenMDW-1.1","snapshot_file":"remaining-nvidia-ultra.html"}},{"rawId":"google/gemini-3.1-flash-lite-preview","modelId":"gemini-3-1-flash-lite-preview","effortField":"reasoning_effort","rawEffort":"high","effortState":"published","referenceEffort":null,"exclusion":"Disponibilité de cette version non vérifiée ; mesure historique conservée.","availability":"CONTRADICTORY_UNVERIFIED","sourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"google/gemini-3.1-flash-lite-preview","checked_at":"2026-09-04","vals_provider":"Google","vals_reasoning_effort":"high","vals_compute_effort":"","vals_reasoning":"","availability":"CONTRADICTORY_UNVERIFIED","route":"direct_retired_vs_operator_catalog_active","provider_api_id":"gemini-3.1-flash-lite-preview","operator_api_id":"google/gemini-3.1-flash-lite-preview","snapshot_or_alias":"","retirement_date":"2026-05-25","retirement_kind":"direct_provider_shutdown","source_url":"https://ai.google.dev/gemini-api/docs/deprecations","additional_source_url":"https://openrouter.ai/api/v1/models/google/gemini-3.1-flash-lite-preview-20260303/endpoints","evidence":"Google declares shutdown 2026-05-25; OpenRouter still lists exact preview version with 3 Google AI Studio endpoints and recent uptime metrics.","configuration_limit":"Do not erase contradiction or replace preview with stable gemini-3.1-flash-lite. Display historic score with availability unverified.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"google-deprecations.html"}},{"rawId":"fireworks/nemotron-lightning-3p5-30b-a3b","modelId":"nemotron-lightning-3-5","effortField":"reasoning_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"fireworks/nemotron-lightning-3p5-30b-a3b","checked_at":"2026-09-04","vals_provider":"Fireworks AI","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"operator_Fireworks","provider_api_id":"","operator_api_id":"accounts/fireworks/models/nemotron-lightning-3p5-30b-a3b","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","additional_source_url":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16","evidence":"Ready; serverless available; exact API path published; model publisher identified as NVIDIA.","configuration_limit":"Fireworks is serving operator, NVIDIA model publisher. Do not substitute Nemotron Ultra or infer reasoning flag from null Vals field.","weights_license":"OpenMDW-1.1 (NVIDIA publisher card)","snapshot_file":"remaining-fireworks-lightning.html"}},{"rawId":"grok/grok-4.20-0309-reasoning","modelId":"grok-4-20-0309-reasoning","effortField":"reasoning_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","availability":"DOCUMENTED_AVAILABLE","sourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"grok/grok-4.20-0309-reasoning","checked_at":"2026-09-04","vals_provider":"SpaceXAI","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"DOCUMENTED_AVAILABLE","route":"direct_provider","provider_api_id":"grok-4.20-0309-reasoning","operator_api_id":"","snapshot_or_alias":"","retirement_date":"","retirement_kind":"","source_url":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","additional_source_url":"","evidence":"Exact model ID has provider service page, current regional pricing and API availability.","configuration_limit":"Preserve explicit reasoning identity/effort. Aliases differ from immutable dated ID; no multi-agent substitution.","weights_license":"UNVERIFIED_IN_CONSULTED_SOURCES","snapshot_file":"remaining-grok-420.html"}},{"rawId":"ant/ling-3.0-flash-2607","modelId":"ling-3-0-flash-2607","effortField":"reasoning_effort","rawEffort":null,"effortState":"not-published","referenceEffort":null,"exclusion":"Disponibilité de cette version non vérifiée ; mesure historique conservée.","availability":"UNVERIFIED_EXACT_VALS_VERSION","sourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","configurationEvidenceUrl":"https://www.vals.ai/benchmarks/code-migration","availabilityEvidence":{"vals_raw":"ant/ling-3.0-flash-2607","checked_at":"2026-09-04","vals_provider":"Ant","vals_reasoning_effort":"","vals_compute_effort":"","vals_reasoning":"","availability":"UNVERIFIED_EXACT_VALS_VERSION","route":"operator_OpenRouter","provider_api_id":"","operator_api_id":"inclusionai/ling-3.0-flash","snapshot_or_alias":"inclusionai/ling-3.0-flash-20260723","retirement_date":"","retirement_kind":"","source_url":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","additional_source_url":"https://huggingface.co/inclusionAI/Ling-3.0-flash","evidence":"Ling 3.0 Flash currently served by Novita and DeepInfra; publisher weights available. Exact Vals suffix 2607 not attested by provider catalog.","configuration_limit":"Family availability documented, but 2607 spelling is only Vals evidence. No invented native Ant API ID, no substitution with fin/sante/int4/fp4 variants.","weights_license":"MIT (publisher model card)","snapshot_file":"remaining-endpoints-inclusionai_ling-3.0-flash.json"}}],"sourceHtmlSha256":"54062dfeec5fa589d42653315e523913b8509e7b0866b8128b5c653ecc7e627e","liveHtmlSha256":"347d4783849cf24cfe8bb37cc2eacf176d0355e7d0abeffc4304594386c72da3","verification":"Les 56 objets overall sont strictement identiques entre les deux captures HTML."}},"prices":[{"modelId":"astra","inputPerMillion":10,"outputPerMillion":50,"currency":"USD","source":{"url":"https://developers.openai.com/api/docs/models/gpt-6-astra","accessedAt":"2026-09-06","publisher":"OpenAI"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API OpenAI","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":{"threshold":272000,"input":20,"output":75},"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"sol","inputPerMillion":4,"outputPerMillion":20,"currency":"USD","source":{"url":"https://developers.openai.com/api/docs/models/gpt-5.6-sol","accessedAt":"2026-09-06","publisher":"OpenAI"},"limitation":"Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément.","service":"API OpenAI","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":{"threshold":272000,"input":8,"output":30},"promotion":{"until":"2026-11-21","after":null},"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"terra","inputPerMillion":2,"outputPerMillion":12,"currency":"USD","source":{"url":"https://developers.openai.com/api/docs/models/gpt-5.6-terra","accessedAt":"2026-09-06","publisher":"OpenAI"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API OpenAI","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":{"threshold":272000,"input":4,"output":18},"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"luna","inputPerMillion":0.2,"outputPerMillion":1.2,"currency":"USD","source":{"url":"https://developers.openai.com/api/docs/models/gpt-5.6-luna","accessedAt":"2026-09-06","publisher":"OpenAI"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API OpenAI","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":{"threshold":272000,"input":0.4,"output":1.8},"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"gpt-5-4","inputPerMillion":2.5,"outputPerMillion":15,"currency":"USD","source":{"url":"https://developers.openai.com/api/docs/models/gpt-5.4","accessedAt":"2026-09-06","publisher":"OpenAI"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API OpenAI","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":{"threshold":272000,"input":5,"output":22.5},"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"gpt-5-4-mini","inputPerMillion":0.75,"outputPerMillion":4.5,"currency":"USD","source":{"url":"https://developers.openai.com/api/docs/models/gpt-5.4-mini","accessedAt":"2026-09-06","publisher":"OpenAI"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API OpenAI","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":null,"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"gpt-5-5","inputPerMillion":5,"outputPerMillion":30,"currency":"USD","source":{"url":"https://developers.openai.com/api/docs/models/gpt-5.5","accessedAt":"2026-09-06","publisher":"OpenAI"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API OpenAI","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":{"threshold":272000,"input":10,"output":45},"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"claude-opus-4-8","inputPerMillion":5,"outputPerMillion":25,"currency":"USD","source":{"url":"https://platform.claude.com/docs/en/about-claude/pricing","accessedAt":"2026-09-06","publisher":"Anthropic"},"limitation":"Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis.","service":"API Anthropic","contextCondition":"Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens.","longContext":null,"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"opus-5","inputPerMillion":5,"outputPerMillion":25,"currency":"USD","source":{"url":"https://platform.claude.com/docs/en/about-claude/pricing","accessedAt":"2026-09-06","publisher":"Anthropic"},"limitation":"Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis.","service":"API Anthropic","contextCondition":"Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens.","longContext":null,"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"fable-5-1","inputPerMillion":10,"outputPerMillion":50,"currency":"USD","source":{"url":"https://platform.claude.com/docs/en/about-claude/pricing","accessedAt":"2026-09-06","publisher":"Anthropic"},"limitation":"Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis.","service":"API Anthropic","contextCondition":"Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens.","longContext":null,"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"gemini-3-1-pro-preview","inputPerMillion":2,"outputPerMillion":12,"currency":"USD","source":{"url":"https://ai.google.dev/gemini-api/docs/pricing","accessedAt":"2026-09-06","publisher":"Google"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API Google","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":{"threshold":200000,"input":4,"output":18},"promotion":null,"reasoningBilling":"Les tokens de réflexion sont inclus dans les tokens facturés en sortie.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"gemini-3-5-flash","inputPerMillion":1.5,"outputPerMillion":9,"currency":"USD","source":{"url":"https://ai.google.dev/gemini-api/docs/pricing","accessedAt":"2026-09-06","publisher":"Google"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API Google","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":null,"promotion":null,"reasoningBilling":"Les tokens de réflexion sont inclus dans les tokens facturés en sortie.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"gemini-3-5-flash-lite","inputPerMillion":0.3,"outputPerMillion":2.5,"currency":"USD","source":{"url":"https://ai.google.dev/gemini-api/docs/pricing","accessedAt":"2026-09-06","publisher":"Google"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API Google","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":null,"promotion":null,"reasoningBilling":"Les tokens de réflexion sont inclus dans les tokens facturés en sortie.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"gemini-3-6-flash","inputPerMillion":0.75,"outputPerMillion":3.75,"currency":"USD","source":{"url":"https://ai.google.dev/gemini-api/docs/pricing","accessedAt":"2026-09-06","publisher":"Google"},"limitation":"Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément.","service":"API Google","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":null,"promotion":{"until":"2026-12-31","after":{"input":1.5,"output":7.5}},"reasoningBilling":"Les tokens de réflexion sont inclus dans les tokens facturés en sortie.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"gemini-3-7-flash","inputPerMillion":0.75,"outputPerMillion":3.75,"currency":"USD","source":{"url":"https://ai.google.dev/gemini-api/docs/pricing","accessedAt":"2026-09-06","publisher":"Google"},"limitation":"Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément.","service":"API Google","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":null,"promotion":{"until":"2026-12-31","after":{"input":1.5,"output":7.5}},"reasoningBilling":"Les tokens de réflexion sont inclus dans les tokens facturés en sortie.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"gemini-3-8-flash","inputPerMillion":0.75,"outputPerMillion":3.75,"currency":"USD","source":{"url":"https://ai.google.dev/gemini-api/docs/pricing","accessedAt":"2026-09-06","publisher":"Google"},"limitation":"Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément.","service":"API Google","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":null,"promotion":{"until":"2026-12-31","after":{"input":1.5,"output":7.5}},"reasoningBilling":"Les tokens de réflexion sont inclus dans les tokens facturés en sortie.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"muse-spark-1-1","inputPerMillion":1.25,"outputPerMillion":4.25,"currency":"USD","source":{"url":"https://openrouter.ai/meta/muse-spark-1.1","accessedAt":"2026-09-06","publisher":"OpenRouter"},"limitation":"Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici.","service":"OpenRouter","contextCondition":"Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée.","longContext":null,"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},{"modelId":"muse-spark-1-2","inputPerMillion":1.25,"outputPerMillion":4.25,"currency":"USD","source":{"url":"https://openrouter.ai/meta/muse-spark-1.2","accessedAt":"2026-09-06","publisher":"OpenRouter"},"limitation":"Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici.","service":"OpenRouter","contextCondition":"Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée.","longContext":null,"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"}],"observations":[{"id":"astra-aa-intelligence","modelId":"astra","domain":"general","constructId":"general-composite","familyId":"aa-intelligence-v4-1-1","benchmark":"Artificial Analysis Intelligence Index v4.1.1","organization":"Artificial Analysis","result":{"display":"61 points","value":61,"unit":"index","better":"higher","dispersion":{"kind":"interval","display":"Marge annoncée à 95 % : moins de ±1 point","low":60,"high":62,"confidence":95}},"sample":{"size":9,"unit":"évaluations composites","runs":10},"protocol":{"harness":"Outils et réglages propres à chacun des neuf tests","effort":"Meilleur niveau publié pour la variante comparée","scoring":"Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %","judge":"Mélange de tests automatiques et de corrections par un autre modèle d’IA"},"benchmarkVersion":"4.1.1","modelSetting":"Meilleur niveau publié pour la variante comparée","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-intelligence-v4-1-1","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","accessedAt":"2026-09-04","publishedAt":"2026-09-03"},"dependencies":["terminal-bench-v2-1","aa-omniscience","aa-lcr"],"limitation":"Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-1-aa-intelligence","modelId":"fable-5-1","domain":"general","constructId":"general-composite","familyId":"aa-intelligence-v4-1-1","benchmark":"Artificial Analysis Intelligence Index v4.1.1","organization":"Artificial Analysis","result":{"display":"66 points","value":66,"unit":"index","better":"higher","dispersion":{"kind":"interval","display":"Marge annoncée à 95 % : moins de ±1 point","low":65,"high":67,"confidence":95}},"sample":{"size":9,"unit":"évaluations composites","runs":10},"protocol":{"harness":"Outils et réglages propres à chacun des neuf tests","effort":"Meilleur niveau publié pour la variante comparée","scoring":"Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %","judge":"Mélange de tests automatiques et de corrections par un autre modèle d’IA"},"benchmarkVersion":"4.1.1","modelSetting":"Meilleur niveau publié pour la variante comparée","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-intelligence-v4-1-1","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","accessedAt":"2026-09-04","publishedAt":"2026-09-03"},"dependencies":["terminal-bench-v2-1","aa-omniscience","aa-lcr"],"limitation":"Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"sol-aa-intelligence","modelId":"sol","domain":"general","constructId":"general-composite","familyId":"aa-intelligence-v4-1-1","benchmark":"Artificial Analysis Intelligence Index v4.1.1","organization":"Artificial Analysis","result":{"display":"61 points","value":61,"unit":"index","better":"higher","dispersion":{"kind":"interval","display":"Marge annoncée à 95 % : moins de ±1 point","low":60,"high":62,"confidence":95}},"sample":{"size":9,"unit":"évaluations composites","runs":10},"protocol":{"harness":"Outils et réglages propres à chacun des neuf tests","effort":"Meilleur niveau publié pour la variante comparée","scoring":"Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %","judge":"Mélange de tests automatiques et de corrections par un autre modèle d’IA"},"benchmarkVersion":"4.1.1","modelSetting":"Meilleur niveau publié pour la variante comparée","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-intelligence-v4-1-1","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","accessedAt":"2026-09-04","publishedAt":"2026-09-03"},"dependencies":["terminal-bench-v2-1","aa-omniscience","aa-lcr"],"limitation":"Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"astra-aa-coding","modelId":"astra","domain":"coding","constructId":"software-agent","familyId":"aa-coding-agent-v1-4","benchmark":"Artificial Analysis Coding Agent Index v1.4","organization":"Artificial Analysis","result":{"display":"67 points","value":67,"unit":"index","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":326,"unit":"tâches","runs":3},"protocol":{"harness":"Agent Codex","effort":"max","scoring":"Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée","judge":"Programmes exécutés et résultats vérifiés automatiquement"},"benchmarkVersion":"1.4","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-coding-agent-v1-4","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","accessedAt":"2026-09-04","publishedAt":"not-published"},"dependencies":["deepswe","terminal-bench-v2-1","terminal-bench-family","swe-atlas-qna"],"limitation":"Le score mesure GPT-6 Astra avec un agent précis. Changer cet agent peut changer le résultat.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-aa-coding","modelId":"fable-5","domain":"coding","constructId":"software-agent","familyId":"aa-coding-agent-v1-4","benchmark":"Artificial Analysis Coding Agent Index v1.4","organization":"Artificial Analysis","result":{"display":"67 points","value":67,"unit":"index","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":326,"unit":"tâches","runs":3},"protocol":{"harness":"Agent Claude Code","effort":"max","scoring":"Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée","judge":"Programmes exécutés et résultats vérifiés automatiquement"},"benchmarkVersion":"1.4","modelSetting":"max avec repli de sécurité","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-coding-agent-v1-4","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","accessedAt":"2026-09-04","publishedAt":"not-published"},"dependencies":["deepswe","terminal-bench-v2-1","terminal-bench-family","swe-atlas-qna"],"limitation":"Le score mesure Claude Fable 5 avec un agent précis. Changer cet agent peut changer le résultat.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-1-aa-coding","modelId":"fable-5-1","domain":"coding","constructId":"software-agent","familyId":"aa-coding-agent-v1-4","benchmark":"Artificial Analysis Coding Agent Index v1.4","organization":"Artificial Analysis","result":{"display":"70 points","value":70,"unit":"index","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":326,"unit":"tâches","runs":3},"protocol":{"harness":"Agent Claude Code","effort":"max","scoring":"Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée","judge":"Programmes exécutés et résultats vérifiés automatiquement"},"benchmarkVersion":"1.4","modelSetting":"max avec repli de sécurité","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-coding-agent-v1-4","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","accessedAt":"2026-09-04","publishedAt":"not-published"},"dependencies":["deepswe","terminal-bench-v2-1","terminal-bench-family","swe-atlas-qna"],"limitation":"Le score mesure Claude Fable 5.1 avec un agent précis. Changer cet agent peut changer le résultat.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"opus-5-aa-coding","modelId":"opus-5","domain":"coding","constructId":"software-agent","familyId":"aa-coding-agent-v1-4","benchmark":"Artificial Analysis Coding Agent Index v1.4","organization":"Artificial Analysis","result":{"display":"68 points","value":68,"unit":"index","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":326,"unit":"tâches","runs":3},"protocol":{"harness":"Agent Claude Code","effort":"max","scoring":"Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée","judge":"Programmes exécutés et résultats vérifiés automatiquement"},"benchmarkVersion":"1.4","modelSetting":"xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-coding-agent-v1-4","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","accessedAt":"2026-09-04","publishedAt":"not-published"},"dependencies":["deepswe","terminal-bench-v2-1","terminal-bench-family","swe-atlas-qna"],"limitation":"Le score mesure Claude Opus 5 avec un agent précis. Changer cet agent peut changer le résultat.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"sol-aa-coding","modelId":"sol","domain":"coding","constructId":"software-agent","familyId":"aa-coding-agent-v1-4","benchmark":"Artificial Analysis Coding Agent Index v1.4","organization":"Artificial Analysis","result":{"display":"65 points","value":65,"unit":"index","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":326,"unit":"tâches","runs":3},"protocol":{"harness":"Agent Codex","effort":"max","scoring":"Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée","judge":"Programmes exécutés et résultats vérifiés automatiquement"},"benchmarkVersion":"1.4","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-coding-agent-v1-4","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","accessedAt":"2026-09-04","publishedAt":"not-published"},"dependencies":["deepswe","terminal-bench-v2-1","terminal-bench-family","swe-atlas-qna"],"limitation":"Le score mesure GPT-5.6 Sol avec un agent précis. Changer cet agent peut changer le résultat.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-1-terminal-bench-4","modelId":"fable-5-1","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"57,88 %","value":57.88,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 54,12 à 61,64 %","low":54.12,"high":61.64,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Claude Code 2.1.257","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"fable-5-1","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-02-anthropic-claude-fable-5-1-max-claude-code.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-02-anthropic-claude-fable-5-1-max-claude-code.json","accessedAt":"2026-09-05","publishedAt":"2026-09-03","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/9dcd4d5b483eadb3e562914afa1412d5c4f24579"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5-1. Date de sortie déclarée par Terminal-Bench : 2026-09-01.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"opus-5-terminal-bench-4","modelId":"opus-5","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"51,82 %","value":51.82,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 48,43 à 55,21 %","low":48.43,"high":55.21,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Claude Code 2.1.231","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"opus-5","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-opus-5-max-claude-code.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-opus-5-max-claude-code.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-5. Date de sortie déclarée par Terminal-Bench : 2026-07-24.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-terminal-bench-4","modelId":"fable-5","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"44,55 %","value":44.55,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 40,70 à 48,40 %","low":40.7,"high":48.4,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Claude Code 2.1.231","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"fable-5","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-fable-5-max-claude-code.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-fable-5-max-claude-code.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5. Date de sortie déclarée par Terminal-Bench : 2026-06-09.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-terminal-bench-4","modelId":"glm-5-3","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"41,82 %","value":41.82,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 38,59 à 45,05 %","low":38.59,"high":45.05,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Claude Code 2.1.207","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","crossSourceExclusion":"Effort max chez Terminal-Bench ; effort LiveBench non publié. Aucune équivalence supposée.","configuration":{"version":"glm-5-3","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-glm-5-3-max-claude-code.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-glm-5-3-max-claude-code.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/glm-5.3. Date de sortie déclarée par Terminal-Bench : 2026-08-14. Fabricant Z.ai ; préfixe source anthropic/, fournisseur du point d’accès non publié. Effort max chez Terminal-Bench ; effort LiveBench non publié. Aucune équivalence supposée.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"sol-terminal-bench-4","modelId":"sol","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"37,27 %","value":37.27,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 33,49 à 41,05 %","low":33.49,"high":41.05,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Codex 0.149.1","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"sol","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-sol-max-codex.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-sol-max-codex.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-sol. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-8-terminal-bench-4","modelId":"claude-opus-4-8","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"23,64 %","value":23.64,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 20,08 à 27,20 %","low":20.08,"high":27.2,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Claude Code 2.1.231","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"claude-opus-4-8","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-opus-4-8-max-claude-code.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-opus-4-8-max-claude-code.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-4-8. Date de sortie déclarée par Terminal-Bench : 2026-05-28.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"terra-terminal-bench-4","modelId":"terra","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"21,52 %","value":21.52,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 18,27 à 24,77 %","low":18.27,"high":24.77,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Codex 0.149.1","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"terra","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-terra-max-codex.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-terra-max-codex.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-terra. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-6-terminal-bench-4","modelId":"grok-4-6","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"20,30 %","value":20.3,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 17,21 à 23,39 %","low":17.21,"high":23.39,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Grok Build 1.0.5","effort":"Non publié","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"Réglage non publié","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","crossSourceExclusion":"Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé.","configuration":{"version":"grok-4-6","effort":"not-published","modelSetting":"Réglage non publié","effortSetting":"Non publié","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-xai-grok-4-6-none-grok-build.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-xai-grok-4-6-none-grok-build.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.6. Date de sortie déclarée par Terminal-Bench : 2026-08-12. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-8-flash-terminal-bench-4","modelId":"gemini-3-8-flash","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"19,09 %","value":19.09,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 15,73 à 22,45 %","low":15.73,"high":22.45,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"mini-SWE-agent 2.4.6","effort":"high","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"gemini-3-8-flash","effort":"high","modelSetting":"high","effortSetting":"high","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-01-gemini-gemini-3-8-flash-high-mini-swe-agent.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-01-gemini-gemini-3-8-flash-high-mini-swe-agent.json","accessedAt":"2026-09-05","publishedAt":"2026-09-03","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/83c7a6172d629c6575b785ab12c8db787bb2e323"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.8-flash. Date de sortie déclarée par Terminal-Bench : 2026-09-02.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"luna-terminal-bench-4","modelId":"luna","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"17,27 %","value":17.27,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 14,42 à 20,12 %","low":14.42,"high":20.12,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Codex 0.149.1","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"luna","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-luna-max-codex.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-luna-max-codex.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-luna. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-5-terminal-bench-4","modelId":"claude-sonnet-5","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"12,42 %","value":12.42,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 9,36 à 15,48 %","low":9.36,"high":15.48,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Claude Code 2.1.231","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","crossSourceExclusion":"Efforts différents : max chez Terminal-Bench, xhigh chez LiveBench.","configuration":{"version":"claude-sonnet-5","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-sonnet-5-max-claude-code.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-sonnet-5-max-claude-code.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-sonnet-5. Date de sortie déclarée par Terminal-Bench : 2026-06-30. Efforts différents : max chez Terminal-Bench, xhigh chez LiveBench.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-5-terminal-bench-4","modelId":"grok-4-5","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"12,42 %","value":12.42,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 9,80 à 15,04 %","low":9.8,"high":15.04,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Grok Build 1.0.5","effort":"Non publié","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"Réglage non publié","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","crossSourceExclusion":"Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé.","configuration":{"version":"grok-4-5","effort":"not-published","modelSetting":"Réglage non publié","effortSetting":"Non publié","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-xai-grok-4-5-none-grok-build.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-xai-grok-4-5-none-grok-build.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.5. Date de sortie déclarée par Terminal-Bench : 2026-07-16. Écart conservé avec la date du catalogue Origin : 2026-07-08. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-7-flash-terminal-bench-4","modelId":"gemini-3-7-flash","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"11,21 %","value":11.21,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 8,76 à 13,66 %","low":8.76,"high":13.66,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"mini-SWE-agent 2.4.6","effort":"high","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"gemini-3-7-flash","effort":"high","modelSetting":"high","effortSetting":"high","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-02-gemini-gemini-3-7-flash-high-mini-swe-agent.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-02-gemini-gemini-3-7-flash-high-mini-swe-agent.json","accessedAt":"2026-09-05","publishedAt":"2026-09-03","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/4eb279f8d4acd122c4f6db12e312f7cb31556604"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.7-flash. Date de sortie déclarée par Terminal-Bench : 2026-08-13.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"minimax-m2-5-swe-bench-verified","modelId":"minimax-m2-5","domain":"coding","constructId":"repository-bug-repair","familyId":"swe-bench-verified-mini-v2-2026-02","benchmark":"SWE-bench Verified","organization":"SWE-bench","result":{"display":"75,8 %","value":75.8,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":500,"unit":"problèmes de dépôt","runs":1},"protocol":{"harness":"mini-SWE-agent 2.0.0","effort":"high","scoring":"Part des 500 problèmes de dépôt résolus","judge":"Tests automatisés propres à chaque problème"},"benchmarkVersion":"Verified, 500 problèmes","modelSetting":"high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"swe-bench-verified-2026","riskOfBias":{"testSetAccess":"public","verification":"mechanical","itemLevelResults":"available","harnessComparable":"same"},"source":{"url":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_minimax-2-5-high/metadata.yaml","accessedAt":"2026-09-04","publishedAt":"2026-02-17","publicationUrl":"https://github.com/SWE-bench/experiments/pull/413","runReviewStatus":"not-disclosed"},"dependencies":["swe-bench-verified-2026-02"],"limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 379 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication.","evidence":{"grade":"C","reason":"Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test."}},{"id":"claude-opus-4-6-swe-bench-verified","modelId":"claude-opus-4-6","domain":"coding","constructId":"repository-bug-repair","familyId":"swe-bench-verified-mini-v2-2026-02","benchmark":"SWE-bench Verified","organization":"SWE-bench","result":{"display":"75,6 %","value":75.6,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":500,"unit":"problèmes de dépôt","runs":1},"protocol":{"harness":"mini-SWE-agent 2.0.0","effort":"Non publié","scoring":"Part des 500 problèmes de dépôt résolus","judge":"Tests automatisés propres à chaque problème"},"benchmarkVersion":"Verified, 500 problèmes","modelSetting":"Réglage non publié","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"swe-bench-verified-2026","riskOfBias":{"testSetAccess":"public","verification":"mechanical","itemLevelResults":"available","harnessComparable":"same"},"source":{"url":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_claude-4-6-opus/metadata.yaml","accessedAt":"2026-09-04","publishedAt":"2026-02-17","publicationUrl":"https://github.com/SWE-bench/experiments/pull/413","revision":{"publishedAt":"2026-02-18","previousValue":75.4,"url":"https://github.com/SWE-bench/experiments/commit/36905bfeb728dadd82a75bb169ed612aac634551"},"runReviewStatus":"not-disclosed"},"dependencies":["swe-bench-verified-2026-02"],"limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 378 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Valeur révisée de 75,4 à 75,6 % le 18 février 2026 : https://github.com/SWE-bench/experiments/commit/36905bfeb728dadd82a75bb169ed612aac634551. Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication.","evidence":{"grade":"C","reason":"Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test."}},{"id":"glm-5-swe-bench-verified","modelId":"glm-5","domain":"coding","constructId":"repository-bug-repair","familyId":"swe-bench-verified-mini-v2-2026-02","benchmark":"SWE-bench Verified","organization":"SWE-bench","result":{"display":"72,8 %","value":72.8,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":500,"unit":"problèmes de dépôt","runs":1},"protocol":{"harness":"mini-SWE-agent 2.0.0","effort":"high","scoring":"Part des 500 problèmes de dépôt résolus","judge":"Tests automatisés propres à chaque problème"},"benchmarkVersion":"Verified, 500 problèmes","modelSetting":"high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"swe-bench-verified-2026","riskOfBias":{"testSetAccess":"public","verification":"mechanical","itemLevelResults":"available","harnessComparable":"same"},"source":{"url":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_glm-5-high/metadata.yaml","accessedAt":"2026-09-04","publishedAt":"2026-02-17","publicationUrl":"https://github.com/SWE-bench/experiments/pull/413","runReviewStatus":"not-disclosed"},"dependencies":["swe-bench-verified-2026-02"],"limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 364 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication.","evidence":{"grade":"C","reason":"Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test."}},{"id":"kimi-k2-5-swe-bench-verified","modelId":"kimi-k2-5","domain":"coding","constructId":"repository-bug-repair","familyId":"swe-bench-verified-mini-v2-2026-02","benchmark":"SWE-bench Verified","organization":"SWE-bench","result":{"display":"70,8 %","value":70.8,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":500,"unit":"problèmes de dépôt","runs":1},"protocol":{"harness":"mini-SWE-agent 2.0.0","effort":"high","scoring":"Part des 500 problèmes de dépôt résolus","judge":"Tests automatisés propres à chaque problème"},"benchmarkVersion":"Verified, 500 problèmes","modelSetting":"high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"swe-bench-verified-2026","riskOfBias":{"testSetAccess":"public","verification":"mechanical","itemLevelResults":"available","harnessComparable":"same"},"source":{"url":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_kimi-k2-5-high/metadata.yaml","accessedAt":"2026-09-04","publishedAt":"2026-02-17","publicationUrl":"https://github.com/SWE-bench/experiments/pull/413","runReviewStatus":"not-disclosed"},"dependencies":["swe-bench-verified-2026-02"],"limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 354 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication.","evidence":{"grade":"C","reason":"Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test."}},{"id":"astra-epoch-eci","modelId":"astra","domain":"general","constructId":"general-composite","familyId":"epoch-eci-2026-09","benchmark":"Epoch Capabilities Index","organization":"Epoch AI","result":{"display":"169 points Epoch","value":169,"unit":"index","better":"higher","dispersion":{"kind":"interval","display":"Fourchette probable à 90 % : 165 à 174","low":165,"high":174,"confidence":90}},"sample":{"size":50,"unit":"tests comparatifs ou davantage","runs":"not-published"},"protocol":{"harness":"Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants","effort":"Meilleur score retenu entre réglages d’un même modèle","scoring":"Calcul tenant compte du niveau de difficulté de chaque test","judge":"Variable selon le test d’origine"},"benchmarkVersion":"2026-09","modelSetting":"Meilleur réglage publié","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"epoch-eci-2026-09","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"not-disclosed"},"source":{"accessedAt":"2026-09-04","publishedAt":"2026-09-03","url":"https://epoch.ai/models/gpt-6-astra"},"dependencies":["multiple-upstream-benchmarks"],"limitation":"Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.","evidence":{"grade":"C","reason":"La source dépend du fabricant ou mélange des résultats de plusieurs origines."}},{"id":"fable-5-1-epoch-eci","modelId":"fable-5-1","domain":"general","constructId":"general-composite","familyId":"epoch-eci-2026-09","benchmark":"Epoch Capabilities Index","organization":"Epoch AI","result":{"display":"163 points Epoch","value":163,"unit":"index","better":"higher","dispersion":{"kind":"interval","display":"Fourchette probable à 90 % : 160 à 166","low":160,"high":166,"confidence":90}},"sample":{"size":50,"unit":"tests comparatifs ou davantage","runs":"not-published"},"protocol":{"harness":"Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants","effort":"Meilleur score retenu entre réglages d’un même modèle","scoring":"Calcul tenant compte du niveau de difficulté de chaque test","judge":"Variable selon le test d’origine"},"benchmarkVersion":"2026-09","modelSetting":"Meilleur réglage publié","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"epoch-eci-2026-09","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"not-disclosed"},"source":{"accessedAt":"2026-09-04","publishedAt":"2026-09-01","url":"https://epoch.ai/models/claude-fable-5-1"},"dependencies":["multiple-upstream-benchmarks"],"limitation":"Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.","evidence":{"grade":"C","reason":"La source dépend du fabricant ou mélange des résultats de plusieurs origines."}},{"id":"sol-epoch-eci","modelId":"sol","domain":"general","constructId":"general-composite","familyId":"epoch-eci-2026-09","benchmark":"Epoch Capabilities Index","organization":"Epoch AI","result":{"display":"162 points Epoch","value":162,"unit":"index","better":"higher","dispersion":{"kind":"interval","display":"Fourchette probable à 90 % : 160 à 165","low":160,"high":165,"confidence":90}},"sample":{"size":50,"unit":"tests comparatifs ou davantage","runs":"not-published"},"protocol":{"harness":"Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants","effort":"Meilleur score retenu entre réglages d’un même modèle","scoring":"Calcul tenant compte du niveau de difficulté de chaque test","judge":"Variable selon le test d’origine"},"benchmarkVersion":"2026-09","modelSetting":"Meilleur réglage publié","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"epoch-eci-2026-09","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"not-disclosed"},"source":{"accessedAt":"2026-09-04","publishedAt":"2026-07-09","url":"https://epoch.ai/models/gpt-5-6-sol"},"dependencies":["multiple-upstream-benchmarks"],"limitation":"Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.","evidence":{"grade":"C","reason":"La source dépend du fabricant ou mélange des résultats de plusieurs origines."}},{"id":"astra-arc-agi-3-standard","modelId":"astra","domain":"agentic","constructId":"novel-rule-learning","familyId":"arc-agi-3-astra","benchmark":"ARC-AGI-3, tâches partiellement cachées, configuration standard","organization":"ARC Prize","result":{"display":"62,7 %","value":62.71,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":"not-published","unit":"environnements partiellement cachés","runs":"not-published"},"protocol":{"harness":"Interface minimale commune, notes visibles gérées par le modèle","effort":"max","scoring":"Objectifs atteints dans des environnements inconnus","judge":"Résultat vérifié par ARC Prize"},"benchmarkVersion":"3","modelSetting":"max, configuration standard","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"arc-agi-3","riskOfBias":{"testSetAccess":"private","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://arcprize.org/results/openai-gpt-6-astra","accessedAt":"2026-09-04","publishedAt":"2026-09-02"},"dependencies":[],"limitation":"Mesure ciblée d’apprentissage de règles nouvelles. Elle ne mesure pas un pourcentage d’intelligence générale.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"astra-arc-agi-3-adapter","modelId":"astra","domain":"agentic","constructId":"novel-rule-learning","familyId":"arc-agi-3-astra","benchmark":"ARC-AGI-3, tâches partiellement cachées, configuration fournisseur","organization":"ARC Prize","result":{"display":"99,9 %","value":99.95,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":"not-published","unit":"environnements partiellement cachés","runs":"not-published"},"protocol":{"harness":"État de raisonnement opaque conservé et contexte compacté par le fournisseur","effort":"high","scoring":"Objectifs atteints dans des environnements inconnus","judge":"Résultat vérifié par ARC Prize"},"benchmarkVersion":"3","modelSetting":"high, configuration fournisseur","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"arc-agi-3","riskOfBias":{"testSetAccess":"private","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://arcprize.org/results/openai-gpt-6-astra","accessedAt":"2026-09-04","publishedAt":"2026-09-02"},"dependencies":["astra-arc-agi-3-standard"],"limitation":"Même série de tâches que la configuration standard. Ce résultat ne constitue pas une seconde confirmation indépendante.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"astra-apex-agents","modelId":"astra","domain":"agentic","constructId":"professional-workflow","familyId":"mercor-apex-agents","benchmark":"APEX-Agents","organization":"Mercor","result":{"display":"62,4 %","value":62.4,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"± 3,6 points","low":58.8,"high":66}},"sample":{"size":480,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions utilisant plusieurs applications de travail","effort":"xHigh","scoring":"Part moyenne des critères réussis","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"xHigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-agents","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["apex-legal","apex-finance","apex-consulting"],"limitation":"Les tâches et critères viennent de professionnels, mais une partie de la correction repose sur un autre modèle d’IA.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-1-apex-agents","modelId":"fable-5-1","domain":"agentic","constructId":"professional-workflow","familyId":"mercor-apex-agents","benchmark":"APEX-Agents","organization":"Mercor","result":{"display":"62,0 %","value":62,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"± 3,5 points","low":58.5,"high":65.5}},"sample":{"size":480,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions utilisant plusieurs applications de travail","effort":"max","scoring":"Part moyenne des critères réussis","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-agents","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["apex-legal","apex-finance","apex-consulting"],"limitation":"Les tâches et critères viennent de professionnels, mais une partie de la correction repose sur un autre modèle d’IA.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"astra-apex-legal-mean-score","modelId":"astra","domain":"legal","constructId":"corporate-lawyer","familyId":"mercor-apex-agents-legal-mean-score","benchmark":"APEX-Agents Corporate Lawyer, moyenne des critères","organization":"Mercor","result":{"display":"67,9 % des critères réussis","value":67.9,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"xHigh","scoring":"Moyenne des critères réussis","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor. Les deux lectures juridiques viennent de cette même entrée.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"xHigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-legal","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-1-apex-legal-mean-score","modelId":"fable-5-1","domain":"legal","constructId":"corporate-lawyer","familyId":"mercor-apex-agents-legal-mean-score","benchmark":"APEX-Agents Corporate Lawyer, moyenne des critères","organization":"Mercor","result":{"display":"64,8 % des critères réussis","value":64.8,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"max","scoring":"Moyenne des critères réussis","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor. Les deux lectures juridiques viennent de cette même entrée.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-legal","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"sol-apex-legal-mean-score","modelId":"sol","domain":"legal","constructId":"corporate-lawyer","familyId":"mercor-apex-agents-legal-mean-score","benchmark":"APEX-Agents Corporate Lawyer, moyenne des critères","organization":"Mercor","result":{"display":"63,4 % des critères réussis","value":63.4,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"max","scoring":"Moyenne des critères réussis","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor. Les deux lectures juridiques viennent de cette même entrée.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-legal","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"astra-apex-legal-all-criteria","modelId":"astra","domain":"legal","constructId":"corporate-lawyer","familyId":"mercor-apex-agents-legal-all-criteria","benchmark":"APEX-Agents Corporate Lawyer, tâches sans erreur","organization":"Mercor","result":{"display":"40,5 % des tâches entièrement réussies","value":40.5,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"xHigh","scoring":"Part des tâches dont tous les critères passent","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor. Les deux lectures juridiques viennent de cette même entrée.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"xHigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-legal","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-1-apex-legal-all-criteria","modelId":"fable-5-1","domain":"legal","constructId":"corporate-lawyer","familyId":"mercor-apex-agents-legal-all-criteria","benchmark":"APEX-Agents Corporate Lawyer, tâches sans erreur","organization":"Mercor","result":{"display":"41,9 % des tâches entièrement réussies","value":41.9,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"max","scoring":"Part des tâches dont tous les critères passent","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor. Les deux lectures juridiques viennent de cette même entrée.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-legal","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"sol-apex-legal-all-criteria","modelId":"sol","domain":"legal","constructId":"corporate-lawyer","familyId":"mercor-apex-agents-legal-all-criteria","benchmark":"APEX-Agents Corporate Lawyer, tâches sans erreur","organization":"Mercor","result":{"display":"35,6 % des tâches entièrement réussies","value":35.6,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"max","scoring":"Part des tâches dont tous les critères passent","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor. Les deux lectures juridiques viennent de cette même entrée.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-legal","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"astra-apex-finance-mean-score","modelId":"astra","domain":"finance","constructId":"investment-banking","familyId":"mercor-apex-agents-finance-mean-score","benchmark":"APEX-Agents Investment Banking Analyst, moyenne des critères","organization":"Mercor","result":{"display":"52,0 % des critères réussis","value":52,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"xHigh","scoring":"Moyenne des critères réussis","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"xHigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-finance","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/investment-banking-analyst-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-1-apex-finance-mean-score","modelId":"fable-5-1","domain":"finance","constructId":"investment-banking","familyId":"mercor-apex-agents-finance-mean-score","benchmark":"APEX-Agents Investment Banking Analyst, moyenne des critères","organization":"Mercor","result":{"display":"55,7 % des critères réussis","value":55.7,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"max","scoring":"Moyenne des critères réussis","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-finance","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/investment-banking-analyst-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"sol-apex-finance-mean-score","modelId":"sol","domain":"finance","constructId":"investment-banking","familyId":"mercor-apex-agents-finance-mean-score","benchmark":"APEX-Agents Investment Banking Analyst, moyenne des critères","organization":"Mercor","result":{"display":"46,6 % des critères réussis","value":46.6,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"max","scoring":"Moyenne des critères réussis","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-finance","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/investment-banking-analyst-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"astra-frontiermath-erdos","modelId":"astra","domain":"mathScience","constructId":"formal-research-math","familyId":"epoch-frontiermath-erdos","benchmark":"FrontierMath Erdős","organization":"Epoch AI","result":{"display":"3 %","value":3,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":68,"unit":"problèmes","runs":1},"protocol":{"harness":"Agent sans internet, budget de 300 $ et 72 heures par problème","effort":"Version pré-lancement pour Astra, réglage fixe par modèle","scoring":"Preuve ou réfutation acceptée par Lean, un vérificateur mathématique","judge":"Outil Lean de vérification mathématique"},"benchmarkVersion":"Erdős 2026-09","modelSetting":"Réglage fixe publié par modèle","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"epoch-frontiermath-erdos","riskOfBias":{"testSetAccess":"private","verification":"formal-proof","itemLevelResults":"partial","harnessComparable":"same"},"source":{"url":"https://epoch.ai/latest/announcing-frontiermath-erdos","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":[],"limitation":"Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-1-frontiermath-erdos","modelId":"fable-5-1","domain":"mathScience","constructId":"formal-research-math","familyId":"epoch-frontiermath-erdos","benchmark":"FrontierMath Erdős","organization":"Epoch AI","result":{"display":"0 %","value":0,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":68,"unit":"problèmes","runs":1},"protocol":{"harness":"Agent sans internet, budget de 300 $ et 72 heures par problème","effort":"Version pré-lancement pour Astra, réglage fixe par modèle","scoring":"Preuve ou réfutation acceptée par Lean, un vérificateur mathématique","judge":"Outil Lean de vérification mathématique"},"benchmarkVersion":"Erdős 2026-09","modelSetting":"Réglage fixe publié par modèle","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"epoch-frontiermath-erdos","riskOfBias":{"testSetAccess":"private","verification":"formal-proof","itemLevelResults":"partial","harnessComparable":"same"},"source":{"url":"https://epoch.ai/latest/announcing-frontiermath-erdos","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":[],"limitation":"Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"sol-frontiermath-erdos","modelId":"sol","domain":"mathScience","constructId":"formal-research-math","familyId":"epoch-frontiermath-erdos","benchmark":"FrontierMath Erdős","organization":"Epoch AI","result":{"display":"0 %","value":0,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":68,"unit":"problèmes","runs":1},"protocol":{"harness":"Agent sans internet, budget de 300 $ et 72 heures par problème","effort":"Version pré-lancement pour Astra, réglage fixe par modèle","scoring":"Preuve ou réfutation acceptée par Lean, un vérificateur mathématique","judge":"Outil Lean de vérification mathématique"},"benchmarkVersion":"Erdős 2026-09","modelSetting":"Réglage fixe publié par modèle","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"epoch-frontiermath-erdos","riskOfBias":{"testSetAccess":"private","verification":"formal-proof","itemLevelResults":"partial","harnessComparable":"same"},"source":{"url":"https://epoch.ai/latest/announcing-frontiermath-erdos","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":[],"limitation":"Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"astra-openai-healthbench-professional","modelId":"astra","domain":"healthcare","constructId":"clinical-response","familyId":"openai-healthbench-professional","benchmark":"HealthBench Professional","organization":"OpenAI","result":{"display":"63,4 %","value":63.4,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":"not-published","unit":"conversations médicales professionnelles","runs":"not-published"},"protocol":{"harness":"Réponses produites dans HealthBench Professional","effort":"Réglage annoncé par OpenAI","scoring":"Score corrigé pour réduire l’avantage des réponses longues","judge":"Critères écrits par des médecins puis correction automatisée"},"benchmarkVersion":"Professional 2026-09","modelSetting":"Réglage annoncé par OpenAI","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"openai-healthbench-professional","riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"not-disclosed"},"source":{"url":"https://deploymentsafety.openai.com/gpt-6-astra/vision","accessedAt":"2026-09-04","publishedAt":"2026-09-03"},"dependencies":[],"limitation":"OpenAI publie ce résultat sur ses propres modèles. Sans test extérieur, il ne suffit pas pour choisir un modèle en santé.","evidence":{"grade":"C","reason":"Chiffre publié par le fabricant du modèle."}},{"id":"sol-openai-healthbench-professional","modelId":"sol","domain":"healthcare","constructId":"clinical-response","familyId":"openai-healthbench-professional","benchmark":"HealthBench Professional","organization":"OpenAI","result":{"display":"60,5 %","value":60.5,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":"not-published","unit":"conversations médicales professionnelles","runs":"not-published"},"protocol":{"harness":"Réponses produites dans HealthBench Professional","effort":"Réglage annoncé par OpenAI","scoring":"Score corrigé pour réduire l’avantage des réponses longues","judge":"Critères écrits par des médecins puis correction automatisée"},"benchmarkVersion":"Professional 2026-09","modelSetting":"Réglage annoncé par OpenAI","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"openai-healthbench-professional","riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"not-disclosed"},"source":{"url":"https://deploymentsafety.openai.com/gpt-6-astra/vision","accessedAt":"2026-09-04","publishedAt":"2026-09-03"},"dependencies":[],"limitation":"OpenAI publie ce résultat sur ses propres modèles. Sans test extérieur, il ne suffit pas pour choisir un modèle en santé.","evidence":{"grade":"C","reason":"Chiffre publié par le fabricant du modèle."}},{"id":"astra-aa-omniscience-hallucination","modelId":"astra","domain":"factuality","constructId":"knowledge-abstention","familyId":"aa-omniscience-2026-09","benchmark":"AA-Omniscience, réponses inventées","organization":"Artificial Analysis","result":{"display":"51 % de réponses inventées","value":51,"unit":"percent","better":"lower","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":"not-published","unit":"questions de connaissance","runs":"not-published"},"protocol":{"harness":"Outils de l’Artificial Analysis Intelligence Index v4.1.1","effort":"max","scoring":"Réponse incorrecte donnée au lieu d’une abstention","judge":"Correction par GPT-5.6 Luna, un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-omniscience-2026-09","riskOfBias":{"testSetAccess":"mixed","verification":"ai-judge","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","accessedAt":"2026-09-04","publishedAt":"2026-09-03"},"dependencies":["aa-intelligence-v4-1-1"],"limitation":"Le résultat dépend des questions choisies et d’une correction par un autre modèle d’IA. Il ne mesure pas toutes les formes d’erreur factuelle.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"sol-aa-omniscience-hallucination","modelId":"sol","domain":"factuality","constructId":"knowledge-abstention","familyId":"aa-omniscience-2026-09","benchmark":"AA-Omniscience, réponses inventées","organization":"Artificial Analysis","result":{"display":"92 % de réponses inventées","value":92,"unit":"percent","better":"lower","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":"not-published","unit":"questions de connaissance","runs":"not-published"},"protocol":{"harness":"Outils de l’Artificial Analysis Intelligence Index v4.1.1","effort":"max","scoring":"Réponse incorrecte donnée au lieu d’une abstention","judge":"Correction par GPT-5.6 Luna, un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-omniscience-2026-09","riskOfBias":{"testSetAccess":"mixed","verification":"ai-judge","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","accessedAt":"2026-09-04","publishedAt":"2026-09-03"},"dependencies":["aa-intelligence-v4-1-1"],"limitation":"Le résultat dépend des questions choisies et d’une correction par un autre modèle d’IA. Il ne mesure pas toutes les formes d’erreur factuelle.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-6-livebench-reasoning","modelId":"claude-opus-4-6","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"88,7 %","value":88.673,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-6-thinking-auto-high-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-6-thinking-auto-high-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-6-livebench-coding","modelId":"claude-opus-4-6","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"78,2 %","value":78.1845,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-6-thinking-auto-high-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-6-thinking-auto-high-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-6-livebench-agentic-coding","modelId":"claude-opus-4-6","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"49,0 %","value":48.9897,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-6-thinking-auto-high-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-6-thinking-auto-high-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-6-livebench-mathematics","modelId":"claude-opus-4-6","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"89,3 %","value":89.317,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-6-thinking-auto-high-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-6-thinking-auto-high-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-6-livebench-data-analysis","modelId":"claude-opus-4-6","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"69,9 %","value":69.893,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-6-thinking-auto-high-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-6-thinking-auto-high-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-6-livebench-language","modelId":"claude-opus-4-6","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"83,3 %","value":83.2697,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-6-thinking-auto-high-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-6-thinking-auto-high-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-6-livebench-instruction-following","modelId":"claude-opus-4-6","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"63,3 %","value":63.3125,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-6-thinking-auto-high-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-6-thinking-auto-high-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-7-livebench-reasoning","modelId":"claude-opus-4-7","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"87,2 %","value":87.1923,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-7-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-7-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-7-livebench-coding","modelId":"claude-opus-4-7","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"82,1 %","value":82.088,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-7-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-7-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-7-livebench-agentic-coding","modelId":"claude-opus-4-7","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"50,7 %","value":50.6563,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-7-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-7-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-7-livebench-mathematics","modelId":"claude-opus-4-7","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"92,9 %","value":92.8538,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-7-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-7-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-7-livebench-data-analysis","modelId":"claude-opus-4-7","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"78,3 %","value":78.2637,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-7-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-7-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-7-livebench-language","modelId":"claude-opus-4-7","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"77,9 %","value":77.914,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-7-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-7-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-7-livebench-instruction-following","modelId":"claude-opus-4-7","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"66,7 %","value":66.7375,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-7-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-7-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-4-6-livebench-reasoning","modelId":"claude-sonnet-4-6","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"84,8 %","value":84.7693,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-4-6-thinking-auto-medium-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-4-6-thinking-auto-medium-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-4-6-livebench-coding","modelId":"claude-sonnet-4-6","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"79,3 %","value":79.2715,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-4-6-thinking-auto-medium-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-4-6-thinking-auto-medium-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-4-6-livebench-agentic-coding","modelId":"claude-sonnet-4-6","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"42,6 %","value":42.626,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-4-6-thinking-auto-medium-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-4-6-thinking-auto-medium-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-4-6-livebench-mathematics","modelId":"claude-sonnet-4-6","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"87,0 %","value":86.994,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-4-6-thinking-auto-medium-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-4-6-thinking-auto-medium-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-4-6-livebench-data-analysis","modelId":"claude-sonnet-4-6","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"77,9 %","value":77.946,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-4-6-thinking-auto-medium-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-4-6-thinking-auto-medium-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-4-6-livebench-language","modelId":"claude-sonnet-4-6","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"76,1 %","value":76.1027,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-4-6-thinking-auto-medium-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-4-6-thinking-auto-medium-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-4-6-livebench-instruction-following","modelId":"claude-sonnet-4-6","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"63,2 %","value":63.2208,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-4-6-thinking-auto-medium-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-4-6-thinking-auto-medium-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-5-livebench-reasoning","modelId":"claude-sonnet-5","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"88,7 %","value":88.6923,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-5-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-5-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-5-livebench-coding","modelId":"claude-sonnet-5","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"80,7 %","value":80.68,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-5-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-5-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-5-livebench-agentic-coding","modelId":"claude-sonnet-5","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"59,4 %","value":59.394,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-5-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-5-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-5-livebench-mathematics","modelId":"claude-sonnet-5","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"92,9 %","value":92.9423,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-5-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-5-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-5-livebench-data-analysis","modelId":"claude-sonnet-5","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"71,7 %","value":71.7407,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-5-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-5-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-5-livebench-language","modelId":"claude-sonnet-5","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"75,0 %","value":74.9703,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-5-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-5-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-5-livebench-instruction-following","modelId":"claude-sonnet-5","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"63,9 %","value":63.8585,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-5-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-5-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-livebench-reasoning","modelId":"deepseek-v4-flash","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"70,6 %","value":70.5818,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-livebench-coding","modelId":"deepseek-v4-flash","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"69,2 %","value":69.228,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-livebench-agentic-coding","modelId":"deepseek-v4-flash","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"37,6 %","value":37.626,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-livebench-mathematics","modelId":"deepseek-v4-flash","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"79,6 %","value":79.6475,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-livebench-data-analysis","modelId":"deepseek-v4-flash","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"68,0 %","value":68.023,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-livebench-language","modelId":"deepseek-v4-flash","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"70,1 %","value":70.124,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-livebench-instruction-following","modelId":"deepseek-v4-flash","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"63,1 %","value":63.1375,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-pro-livebench-reasoning","modelId":"deepseek-v4-pro","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"82,7 %","value":82.6923,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-pro-livebench-coding","modelId":"deepseek-v4-pro","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"70,0 %","value":69.994,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-pro-livebench-agentic-coding","modelId":"deepseek-v4-pro","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"42,6 %","value":42.626,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-pro-livebench-mathematics","modelId":"deepseek-v4-pro","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"90,7 %","value":90.6755,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-pro-livebench-data-analysis","modelId":"deepseek-v4-pro","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"74,5 %","value":74.5377,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-pro-livebench-language","modelId":"deepseek-v4-pro","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"78,1 %","value":78.1303,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-pro-livebench-instruction-following","modelId":"deepseek-v4-pro","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"62,4 %","value":62.35,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-1-pro-preview-livebench-reasoning","modelId":"gemini-3-1-pro-preview","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"84,0 %","value":84.0048,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.1-pro-preview-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.1-pro-preview-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-1-pro-preview-livebench-coding","modelId":"gemini-3-1-pro-preview","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"76,5 %","value":76.4545,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.1-pro-preview-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.1-pro-preview-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gemini-3-1-pro-preview","effort":"high","modelSetting":"gemini-3.1-pro-preview-high","effortSetting":"Réglage publié : gemini-3.1-pro-preview-high","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-1-pro-preview-livebench-agentic-coding","modelId":"gemini-3-1-pro-preview","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"44,1 %","value":44.1413,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.1-pro-preview-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.1-pro-preview-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-1-pro-preview-livebench-mathematics","modelId":"gemini-3-1-pro-preview","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"91,0 %","value":91.045,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.1-pro-preview-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.1-pro-preview-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-1-pro-preview-livebench-data-analysis","modelId":"gemini-3-1-pro-preview","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"78,5 %","value":78.5413,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.1-pro-preview-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.1-pro-preview-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-1-pro-preview-livebench-language","modelId":"gemini-3-1-pro-preview","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"85,4 %","value":85.376,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.1-pro-preview-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.1-pro-preview-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-1-pro-preview-livebench-instruction-following","modelId":"gemini-3-1-pro-preview","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"79,1 %","value":79.1,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.1-pro-preview-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.1-pro-preview-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-5-flash-livebench-reasoning","modelId":"gemini-3-5-flash","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"82,0 %","value":82.0048,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-5-flash-livebench-coding","modelId":"gemini-3-5-flash","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"78,2 %","value":78.1845,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gemini-3-5-flash","effort":"high","modelSetting":"gemini-3.5-flash-high","effortSetting":"Réglage publié : gemini-3.5-flash-high","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-5-flash-livebench-agentic-coding","modelId":"gemini-3-5-flash","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"49,0 %","value":48.9897,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-5-flash-livebench-mathematics","modelId":"gemini-3-5-flash","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"88,2 %","value":88.2438,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-5-flash-livebench-data-analysis","modelId":"gemini-3-5-flash","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"64,9 %","value":64.8573,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-5-flash-livebench-language","modelId":"gemini-3-5-flash","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"84,6 %","value":84.5843,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-5-flash-livebench-instruction-following","modelId":"gemini-3-5-flash","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"75,6 %","value":75.6,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-2-livebench-reasoning","modelId":"glm-5-2","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"78,6 %","value":78.625,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.2","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.2","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-2-livebench-coding","modelId":"glm-5-2","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"79,7 %","value":79.654,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.2","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.2","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-2-livebench-agentic-coding","modelId":"glm-5-2","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"51,8 %","value":51.7677,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.2","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.2","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-2-livebench-mathematics","modelId":"glm-5-2","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"89,8 %","value":89.7813,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.2","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.2","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-2-livebench-data-analysis","modelId":"glm-5-2","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"73,7 %","value":73.7397,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.2","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.2","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-2-livebench-language","modelId":"glm-5-2","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"76,2 %","value":76.2417,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.2","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.2","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-2-livebench-instruction-following","modelId":"glm-5-2","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"62,3 %","value":62.2918,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.2","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.2","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-mini-livebench-reasoning","modelId":"gpt-5-4-mini","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"71,3 %","value":71.3238,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":199,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-mini-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-mini-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-mini-livebench-coding","modelId":"gpt-5-4-mini","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"71,6 %","value":71.624,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":110,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-mini-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-mini-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gpt-5.4-mini-2026-03-17","effort":"xhigh","modelSetting":"gpt-5.4-mini-xhigh","effortSetting":"Réglage publié : gpt-5.4-mini-xhigh","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-mini-livebench-agentic-coding","modelId":"gpt-5-4-mini","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"41,7 %","value":41.6667,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-mini-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-mini-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-mini-livebench-mathematics","modelId":"gpt-5-4-mini","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"78,5 %","value":78.462,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":377,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-mini-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-mini-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-mini-livebench-data-analysis","modelId":"gpt-5-4-mini","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"70,8 %","value":70.7857,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-mini-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-mini-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-mini-livebench-language","modelId":"gpt-5-4-mini","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"71,0 %","value":70.9517,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":149,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-mini-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-mini-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-mini-livebench-instruction-following","modelId":"gpt-5-4-mini","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"59,8 %","value":59.804,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-mini-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-mini-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-nano-livebench-reasoning","modelId":"gpt-5-4-nano","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"81,1 %","value":81.097,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":194,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-nano-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-nano-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-nano-livebench-coding","modelId":"gpt-5-4-nano","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"70,8 %","value":70.8385,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":116,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-nano-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-nano-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-nano-livebench-agentic-coding","modelId":"gpt-5-4-nano","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"46,8 %","value":46.7677,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-nano-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-nano-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-nano-livebench-mathematics","modelId":"gpt-5-4-nano","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"91,0 %","value":90.977,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":377,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-nano-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-nano-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-nano-livebench-data-analysis","modelId":"gpt-5-4-nano","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"67,6 %","value":67.6427,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":146,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-nano-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-nano-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-nano-livebench-language","modelId":"gpt-5-4-nano","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"62,5 %","value":62.507,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":144,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-nano-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-nano-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-nano-livebench-instruction-following","modelId":"gpt-5-4-nano","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"67,2 %","value":67.2048,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":197,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-nano-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-nano-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-livebench-reasoning","modelId":"gpt-5-4","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"88,1 %","value":88.1155,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-livebench-coding","modelId":"gpt-5-4","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"77,5 %","value":77.5415,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gpt-5.4-2026-03-05","effort":"xhigh","modelSetting":"gpt-5.4-xhigh","effortSetting":"Réglage publié : gpt-5.4-xhigh","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-livebench-agentic-coding","modelId":"gpt-5-4","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"53,8 %","value":53.8383,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-livebench-mathematics","modelId":"gpt-5-4","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"94,1 %","value":94.148,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-livebench-data-analysis","modelId":"gpt-5-4","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"79,3 %","value":79.3133,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-livebench-language","modelId":"gpt-5-4","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"82,6 %","value":82.6337,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-livebench-instruction-following","modelId":"gpt-5-4","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"70,2 %","value":70.2168,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-5-livebench-reasoning","modelId":"gpt-5-5","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"89,7 %","value":89.6538,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.5-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.5-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-5-livebench-coding","modelId":"gpt-5-5","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"82,1 %","value":82.1495,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.5-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.5-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gpt-5-5","effort":"xhigh","modelSetting":"gpt-5.5-xhigh","effortSetting":"Réglage publié : gpt-5.5-xhigh","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-5-livebench-agentic-coding","modelId":"gpt-5-5","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"54,0 %","value":53.9897,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.5-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.5-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-5-livebench-mathematics","modelId":"gpt-5-5","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"95,9 %","value":95.8573,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.5-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.5-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-5-livebench-data-analysis","modelId":"gpt-5-5","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"81,6 %","value":81.5757,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.5-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.5-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-5-livebench-language","modelId":"gpt-5-5","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"87,4 %","value":87.363,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.5-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.5-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-5-livebench-instruction-following","modelId":"gpt-5-5","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"70,7 %","value":70.7293,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.5-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.5-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-3-livebench-reasoning","modelId":"grok-4-3","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"70,8 %","value":70.822,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-3-livebench-coding","modelId":"grok-4-3","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"69,9 %","value":69.9325,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-3-livebench-agentic-coding","modelId":"grok-4-3","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"18,5 %","value":18.5353,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-3-livebench-mathematics","modelId":"grok-4-3","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"84,3 %","value":84.339,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-3-livebench-data-analysis","modelId":"grok-4-3","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"55,8 %","value":55.7727,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-3-livebench-language","modelId":"grok-4-3","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"73,6 %","value":73.58,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-3-livebench-instruction-following","modelId":"grok-4-3","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"62,8 %","value":62.75,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-5-livebench-reasoning","modelId":"grok-4-5","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"87,2 %","value":87.173,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.5","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.5","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-5-livebench-coding","modelId":"grok-4-5","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"68,6 %","value":68.5855,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.5","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.5","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-5-livebench-agentic-coding","modelId":"grok-4-5","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"56,5 %","value":56.4647,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.5","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.5","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-5-livebench-mathematics","modelId":"grok-4-5","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"90,8 %","value":90.8245,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.5","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.5","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-5-livebench-data-analysis","modelId":"grok-4-5","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"73,0 %","value":73.0377,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.5","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.5","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-5-livebench-language","modelId":"grok-4-5","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"82,8 %","value":82.7953,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.5","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.5","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-5-livebench-instruction-following","modelId":"grok-4-5","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"71,5 %","value":71.5293,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.5","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.5","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-build-0-1-livebench-reasoning","modelId":"grok-build-0-1","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"76,4 %","value":76.3703,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-build-0.1","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-build-0.1","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-build-0-1-livebench-coding","modelId":"grok-build-0-1","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"65,4 %","value":65.3855,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-build-0.1","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-build-0.1","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-build-0-1-livebench-agentic-coding","modelId":"grok-build-0-1","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"45,8 %","value":45.808,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-build-0.1","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-build-0.1","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-build-0-1-livebench-mathematics","modelId":"grok-build-0-1","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"78,4 %","value":78.4288,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-build-0.1","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-build-0.1","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-build-0-1-livebench-data-analysis","modelId":"grok-build-0-1","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"70,8 %","value":70.794,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-build-0.1","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-build-0.1","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-build-0-1-livebench-language","modelId":"grok-build-0-1","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"72,5 %","value":72.46,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-build-0.1","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-build-0.1","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-build-0-1-livebench-instruction-following","modelId":"grok-build-0-1","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"65,2 %","value":65.2208,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-build-0.1","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-build-0.1","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-6-livebench-reasoning","modelId":"kimi-k2-6","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"79,4 %","value":79.375,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.6-thinking","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.6-thinking","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-6-livebench-coding","modelId":"kimi-k2-6","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"78,6 %","value":78.567,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.6-thinking","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.6-thinking","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-6-livebench-agentic-coding","modelId":"kimi-k2-6","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"46,9 %","value":46.9193,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.6-thinking","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.6-thinking","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-6-livebench-mathematics","modelId":"kimi-k2-6","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"84,3 %","value":84.2763,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.6-thinking","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.6-thinking","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-6-livebench-data-analysis","modelId":"kimi-k2-6","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"65,1 %","value":65.1343,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.6-thinking","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.6-thinking","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-6-livebench-language","modelId":"kimi-k2-6","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"75,1 %","value":75.1413,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.6-thinking","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.6-thinking","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-6-livebench-instruction-following","modelId":"kimi-k2-6","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"64,4 %","value":64.3583,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.6-thinking","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.6-thinking","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-7-code-livebench-reasoning","modelId":"kimi-k2-7-code","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"82,8 %","value":82.8078,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.7-code","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.7-code","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-7-code-livebench-coding","modelId":"kimi-k2-7-code","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"74,0 %","value":73.959,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.7-code","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.7-code","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-7-code-livebench-agentic-coding","modelId":"kimi-k2-7-code","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"45,7 %","value":45.6563,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.7-code","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.7-code","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-7-code-livebench-mathematics","modelId":"kimi-k2-7-code","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"79,6 %","value":79.6043,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.7-code","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.7-code","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-7-code-livebench-data-analysis","modelId":"kimi-k2-7-code","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"62,7 %","value":62.6573,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.7-code","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.7-code","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-7-code-livebench-language","modelId":"kimi-k2-7-code","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"77,9 %","value":77.9057,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.7-code","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.7-code","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-7-code-livebench-instruction-following","modelId":"kimi-k2-7-code","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"56,3 %","value":56.2918,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.7-code","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.7-code","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"minimax-m3-livebench-reasoning","modelId":"minimax-m3","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"74,5 %","value":74.4808,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : minimax-m3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"minimax-m3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"minimax-m3-livebench-coding","modelId":"minimax-m3","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"68,2 %","value":68.2025,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : minimax-m3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"minimax-m3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"minimax-m3-livebench-agentic-coding","modelId":"minimax-m3","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"40,7 %","value":40.6563,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : minimax-m3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"minimax-m3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"minimax-m3-livebench-mathematics","modelId":"minimax-m3","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"76,9 %","value":76.9475,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : minimax-m3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"minimax-m3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"minimax-m3-livebench-data-analysis","modelId":"minimax-m3","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"76,2 %","value":76.1663,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : minimax-m3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"minimax-m3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"minimax-m3-livebench-language","modelId":"minimax-m3","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"76,8 %","value":76.8357,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : minimax-m3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"minimax-m3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"minimax-m3-livebench-instruction-following","modelId":"minimax-m3","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"57,5 %","value":57.5083,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : minimax-m3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"minimax-m3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-6-27b-livebench-reasoning","modelId":"qwen3-6-27b","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"70,3 %","value":70.2838,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-6-27b-livebench-coding","modelId":"qwen3-6-27b","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"71,8 %","value":71.785,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-6-27b-livebench-agentic-coding","modelId":"qwen3-6-27b","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"39,3 %","value":39.2927,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-6-27b-livebench-mathematics","modelId":"qwen3-6-27b","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"79,9 %","value":79.8685,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-6-27b-livebench-data-analysis","modelId":"qwen3-6-27b","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"70,4 %","value":70.4267,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-6-27b-livebench-language","modelId":"qwen3-6-27b","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"63,3 %","value":63.3043,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-6-27b-livebench-instruction-following","modelId":"qwen3-6-27b","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"53,2 %","value":53.229,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-6-plus-livebench-reasoning","modelId":"qwen3-6-plus","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"75,8 %","value":75.827,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-plus","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-plus","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-6-plus-livebench-coding","modelId":"qwen3-6-plus","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"78,2 %","value":78.1845,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-plus","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-plus","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-6-plus-livebench-agentic-coding","modelId":"qwen3-6-plus","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"41,4 %","value":41.3637,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-plus","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-plus","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-6-plus-livebench-mathematics","modelId":"qwen3-6-plus","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"83,7 %","value":83.7248,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-plus","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-plus","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-6-plus-livebench-data-analysis","modelId":"qwen3-6-plus","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"69,9 %","value":69.9117,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-plus","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-plus","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-6-plus-livebench-language","modelId":"qwen3-6-plus","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"75,0 %","value":74.9893,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-plus","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-plus","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-6-plus-livebench-instruction-following","modelId":"qwen3-6-plus","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"58,3 %","value":58.342,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-plus","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-plus","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-7-max-livebench-reasoning","modelId":"qwen3-7-max","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"83,3 %","value":83.3365,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.7-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.7-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-7-max-livebench-coding","modelId":"qwen3-7-max","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"74,2 %","value":74.219,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.7-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.7-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-7-max-livebench-agentic-coding","modelId":"qwen3-7-max","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"43,6 %","value":43.586,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.7-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.7-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-7-max-livebench-mathematics","modelId":"qwen3-7-max","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"85,2 %","value":85.2483,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.7-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.7-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-7-max-livebench-data-analysis","modelId":"qwen3-7-max","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"71,8 %","value":71.786,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.7-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.7-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-7-max-livebench-language","modelId":"qwen3-7-max","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"79,7 %","value":79.739,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.7-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.7-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-7-max-livebench-instruction-following","modelId":"qwen3-7-max","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"74,0 %","value":74.0415,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.7-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.7-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"sol-livebench-reasoning","modelId":"sol","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"91,7 %","value":91.6538,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-sol-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-sol-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"sol-livebench-coding","modelId":"sol","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"83,9 %","value":83.941,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-sol-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-sol-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"sol","effort":"max","modelSetting":"gpt-5.6-sol-max","effortSetting":"Réglage publié : gpt-5.6-sol-max","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"sol-livebench-agentic-coding","modelId":"sol","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"56,2 %","value":56.212,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-sol-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-sol-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"sol-livebench-mathematics","modelId":"sol","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"96,2 %","value":96.1978,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-sol-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-sol-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"sol-livebench-data-analysis","modelId":"sol","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"79,8 %","value":79.8407,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-sol-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-sol-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"sol-livebench-language","modelId":"sol","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"87,7 %","value":87.6837,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-sol-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-sol-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"sol-livebench-instruction-following","modelId":"sol","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"71,8 %","value":71.846,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-sol-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-sol-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"terra-livebench-reasoning","modelId":"terra","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"90,6 %","value":90.6345,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-terra-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-terra-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"terra-livebench-coding","modelId":"terra","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"78,2 %","value":78.2455,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-terra-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-terra-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"terra","effort":"max","modelSetting":"gpt-5.6-terra-max","effortSetting":"Réglage publié : gpt-5.6-terra-max","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"terra-livebench-agentic-coding","modelId":"terra","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"54,9 %","value":54.9497,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-terra-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-terra-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"terra-livebench-mathematics","modelId":"terra","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"94,9 %","value":94.9083,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-terra-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-terra-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"terra-livebench-data-analysis","modelId":"terra","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"79,3 %","value":79.3067,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-terra-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-terra-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"terra-livebench-language","modelId":"terra","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"82,9 %","value":82.8927,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-terra-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-terra-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"terra-livebench-instruction-following","modelId":"terra","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"64,6 %","value":64.6165,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-terra-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-terra-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"luna-livebench-reasoning","modelId":"luna","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"85,6 %","value":85.6443,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-luna-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-luna-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"luna-livebench-coding","modelId":"luna","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"82,9 %","value":82.915,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-luna-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-luna-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"luna","effort":"max","modelSetting":"gpt-5.6-luna-max","effortSetting":"Réglage publié : gpt-5.6-luna-max","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"luna-livebench-agentic-coding","modelId":"luna","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"48,4 %","value":48.4343,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-luna-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-luna-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"luna-livebench-mathematics","modelId":"luna","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"87,2 %","value":87.2008,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-luna-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-luna-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"luna-livebench-data-analysis","modelId":"luna","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"78,0 %","value":78.0333,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-luna-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-luna-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"luna-livebench-language","modelId":"luna","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"72,6 %","value":72.567,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-luna-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-luna-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"luna-livebench-instruction-following","modelId":"luna","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"60,1 %","value":60.121,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-luna-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-luna-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-livebench-reasoning","modelId":"fable-5","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"89,7 %","value":89.6538,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-livebench-coding","modelId":"fable-5","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"86,0 %","value":85.992,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-livebench-agentic-coding","modelId":"fable-5","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"62,2 %","value":62.1717,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-livebench-mathematics","modelId":"fable-5","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"96,0 %","value":95.9858,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-livebench-data-analysis","modelId":"fable-5","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"80,5 %","value":80.5377,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-livebench-language","modelId":"fable-5","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"90,7 %","value":90.684,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-livebench-instruction-following","modelId":"fable-5","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"75,8 %","value":75.7708,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-1-livebench-reasoning","modelId":"muse-spark-1-1","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"87,7 %","value":87.7308,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.1-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.1-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-1-livebench-coding","modelId":"muse-spark-1-1","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"77,2 %","value":77.1585,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.1-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.1-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"muse-spark-1-1","effort":"xhigh","modelSetting":"muse-spark-1.1-xhigh","effortSetting":"Réglage publié : muse-spark-1.1-xhigh","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-1-livebench-agentic-coding","modelId":"muse-spark-1-1","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"58,5 %","value":58.5353,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.1-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.1-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-1-livebench-mathematics","modelId":"muse-spark-1-1","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"87,1 %","value":87.1448,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.1-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.1-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-1-livebench-data-analysis","modelId":"muse-spark-1-1","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"72,5 %","value":72.548,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.1-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.1-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-1-livebench-language","modelId":"muse-spark-1-1","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"74,3 %","value":74.342,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.1-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.1-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-1-livebench-instruction-following","modelId":"muse-spark-1-1","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"69,6 %","value":69.6375,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.1-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.1-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k3-livebench-reasoning","modelId":"kimi-k3","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"90,7 %","value":90.673,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k3-livebench-coding","modelId":"kimi-k3","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"81,4 %","value":81.4455,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k3-livebench-agentic-coding","modelId":"kimi-k3","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"62,2 %","value":62.1717,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k3-livebench-mathematics","modelId":"kimi-k3","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"84,4 %","value":84.4368,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k3-livebench-data-analysis","modelId":"kimi-k3","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"78,7 %","value":78.7337,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k3-livebench-language","modelId":"kimi-k3","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"85,5 %","value":85.528,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k3-livebench-instruction-following","modelId":"kimi-k3","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"71,4 %","value":71.3628,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"inkling-livebench-reasoning","modelId":"inkling","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"78,3 %","value":78.3463,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : inkling-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"inkling-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"inkling-livebench-coding","modelId":"inkling","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"71,0 %","value":71.0195,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : inkling-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"inkling-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"inkling","effort":"xhigh","modelSetting":"inkling-xhigh","effortSetting":"Réglage publié : inkling-xhigh","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"inkling-livebench-agentic-coding","modelId":"inkling","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"49,4 %","value":49.394,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : inkling-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"inkling-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"inkling-livebench-mathematics","modelId":"inkling","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"88,4 %","value":88.3648,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : inkling-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"inkling-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"inkling-livebench-data-analysis","modelId":"inkling","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"72,8 %","value":72.778,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : inkling-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"inkling-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"inkling-livebench-language","modelId":"inkling","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"73,5 %","value":73.4587,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : inkling-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"inkling-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"inkling-livebench-instruction-following","modelId":"inkling","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"70,1 %","value":70.0958,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : inkling-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"inkling-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-5-flash-lite-livebench-reasoning","modelId":"gemini-3-5-flash-lite","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"60,2 %","value":60.1875,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-lite-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-lite-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-5-flash-lite-livebench-coding","modelId":"gemini-3-5-flash-lite","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"76,1 %","value":76.0715,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-lite-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-lite-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gemini-3-5-flash-lite","effort":"high","modelSetting":"gemini-3.5-flash-lite-high","effortSetting":"Réglage publié : gemini-3.5-flash-lite-high","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-5-flash-lite-livebench-agentic-coding","modelId":"gemini-3-5-flash-lite","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"45,3 %","value":45.2527,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-lite-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-lite-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-5-flash-lite-livebench-mathematics","modelId":"gemini-3-5-flash-lite","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"73,7 %","value":73.7395,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-lite-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-lite-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-5-flash-lite-livebench-data-analysis","modelId":"gemini-3-5-flash-lite","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"53,2 %","value":53.2497,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-lite-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-lite-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-5-flash-lite-livebench-language","modelId":"gemini-3-5-flash-lite","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"71,8 %","value":71.8203,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-lite-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-lite-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-5-flash-lite-livebench-instruction-following","modelId":"gemini-3-5-flash-lite","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"67,2 %","value":67.2378,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-lite-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-lite-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-6-flash-livebench-reasoning","modelId":"gemini-3-6-flash","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"85,1 %","value":85.149,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.6-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.6-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-6-flash-livebench-coding","modelId":"gemini-3-6-flash","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"77,9 %","value":77.863,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.6-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.6-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gemini-3-6-flash","effort":"high","modelSetting":"gemini-3.6-flash-high","effortSetting":"Réglage publié : gemini-3.6-flash-high","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-6-flash-livebench-agentic-coding","modelId":"gemini-3-6-flash","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"43,4 %","value":43.4343,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.6-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.6-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-6-flash-livebench-mathematics","modelId":"gemini-3-6-flash","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"86,4 %","value":86.4025,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.6-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.6-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-6-flash-livebench-data-analysis","modelId":"gemini-3-6-flash","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"63,0 %","value":62.9993,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.6-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.6-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-6-flash-livebench-language","modelId":"gemini-3-6-flash","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"83,9 %","value":83.8977,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.6-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.6-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-6-flash-livebench-instruction-following","modelId":"gemini-3-6-flash","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"75,4 %","value":75.3668,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.6-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.6-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"opus-5-livebench-reasoning","modelId":"opus-5","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"91,2 %","value":91.2115,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"opus-5-livebench-coding","modelId":"opus-5","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"81,4 %","value":81.4455,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"opus-5","effort":"max","modelSetting":"claude-opus-5-max-effort","effortSetting":"Réglage publié : claude-opus-5-max-effort","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"opus-5-livebench-agentic-coding","modelId":"opus-5","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"65,2 %","value":65.202,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"opus-5-livebench-mathematics","modelId":"opus-5","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"95,7 %","value":95.731,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":380,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"opus-5-livebench-data-analysis","modelId":"opus-5","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"74,6 %","value":74.5503,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"opus-5-livebench-language","modelId":"opus-5","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"88,7 %","value":88.688,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"opus-5-livebench-instruction-following","modelId":"opus-5","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"63,8 %","value":63.7665,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-8-livebench-reasoning","modelId":"claude-opus-4-8","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"89,2 %","value":89.1923,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-8-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-8-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-8-livebench-coding","modelId":"claude-opus-4-8","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"81,8 %","value":81.828,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-8-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-8-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"claude-opus-4-8","effort":"max","modelSetting":"claude-opus-4-8-max-effort","effortSetting":"Réglage publié : claude-opus-4-8-max-effort","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-8-livebench-agentic-coding","modelId":"claude-opus-4-8","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"50,5 %","value":50.505,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-8-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-8-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-8-livebench-mathematics","modelId":"claude-opus-4-8","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"94,3 %","value":94.3165,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-8-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-8-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-8-livebench-data-analysis","modelId":"claude-opus-4-8","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"66,0 %","value":66.0333,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-8-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-8-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-8-livebench-language","modelId":"claude-opus-4-8","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"79,7 %","value":79.6593,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-8-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-8-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-8-livebench-instruction-following","modelId":"claude-opus-4-8","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"72,0 %","value":72.0335,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-8-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-8-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-0731-livebench-reasoning","modelId":"deepseek-v4-flash-0731","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"86,6 %","value":86.6345,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-0731","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-0731","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-0731-livebench-coding","modelId":"deepseek-v4-flash-0731","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"75,0 %","value":74.9845,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-0731","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-0731","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-0731-livebench-agentic-coding","modelId":"deepseek-v4-flash-0731","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"46,8 %","value":46.7677,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-0731","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-0731","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-0731-livebench-mathematics","modelId":"deepseek-v4-flash-0731","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"86,8 %","value":86.7898,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-0731","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-0731","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-0731-livebench-data-analysis","modelId":"deepseek-v4-flash-0731","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"79,3 %","value":79.3273,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-0731","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-0731","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-0731-livebench-language","modelId":"deepseek-v4-flash-0731","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"79,2 %","value":79.175,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-0731","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-0731","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-0731-livebench-instruction-following","modelId":"deepseek-v4-flash-0731","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"65,5 %","value":65.5168,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-0731","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-0731","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-max-livebench-reasoning","modelId":"qwen3-8-max","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"88,2 %","value":88.2115,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-max-livebench-coding","modelId":"qwen3-8-max","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"72,9 %","value":72.872,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-max-livebench-agentic-coding","modelId":"qwen3-8-max","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"64,6 %","value":64.6467,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-max-livebench-mathematics","modelId":"qwen3-8-max","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"91,3 %","value":91.3123,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-max-livebench-data-analysis","modelId":"qwen3-8-max","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"78,4 %","value":78.413,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-max-livebench-language","modelId":"qwen3-8-max","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"79,7 %","value":79.6873,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-max-livebench-instruction-following","modelId":"qwen3-8-max","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"74,1 %","value":74.0835,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-2-livebench-reasoning","modelId":"muse-spark-1-2","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"90,0 %","value":90.0048,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.2-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.2-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-2-livebench-coding","modelId":"muse-spark-1-2","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"77,5 %","value":77.5415,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.2-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.2-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"muse-spark-1-2","effort":"xhigh","modelSetting":"muse-spark-1.2-xhigh","effortSetting":"Réglage publié : muse-spark-1.2-xhigh","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-2-livebench-agentic-coding","modelId":"muse-spark-1-2","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"57,6 %","value":57.5757,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.2-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.2-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-2-livebench-mathematics","modelId":"muse-spark-1-2","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"91,2 %","value":91.2035,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.2-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.2-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-2-livebench-data-analysis","modelId":"muse-spark-1-2","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"76,5 %","value":76.4583,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.2-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.2-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-2-livebench-language","modelId":"muse-spark-1-2","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"78,6 %","value":78.5747,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.2-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.2-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-2-livebench-instruction-following","modelId":"muse-spark-1-2","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"74,3 %","value":74.325,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.2-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.2-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"smaug-agentic-livebench-reasoning","modelId":"smaug-agentic","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"90,3 %","value":90.274,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : smaug-agentic","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"smaug-agentic","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"smaug-agentic-livebench-coding","modelId":"smaug-agentic","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"82,5 %","value":82.471,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : smaug-agentic","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"smaug-agentic","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"smaug-agentic-livebench-agentic-coding","modelId":"smaug-agentic","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"64,6 %","value":64.6467,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : smaug-agentic","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"smaug-agentic","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"smaug-agentic-livebench-mathematics","modelId":"smaug-agentic","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"83,9 %","value":83.9195,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : smaug-agentic","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"smaug-agentic","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"smaug-agentic-livebench-data-analysis","modelId":"smaug-agentic","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"79,9 %","value":79.8983,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : smaug-agentic","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"smaug-agentic","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"smaug-agentic-livebench-language","modelId":"smaug-agentic","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"84,4 %","value":84.3567,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : smaug-agentic","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"smaug-agentic","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"smaug-agentic-livebench-instruction-following","modelId":"smaug-agentic","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"71,0 %","value":70.9918,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : smaug-agentic","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"smaug-agentic","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-pro-0813-livebench-reasoning","modelId":"deepseek-v4-pro-0813","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"85,8 %","value":85.8413,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro-0813","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro-0813","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-pro-0813-livebench-coding","modelId":"deepseek-v4-pro-0813","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"77,2 %","value":77.1585,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro-0813","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro-0813","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-pro-0813-livebench-agentic-coding","modelId":"deepseek-v4-pro-0813","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"54,9 %","value":54.9497,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro-0813","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro-0813","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-pro-0813-livebench-mathematics","modelId":"deepseek-v4-pro-0813","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"95,1 %","value":95.0863,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro-0813","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro-0813","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-pro-0813-livebench-data-analysis","modelId":"deepseek-v4-pro-0813","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"79,2 %","value":79.2433,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro-0813","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro-0813","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-pro-0813-livebench-language","modelId":"deepseek-v4-pro-0813","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"82,1 %","value":82.074,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro-0813","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro-0813","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-pro-0813-livebench-instruction-following","modelId":"deepseek-v4-pro-0813","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"67,7 %","value":67.7,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro-0813","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro-0813","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-6-livebench-reasoning","modelId":"grok-4-6","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"90,5 %","value":90.5095,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.6","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.6","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-6-livebench-coding","modelId":"grok-4-6","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"76,8 %","value":76.776,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.6","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.6","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-6-livebench-agentic-coding","modelId":"grok-4-6","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"57,0 %","value":57.02,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.6","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.6","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-6-livebench-mathematics","modelId":"grok-4-6","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"92,6 %","value":92.568,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.6","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.6","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-6-livebench-data-analysis","modelId":"grok-4-6","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"73,9 %","value":73.857,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.6","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.6","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-6-livebench-language","modelId":"grok-4-6","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"83,7 %","value":83.697,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.6","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.6","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-6-livebench-instruction-following","modelId":"grok-4-6","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"71,9 %","value":71.8665,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.6","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.6","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-7-flash-livebench-reasoning","modelId":"gemini-3-7-flash","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"87,8 %","value":87.798,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.7-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.7-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-7-flash-livebench-coding","modelId":"gemini-3-7-flash","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"78,9 %","value":78.8885,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.7-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.7-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gemini-3-7-flash","effort":"high","modelSetting":"gemini-3.7-flash-high","effortSetting":"Réglage publié : gemini-3.7-flash-high","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-7-flash-livebench-agentic-coding","modelId":"gemini-3-7-flash","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"58,3 %","value":58.283,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.7-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.7-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-7-flash-livebench-mathematics","modelId":"gemini-3-7-flash","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"93,5 %","value":93.468,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.7-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.7-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-7-flash-livebench-data-analysis","modelId":"gemini-3-7-flash","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"68,0 %","value":67.9643,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.7-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.7-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-7-flash-livebench-language","modelId":"gemini-3-7-flash","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"85,5 %","value":85.455,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.7-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.7-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-7-flash-livebench-instruction-following","modelId":"gemini-3-7-flash","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"79,9 %","value":79.9253,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.7-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.7-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-27b-livebench-reasoning","modelId":"qwen3-8-27b","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"80,0 %","value":80.0288,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-27b-livebench-coding","modelId":"qwen3-8-27b","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"75,7 %","value":75.689,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-27b-livebench-agentic-coding","modelId":"qwen3-8-27b","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"61,4 %","value":61.3637,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-27b-livebench-mathematics","modelId":"qwen3-8-27b","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"86,2 %","value":86.2128,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-27b-livebench-data-analysis","modelId":"qwen3-8-27b","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"76,6 %","value":76.5857,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-27b-livebench-language","modelId":"qwen3-8-27b","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"74,3 %","value":74.3457,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-27b-livebench-instruction-following","modelId":"qwen3-8-27b","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"72,7 %","value":72.6583,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-vision-exp-livebench-reasoning","modelId":"deepseek-v4-flash-vision-exp","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"85,4 %","value":85.399,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-vision-exp","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-vision-exp","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-vision-exp-livebench-coding","modelId":"deepseek-v4-flash-vision-exp","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"68,2 %","value":68.2025,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-vision-exp","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-vision-exp","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-vision-exp-livebench-agentic-coding","modelId":"deepseek-v4-flash-vision-exp","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"65,1 %","value":65.101,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-vision-exp","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-vision-exp","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-vision-exp-livebench-mathematics","modelId":"deepseek-v4-flash-vision-exp","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"87,8 %","value":87.8068,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-vision-exp","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-vision-exp","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-vision-exp-livebench-data-analysis","modelId":"deepseek-v4-flash-vision-exp","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"79,5 %","value":79.4767,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-vision-exp","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-vision-exp","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-vision-exp-livebench-language","modelId":"deepseek-v4-flash-vision-exp","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"80,4 %","value":80.3597,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-vision-exp","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-vision-exp","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-vision-exp-livebench-instruction-following","modelId":"deepseek-v4-flash-vision-exp","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"71,0 %","value":70.9582,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-vision-exp","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-vision-exp","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-livebench-reasoning","modelId":"glm-5-3","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"85,8 %","value":85.803,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-livebench-coding","modelId":"glm-5-3","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"79,0 %","value":78.95,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-livebench-agentic-coding","modelId":"glm-5-3","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"60,9 %","value":60.909,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-livebench-mathematics","modelId":"glm-5-3","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"87,9 %","value":87.898,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-livebench-data-analysis","modelId":"glm-5-3","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"70,2 %","value":70.2443,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-livebench-language","modelId":"glm-5-3","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"79,9 %","value":79.8563,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-livebench-instruction-following","modelId":"glm-5-3","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"69,3 %","value":69.304,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-flash-livebench-reasoning","modelId":"glm-5-3-flash","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"77,6 %","value":77.6443,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-flash-livebench-coding","modelId":"glm-5-3-flash","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"79,0 %","value":78.95,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-flash-livebench-agentic-coding","modelId":"glm-5-3-flash","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"56,8 %","value":56.7677,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-flash-livebench-mathematics","modelId":"glm-5-3-flash","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"81,2 %","value":81.2445,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-flash-livebench-data-analysis","modelId":"glm-5-3-flash","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"76,4 %","value":76.401,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-flash-livebench-language","modelId":"glm-5-3-flash","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"77,3 %","value":77.3073,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-flash-livebench-instruction-following","modelId":"glm-5-3-flash","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"52,8 %","value":52.8208,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-flash-next-livebench-reasoning","modelId":"qwen3-8-flash-next","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"87,4 %","value":87.3798,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-flash-next","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-flash-next","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-flash-next-livebench-coding","modelId":"qwen3-8-flash-next","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"72,6 %","value":72.5505,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-flash-next","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-flash-next","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-flash-next-livebench-agentic-coding","modelId":"qwen3-8-flash-next","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"61,6 %","value":61.6163,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-flash-next","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-flash-next","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-flash-next-livebench-mathematics","modelId":"qwen3-8-flash-next","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"85,8 %","value":85.821,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-flash-next","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-flash-next","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-flash-next-livebench-data-analysis","modelId":"qwen3-8-flash-next","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"74,2 %","value":74.24,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-flash-next","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-flash-next","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-flash-next-livebench-language","modelId":"qwen3-8-flash-next","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"74,6 %","value":74.643,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-flash-next","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-flash-next","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-flash-next-livebench-instruction-following","modelId":"qwen3-8-flash-next","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"77,1 %","value":77.1085,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-flash-next","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-flash-next","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"nemotron-3-ultra-livebench-reasoning","modelId":"nemotron-3-ultra","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"74,7 %","value":74.697,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : nemotron-3-ultra-550b-a55b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"nemotron-3-ultra-550b-a55b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"nemotron-3-ultra-livebench-coding","modelId":"nemotron-3-ultra","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"70,7 %","value":70.698,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : nemotron-3-ultra-550b-a55b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"nemotron-3-ultra-550b-a55b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"nemotron-3-ultra-livebench-agentic-coding","modelId":"nemotron-3-ultra","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"38,7 %","value":38.7373,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : nemotron-3-ultra-550b-a55b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"nemotron-3-ultra-550b-a55b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"nemotron-3-ultra-livebench-mathematics","modelId":"nemotron-3-ultra","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"88,7 %","value":88.6633,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : nemotron-3-ultra-550b-a55b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"nemotron-3-ultra-550b-a55b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"nemotron-3-ultra-livebench-data-analysis","modelId":"nemotron-3-ultra","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"54,5 %","value":54.4567,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : nemotron-3-ultra-550b-a55b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"nemotron-3-ultra-550b-a55b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"nemotron-3-ultra-livebench-language","modelId":"nemotron-3-ultra","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"70,8 %","value":70.8113,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : nemotron-3-ultra-550b-a55b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"nemotron-3-ultra-550b-a55b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"nemotron-3-ultra-livebench-instruction-following","modelId":"nemotron-3-ultra","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"73,4 %","value":73.4455,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : nemotron-3-ultra-550b-a55b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"nemotron-3-ultra-550b-a55b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-1-livebench-reasoning","modelId":"fable-5-1","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"91,7 %","value":91.6923,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-1-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-1-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-1-livebench-coding","modelId":"fable-5-1","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"86,4 %","value":86.375,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-1-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-1-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-1-livebench-agentic-coding","modelId":"fable-5-1","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"66,1 %","value":66.0607,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-1-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-1-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-1-livebench-mathematics","modelId":"fable-5-1","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"97,0 %","value":97.0068,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-1-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-1-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-1-livebench-data-analysis","modelId":"fable-5-1","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"80,3 %","value":80.2757,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-1-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-1-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-1-livebench-language","modelId":"fable-5-1","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"89,5 %","value":89.501,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-1-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-1-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-1-livebench-instruction-following","modelId":"fable-5-1","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"73,0 %","value":72.9878,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-1-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-1-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-8-flash-livebench-reasoning","modelId":"gemini-3-8-flash","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"89,3 %","value":89.2933,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.8-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.8-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-8-flash-livebench-coding","modelId":"gemini-3-8-flash","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"72,5 %","value":72.489,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.8-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.8-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gemini-3-8-flash","effort":"high","modelSetting":"gemini-3.8-flash-high","effortSetting":"Réglage publié : gemini-3.8-flash-high","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-8-flash-livebench-agentic-coding","modelId":"gemini-3-8-flash","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"54,2 %","value":54.2423,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.8-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.8-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-8-flash-livebench-mathematics","modelId":"gemini-3-8-flash","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"91,6 %","value":91.5643,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.8-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.8-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-8-flash-livebench-data-analysis","modelId":"gemini-3-8-flash","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"54,0 %","value":54.0057,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.8-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.8-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-8-flash-livebench-language","modelId":"gemini-3-8-flash","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"87,8 %","value":87.7927,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.8-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.8-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-8-flash-livebench-instruction-following","modelId":"gemini-3-8-flash","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"81,4 %","value":81.4125,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.8-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.8-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-3-livebench-reasoning","modelId":"muse-spark-1-3","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"89,7 %","value":89.6538,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.3-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.3-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-3-livebench-coding","modelId":"muse-spark-1-3","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"81,1 %","value":81.0625,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.3-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.3-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-3-livebench-agentic-coding","modelId":"muse-spark-1-3","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"64,1 %","value":64.091,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.3-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.3-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-3-livebench-mathematics","modelId":"muse-spark-1-3","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"96,0 %","value":95.95,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.3-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.3-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-3-livebench-data-analysis","modelId":"muse-spark-1-3","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"79,6 %","value":79.5653,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.3-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.3-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-3-livebench-language","modelId":"muse-spark-1-3","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"82,8 %","value":82.7937,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.3-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.3-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-3-livebench-instruction-following","modelId":"muse-spark-1-3","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"78,0 %","value":78.0043,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.3-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.3-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"astra-vals-code-migration","modelId":"astra","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":67.74,"display":"67,74 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.216,"display":"Erreur standard publiée : 4,216 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"openai/gpt-6-astra\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-6-astra. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"opus-5-vals-code-migration","modelId":"opus-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":57.473,"display":"57,473 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.371,"display":"Erreur standard publiée : 4,371 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"compute_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"anthropic/claude-opus-5\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"opus-5","effort":"max","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"anthropic/claude-opus-5\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","effortSetting":"compute_effort publié : max"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-vals-code-migration","modelId":"fable-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":55.065,"display":"55,065 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.605,"display":"Erreur standard publiée : 4,605 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"compute_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"anthropic/claude-fable-5\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","crossSourceExclusion":"Politique de repli non documentée entre les évaluateurs.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"fable-5-1-vals-code-migration","modelId":"fable-5-1","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":54.607,"display":"54,607 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.812,"display":"Erreur standard publiée : 4,812 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"compute_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"anthropic/claude-fable-5-1\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","crossSourceExclusion":"Politique de repli non documentée entre les évaluateurs.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"sol-vals-code-migration","modelId":"sol","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":52.916,"display":"52,916 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.353,"display":"Erreur standard publiée : 4,353 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"openai/gpt-5.6-sol\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"sol","effort":"max","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"openai/gpt-5.6-sol\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","effortSetting":"reasoning_effort publié : max"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"terra-vals-code-migration","modelId":"terra","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":47.804,"display":"47,804 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.28,"display":"Erreur standard publiée : 4,28 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"openai/gpt-5.6-terra\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"terra","effort":"max","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"openai/gpt-5.6-terra\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","effortSetting":"reasoning_effort publié : max"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-8-vals-code-migration","modelId":"claude-opus-4-8","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":47.25,"display":"47,25 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.176,"display":"Erreur standard publiée : 4,176 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"compute_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"anthropic/claude-opus-4-8\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"claude-opus-4-8","effort":"max","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"anthropic/claude-opus-4-8\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","effortSetting":"compute_effort publié : max"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-5-vals-code-migration","modelId":"gpt-5-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":45.161,"display":"45,161 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.164,"display":"Erreur standard publiée : 4,164 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : xhigh","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"openai/gpt-5.5\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.5. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gpt-5-5","effort":"xhigh","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"openai/gpt-5.5\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","effortSetting":"reasoning_effort publié : xhigh"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-6-vals-code-migration","modelId":"grok-4-6","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":44.572,"display":"44,572 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.479,"display":"Erreur standard publiée : 4,479 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"grok/grok-4.6\",\"temperature\":0.7,\"top_p\":0.95,\"max_output_tokens\":null,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"SpaceXAI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.6. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"luna-vals-code-migration","modelId":"luna","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":44.55,"display":"44,55 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.244,"display":"Erreur standard publiée : 4,244 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"openai/gpt-5.6-luna\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"luna","effort":"max","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"openai/gpt-5.6-luna\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","effortSetting":"reasoning_effort publié : max"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-5-vals-code-migration","modelId":"claude-sonnet-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":44.392,"display":"44,392 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.246,"display":"Erreur standard publiée : 4,246 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"compute_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"anthropic/claude-sonnet-5\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","crossSourceExclusion":"Efforts différents entre Vals et LiveBench.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-vals-code-migration","modelId":"glm-5-3","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":44.222,"display":"44,222 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.289,"display":"Erreur standard publiée : 4,289 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"zai/glm-5.3\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Zhipu AI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.3. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-opus-4-7-vals-code-migration","modelId":"claude-opus-4-7","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":43.878,"display":"43,878 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.22,"display":"Erreur standard publiée : 4,22 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"compute_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"anthropic/claude-opus-4-7\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","crossSourceExclusion":"Efforts différents entre Vals et LiveBench.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-pro-0813-vals-code-migration","modelId":"deepseek-v4-pro-0813","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":41.54,"display":"41,54 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.301,"display":"Erreur standard publiée : 4,301 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"deepseek/deepseek-v4-pro-0813\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":384000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"DeepSeek\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-sonnet-4-6-vals-code-migration","modelId":"claude-sonnet-4-6","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":39.892,"display":"39,892 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.138,"display":"Erreur standard publiée : 4,138 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"compute_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"anthropic/claude-sonnet-4-6\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":true,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","crossSourceExclusion":"Efforts différents entre Vals et LiveBench.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-flash-0731-vals-code-migration","modelId":"deepseek-v4-flash-0731","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":38.631,"display":"38,631 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.382,"display":"Erreur standard publiée : 4,382 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"deepseek/deepseek-v4-flash-0731\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":384000,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"DeepSeek\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-2-vals-code-migration","modelId":"glm-5-2","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":37.87,"display":"37,87 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.143,"display":"Erreur standard publiée : 4,143 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"zai/glm-5.2\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":131072,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Zhipu AI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.2. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-5-vals-code-migration","modelId":"grok-4-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":36.596,"display":"36,596 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.141,"display":"Erreur standard publiée : 4,141 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"grok/grok-4.5\",\"temperature\":0.7,\"top_p\":0.95,\"max_output_tokens\":null,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"SpaceXAI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.5. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-8-flash-vals-code-migration","modelId":"gemini-3-8-flash","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":36.546,"display":"36,546 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.184,"display":"Erreur standard publiée : 4,184 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"google/gemini-3.8-flash\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gemini-3-8-flash","effort":"high","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"google/gemini-3.8-flash\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","effortSetting":"reasoning_effort publié : high"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-vals-code-migration","modelId":"gpt-5-4","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":34.984,"display":"34,984 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.113,"display":"Erreur standard publiée : 4,113 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : xhigh","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"openai/gpt-5.4-2026-03-05\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gpt-5.4-2026-03-05","effort":"xhigh","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"openai/gpt-5.4-2026-03-05\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","effortSetting":"reasoning_effort publié : xhigh"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-7-flash-vals-code-migration","modelId":"gemini-3-7-flash","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":34.8,"display":"34,8 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.225,"display":"Erreur standard publiée : 4,225 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"google/gemini-3.7-flash\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gemini-3-7-flash","effort":"high","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"google/gemini-3.7-flash\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","effortSetting":"reasoning_effort publié : high"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-1-vals-code-migration","modelId":"muse-spark-1-1","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":31.115,"display":"31,115 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.068,"display":"Erreur standard publiée : 4,068 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : xhigh","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"meta/muse_spark_1_1\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":256000,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Meta\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.1. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"muse-spark-1-1","effort":"xhigh","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"meta/muse_spark_1_1\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":256000,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Meta\",\"harness\":null}","effortSetting":"reasoning_effort publié : xhigh"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-6-flash-vals-code-migration","modelId":"gemini-3-6-flash","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":30.928,"display":"30,928 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.068,"display":"Erreur standard publiée : 4,068 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"google/gemini-3.6-flash\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gemini-3-6-flash","effort":"high","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"google/gemini-3.6-flash\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","effortSetting":"reasoning_effort publié : high"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"muse-spark-1-2-vals-code-migration","modelId":"muse-spark-1-2","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":29.954,"display":"29,954 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.023,"display":"Erreur standard publiée : 4,023 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : xhigh","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"meta/muse_spark_1_2\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":131072,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Meta\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.2. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"muse-spark-1-2","effort":"xhigh","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"meta/muse_spark_1_2\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":131072,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Meta\",\"harness\":null}","effortSetting":"reasoning_effort publié : xhigh"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-6-vals-code-migration","modelId":"kimi-k2-6","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":27.768,"display":"27,768 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.144,"display":"Erreur standard publiée : 4,144 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"kimi/kimi-k2.6\",\"temperature\":null,\"top_p\":0.95,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Moonshot AI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-5-flash-vals-code-migration","modelId":"gemini-3-5-flash","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":26.745,"display":"26,745 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.104,"display":"Erreur standard publiée : 4,104 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"google/gemini-3.5-flash\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gemini-3-5-flash","effort":"high","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"google/gemini-3.5-flash\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","effortSetting":"reasoning_effort publié : high"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"deepseek-v4-pro-vals-code-migration","modelId":"deepseek-v4-pro","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":26.201,"display":"26,201 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.037,"display":"Erreur standard publiée : 4,037 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"deepseek/deepseek-v4-pro\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":384000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"DeepSeek\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-pro-20260423/endpoints. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-1-vals-code-migration","modelId":"glm-5-1","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":25.768,"display":"25,768 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.087,"display":"Erreur standard publiée : 4,087 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"zai/glm-5.1\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":131072,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Zhipu AI\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.1. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-7-code-vals-code-migration","modelId":"kimi-k2-7-code","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":25.392,"display":"25,392 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.161,"display":"Erreur standard publiée : 4,161 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"kimi/kimi-k2.7-code\",\"temperature\":null,\"top_p\":0.95,\"max_output_tokens\":32768,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Moonshot AI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-max-vals-code-migration","modelId":"qwen3-8-max","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":23.958,"display":"23,958 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.309,"display":"Erreur standard publiée : 4,309 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"alibaba/qwen3.8-max\",\"temperature\":0.7,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Alibaba\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"mimo-v2-5-pro-vals-code-migration","modelId":"mimo-v2-5-pro","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":21.557,"display":"21,557 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.127,"display":"Erreur standard publiée : 4,127 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"xiaomi/mimo-v2.5-pro\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Xiaomi\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"glm-5-3-flash-vals-code-migration","modelId":"glm-5-3-flash","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":20.515,"display":"20,515 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.207,"display":"Erreur standard publiée : 4,207 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"zai/glm-5.3-flash\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Zhipu AI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/vlm/glm-5.3-flash. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"minimax-m3-vals-code-migration","modelId":"minimax-m3","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":19.925,"display":"19,925 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":3.944,"display":"Erreur standard publiée : 3,944 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"minimax/MiniMax-M3\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":512000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"MiniMax\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-1-pro-preview-vals-code-migration","modelId":"gemini-3-1-pro-preview","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":17.313,"display":"17,313 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":3.933,"display":"Erreur standard publiée : 3,933 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"google/gemini-3.1-pro-preview\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gemini-3-1-pro-preview","effort":"high","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"google/gemini-3.1-pro-preview\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","effortSetting":"reasoning_effort publié : high"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k3-vals-code-migration","modelId":"kimi-k3","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":16.099,"display":"16,099 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.101,"display":"Erreur standard publiée : 4,101 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"kimi/kimi-k3\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":262144,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Moonshot AI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-nano-vals-code-migration","modelId":"gpt-5-4-nano","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":14.467,"display":"14,467 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.025,"display":"Erreur standard publiée : 4,025 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"openai/gpt-5.4-nano-2026-03-17\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","crossSourceExclusion":"Efforts différents entre Vals et LiveBench.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-nano. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"mimo-v2-5-vals-code-migration","modelId":"mimo-v2-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":14.228,"display":"14,228 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":3.687,"display":"Erreur standard publiée : 3,687 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"xiaomi/mimo-v2.5\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Xiaomi\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-8-27b-vals-code-migration","modelId":"qwen3-8-27b","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":14.157,"display":"14,157 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.189,"display":"Erreur standard publiée : 4,189 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : xhigh","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"alibaba/qwen3.8-27b\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Alibaba\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/qwen/qwen3.8-27b-20260814/endpoints. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"inkling-small-vals-code-migration","modelId":"inkling-small","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":13.675,"display":"13,675 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":3.81,"display":"Erreur standard publiée : 3,81 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : 0.99","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"thinkingmachines/inkling-small\",\"temperature\":1,\"top_p\":1,\"max_output_tokens\":262000,\"reasoning\":null,\"reasoning_effort\":\"0.99\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Thinkingmachines\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-7-max-vals-code-migration","modelId":"qwen3-7-max","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":13.069,"display":"13,069 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":2.858,"display":"Erreur standard publiée : 2,858 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"alibaba/qwen3.7-max\",\"temperature\":0.7,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Alibaba\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gpt-5-4-mini-vals-code-migration","modelId":"gpt-5-4-mini","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":12.936,"display":"12,936 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":3.641,"display":"Erreur standard publiée : 3,641 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : xhigh","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"openai/gpt-5.4-mini-2026-03-17\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-mini. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gpt-5.4-mini-2026-03-17","effort":"xhigh","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"openai/gpt-5.4-mini-2026-03-17\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","effortSetting":"reasoning_effort publié : xhigh"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-7-plus-vals-code-migration","modelId":"qwen3-7-plus","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":12.856,"display":"12,856 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":2.931,"display":"Erreur standard publiée : 2,931 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"alibaba/qwen3.7-plus\",\"temperature\":0.7,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Alibaba\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"inkling-vals-code-migration","modelId":"inkling","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":11.79,"display":"11,79 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":3.396,"display":"Erreur standard publiée : 3,396 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : 0.99 ; xhigh = 0,99 selon Tinker.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"thinkingmachines/inkling\",\"temperature\":1,\"top_p\":1,\"max_output_tokens\":256000,\"reasoning\":null,\"reasoning_effort\":\"0.99\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Thinkingmachines\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"inkling","effort":"xhigh","evidenceUrl":"https://tinker-docs.thinkingmachines.ai/cookbook/inkling/thinking-effort/","modelSetting":"{\"id\":\"thinkingmachines/inkling\",\"temperature\":1,\"top_p\":1,\"max_output_tokens\":256000,\"reasoning\":null,\"reasoning_effort\":\"0.99\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Thinkingmachines\",\"harness\":null}","effortSetting":"reasoning_effort publié : 0.99 ; xhigh = 0,99 selon Tinker."},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"qwen3-6-plus-vals-code-migration","modelId":"qwen3-6-plus","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":11.102,"display":"11,102 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.312,"display":"Erreur standard publiée : 1,312 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"alibaba/qwen3.6-plus\",\"temperature\":0.7,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Alibaba\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"minimax-m2-7-vals-code-migration","modelId":"minimax-m2-7","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":8.685,"display":"8,685 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.786,"display":"Erreur standard publiée : 1,786 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"minimax/MiniMax-M2.7\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":80000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"MiniMax\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"claude-haiku-4-5-vals-code-migration","modelId":"claude-haiku-4-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":7.551,"display":"7,551 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.056,"display":"Erreur standard publiée : 1,056 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"anthropic/claude-haiku-4-5-20251001-thinking\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":64000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"kimi-k2-5-vals-code-migration","modelId":"kimi-k2-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":6.962,"display":"6,962 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.29,"display":"Erreur standard publiée : 1,29 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"kimi/kimi-k2.5-thinking\",\"temperature\":null,\"top_p\":0.95,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Moonshot AI\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/moonshotai/kimi-k2.5-0127/endpoints. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-3-vals-code-migration","modelId":"grok-4-3","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":6.795,"display":"6,795 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.195,"display":"Erreur standard publiée : 1,195 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"grok/grok-4.3\",\"temperature\":0.7,\"top_p\":0.95,\"max_output_tokens\":null,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"SpaceXAI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.3. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-flash-preview-vals-code-migration","modelId":"gemini-3-flash-preview","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":6.391,"display":"6,391 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.093,"display":"Erreur standard publiée : 1,093 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"google/gemini-3-flash-preview\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-5-flash-lite-vals-code-migration","modelId":"gemini-3-5-flash-lite","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":6.148,"display":"6,148 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.708,"display":"Erreur standard publiée : 1,708 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"google/gemini-3.5-flash-lite\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gemini-3-5-flash-lite","effort":"high","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"google/gemini-3.5-flash-lite\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","effortSetting":"reasoning_effort publié : high"},"evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"mistral-medium-3-5-vals-code-migration","modelId":"mistral-medium-3-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":5.127,"display":"5,127 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.369,"display":"Erreur standard publiée : 1,369 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"mistralai/mistral-medium-3.5\",\"temperature\":0.7,\"top_p\":0.95,\"max_output_tokens\":80000,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Mistral AI\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.mistral.ai/models/mistral-medium-3-5-26-04. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"nemotron-3-ultra-vals-code-migration","modelId":"nemotron-3-ultra","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":4.905,"display":"4,905 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.589,"display":"Erreur standard publiée : 1,589 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"nvidia/nemotron-3-ultra-550b-a55b\",\"temperature\":null,\"top_p\":0.95,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Nvidia\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://build.nvidia.com/nvidia/nemotron-3-ultra-550b-a55b. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"gemini-3-1-flash-lite-preview-vals-code-migration","modelId":"gemini-3-1-flash-lite-preview","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":4.609,"display":"4,609 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.069,"display":"Erreur standard publiée : 1,069 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"google/gemini-3.1-flash-lite-preview\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","crossSourceExclusion":"Disponibilité de cette version non vérifiée ; mesure historique conservée.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"nemotron-lightning-3-5-vals-code-migration","modelId":"nemotron-lightning-3-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":2.951,"display":"2,951 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":0.951,"display":"Erreur standard publiée : 0,951 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"fireworks/nemotron-lightning-3p5-30b-a3b\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":131072,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Fireworks AI\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"grok-4-20-0309-reasoning-vals-code-migration","modelId":"grok-4-20-0309-reasoning","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":0.314,"display":"0,314 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":0.11,"display":"Erreur standard publiée : 0,11 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"grok/grok-4.20-0309-reasoning\",\"temperature\":0.7,\"top_p\":0.95,\"max_output_tokens\":2000000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"SpaceXAI\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.20-0309-reasoning. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}},{"id":"ling-3-0-flash-2607-vals-code-migration","modelId":"ling-3-0-flash-2607","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":0,"display":"0 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":0,"display":"Erreur standard publiée : 0 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"ant/ling-3.0-flash-2607\",\"temperature\":0.6,\"top_p\":0.95,\"max_output_tokens\":131072,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Ant\",\"harness\":null}","crossSourceExclusion":"Disponibilité de cette version non vérifiée ; mesure historique conservée.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints. Dossier complet : /benchmarks/vals-2026-09.json","evidence":{"grade":"B","reason":"Test extérieur utile, avec au moins une limite de comparaison ou de vérification."}}],"profiles":{"astra":{"general":{"domain":"general","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"astra-aa-intelligence","modelId":"astra","domain":"general","constructId":"general-composite","familyId":"aa-intelligence-v4-1-1","benchmark":"Artificial Analysis Intelligence Index v4.1.1","organization":"Artificial Analysis","result":{"display":"61 points","value":61,"unit":"index","better":"higher","dispersion":{"kind":"interval","display":"Marge annoncée à 95 % : moins de ±1 point","low":60,"high":62,"confidence":95}},"sample":{"size":9,"unit":"évaluations composites","runs":10},"protocol":{"harness":"Outils et réglages propres à chacun des neuf tests","effort":"Meilleur niveau publié pour la variante comparée","scoring":"Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %","judge":"Mélange de tests automatiques et de corrections par un autre modèle d’IA"},"benchmarkVersion":"4.1.1","modelSetting":"Meilleur niveau publié pour la variante comparée","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-intelligence-v4-1-1","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","accessedAt":"2026-09-04","publishedAt":"2026-09-03"},"dependencies":["terminal-bench-v2-1","aa-omniscience","aa-lcr"],"limitation":"Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve."},{"id":"astra-epoch-eci","modelId":"astra","domain":"general","constructId":"general-composite","familyId":"epoch-eci-2026-09","benchmark":"Epoch Capabilities Index","organization":"Epoch AI","result":{"display":"169 points Epoch","value":169,"unit":"index","better":"higher","dispersion":{"kind":"interval","display":"Fourchette probable à 90 % : 165 à 174","low":165,"high":174,"confidence":90}},"sample":{"size":50,"unit":"tests comparatifs ou davantage","runs":"not-published"},"protocol":{"harness":"Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants","effort":"Meilleur score retenu entre réglages d’un même modèle","scoring":"Calcul tenant compte du niveau de difficulté de chaque test","judge":"Variable selon le test d’origine"},"benchmarkVersion":"2026-09","modelSetting":"Meilleur réglage publié","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"epoch-eci-2026-09","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"not-disclosed"},"source":{"accessedAt":"2026-09-04","publishedAt":"2026-09-03","url":"https://epoch.ai/models/gpt-6-astra"},"dependencies":["multiple-upstream-benchmarks"],"limitation":"Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"astra-arc-agi-3-standard","modelId":"astra","domain":"agentic","constructId":"novel-rule-learning","familyId":"arc-agi-3-astra","benchmark":"ARC-AGI-3, tâches partiellement cachées, configuration standard","organization":"ARC Prize","result":{"display":"62,7 %","value":62.71,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":"not-published","unit":"environnements partiellement cachés","runs":"not-published"},"protocol":{"harness":"Interface minimale commune, notes visibles gérées par le modèle","effort":"max","scoring":"Objectifs atteints dans des environnements inconnus","judge":"Résultat vérifié par ARC Prize"},"benchmarkVersion":"3","modelSetting":"max, configuration standard","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"arc-agi-3","riskOfBias":{"testSetAccess":"private","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://arcprize.org/results/openai-gpt-6-astra","accessedAt":"2026-09-04","publishedAt":"2026-09-02"},"dependencies":[],"limitation":"Mesure ciblée d’apprentissage de règles nouvelles. Elle ne mesure pas un pourcentage d’intelligence générale."},{"id":"astra-arc-agi-3-adapter","modelId":"astra","domain":"agentic","constructId":"novel-rule-learning","familyId":"arc-agi-3-astra","benchmark":"ARC-AGI-3, tâches partiellement cachées, configuration fournisseur","organization":"ARC Prize","result":{"display":"99,9 %","value":99.95,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":"not-published","unit":"environnements partiellement cachés","runs":"not-published"},"protocol":{"harness":"État de raisonnement opaque conservé et contexte compacté par le fournisseur","effort":"high","scoring":"Objectifs atteints dans des environnements inconnus","judge":"Résultat vérifié par ARC Prize"},"benchmarkVersion":"3","modelSetting":"high, configuration fournisseur","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"arc-agi-3","riskOfBias":{"testSetAccess":"private","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://arcprize.org/results/openai-gpt-6-astra","accessedAt":"2026-09-04","publishedAt":"2026-09-02"},"dependencies":["astra-arc-agi-3-standard"],"limitation":"Même série de tâches que la configuration standard. Ce résultat ne constitue pas une seconde confirmation indépendante."},{"id":"astra-apex-agents","modelId":"astra","domain":"agentic","constructId":"professional-workflow","familyId":"mercor-apex-agents","benchmark":"APEX-Agents","organization":"Mercor","result":{"display":"62,4 %","value":62.4,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"± 3,6 points","low":58.8,"high":66}},"sample":{"size":480,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions utilisant plusieurs applications de travail","effort":"xHigh","scoring":"Part moyenne des critères réussis","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"xHigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-agents","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["apex-legal","apex-finance","apex-consulting"],"limitation":"Les tâches et critères viennent de professionnels, mais une partie de la correction repose sur un autre modèle d’IA."}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"astra-aa-coding","modelId":"astra","domain":"coding","constructId":"software-agent","familyId":"aa-coding-agent-v1-4","benchmark":"Artificial Analysis Coding Agent Index v1.4","organization":"Artificial Analysis","result":{"display":"67 points","value":67,"unit":"index","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":326,"unit":"tâches","runs":3},"protocol":{"harness":"Agent Codex","effort":"max","scoring":"Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée","judge":"Programmes exécutés et résultats vérifiés automatiquement"},"benchmarkVersion":"1.4","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-coding-agent-v1-4","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","accessedAt":"2026-09-04","publishedAt":"not-published"},"dependencies":["deepswe","terminal-bench-v2-1","terminal-bench-family","swe-atlas-qna"],"limitation":"Le score mesure GPT-6 Astra avec un agent précis. Changer cet agent peut changer le résultat."},{"id":"astra-vals-code-migration","modelId":"astra","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":67.74,"display":"67,74 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.216,"display":"Erreur standard publiée : 4,216 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"openai/gpt-6-astra\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-6-astra. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"astra-apex-legal-mean-score","modelId":"astra","domain":"legal","constructId":"corporate-lawyer","familyId":"mercor-apex-agents-legal-mean-score","benchmark":"APEX-Agents Corporate Lawyer, moyenne des critères","organization":"Mercor","result":{"display":"67,9 % des critères réussis","value":67.9,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"xHigh","scoring":"Moyenne des critères réussis","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor. Les deux lectures juridiques viennent de cette même entrée.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"xHigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-legal","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure."},{"id":"astra-apex-legal-all-criteria","modelId":"astra","domain":"legal","constructId":"corporate-lawyer","familyId":"mercor-apex-agents-legal-all-criteria","benchmark":"APEX-Agents Corporate Lawyer, tâches sans erreur","organization":"Mercor","result":{"display":"40,5 % des tâches entièrement réussies","value":40.5,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"xHigh","scoring":"Part des tâches dont tous les critères passent","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor. Les deux lectures juridiques viennent de cette même entrée.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"xHigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-legal","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"finance":{"domain":"finance","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"astra-apex-finance-mean-score","modelId":"astra","domain":"finance","constructId":"investment-banking","familyId":"mercor-apex-agents-finance-mean-score","benchmark":"APEX-Agents Investment Banking Analyst, moyenne des critères","organization":"Mercor","result":{"display":"52,0 % des critères réussis","value":52,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"xHigh","scoring":"Moyenne des critères réussis","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"xHigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-finance","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/investment-banking-analyst-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[{"id":"astra-openai-healthbench-professional","modelId":"astra","domain":"healthcare","constructId":"clinical-response","familyId":"openai-healthbench-professional","benchmark":"HealthBench Professional","organization":"OpenAI","result":{"display":"63,4 %","value":63.4,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":"not-published","unit":"conversations médicales professionnelles","runs":"not-published"},"protocol":{"harness":"Réponses produites dans HealthBench Professional","effort":"Réglage annoncé par OpenAI","scoring":"Score corrigé pour réduire l’avantage des réponses longues","judge":"Critères écrits par des médecins puis correction automatisée"},"benchmarkVersion":"Professional 2026-09","modelSetting":"Réglage annoncé par OpenAI","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"openai-healthbench-professional","riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"not-disclosed"},"source":{"url":"https://deploymentsafety.openai.com/gpt-6-astra/vision","accessedAt":"2026-09-04","publishedAt":"2026-09-03"},"dependencies":[],"limitation":"OpenAI publie ce résultat sur ses propres modèles. Sans test extérieur, il ne suffit pas pour choisir un modèle en santé."}],"rationale":"Résultats disponibles uniquement auprès du fabricant ou d’un partenaire."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"astra-frontiermath-erdos","modelId":"astra","domain":"mathScience","constructId":"formal-research-math","familyId":"epoch-frontiermath-erdos","benchmark":"FrontierMath Erdős","organization":"Epoch AI","result":{"display":"3 %","value":3,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":68,"unit":"problèmes","runs":1},"protocol":{"harness":"Agent sans internet, budget de 300 $ et 72 heures par problème","effort":"Version pré-lancement pour Astra, réglage fixe par modèle","scoring":"Preuve ou réfutation acceptée par Lean, un vérificateur mathématique","judge":"Outil Lean de vérification mathématique"},"benchmarkVersion":"Erdős 2026-09","modelSetting":"Réglage fixe publié par modèle","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"epoch-frontiermath-erdos","riskOfBias":{"testSetAccess":"private","verification":"formal-proof","itemLevelResults":"partial","harnessComparable":"same"},"source":{"url":"https://epoch.ai/latest/announcing-frontiermath-erdos","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":[],"limitation":"Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"astra-aa-omniscience-hallucination","modelId":"astra","domain":"factuality","constructId":"knowledge-abstention","familyId":"aa-omniscience-2026-09","benchmark":"AA-Omniscience, réponses inventées","organization":"Artificial Analysis","result":{"display":"51 % de réponses inventées","value":51,"unit":"percent","better":"lower","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":"not-published","unit":"questions de connaissance","runs":"not-published"},"protocol":{"harness":"Outils de l’Artificial Analysis Intelligence Index v4.1.1","effort":"max","scoring":"Réponse incorrecte donnée au lieu d’une abstention","judge":"Correction par GPT-5.6 Luna, un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-omniscience-2026-09","riskOfBias":{"testSetAccess":"mixed","verification":"ai-judge","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","accessedAt":"2026-09-04","publishedAt":"2026-09-03"},"dependencies":["aa-intelligence-v4-1-1"],"limitation":"Le résultat dépend des questions choisies et d’une correction par un autre modèle d’IA. Il ne mesure pas toutes les formes d’erreur factuelle."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"fable-5-1":{"general":{"domain":"general","status":"provisional","independentFamilies":5,"organizations":2,"observations":[{"id":"fable-5-1-aa-intelligence","modelId":"fable-5-1","domain":"general","constructId":"general-composite","familyId":"aa-intelligence-v4-1-1","benchmark":"Artificial Analysis Intelligence Index v4.1.1","organization":"Artificial Analysis","result":{"display":"66 points","value":66,"unit":"index","better":"higher","dispersion":{"kind":"interval","display":"Marge annoncée à 95 % : moins de ±1 point","low":65,"high":67,"confidence":95}},"sample":{"size":9,"unit":"évaluations composites","runs":10},"protocol":{"harness":"Outils et réglages propres à chacun des neuf tests","effort":"Meilleur niveau publié pour la variante comparée","scoring":"Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %","judge":"Mélange de tests automatiques et de corrections par un autre modèle d’IA"},"benchmarkVersion":"4.1.1","modelSetting":"Meilleur niveau publié pour la variante comparée","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-intelligence-v4-1-1","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","accessedAt":"2026-09-04","publishedAt":"2026-09-03"},"dependencies":["terminal-bench-v2-1","aa-omniscience","aa-lcr"],"limitation":"Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve."},{"id":"fable-5-1-epoch-eci","modelId":"fable-5-1","domain":"general","constructId":"general-composite","familyId":"epoch-eci-2026-09","benchmark":"Epoch Capabilities Index","organization":"Epoch AI","result":{"display":"163 points Epoch","value":163,"unit":"index","better":"higher","dispersion":{"kind":"interval","display":"Fourchette probable à 90 % : 160 à 166","low":160,"high":166,"confidence":90}},"sample":{"size":50,"unit":"tests comparatifs ou davantage","runs":"not-published"},"protocol":{"harness":"Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants","effort":"Meilleur score retenu entre réglages d’un même modèle","scoring":"Calcul tenant compte du niveau de difficulté de chaque test","judge":"Variable selon le test d’origine"},"benchmarkVersion":"2026-09","modelSetting":"Meilleur réglage publié","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"epoch-eci-2026-09","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"not-disclosed"},"source":{"accessedAt":"2026-09-04","publishedAt":"2026-09-01","url":"https://epoch.ai/models/claude-fable-5-1"},"dependencies":["multiple-upstream-benchmarks"],"limitation":"Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu."},{"id":"fable-5-1-livebench-reasoning","modelId":"fable-5-1","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"91,7 %","value":91.6923,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-1-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-1-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"fable-5-1-livebench-data-analysis","modelId":"fable-5-1","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"80,3 %","value":80.2757,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-1-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-1-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"fable-5-1-livebench-language","modelId":"fable-5-1","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"89,5 %","value":89.501,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-1-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-1-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"fable-5-1-livebench-instruction-following","modelId":"fable-5-1","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"73,0 %","value":72.9878,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-1-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-1-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"5 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"fable-5-1-apex-agents","modelId":"fable-5-1","domain":"agentic","constructId":"professional-workflow","familyId":"mercor-apex-agents","benchmark":"APEX-Agents","organization":"Mercor","result":{"display":"62,0 %","value":62,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"± 3,5 points","low":58.5,"high":65.5}},"sample":{"size":480,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions utilisant plusieurs applications de travail","effort":"max","scoring":"Part moyenne des critères réussis","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-agents","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["apex-legal","apex-finance","apex-consulting"],"limitation":"Les tâches et critères viennent de professionnels, mais une partie de la correction repose sur un autre modèle d’IA."},{"id":"fable-5-1-livebench-agentic-coding","modelId":"fable-5-1","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"66,1 %","value":66.0607,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-1-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-1-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"established","independentFamilies":3,"organizations":4,"observations":[{"id":"fable-5-1-aa-coding","modelId":"fable-5-1","domain":"coding","constructId":"software-agent","familyId":"aa-coding-agent-v1-4","benchmark":"Artificial Analysis Coding Agent Index v1.4","organization":"Artificial Analysis","result":{"display":"70 points","value":70,"unit":"index","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":326,"unit":"tâches","runs":3},"protocol":{"harness":"Agent Claude Code","effort":"max","scoring":"Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée","judge":"Programmes exécutés et résultats vérifiés automatiquement"},"benchmarkVersion":"1.4","modelSetting":"max avec repli de sécurité","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-coding-agent-v1-4","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","accessedAt":"2026-09-04","publishedAt":"not-published"},"dependencies":["deepswe","terminal-bench-v2-1","terminal-bench-family","swe-atlas-qna"],"limitation":"Le score mesure Claude Fable 5.1 avec un agent précis. Changer cet agent peut changer le résultat."},{"id":"fable-5-1-terminal-bench-4","modelId":"fable-5-1","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"57,88 %","value":57.88,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 54,12 à 61,64 %","low":54.12,"high":61.64,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Claude Code 2.1.257","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"fable-5-1","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-02-anthropic-claude-fable-5-1-max-claude-code.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-02-anthropic-claude-fable-5-1-max-claude-code.json","accessedAt":"2026-09-05","publishedAt":"2026-09-03","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/9dcd4d5b483eadb3e562914afa1412d5c4f24579"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5-1. Date de sortie déclarée par Terminal-Bench : 2026-09-01."},{"id":"fable-5-1-livebench-coding","modelId":"fable-5-1","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"86,4 %","value":86.375,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-1-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-1-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"fable-5-1-vals-code-migration","modelId":"fable-5-1","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":54.607,"display":"54,607 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.812,"display":"Erreur standard publiée : 4,812 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"compute_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"anthropic/claude-fable-5-1\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","crossSourceExclusion":"Politique de repli non documentée entre les évaluateurs.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"Trois équipes extérieures indépendantes ont mesuré ce modèle dans le même domaine."},"legal":{"domain":"legal","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"fable-5-1-apex-legal-mean-score","modelId":"fable-5-1","domain":"legal","constructId":"corporate-lawyer","familyId":"mercor-apex-agents-legal-mean-score","benchmark":"APEX-Agents Corporate Lawyer, moyenne des critères","organization":"Mercor","result":{"display":"64,8 % des critères réussis","value":64.8,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"max","scoring":"Moyenne des critères réussis","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor. Les deux lectures juridiques viennent de cette même entrée.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-legal","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure."},{"id":"fable-5-1-apex-legal-all-criteria","modelId":"fable-5-1","domain":"legal","constructId":"corporate-lawyer","familyId":"mercor-apex-agents-legal-all-criteria","benchmark":"APEX-Agents Corporate Lawyer, tâches sans erreur","organization":"Mercor","result":{"display":"41,9 % des tâches entièrement réussies","value":41.9,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"max","scoring":"Part des tâches dont tous les critères passent","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor. Les deux lectures juridiques viennent de cette même entrée.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-legal","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"finance":{"domain":"finance","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"fable-5-1-apex-finance-mean-score","modelId":"fable-5-1","domain":"finance","constructId":"investment-banking","familyId":"mercor-apex-agents-finance-mean-score","benchmark":"APEX-Agents Investment Banking Analyst, moyenne des critères","organization":"Mercor","result":{"display":"55,7 % des critères réussis","value":55.7,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"max","scoring":"Moyenne des critères réussis","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-finance","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/investment-banking-analyst-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"fable-5-1-frontiermath-erdos","modelId":"fable-5-1","domain":"mathScience","constructId":"formal-research-math","familyId":"epoch-frontiermath-erdos","benchmark":"FrontierMath Erdős","organization":"Epoch AI","result":{"display":"0 %","value":0,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":68,"unit":"problèmes","runs":1},"protocol":{"harness":"Agent sans internet, budget de 300 $ et 72 heures par problème","effort":"Version pré-lancement pour Astra, réglage fixe par modèle","scoring":"Preuve ou réfutation acceptée par Lean, un vérificateur mathématique","judge":"Outil Lean de vérification mathématique"},"benchmarkVersion":"Erdős 2026-09","modelSetting":"Réglage fixe publié par modèle","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"epoch-frontiermath-erdos","riskOfBias":{"testSetAccess":"private","verification":"formal-proof","itemLevelResults":"partial","harnessComparable":"same"},"source":{"url":"https://epoch.ai/latest/announcing-frontiermath-erdos","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":[],"limitation":"Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques."},{"id":"fable-5-1-livebench-mathematics","modelId":"fable-5-1","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"97,0 %","value":97.0068,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-1-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-1-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"fable-5":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"fable-5-livebench-reasoning","modelId":"fable-5","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"89,7 %","value":89.6538,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"fable-5-livebench-data-analysis","modelId":"fable-5","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"80,5 %","value":80.5377,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"fable-5-livebench-language","modelId":"fable-5","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"90,7 %","value":90.684,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"fable-5-livebench-instruction-following","modelId":"fable-5","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"75,8 %","value":75.7708,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"fable-5-livebench-agentic-coding","modelId":"fable-5","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"62,2 %","value":62.1717,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"established","independentFamilies":3,"organizations":4,"observations":[{"id":"fable-5-aa-coding","modelId":"fable-5","domain":"coding","constructId":"software-agent","familyId":"aa-coding-agent-v1-4","benchmark":"Artificial Analysis Coding Agent Index v1.4","organization":"Artificial Analysis","result":{"display":"67 points","value":67,"unit":"index","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":326,"unit":"tâches","runs":3},"protocol":{"harness":"Agent Claude Code","effort":"max","scoring":"Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée","judge":"Programmes exécutés et résultats vérifiés automatiquement"},"benchmarkVersion":"1.4","modelSetting":"max avec repli de sécurité","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-coding-agent-v1-4","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","accessedAt":"2026-09-04","publishedAt":"not-published"},"dependencies":["deepswe","terminal-bench-v2-1","terminal-bench-family","swe-atlas-qna"],"limitation":"Le score mesure Claude Fable 5 avec un agent précis. Changer cet agent peut changer le résultat."},{"id":"fable-5-terminal-bench-4","modelId":"fable-5","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"44,55 %","value":44.55,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 40,70 à 48,40 %","low":40.7,"high":48.4,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Claude Code 2.1.231","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"fable-5","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-fable-5-max-claude-code.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-fable-5-max-claude-code.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5. Date de sortie déclarée par Terminal-Bench : 2026-06-09."},{"id":"fable-5-livebench-coding","modelId":"fable-5","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"86,0 %","value":85.992,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"fable-5-vals-code-migration","modelId":"fable-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":55.065,"display":"55,065 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.605,"display":"Erreur standard publiée : 4,605 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"compute_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"anthropic/claude-fable-5\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","crossSourceExclusion":"Politique de repli non documentée entre les évaluateurs.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"Trois équipes extérieures indépendantes ont mesuré ce modèle dans le même domaine."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"fable-5-livebench-mathematics","modelId":"fable-5","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"96,0 %","value":95.9858,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-fable-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-fable-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"opus-5":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"opus-5-livebench-reasoning","modelId":"opus-5","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"91,2 %","value":91.2115,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"opus-5-livebench-data-analysis","modelId":"opus-5","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"74,6 %","value":74.5503,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"opus-5-livebench-language","modelId":"opus-5","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"88,7 %","value":88.688,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"opus-5-livebench-instruction-following","modelId":"opus-5","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"63,8 %","value":63.7665,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"opus-5-livebench-agentic-coding","modelId":"opus-5","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"65,2 %","value":65.202,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"established","independentFamilies":3,"organizations":4,"observations":[{"id":"opus-5-aa-coding","modelId":"opus-5","domain":"coding","constructId":"software-agent","familyId":"aa-coding-agent-v1-4","benchmark":"Artificial Analysis Coding Agent Index v1.4","organization":"Artificial Analysis","result":{"display":"68 points","value":68,"unit":"index","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":326,"unit":"tâches","runs":3},"protocol":{"harness":"Agent Claude Code","effort":"max","scoring":"Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée","judge":"Programmes exécutés et résultats vérifiés automatiquement"},"benchmarkVersion":"1.4","modelSetting":"xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-coding-agent-v1-4","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","accessedAt":"2026-09-04","publishedAt":"not-published"},"dependencies":["deepswe","terminal-bench-v2-1","terminal-bench-family","swe-atlas-qna"],"limitation":"Le score mesure Claude Opus 5 avec un agent précis. Changer cet agent peut changer le résultat."},{"id":"opus-5-terminal-bench-4","modelId":"opus-5","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"51,82 %","value":51.82,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 48,43 à 55,21 %","low":48.43,"high":55.21,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Claude Code 2.1.231","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"opus-5","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-opus-5-max-claude-code.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-opus-5-max-claude-code.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-5. Date de sortie déclarée par Terminal-Bench : 2026-07-24."},{"id":"opus-5-livebench-coding","modelId":"opus-5","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"81,4 %","value":81.4455,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"opus-5","effort":"max","modelSetting":"claude-opus-5-max-effort","effortSetting":"Réglage publié : claude-opus-5-max-effort","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"opus-5-vals-code-migration","modelId":"opus-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":57.473,"display":"57,473 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.371,"display":"Erreur standard publiée : 4,371 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"compute_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"anthropic/claude-opus-5\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"opus-5","effort":"max","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"anthropic/claude-opus-5\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","effortSetting":"compute_effort publié : max"}}],"rationale":"Trois équipes extérieures indépendantes ont mesuré ce modèle dans le même domaine."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"opus-5-livebench-mathematics","modelId":"opus-5","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"95,7 %","value":95.731,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":380,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-5-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-5-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"sol":{"general":{"domain":"general","status":"provisional","independentFamilies":5,"organizations":2,"observations":[{"id":"sol-aa-intelligence","modelId":"sol","domain":"general","constructId":"general-composite","familyId":"aa-intelligence-v4-1-1","benchmark":"Artificial Analysis Intelligence Index v4.1.1","organization":"Artificial Analysis","result":{"display":"61 points","value":61,"unit":"index","better":"higher","dispersion":{"kind":"interval","display":"Marge annoncée à 95 % : moins de ±1 point","low":60,"high":62,"confidence":95}},"sample":{"size":9,"unit":"évaluations composites","runs":10},"protocol":{"harness":"Outils et réglages propres à chacun des neuf tests","effort":"Meilleur niveau publié pour la variante comparée","scoring":"Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %","judge":"Mélange de tests automatiques et de corrections par un autre modèle d’IA"},"benchmarkVersion":"4.1.1","modelSetting":"Meilleur niveau publié pour la variante comparée","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-intelligence-v4-1-1","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","accessedAt":"2026-09-04","publishedAt":"2026-09-03"},"dependencies":["terminal-bench-v2-1","aa-omniscience","aa-lcr"],"limitation":"Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve."},{"id":"sol-epoch-eci","modelId":"sol","domain":"general","constructId":"general-composite","familyId":"epoch-eci-2026-09","benchmark":"Epoch Capabilities Index","organization":"Epoch AI","result":{"display":"162 points Epoch","value":162,"unit":"index","better":"higher","dispersion":{"kind":"interval","display":"Fourchette probable à 90 % : 160 à 165","low":160,"high":165,"confidence":90}},"sample":{"size":50,"unit":"tests comparatifs ou davantage","runs":"not-published"},"protocol":{"harness":"Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants","effort":"Meilleur score retenu entre réglages d’un même modèle","scoring":"Calcul tenant compte du niveau de difficulté de chaque test","judge":"Variable selon le test d’origine"},"benchmarkVersion":"2026-09","modelSetting":"Meilleur réglage publié","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"epoch-eci-2026-09","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"not-disclosed"},"source":{"accessedAt":"2026-09-04","publishedAt":"2026-07-09","url":"https://epoch.ai/models/gpt-5-6-sol"},"dependencies":["multiple-upstream-benchmarks"],"limitation":"Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu."},{"id":"sol-livebench-reasoning","modelId":"sol","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"91,7 %","value":91.6538,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-sol-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-sol-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"sol-livebench-data-analysis","modelId":"sol","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"79,8 %","value":79.8407,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-sol-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-sol-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"sol-livebench-language","modelId":"sol","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"87,7 %","value":87.6837,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-sol-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-sol-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"sol-livebench-instruction-following","modelId":"sol","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"71,8 %","value":71.846,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-sol-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-sol-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"5 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"sol-livebench-agentic-coding","modelId":"sol","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"56,2 %","value":56.212,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-sol-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-sol-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"established","independentFamilies":3,"organizations":4,"observations":[{"id":"sol-aa-coding","modelId":"sol","domain":"coding","constructId":"software-agent","familyId":"aa-coding-agent-v1-4","benchmark":"Artificial Analysis Coding Agent Index v1.4","organization":"Artificial Analysis","result":{"display":"65 points","value":65,"unit":"index","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":326,"unit":"tâches","runs":3},"protocol":{"harness":"Agent Codex","effort":"max","scoring":"Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée","judge":"Programmes exécutés et résultats vérifiés automatiquement"},"benchmarkVersion":"1.4","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-coding-agent-v1-4","riskOfBias":{"testSetAccess":"mixed","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"different"},"source":{"url":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","accessedAt":"2026-09-04","publishedAt":"not-published"},"dependencies":["deepswe","terminal-bench-v2-1","terminal-bench-family","swe-atlas-qna"],"limitation":"Le score mesure GPT-5.6 Sol avec un agent précis. Changer cet agent peut changer le résultat."},{"id":"sol-terminal-bench-4","modelId":"sol","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"37,27 %","value":37.27,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 33,49 à 41,05 %","low":33.49,"high":41.05,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Codex 0.149.1","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"sol","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-sol-max-codex.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-sol-max-codex.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-sol. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09."},{"id":"sol-livebench-coding","modelId":"sol","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"83,9 %","value":83.941,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-sol-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-sol-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"sol","effort":"max","modelSetting":"gpt-5.6-sol-max","effortSetting":"Réglage publié : gpt-5.6-sol-max","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"sol-vals-code-migration","modelId":"sol","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":52.916,"display":"52,916 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.353,"display":"Erreur standard publiée : 4,353 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"openai/gpt-5.6-sol\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"sol","effort":"max","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"openai/gpt-5.6-sol\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","effortSetting":"reasoning_effort publié : max"}}],"rationale":"Trois équipes extérieures indépendantes ont mesuré ce modèle dans le même domaine."},"legal":{"domain":"legal","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"sol-apex-legal-mean-score","modelId":"sol","domain":"legal","constructId":"corporate-lawyer","familyId":"mercor-apex-agents-legal-mean-score","benchmark":"APEX-Agents Corporate Lawyer, moyenne des critères","organization":"Mercor","result":{"display":"63,4 % des critères réussis","value":63.4,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"max","scoring":"Moyenne des critères réussis","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor. Les deux lectures juridiques viennent de cette même entrée.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-legal","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure."},{"id":"sol-apex-legal-all-criteria","modelId":"sol","domain":"legal","constructId":"corporate-lawyer","familyId":"mercor-apex-agents-legal-all-criteria","benchmark":"APEX-Agents Corporate Lawyer, tâches sans erreur","organization":"Mercor","result":{"display":"35,6 % des tâches entièrement réussies","value":35.6,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"max","scoring":"Part des tâches dont tous les critères passent","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor. Les deux lectures juridiques viennent de cette même entrée.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-legal","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"finance":{"domain":"finance","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"sol-apex-finance-mean-score","modelId":"sol","domain":"finance","constructId":"investment-banking","familyId":"mercor-apex-agents-finance-mean-score","benchmark":"APEX-Agents Investment Banking Analyst, moyenne des critères","organization":"Mercor","result":{"display":"46,6 % des critères réussis","value":46.6,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":160,"unit":"tâches","runs":"not-published"},"protocol":{"harness":"Agent en boucle d’actions avec outils et documents professionnels","effort":"max","scoring":"Moyenne des critères réussis","selection":"Pour chaque modèle, Origin retient l’entrée au meilleur score moyen parmi les configurations d’agent publiées par Mercor.","judge":"Critères écrits par des experts puis corrigés par un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"mercor-apex-finance","riskOfBias":{"testSetAccess":"public","verification":"ai-judge","itemLevelResults":"partial","harnessComparable":"different"},"source":{"url":"https://www.mercor.com/apex/apex-agents-leaderboard/investment-banking-analyst-agent/","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":["mercor-apex-agents"],"limitation":"Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[{"id":"sol-openai-healthbench-professional","modelId":"sol","domain":"healthcare","constructId":"clinical-response","familyId":"openai-healthbench-professional","benchmark":"HealthBench Professional","organization":"OpenAI","result":{"display":"60,5 %","value":60.5,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":"not-published","unit":"conversations médicales professionnelles","runs":"not-published"},"protocol":{"harness":"Réponses produites dans HealthBench Professional","effort":"Réglage annoncé par OpenAI","scoring":"Score corrigé pour réduire l’avantage des réponses longues","judge":"Critères écrits par des médecins puis correction automatisée"},"benchmarkVersion":"Professional 2026-09","modelSetting":"Réglage annoncé par OpenAI","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"openai-healthbench-professional","riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"not-disclosed"},"source":{"url":"https://deploymentsafety.openai.com/gpt-6-astra/vision","accessedAt":"2026-09-04","publishedAt":"2026-09-03"},"dependencies":[],"limitation":"OpenAI publie ce résultat sur ses propres modèles. Sans test extérieur, il ne suffit pas pour choisir un modèle en santé."}],"rationale":"Résultats disponibles uniquement auprès du fabricant ou d’un partenaire."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"sol-frontiermath-erdos","modelId":"sol","domain":"mathScience","constructId":"formal-research-math","familyId":"epoch-frontiermath-erdos","benchmark":"FrontierMath Erdős","organization":"Epoch AI","result":{"display":"0 %","value":0,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":68,"unit":"problèmes","runs":1},"protocol":{"harness":"Agent sans internet, budget de 300 $ et 72 heures par problème","effort":"Version pré-lancement pour Astra, réglage fixe par modèle","scoring":"Preuve ou réfutation acceptée par Lean, un vérificateur mathématique","judge":"Outil Lean de vérification mathématique"},"benchmarkVersion":"Erdős 2026-09","modelSetting":"Réglage fixe publié par modèle","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"epoch-frontiermath-erdos","riskOfBias":{"testSetAccess":"private","verification":"formal-proof","itemLevelResults":"partial","harnessComparable":"same"},"source":{"url":"https://epoch.ai/latest/announcing-frontiermath-erdos","accessedAt":"2026-09-04","publishedAt":"2026-09-01"},"dependencies":[],"limitation":"Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques."},{"id":"sol-livebench-mathematics","modelId":"sol","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"96,2 %","value":96.1978,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-sol-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-sol-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"sol-aa-omniscience-hallucination","modelId":"sol","domain":"factuality","constructId":"knowledge-abstention","familyId":"aa-omniscience-2026-09","benchmark":"AA-Omniscience, réponses inventées","organization":"Artificial Analysis","result":{"display":"92 % de réponses inventées","value":92,"unit":"percent","better":"lower","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":"not-published","unit":"questions de connaissance","runs":"not-published"},"protocol":{"harness":"Outils de l’Artificial Analysis Intelligence Index v4.1.1","effort":"max","scoring":"Réponse incorrecte donnée au lieu d’une abstention","judge":"Correction par GPT-5.6 Luna, un autre modèle d’IA"},"benchmarkVersion":"2026-09","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"aa-omniscience-2026-09","riskOfBias":{"testSetAccess":"mixed","verification":"ai-judge","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","accessedAt":"2026-09-04","publishedAt":"2026-09-03"},"dependencies":["aa-intelligence-v4-1-1"],"limitation":"Le résultat dépend des questions choisies et d’une correction par un autre modèle d’IA. Il ne mesure pas toutes les formes d’erreur factuelle."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"minimax-m2-5":{"general":{"domain":"general","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"agentic":{"domain":"agentic","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"coding":{"domain":"coding","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[{"id":"minimax-m2-5-swe-bench-verified","modelId":"minimax-m2-5","domain":"coding","constructId":"repository-bug-repair","familyId":"swe-bench-verified-mini-v2-2026-02","benchmark":"SWE-bench Verified","organization":"SWE-bench","result":{"display":"75,8 %","value":75.8,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":500,"unit":"problèmes de dépôt","runs":1},"protocol":{"harness":"mini-SWE-agent 2.0.0","effort":"high","scoring":"Part des 500 problèmes de dépôt résolus","judge":"Tests automatisés propres à chaque problème"},"benchmarkVersion":"Verified, 500 problèmes","modelSetting":"high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"swe-bench-verified-2026","riskOfBias":{"testSetAccess":"public","verification":"mechanical","itemLevelResults":"available","harnessComparable":"same"},"source":{"url":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_minimax-2-5-high/metadata.yaml","accessedAt":"2026-09-04","publishedAt":"2026-02-17","publicationUrl":"https://github.com/SWE-bench/experiments/pull/413","runReviewStatus":"not-disclosed"},"dependencies":["swe-bench-verified-2026-02"],"limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 379 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication."}],"rationale":"Résultats disponibles uniquement auprès du fabricant ou d’un partenaire."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"claude-opus-4-6":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"claude-opus-4-6-livebench-reasoning","modelId":"claude-opus-4-6","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"88,7 %","value":88.673,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-6-thinking-auto-high-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-6-thinking-auto-high-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-opus-4-6-livebench-data-analysis","modelId":"claude-opus-4-6","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"69,9 %","value":69.893,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-6-thinking-auto-high-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-6-thinking-auto-high-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-opus-4-6-livebench-language","modelId":"claude-opus-4-6","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"83,3 %","value":83.2697,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-6-thinking-auto-high-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-6-thinking-auto-high-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-opus-4-6-livebench-instruction-following","modelId":"claude-opus-4-6","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"63,3 %","value":63.3125,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-6-thinking-auto-high-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-6-thinking-auto-high-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"claude-opus-4-6-livebench-agentic-coding","modelId":"claude-opus-4-6","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"49,0 %","value":48.9897,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-6-thinking-auto-high-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-6-thinking-auto-high-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"claude-opus-4-6-swe-bench-verified","modelId":"claude-opus-4-6","domain":"coding","constructId":"repository-bug-repair","familyId":"swe-bench-verified-mini-v2-2026-02","benchmark":"SWE-bench Verified","organization":"SWE-bench","result":{"display":"75,6 %","value":75.6,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":500,"unit":"problèmes de dépôt","runs":1},"protocol":{"harness":"mini-SWE-agent 2.0.0","effort":"Non publié","scoring":"Part des 500 problèmes de dépôt résolus","judge":"Tests automatisés propres à chaque problème"},"benchmarkVersion":"Verified, 500 problèmes","modelSetting":"Réglage non publié","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"swe-bench-verified-2026","riskOfBias":{"testSetAccess":"public","verification":"mechanical","itemLevelResults":"available","harnessComparable":"same"},"source":{"url":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_claude-4-6-opus/metadata.yaml","accessedAt":"2026-09-04","publishedAt":"2026-02-17","publicationUrl":"https://github.com/SWE-bench/experiments/pull/413","revision":{"publishedAt":"2026-02-18","previousValue":75.4,"url":"https://github.com/SWE-bench/experiments/commit/36905bfeb728dadd82a75bb169ed612aac634551"},"runReviewStatus":"not-disclosed"},"dependencies":["swe-bench-verified-2026-02"],"limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 378 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Valeur révisée de 75,4 à 75,6 % le 18 février 2026 : https://github.com/SWE-bench/experiments/commit/36905bfeb728dadd82a75bb169ed612aac634551. Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication."},{"id":"claude-opus-4-6-livebench-coding","modelId":"claude-opus-4-6","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"78,2 %","value":78.1845,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-6-thinking-auto-high-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-6-thinking-auto-high-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"claude-opus-4-6-livebench-mathematics","modelId":"claude-opus-4-6","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"89,3 %","value":89.317,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-6-thinking-auto-high-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-6-thinking-auto-high-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"glm-5":{"general":{"domain":"general","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"agentic":{"domain":"agentic","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"coding":{"domain":"coding","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[{"id":"glm-5-swe-bench-verified","modelId":"glm-5","domain":"coding","constructId":"repository-bug-repair","familyId":"swe-bench-verified-mini-v2-2026-02","benchmark":"SWE-bench Verified","organization":"SWE-bench","result":{"display":"72,8 %","value":72.8,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":500,"unit":"problèmes de dépôt","runs":1},"protocol":{"harness":"mini-SWE-agent 2.0.0","effort":"high","scoring":"Part des 500 problèmes de dépôt résolus","judge":"Tests automatisés propres à chaque problème"},"benchmarkVersion":"Verified, 500 problèmes","modelSetting":"high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"swe-bench-verified-2026","riskOfBias":{"testSetAccess":"public","verification":"mechanical","itemLevelResults":"available","harnessComparable":"same"},"source":{"url":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_glm-5-high/metadata.yaml","accessedAt":"2026-09-04","publishedAt":"2026-02-17","publicationUrl":"https://github.com/SWE-bench/experiments/pull/413","runReviewStatus":"not-disclosed"},"dependencies":["swe-bench-verified-2026-02"],"limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 364 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication."}],"rationale":"Résultats disponibles uniquement auprès du fabricant ou d’un partenaire."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"kimi-k2-5":{"general":{"domain":"general","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"agentic":{"domain":"agentic","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"kimi-k2-5-swe-bench-verified","modelId":"kimi-k2-5","domain":"coding","constructId":"repository-bug-repair","familyId":"swe-bench-verified-mini-v2-2026-02","benchmark":"SWE-bench Verified","organization":"SWE-bench","result":{"display":"70,8 %","value":70.8,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":500,"unit":"problèmes de dépôt","runs":1},"protocol":{"harness":"mini-SWE-agent 2.0.0","effort":"high","scoring":"Part des 500 problèmes de dépôt résolus","judge":"Tests automatisés propres à chaque problème"},"benchmarkVersion":"Verified, 500 problèmes","modelSetting":"high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"swe-bench-verified-2026","riskOfBias":{"testSetAccess":"public","verification":"mechanical","itemLevelResults":"available","harnessComparable":"same"},"source":{"url":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_kimi-k2-5-high/metadata.yaml","accessedAt":"2026-09-04","publishedAt":"2026-02-17","publicationUrl":"https://github.com/SWE-bench/experiments/pull/413","runReviewStatus":"not-disclosed"},"dependencies":["swe-bench-verified-2026-02"],"limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 354 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication."},{"id":"kimi-k2-5-vals-code-migration","modelId":"kimi-k2-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":6.962,"display":"6,962 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.29,"display":"Erreur standard publiée : 1,29 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"kimi/kimi-k2.5-thinking\",\"temperature\":null,\"top_p\":0.95,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Moonshot AI\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/moonshotai/kimi-k2.5-0127/endpoints. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"claude-opus-4-7":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"claude-opus-4-7-livebench-reasoning","modelId":"claude-opus-4-7","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"87,2 %","value":87.1923,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-7-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-7-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-opus-4-7-livebench-data-analysis","modelId":"claude-opus-4-7","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"78,3 %","value":78.2637,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-7-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-7-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-opus-4-7-livebench-language","modelId":"claude-opus-4-7","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"77,9 %","value":77.914,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-7-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-7-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-opus-4-7-livebench-instruction-following","modelId":"claude-opus-4-7","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"66,7 %","value":66.7375,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-7-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-7-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"claude-opus-4-7-livebench-agentic-coding","modelId":"claude-opus-4-7","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"50,7 %","value":50.6563,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-7-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-7-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"claude-opus-4-7-livebench-coding","modelId":"claude-opus-4-7","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"82,1 %","value":82.088,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-7-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-7-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-opus-4-7-vals-code-migration","modelId":"claude-opus-4-7","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":43.878,"display":"43,878 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.22,"display":"Erreur standard publiée : 4,22 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"compute_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"anthropic/claude-opus-4-7\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","crossSourceExclusion":"Efforts différents entre Vals et LiveBench.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"claude-opus-4-7-livebench-mathematics","modelId":"claude-opus-4-7","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"92,9 %","value":92.8538,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-7-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-7-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"claude-sonnet-4-6":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"claude-sonnet-4-6-livebench-reasoning","modelId":"claude-sonnet-4-6","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"84,8 %","value":84.7693,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-4-6-thinking-auto-medium-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-4-6-thinking-auto-medium-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-sonnet-4-6-livebench-data-analysis","modelId":"claude-sonnet-4-6","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"77,9 %","value":77.946,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-4-6-thinking-auto-medium-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-4-6-thinking-auto-medium-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-sonnet-4-6-livebench-language","modelId":"claude-sonnet-4-6","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"76,1 %","value":76.1027,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-4-6-thinking-auto-medium-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-4-6-thinking-auto-medium-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-sonnet-4-6-livebench-instruction-following","modelId":"claude-sonnet-4-6","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"63,2 %","value":63.2208,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-4-6-thinking-auto-medium-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-4-6-thinking-auto-medium-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"claude-sonnet-4-6-livebench-agentic-coding","modelId":"claude-sonnet-4-6","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"42,6 %","value":42.626,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-4-6-thinking-auto-medium-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-4-6-thinking-auto-medium-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"claude-sonnet-4-6-livebench-coding","modelId":"claude-sonnet-4-6","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"79,3 %","value":79.2715,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-4-6-thinking-auto-medium-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-4-6-thinking-auto-medium-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-sonnet-4-6-vals-code-migration","modelId":"claude-sonnet-4-6","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":39.892,"display":"39,892 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.138,"display":"Erreur standard publiée : 4,138 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"compute_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"anthropic/claude-sonnet-4-6\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":true,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","crossSourceExclusion":"Efforts différents entre Vals et LiveBench.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"claude-sonnet-4-6-livebench-mathematics","modelId":"claude-sonnet-4-6","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"87,0 %","value":86.994,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-4-6-thinking-auto-medium-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-4-6-thinking-auto-medium-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"claude-sonnet-5":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"claude-sonnet-5-livebench-reasoning","modelId":"claude-sonnet-5","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"88,7 %","value":88.6923,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-5-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-5-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-sonnet-5-livebench-data-analysis","modelId":"claude-sonnet-5","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"71,7 %","value":71.7407,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-5-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-5-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-sonnet-5-livebench-language","modelId":"claude-sonnet-5","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"75,0 %","value":74.9703,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-5-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-5-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-sonnet-5-livebench-instruction-following","modelId":"claude-sonnet-5","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"63,9 %","value":63.8585,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-5-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-5-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"claude-sonnet-5-livebench-agentic-coding","modelId":"claude-sonnet-5","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"59,4 %","value":59.394,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-5-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-5-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"established","independentFamilies":3,"organizations":3,"observations":[{"id":"claude-sonnet-5-terminal-bench-4","modelId":"claude-sonnet-5","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"12,42 %","value":12.42,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 9,36 à 15,48 %","low":9.36,"high":15.48,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Claude Code 2.1.231","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","crossSourceExclusion":"Efforts différents : max chez Terminal-Bench, xhigh chez LiveBench.","configuration":{"version":"claude-sonnet-5","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-sonnet-5-max-claude-code.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-sonnet-5-max-claude-code.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-sonnet-5. Date de sortie déclarée par Terminal-Bench : 2026-06-30. Efforts différents : max chez Terminal-Bench, xhigh chez LiveBench."},{"id":"claude-sonnet-5-livebench-coding","modelId":"claude-sonnet-5","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"80,7 %","value":80.68,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-5-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-5-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-sonnet-5-vals-code-migration","modelId":"claude-sonnet-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":44.392,"display":"44,392 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.246,"display":"Erreur standard publiée : 4,246 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"compute_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"anthropic/claude-sonnet-5\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","crossSourceExclusion":"Efforts différents entre Vals et LiveBench.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"Trois équipes extérieures indépendantes ont mesuré ce modèle dans le même domaine."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"claude-sonnet-5-livebench-mathematics","modelId":"claude-sonnet-5","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"92,9 %","value":92.9423,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-sonnet-5-xhigh-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-sonnet-5-xhigh-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"deepseek-v4-flash":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"deepseek-v4-flash-livebench-reasoning","modelId":"deepseek-v4-flash","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"70,6 %","value":70.5818,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-flash-livebench-data-analysis","modelId":"deepseek-v4-flash","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"68,0 %","value":68.023,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-flash-livebench-language","modelId":"deepseek-v4-flash","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"70,1 %","value":70.124,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-flash-livebench-instruction-following","modelId":"deepseek-v4-flash","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"63,1 %","value":63.1375,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"deepseek-v4-flash-livebench-agentic-coding","modelId":"deepseek-v4-flash","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"37,6 %","value":37.626,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"deepseek-v4-flash-livebench-coding","modelId":"deepseek-v4-flash","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"69,2 %","value":69.228,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"deepseek-v4-flash-livebench-mathematics","modelId":"deepseek-v4-flash","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"79,6 %","value":79.6475,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"deepseek-v4-pro":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"deepseek-v4-pro-livebench-reasoning","modelId":"deepseek-v4-pro","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"82,7 %","value":82.6923,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-pro-livebench-data-analysis","modelId":"deepseek-v4-pro","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"74,5 %","value":74.5377,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-pro-livebench-language","modelId":"deepseek-v4-pro","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"78,1 %","value":78.1303,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-pro-livebench-instruction-following","modelId":"deepseek-v4-pro","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"62,4 %","value":62.35,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"deepseek-v4-pro-livebench-agentic-coding","modelId":"deepseek-v4-pro","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"42,6 %","value":42.626,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"deepseek-v4-pro-livebench-coding","modelId":"deepseek-v4-pro","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"70,0 %","value":69.994,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-pro-vals-code-migration","modelId":"deepseek-v4-pro","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":26.201,"display":"26,201 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.037,"display":"Erreur standard publiée : 4,037 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"deepseek/deepseek-v4-pro\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":384000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"DeepSeek\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-pro-20260423/endpoints. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"deepseek-v4-pro-livebench-mathematics","modelId":"deepseek-v4-pro","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"90,7 %","value":90.6755,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"gemini-3-1-pro-preview":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"gemini-3-1-pro-preview-livebench-reasoning","modelId":"gemini-3-1-pro-preview","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"84,0 %","value":84.0048,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.1-pro-preview-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.1-pro-preview-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-1-pro-preview-livebench-data-analysis","modelId":"gemini-3-1-pro-preview","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"78,5 %","value":78.5413,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.1-pro-preview-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.1-pro-preview-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-1-pro-preview-livebench-language","modelId":"gemini-3-1-pro-preview","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"85,4 %","value":85.376,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.1-pro-preview-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.1-pro-preview-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-1-pro-preview-livebench-instruction-following","modelId":"gemini-3-1-pro-preview","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"79,1 %","value":79.1,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.1-pro-preview-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.1-pro-preview-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gemini-3-1-pro-preview-livebench-agentic-coding","modelId":"gemini-3-1-pro-preview","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"44,1 %","value":44.1413,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.1-pro-preview-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.1-pro-preview-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"gemini-3-1-pro-preview-livebench-coding","modelId":"gemini-3-1-pro-preview","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"76,5 %","value":76.4545,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.1-pro-preview-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.1-pro-preview-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gemini-3-1-pro-preview","effort":"high","modelSetting":"gemini-3.1-pro-preview-high","effortSetting":"Réglage publié : gemini-3.1-pro-preview-high","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"gemini-3-1-pro-preview-vals-code-migration","modelId":"gemini-3-1-pro-preview","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":17.313,"display":"17,313 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":3.933,"display":"Erreur standard publiée : 3,933 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"google/gemini-3.1-pro-preview\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gemini-3-1-pro-preview","effort":"high","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"google/gemini-3.1-pro-preview\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","effortSetting":"reasoning_effort publié : high"}}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gemini-3-1-pro-preview-livebench-mathematics","modelId":"gemini-3-1-pro-preview","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"91,0 %","value":91.045,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.1-pro-preview-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.1-pro-preview-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"gemini-3-5-flash":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"gemini-3-5-flash-livebench-reasoning","modelId":"gemini-3-5-flash","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"82,0 %","value":82.0048,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-5-flash-livebench-data-analysis","modelId":"gemini-3-5-flash","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"64,9 %","value":64.8573,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-5-flash-livebench-language","modelId":"gemini-3-5-flash","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"84,6 %","value":84.5843,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-5-flash-livebench-instruction-following","modelId":"gemini-3-5-flash","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"75,6 %","value":75.6,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gemini-3-5-flash-livebench-agentic-coding","modelId":"gemini-3-5-flash","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"49,0 %","value":48.9897,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"gemini-3-5-flash-livebench-coding","modelId":"gemini-3-5-flash","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"78,2 %","value":78.1845,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gemini-3-5-flash","effort":"high","modelSetting":"gemini-3.5-flash-high","effortSetting":"Réglage publié : gemini-3.5-flash-high","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"gemini-3-5-flash-vals-code-migration","modelId":"gemini-3-5-flash","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":26.745,"display":"26,745 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.104,"display":"Erreur standard publiée : 4,104 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"google/gemini-3.5-flash\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gemini-3-5-flash","effort":"high","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"google/gemini-3.5-flash\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","effortSetting":"reasoning_effort publié : high"}}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gemini-3-5-flash-livebench-mathematics","modelId":"gemini-3-5-flash","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"88,2 %","value":88.2438,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"glm-5-2":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"glm-5-2-livebench-reasoning","modelId":"glm-5-2","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"78,6 %","value":78.625,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.2","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.2","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"glm-5-2-livebench-data-analysis","modelId":"glm-5-2","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"73,7 %","value":73.7397,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.2","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.2","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"glm-5-2-livebench-language","modelId":"glm-5-2","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"76,2 %","value":76.2417,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.2","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.2","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"glm-5-2-livebench-instruction-following","modelId":"glm-5-2","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"62,3 %","value":62.2918,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.2","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.2","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"glm-5-2-livebench-agentic-coding","modelId":"glm-5-2","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"51,8 %","value":51.7677,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.2","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.2","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"glm-5-2-livebench-coding","modelId":"glm-5-2","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"79,7 %","value":79.654,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.2","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.2","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"glm-5-2-vals-code-migration","modelId":"glm-5-2","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":37.87,"display":"37,87 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.143,"display":"Erreur standard publiée : 4,143 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"zai/glm-5.2\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":131072,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Zhipu AI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.2. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"glm-5-2-livebench-mathematics","modelId":"glm-5-2","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"89,8 %","value":89.7813,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.2","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.2","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"gpt-5-4-mini":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"gpt-5-4-mini-livebench-reasoning","modelId":"gpt-5-4-mini","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"71,3 %","value":71.3238,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":199,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-mini-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-mini-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gpt-5-4-mini-livebench-data-analysis","modelId":"gpt-5-4-mini","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"70,8 %","value":70.7857,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-mini-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-mini-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gpt-5-4-mini-livebench-language","modelId":"gpt-5-4-mini","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"71,0 %","value":70.9517,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":149,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-mini-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-mini-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gpt-5-4-mini-livebench-instruction-following","modelId":"gpt-5-4-mini","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"59,8 %","value":59.804,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-mini-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-mini-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gpt-5-4-mini-livebench-agentic-coding","modelId":"gpt-5-4-mini","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"41,7 %","value":41.6667,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-mini-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-mini-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"gpt-5-4-mini-livebench-coding","modelId":"gpt-5-4-mini","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"71,6 %","value":71.624,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":110,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-mini-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-mini-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gpt-5.4-mini-2026-03-17","effort":"xhigh","modelSetting":"gpt-5.4-mini-xhigh","effortSetting":"Réglage publié : gpt-5.4-mini-xhigh","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"gpt-5-4-mini-vals-code-migration","modelId":"gpt-5-4-mini","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":12.936,"display":"12,936 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":3.641,"display":"Erreur standard publiée : 3,641 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : xhigh","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"openai/gpt-5.4-mini-2026-03-17\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-mini. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gpt-5.4-mini-2026-03-17","effort":"xhigh","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"openai/gpt-5.4-mini-2026-03-17\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","effortSetting":"reasoning_effort publié : xhigh"}}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gpt-5-4-mini-livebench-mathematics","modelId":"gpt-5-4-mini","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"78,5 %","value":78.462,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":377,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-mini-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-mini-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"gpt-5-4-nano":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"gpt-5-4-nano-livebench-reasoning","modelId":"gpt-5-4-nano","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"81,1 %","value":81.097,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":194,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-nano-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-nano-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gpt-5-4-nano-livebench-data-analysis","modelId":"gpt-5-4-nano","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"67,6 %","value":67.6427,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":146,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-nano-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-nano-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gpt-5-4-nano-livebench-language","modelId":"gpt-5-4-nano","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"62,5 %","value":62.507,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":144,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-nano-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-nano-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gpt-5-4-nano-livebench-instruction-following","modelId":"gpt-5-4-nano","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"67,2 %","value":67.2048,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":197,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-nano-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-nano-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gpt-5-4-nano-livebench-agentic-coding","modelId":"gpt-5-4-nano","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"46,8 %","value":46.7677,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-nano-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-nano-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"gpt-5-4-nano-livebench-coding","modelId":"gpt-5-4-nano","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"70,8 %","value":70.8385,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":116,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-nano-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-nano-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gpt-5-4-nano-vals-code-migration","modelId":"gpt-5-4-nano","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":14.467,"display":"14,467 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.025,"display":"Erreur standard publiée : 4,025 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"openai/gpt-5.4-nano-2026-03-17\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","crossSourceExclusion":"Efforts différents entre Vals et LiveBench.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-nano. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gpt-5-4-nano-livebench-mathematics","modelId":"gpt-5-4-nano","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"91,0 %","value":90.977,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":377,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-nano-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-nano-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"gpt-5-4":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"gpt-5-4-livebench-reasoning","modelId":"gpt-5-4","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"88,1 %","value":88.1155,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gpt-5-4-livebench-data-analysis","modelId":"gpt-5-4","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"79,3 %","value":79.3133,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gpt-5-4-livebench-language","modelId":"gpt-5-4","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"82,6 %","value":82.6337,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gpt-5-4-livebench-instruction-following","modelId":"gpt-5-4","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"70,2 %","value":70.2168,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gpt-5-4-livebench-agentic-coding","modelId":"gpt-5-4","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"53,8 %","value":53.8383,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"gpt-5-4-livebench-coding","modelId":"gpt-5-4","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"77,5 %","value":77.5415,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gpt-5.4-2026-03-05","effort":"xhigh","modelSetting":"gpt-5.4-xhigh","effortSetting":"Réglage publié : gpt-5.4-xhigh","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"gpt-5-4-vals-code-migration","modelId":"gpt-5-4","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":34.984,"display":"34,984 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.113,"display":"Erreur standard publiée : 4,113 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : xhigh","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"openai/gpt-5.4-2026-03-05\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gpt-5.4-2026-03-05","effort":"xhigh","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"openai/gpt-5.4-2026-03-05\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","effortSetting":"reasoning_effort publié : xhigh"}}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gpt-5-4-livebench-mathematics","modelId":"gpt-5-4","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"94,1 %","value":94.148,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.4-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.4-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"gpt-5-5":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"gpt-5-5-livebench-reasoning","modelId":"gpt-5-5","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"89,7 %","value":89.6538,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.5-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.5-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gpt-5-5-livebench-data-analysis","modelId":"gpt-5-5","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"81,6 %","value":81.5757,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.5-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.5-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gpt-5-5-livebench-language","modelId":"gpt-5-5","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"87,4 %","value":87.363,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.5-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.5-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gpt-5-5-livebench-instruction-following","modelId":"gpt-5-5","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"70,7 %","value":70.7293,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.5-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.5-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gpt-5-5-livebench-agentic-coding","modelId":"gpt-5-5","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"54,0 %","value":53.9897,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.5-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.5-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"gpt-5-5-livebench-coding","modelId":"gpt-5-5","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"82,1 %","value":82.1495,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.5-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.5-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gpt-5-5","effort":"xhigh","modelSetting":"gpt-5.5-xhigh","effortSetting":"Réglage publié : gpt-5.5-xhigh","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"gpt-5-5-vals-code-migration","modelId":"gpt-5-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":45.161,"display":"45,161 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.164,"display":"Erreur standard publiée : 4,164 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : xhigh","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"openai/gpt-5.5\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.5. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gpt-5-5","effort":"xhigh","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"openai/gpt-5.5\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","effortSetting":"reasoning_effort publié : xhigh"}}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gpt-5-5-livebench-mathematics","modelId":"gpt-5-5","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"95,9 %","value":95.8573,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.5-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.5-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"grok-4-3":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"grok-4-3-livebench-reasoning","modelId":"grok-4-3","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"70,8 %","value":70.822,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"grok-4-3-livebench-data-analysis","modelId":"grok-4-3","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"55,8 %","value":55.7727,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"grok-4-3-livebench-language","modelId":"grok-4-3","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"73,6 %","value":73.58,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"grok-4-3-livebench-instruction-following","modelId":"grok-4-3","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"62,8 %","value":62.75,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"grok-4-3-livebench-agentic-coding","modelId":"grok-4-3","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"18,5 %","value":18.5353,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"grok-4-3-livebench-coding","modelId":"grok-4-3","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"69,9 %","value":69.9325,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"grok-4-3-vals-code-migration","modelId":"grok-4-3","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":6.795,"display":"6,795 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.195,"display":"Erreur standard publiée : 1,195 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"grok/grok-4.3\",\"temperature\":0.7,\"top_p\":0.95,\"max_output_tokens\":null,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"SpaceXAI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.3. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"grok-4-3-livebench-mathematics","modelId":"grok-4-3","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"84,3 %","value":84.339,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"grok-4-5":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"grok-4-5-livebench-reasoning","modelId":"grok-4-5","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"87,2 %","value":87.173,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.5","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.5","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"grok-4-5-livebench-data-analysis","modelId":"grok-4-5","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"73,0 %","value":73.0377,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.5","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.5","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"grok-4-5-livebench-language","modelId":"grok-4-5","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"82,8 %","value":82.7953,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.5","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.5","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"grok-4-5-livebench-instruction-following","modelId":"grok-4-5","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"71,5 %","value":71.5293,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.5","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.5","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"grok-4-5-livebench-agentic-coding","modelId":"grok-4-5","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"56,5 %","value":56.4647,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.5","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.5","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"established","independentFamilies":3,"organizations":3,"observations":[{"id":"grok-4-5-terminal-bench-4","modelId":"grok-4-5","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"12,42 %","value":12.42,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 9,80 à 15,04 %","low":9.8,"high":15.04,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Grok Build 1.0.5","effort":"Non publié","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"Réglage non publié","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","crossSourceExclusion":"Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé.","configuration":{"version":"grok-4-5","effort":"not-published","modelSetting":"Réglage non publié","effortSetting":"Non publié","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-xai-grok-4-5-none-grok-build.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-xai-grok-4-5-none-grok-build.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.5. Date de sortie déclarée par Terminal-Bench : 2026-07-16. Écart conservé avec la date du catalogue Origin : 2026-07-08. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé."},{"id":"grok-4-5-livebench-coding","modelId":"grok-4-5","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"68,6 %","value":68.5855,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.5","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.5","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"grok-4-5-vals-code-migration","modelId":"grok-4-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":36.596,"display":"36,596 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.141,"display":"Erreur standard publiée : 4,141 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"grok/grok-4.5\",\"temperature\":0.7,\"top_p\":0.95,\"max_output_tokens\":null,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"SpaceXAI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.5. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"Trois équipes extérieures indépendantes ont mesuré ce modèle dans le même domaine."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"grok-4-5-livebench-mathematics","modelId":"grok-4-5","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"90,8 %","value":90.8245,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.5","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.5","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"grok-build-0-1":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"grok-build-0-1-livebench-reasoning","modelId":"grok-build-0-1","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"76,4 %","value":76.3703,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-build-0.1","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-build-0.1","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"grok-build-0-1-livebench-data-analysis","modelId":"grok-build-0-1","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"70,8 %","value":70.794,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-build-0.1","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-build-0.1","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"grok-build-0-1-livebench-language","modelId":"grok-build-0-1","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"72,5 %","value":72.46,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-build-0.1","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-build-0.1","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"grok-build-0-1-livebench-instruction-following","modelId":"grok-build-0-1","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"65,2 %","value":65.2208,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-build-0.1","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-build-0.1","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"grok-build-0-1-livebench-agentic-coding","modelId":"grok-build-0-1","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"45,8 %","value":45.808,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-build-0.1","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-build-0.1","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"grok-build-0-1-livebench-coding","modelId":"grok-build-0-1","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"65,4 %","value":65.3855,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-build-0.1","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-build-0.1","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"grok-build-0-1-livebench-mathematics","modelId":"grok-build-0-1","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"78,4 %","value":78.4288,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-build-0.1","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-build-0.1","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"kimi-k2-6":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"kimi-k2-6-livebench-reasoning","modelId":"kimi-k2-6","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"79,4 %","value":79.375,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.6-thinking","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.6-thinking","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"kimi-k2-6-livebench-data-analysis","modelId":"kimi-k2-6","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"65,1 %","value":65.1343,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.6-thinking","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.6-thinking","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"kimi-k2-6-livebench-language","modelId":"kimi-k2-6","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"75,1 %","value":75.1413,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.6-thinking","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.6-thinking","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"kimi-k2-6-livebench-instruction-following","modelId":"kimi-k2-6","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"64,4 %","value":64.3583,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.6-thinking","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.6-thinking","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"kimi-k2-6-livebench-agentic-coding","modelId":"kimi-k2-6","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"46,9 %","value":46.9193,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.6-thinking","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.6-thinking","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"kimi-k2-6-livebench-coding","modelId":"kimi-k2-6","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"78,6 %","value":78.567,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.6-thinking","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.6-thinking","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"kimi-k2-6-vals-code-migration","modelId":"kimi-k2-6","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":27.768,"display":"27,768 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.144,"display":"Erreur standard publiée : 4,144 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"kimi/kimi-k2.6\",\"temperature\":null,\"top_p\":0.95,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Moonshot AI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"kimi-k2-6-livebench-mathematics","modelId":"kimi-k2-6","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"84,3 %","value":84.2763,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.6-thinking","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.6-thinking","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"kimi-k2-7-code":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"kimi-k2-7-code-livebench-reasoning","modelId":"kimi-k2-7-code","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"82,8 %","value":82.8078,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.7-code","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.7-code","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"kimi-k2-7-code-livebench-data-analysis","modelId":"kimi-k2-7-code","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"62,7 %","value":62.6573,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.7-code","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.7-code","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"kimi-k2-7-code-livebench-language","modelId":"kimi-k2-7-code","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"77,9 %","value":77.9057,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.7-code","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.7-code","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"kimi-k2-7-code-livebench-instruction-following","modelId":"kimi-k2-7-code","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"56,3 %","value":56.2918,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.7-code","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.7-code","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"kimi-k2-7-code-livebench-agentic-coding","modelId":"kimi-k2-7-code","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"45,7 %","value":45.6563,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.7-code","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.7-code","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"kimi-k2-7-code-livebench-coding","modelId":"kimi-k2-7-code","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"74,0 %","value":73.959,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.7-code","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.7-code","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"kimi-k2-7-code-vals-code-migration","modelId":"kimi-k2-7-code","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":25.392,"display":"25,392 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.161,"display":"Erreur standard publiée : 4,161 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"kimi/kimi-k2.7-code\",\"temperature\":null,\"top_p\":0.95,\"max_output_tokens\":32768,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Moonshot AI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"kimi-k2-7-code-livebench-mathematics","modelId":"kimi-k2-7-code","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"79,6 %","value":79.6043,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k2.7-code","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k2.7-code","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"minimax-m3":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"minimax-m3-livebench-reasoning","modelId":"minimax-m3","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"74,5 %","value":74.4808,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : minimax-m3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"minimax-m3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"minimax-m3-livebench-data-analysis","modelId":"minimax-m3","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"76,2 %","value":76.1663,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : minimax-m3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"minimax-m3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"minimax-m3-livebench-language","modelId":"minimax-m3","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"76,8 %","value":76.8357,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : minimax-m3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"minimax-m3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"minimax-m3-livebench-instruction-following","modelId":"minimax-m3","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"57,5 %","value":57.5083,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : minimax-m3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"minimax-m3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"minimax-m3-livebench-agentic-coding","modelId":"minimax-m3","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"40,7 %","value":40.6563,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : minimax-m3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"minimax-m3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"minimax-m3-livebench-coding","modelId":"minimax-m3","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"68,2 %","value":68.2025,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : minimax-m3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"minimax-m3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"minimax-m3-vals-code-migration","modelId":"minimax-m3","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":19.925,"display":"19,925 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":3.944,"display":"Erreur standard publiée : 3,944 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"minimax/MiniMax-M3\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":512000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"MiniMax\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"minimax-m3-livebench-mathematics","modelId":"minimax-m3","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"76,9 %","value":76.9475,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : minimax-m3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"minimax-m3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"qwen3-6-27b":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"qwen3-6-27b-livebench-reasoning","modelId":"qwen3-6-27b","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"70,3 %","value":70.2838,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-6-27b-livebench-data-analysis","modelId":"qwen3-6-27b","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"70,4 %","value":70.4267,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-6-27b-livebench-language","modelId":"qwen3-6-27b","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"63,3 %","value":63.3043,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-6-27b-livebench-instruction-following","modelId":"qwen3-6-27b","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"53,2 %","value":53.229,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"qwen3-6-27b-livebench-agentic-coding","modelId":"qwen3-6-27b","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"39,3 %","value":39.2927,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"qwen3-6-27b-livebench-coding","modelId":"qwen3-6-27b","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"71,8 %","value":71.785,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"qwen3-6-27b-livebench-mathematics","modelId":"qwen3-6-27b","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"79,9 %","value":79.8685,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"qwen3-6-plus":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"qwen3-6-plus-livebench-reasoning","modelId":"qwen3-6-plus","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"75,8 %","value":75.827,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-plus","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-plus","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-6-plus-livebench-data-analysis","modelId":"qwen3-6-plus","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"69,9 %","value":69.9117,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-plus","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-plus","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-6-plus-livebench-language","modelId":"qwen3-6-plus","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"75,0 %","value":74.9893,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-plus","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-plus","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-6-plus-livebench-instruction-following","modelId":"qwen3-6-plus","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"58,3 %","value":58.342,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-plus","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-plus","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"qwen3-6-plus-livebench-agentic-coding","modelId":"qwen3-6-plus","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"41,4 %","value":41.3637,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-plus","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-plus","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"qwen3-6-plus-livebench-coding","modelId":"qwen3-6-plus","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"78,2 %","value":78.1845,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-plus","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-plus","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-6-plus-vals-code-migration","modelId":"qwen3-6-plus","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":11.102,"display":"11,102 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.312,"display":"Erreur standard publiée : 1,312 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"alibaba/qwen3.6-plus\",\"temperature\":0.7,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Alibaba\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"qwen3-6-plus-livebench-mathematics","modelId":"qwen3-6-plus","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"83,7 %","value":83.7248,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.6-plus","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.6-plus","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"qwen3-7-max":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"qwen3-7-max-livebench-reasoning","modelId":"qwen3-7-max","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"83,3 %","value":83.3365,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.7-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.7-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-7-max-livebench-data-analysis","modelId":"qwen3-7-max","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"71,8 %","value":71.786,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.7-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.7-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-7-max-livebench-language","modelId":"qwen3-7-max","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"79,7 %","value":79.739,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.7-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.7-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-7-max-livebench-instruction-following","modelId":"qwen3-7-max","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"74,0 %","value":74.0415,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.7-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.7-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"qwen3-7-max-livebench-agentic-coding","modelId":"qwen3-7-max","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"43,6 %","value":43.586,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.7-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.7-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"qwen3-7-max-livebench-coding","modelId":"qwen3-7-max","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"74,2 %","value":74.219,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.7-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.7-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-7-max-vals-code-migration","modelId":"qwen3-7-max","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":13.069,"display":"13,069 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":2.858,"display":"Erreur standard publiée : 2,858 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"alibaba/qwen3.7-max\",\"temperature\":0.7,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Alibaba\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"qwen3-7-max-livebench-mathematics","modelId":"qwen3-7-max","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"85,2 %","value":85.2483,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.7-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.7-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"terra":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"terra-livebench-reasoning","modelId":"terra","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"90,6 %","value":90.6345,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-terra-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-terra-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"terra-livebench-data-analysis","modelId":"terra","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"79,3 %","value":79.3067,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-terra-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-terra-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"terra-livebench-language","modelId":"terra","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"82,9 %","value":82.8927,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-terra-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-terra-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"terra-livebench-instruction-following","modelId":"terra","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"64,6 %","value":64.6165,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-terra-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-terra-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"terra-livebench-agentic-coding","modelId":"terra","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"54,9 %","value":54.9497,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-terra-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-terra-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"established","independentFamilies":3,"organizations":3,"observations":[{"id":"terra-terminal-bench-4","modelId":"terra","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"21,52 %","value":21.52,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 18,27 à 24,77 %","low":18.27,"high":24.77,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Codex 0.149.1","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"terra","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-terra-max-codex.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-terra-max-codex.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-terra. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09."},{"id":"terra-livebench-coding","modelId":"terra","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"78,2 %","value":78.2455,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-terra-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-terra-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"terra","effort":"max","modelSetting":"gpt-5.6-terra-max","effortSetting":"Réglage publié : gpt-5.6-terra-max","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"terra-vals-code-migration","modelId":"terra","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":47.804,"display":"47,804 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.28,"display":"Erreur standard publiée : 4,28 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"openai/gpt-5.6-terra\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"terra","effort":"max","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"openai/gpt-5.6-terra\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","effortSetting":"reasoning_effort publié : max"}}],"rationale":"Trois équipes extérieures indépendantes ont mesuré ce modèle dans le même domaine."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"terra-livebench-mathematics","modelId":"terra","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"94,9 %","value":94.9083,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-terra-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-terra-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"luna":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"luna-livebench-reasoning","modelId":"luna","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"85,6 %","value":85.6443,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-luna-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-luna-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"luna-livebench-data-analysis","modelId":"luna","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"78,0 %","value":78.0333,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-luna-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-luna-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"luna-livebench-language","modelId":"luna","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"72,6 %","value":72.567,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-luna-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-luna-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"luna-livebench-instruction-following","modelId":"luna","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"60,1 %","value":60.121,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-luna-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-luna-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"luna-livebench-agentic-coding","modelId":"luna","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"48,4 %","value":48.4343,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-luna-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-luna-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"established","independentFamilies":3,"organizations":3,"observations":[{"id":"luna-terminal-bench-4","modelId":"luna","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"17,27 %","value":17.27,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 14,42 à 20,12 %","low":14.42,"high":20.12,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Codex 0.149.1","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"luna","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-luna-max-codex.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-luna-max-codex.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-luna. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09."},{"id":"luna-livebench-coding","modelId":"luna","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"82,9 %","value":82.915,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-luna-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-luna-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"luna","effort":"max","modelSetting":"gpt-5.6-luna-max","effortSetting":"Réglage publié : gpt-5.6-luna-max","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"luna-vals-code-migration","modelId":"luna","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":44.55,"display":"44,55 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.244,"display":"Erreur standard publiée : 4,244 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"openai/gpt-5.6-luna\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"luna","effort":"max","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"openai/gpt-5.6-luna\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"OpenAI\",\"harness\":null}","effortSetting":"reasoning_effort publié : max"}}],"rationale":"Trois équipes extérieures indépendantes ont mesuré ce modèle dans le même domaine."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"luna-livebench-mathematics","modelId":"luna","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"87,2 %","value":87.2008,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gpt-5.6-luna-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gpt-5.6-luna-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"muse-spark-1-1":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"muse-spark-1-1-livebench-reasoning","modelId":"muse-spark-1-1","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"87,7 %","value":87.7308,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.1-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.1-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"muse-spark-1-1-livebench-data-analysis","modelId":"muse-spark-1-1","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"72,5 %","value":72.548,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.1-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.1-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"muse-spark-1-1-livebench-language","modelId":"muse-spark-1-1","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"74,3 %","value":74.342,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.1-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.1-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"muse-spark-1-1-livebench-instruction-following","modelId":"muse-spark-1-1","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"69,6 %","value":69.6375,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.1-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.1-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"muse-spark-1-1-livebench-agentic-coding","modelId":"muse-spark-1-1","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"58,5 %","value":58.5353,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.1-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.1-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"muse-spark-1-1-livebench-coding","modelId":"muse-spark-1-1","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"77,2 %","value":77.1585,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.1-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.1-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"muse-spark-1-1","effort":"xhigh","modelSetting":"muse-spark-1.1-xhigh","effortSetting":"Réglage publié : muse-spark-1.1-xhigh","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"muse-spark-1-1-vals-code-migration","modelId":"muse-spark-1-1","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":31.115,"display":"31,115 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.068,"display":"Erreur standard publiée : 4,068 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : xhigh","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"meta/muse_spark_1_1\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":256000,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Meta\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.1. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"muse-spark-1-1","effort":"xhigh","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"meta/muse_spark_1_1\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":256000,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Meta\",\"harness\":null}","effortSetting":"reasoning_effort publié : xhigh"}}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"muse-spark-1-1-livebench-mathematics","modelId":"muse-spark-1-1","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"87,1 %","value":87.1448,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.1-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.1-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"kimi-k3":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"kimi-k3-livebench-reasoning","modelId":"kimi-k3","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"90,7 %","value":90.673,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"kimi-k3-livebench-data-analysis","modelId":"kimi-k3","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"78,7 %","value":78.7337,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"kimi-k3-livebench-language","modelId":"kimi-k3","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"85,5 %","value":85.528,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"kimi-k3-livebench-instruction-following","modelId":"kimi-k3","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"71,4 %","value":71.3628,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"kimi-k3-livebench-agentic-coding","modelId":"kimi-k3","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"62,2 %","value":62.1717,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"kimi-k3-livebench-coding","modelId":"kimi-k3","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"81,4 %","value":81.4455,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"kimi-k3-vals-code-migration","modelId":"kimi-k3","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":16.099,"display":"16,099 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.101,"display":"Erreur standard publiée : 4,101 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"kimi/kimi-k3\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":262144,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Moonshot AI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"kimi-k3-livebench-mathematics","modelId":"kimi-k3","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"84,4 %","value":84.4368,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : kimi-k3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"kimi-k3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"inkling":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"inkling-livebench-reasoning","modelId":"inkling","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"78,3 %","value":78.3463,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : inkling-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"inkling-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"inkling-livebench-data-analysis","modelId":"inkling","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"72,8 %","value":72.778,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : inkling-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"inkling-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"inkling-livebench-language","modelId":"inkling","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"73,5 %","value":73.4587,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : inkling-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"inkling-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"inkling-livebench-instruction-following","modelId":"inkling","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"70,1 %","value":70.0958,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : inkling-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"inkling-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"inkling-livebench-agentic-coding","modelId":"inkling","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"49,4 %","value":49.394,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : inkling-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"inkling-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"inkling-livebench-coding","modelId":"inkling","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"71,0 %","value":71.0195,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : inkling-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"inkling-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"inkling","effort":"xhigh","modelSetting":"inkling-xhigh","effortSetting":"Réglage publié : inkling-xhigh","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"inkling-vals-code-migration","modelId":"inkling","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":11.79,"display":"11,79 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":3.396,"display":"Erreur standard publiée : 3,396 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : 0.99 ; xhigh = 0,99 selon Tinker.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"thinkingmachines/inkling\",\"temperature\":1,\"top_p\":1,\"max_output_tokens\":256000,\"reasoning\":null,\"reasoning_effort\":\"0.99\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Thinkingmachines\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"inkling","effort":"xhigh","evidenceUrl":"https://tinker-docs.thinkingmachines.ai/cookbook/inkling/thinking-effort/","modelSetting":"{\"id\":\"thinkingmachines/inkling\",\"temperature\":1,\"top_p\":1,\"max_output_tokens\":256000,\"reasoning\":null,\"reasoning_effort\":\"0.99\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Thinkingmachines\",\"harness\":null}","effortSetting":"reasoning_effort publié : 0.99 ; xhigh = 0,99 selon Tinker."}}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"inkling-livebench-mathematics","modelId":"inkling","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"88,4 %","value":88.3648,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : inkling-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"inkling-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"gemini-3-5-flash-lite":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"gemini-3-5-flash-lite-livebench-reasoning","modelId":"gemini-3-5-flash-lite","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"60,2 %","value":60.1875,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-lite-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-lite-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-5-flash-lite-livebench-data-analysis","modelId":"gemini-3-5-flash-lite","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"53,2 %","value":53.2497,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-lite-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-lite-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-5-flash-lite-livebench-language","modelId":"gemini-3-5-flash-lite","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"71,8 %","value":71.8203,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-lite-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-lite-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-5-flash-lite-livebench-instruction-following","modelId":"gemini-3-5-flash-lite","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"67,2 %","value":67.2378,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-lite-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-lite-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gemini-3-5-flash-lite-livebench-agentic-coding","modelId":"gemini-3-5-flash-lite","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"45,3 %","value":45.2527,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-lite-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-lite-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"gemini-3-5-flash-lite-livebench-coding","modelId":"gemini-3-5-flash-lite","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"76,1 %","value":76.0715,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-lite-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-lite-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gemini-3-5-flash-lite","effort":"high","modelSetting":"gemini-3.5-flash-lite-high","effortSetting":"Réglage publié : gemini-3.5-flash-lite-high","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"gemini-3-5-flash-lite-vals-code-migration","modelId":"gemini-3-5-flash-lite","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":6.148,"display":"6,148 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.708,"display":"Erreur standard publiée : 1,708 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"google/gemini-3.5-flash-lite\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gemini-3-5-flash-lite","effort":"high","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"google/gemini-3.5-flash-lite\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","effortSetting":"reasoning_effort publié : high"}}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gemini-3-5-flash-lite-livebench-mathematics","modelId":"gemini-3-5-flash-lite","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"73,7 %","value":73.7395,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.5-flash-lite-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.5-flash-lite-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"gemini-3-6-flash":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"gemini-3-6-flash-livebench-reasoning","modelId":"gemini-3-6-flash","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"85,1 %","value":85.149,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.6-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.6-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-6-flash-livebench-data-analysis","modelId":"gemini-3-6-flash","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"63,0 %","value":62.9993,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.6-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.6-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-6-flash-livebench-language","modelId":"gemini-3-6-flash","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"83,9 %","value":83.8977,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.6-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.6-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-6-flash-livebench-instruction-following","modelId":"gemini-3-6-flash","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"75,4 %","value":75.3668,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.6-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.6-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gemini-3-6-flash-livebench-agentic-coding","modelId":"gemini-3-6-flash","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"43,4 %","value":43.4343,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.6-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.6-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"gemini-3-6-flash-livebench-coding","modelId":"gemini-3-6-flash","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"77,9 %","value":77.863,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.6-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.6-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gemini-3-6-flash","effort":"high","modelSetting":"gemini-3.6-flash-high","effortSetting":"Réglage publié : gemini-3.6-flash-high","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"gemini-3-6-flash-vals-code-migration","modelId":"gemini-3-6-flash","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":30.928,"display":"30,928 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.068,"display":"Erreur standard publiée : 4,068 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"google/gemini-3.6-flash\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gemini-3-6-flash","effort":"high","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"google/gemini-3.6-flash\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","effortSetting":"reasoning_effort publié : high"}}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gemini-3-6-flash-livebench-mathematics","modelId":"gemini-3-6-flash","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"86,4 %","value":86.4025,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.6-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.6-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"claude-opus-4-8":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"claude-opus-4-8-livebench-reasoning","modelId":"claude-opus-4-8","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"89,2 %","value":89.1923,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-8-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-8-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-opus-4-8-livebench-data-analysis","modelId":"claude-opus-4-8","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"66,0 %","value":66.0333,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-8-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-8-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-opus-4-8-livebench-language","modelId":"claude-opus-4-8","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"79,7 %","value":79.6593,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-8-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-8-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"claude-opus-4-8-livebench-instruction-following","modelId":"claude-opus-4-8","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"72,0 %","value":72.0335,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-8-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-8-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"claude-opus-4-8-livebench-agentic-coding","modelId":"claude-opus-4-8","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"50,5 %","value":50.505,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-8-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-8-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"established","independentFamilies":3,"organizations":3,"observations":[{"id":"claude-opus-4-8-terminal-bench-4","modelId":"claude-opus-4-8","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"23,64 %","value":23.64,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 20,08 à 27,20 %","low":20.08,"high":27.2,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Claude Code 2.1.231","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"claude-opus-4-8","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-opus-4-8-max-claude-code.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-opus-4-8-max-claude-code.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-4-8. Date de sortie déclarée par Terminal-Bench : 2026-05-28."},{"id":"claude-opus-4-8-livebench-coding","modelId":"claude-opus-4-8","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"81,8 %","value":81.828,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-8-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-8-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"claude-opus-4-8","effort":"max","modelSetting":"claude-opus-4-8-max-effort","effortSetting":"Réglage publié : claude-opus-4-8-max-effort","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"claude-opus-4-8-vals-code-migration","modelId":"claude-opus-4-8","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":47.25,"display":"47,25 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.176,"display":"Erreur standard publiée : 4,176 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"compute_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"anthropic/claude-opus-4-8\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"claude-opus-4-8","effort":"max","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"anthropic/claude-opus-4-8\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":\"max\",\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","effortSetting":"compute_effort publié : max"}}],"rationale":"Trois équipes extérieures indépendantes ont mesuré ce modèle dans le même domaine."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"claude-opus-4-8-livebench-mathematics","modelId":"claude-opus-4-8","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"94,3 %","value":94.3165,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : claude-opus-4-8-max-effort","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"claude-opus-4-8-max-effort","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"deepseek-v4-flash-0731":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"deepseek-v4-flash-0731-livebench-reasoning","modelId":"deepseek-v4-flash-0731","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"86,6 %","value":86.6345,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-0731","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-0731","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-flash-0731-livebench-data-analysis","modelId":"deepseek-v4-flash-0731","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"79,3 %","value":79.3273,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-0731","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-0731","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-flash-0731-livebench-language","modelId":"deepseek-v4-flash-0731","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"79,2 %","value":79.175,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-0731","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-0731","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-flash-0731-livebench-instruction-following","modelId":"deepseek-v4-flash-0731","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"65,5 %","value":65.5168,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-0731","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-0731","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"deepseek-v4-flash-0731-livebench-agentic-coding","modelId":"deepseek-v4-flash-0731","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"46,8 %","value":46.7677,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-0731","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-0731","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"deepseek-v4-flash-0731-livebench-coding","modelId":"deepseek-v4-flash-0731","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"75,0 %","value":74.9845,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-0731","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-0731","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-flash-0731-vals-code-migration","modelId":"deepseek-v4-flash-0731","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":38.631,"display":"38,631 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.382,"display":"Erreur standard publiée : 4,382 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"deepseek/deepseek-v4-flash-0731\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":384000,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"DeepSeek\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"deepseek-v4-flash-0731-livebench-mathematics","modelId":"deepseek-v4-flash-0731","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"86,8 %","value":86.7898,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-0731","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-0731","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"qwen3-8-max":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"qwen3-8-max-livebench-reasoning","modelId":"qwen3-8-max","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"88,2 %","value":88.2115,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-8-max-livebench-data-analysis","modelId":"qwen3-8-max","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"78,4 %","value":78.413,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-8-max-livebench-language","modelId":"qwen3-8-max","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"79,7 %","value":79.6873,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-8-max-livebench-instruction-following","modelId":"qwen3-8-max","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"74,1 %","value":74.0835,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"qwen3-8-max-livebench-agentic-coding","modelId":"qwen3-8-max","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"64,6 %","value":64.6467,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"qwen3-8-max-livebench-coding","modelId":"qwen3-8-max","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"72,9 %","value":72.872,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-8-max-vals-code-migration","modelId":"qwen3-8-max","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":23.958,"display":"23,958 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.309,"display":"Erreur standard publiée : 4,309 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"alibaba/qwen3.8-max\",\"temperature\":0.7,\"top_p\":null,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Alibaba\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"qwen3-8-max-livebench-mathematics","modelId":"qwen3-8-max","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"91,3 %","value":91.3123,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-max","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"muse-spark-1-2":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"muse-spark-1-2-livebench-reasoning","modelId":"muse-spark-1-2","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"90,0 %","value":90.0048,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.2-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.2-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"muse-spark-1-2-livebench-data-analysis","modelId":"muse-spark-1-2","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"76,5 %","value":76.4583,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.2-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.2-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"muse-spark-1-2-livebench-language","modelId":"muse-spark-1-2","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"78,6 %","value":78.5747,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.2-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.2-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"muse-spark-1-2-livebench-instruction-following","modelId":"muse-spark-1-2","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"74,3 %","value":74.325,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.2-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.2-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"muse-spark-1-2-livebench-agentic-coding","modelId":"muse-spark-1-2","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"57,6 %","value":57.5757,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.2-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.2-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"muse-spark-1-2-livebench-coding","modelId":"muse-spark-1-2","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"77,5 %","value":77.5415,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.2-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.2-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"muse-spark-1-2","effort":"xhigh","modelSetting":"muse-spark-1.2-xhigh","effortSetting":"Réglage publié : muse-spark-1.2-xhigh","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"muse-spark-1-2-vals-code-migration","modelId":"muse-spark-1-2","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":29.954,"display":"29,954 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.023,"display":"Erreur standard publiée : 4,023 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : xhigh","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"meta/muse_spark_1_2\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":131072,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Meta\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.2. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"muse-spark-1-2","effort":"xhigh","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"meta/muse_spark_1_2\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":131072,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Meta\",\"harness\":null}","effortSetting":"reasoning_effort publié : xhigh"}}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"muse-spark-1-2-livebench-mathematics","modelId":"muse-spark-1-2","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"91,2 %","value":91.2035,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.2-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.2-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"smaug-agentic":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"smaug-agentic-livebench-reasoning","modelId":"smaug-agentic","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"90,3 %","value":90.274,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : smaug-agentic","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"smaug-agentic","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"smaug-agentic-livebench-data-analysis","modelId":"smaug-agentic","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"79,9 %","value":79.8983,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : smaug-agentic","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"smaug-agentic","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"smaug-agentic-livebench-language","modelId":"smaug-agentic","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"84,4 %","value":84.3567,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : smaug-agentic","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"smaug-agentic","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"smaug-agentic-livebench-instruction-following","modelId":"smaug-agentic","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"71,0 %","value":70.9918,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : smaug-agentic","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"smaug-agentic","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"smaug-agentic-livebench-agentic-coding","modelId":"smaug-agentic","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"64,6 %","value":64.6467,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : smaug-agentic","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"smaug-agentic","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"smaug-agentic-livebench-coding","modelId":"smaug-agentic","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"82,5 %","value":82.471,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : smaug-agentic","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"smaug-agentic","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"smaug-agentic-livebench-mathematics","modelId":"smaug-agentic","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"83,9 %","value":83.9195,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : smaug-agentic","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"smaug-agentic","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"deepseek-v4-pro-0813":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"deepseek-v4-pro-0813-livebench-reasoning","modelId":"deepseek-v4-pro-0813","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"85,8 %","value":85.8413,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro-0813","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro-0813","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-pro-0813-livebench-data-analysis","modelId":"deepseek-v4-pro-0813","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"79,2 %","value":79.2433,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro-0813","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro-0813","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-pro-0813-livebench-language","modelId":"deepseek-v4-pro-0813","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"82,1 %","value":82.074,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro-0813","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro-0813","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-pro-0813-livebench-instruction-following","modelId":"deepseek-v4-pro-0813","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"67,7 %","value":67.7,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro-0813","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro-0813","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"deepseek-v4-pro-0813-livebench-agentic-coding","modelId":"deepseek-v4-pro-0813","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"54,9 %","value":54.9497,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro-0813","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro-0813","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"deepseek-v4-pro-0813-livebench-coding","modelId":"deepseek-v4-pro-0813","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"77,2 %","value":77.1585,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro-0813","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro-0813","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-pro-0813-vals-code-migration","modelId":"deepseek-v4-pro-0813","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":41.54,"display":"41,54 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.301,"display":"Erreur standard publiée : 4,301 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"deepseek/deepseek-v4-pro-0813\",\"temperature\":null,\"top_p\":null,\"max_output_tokens\":384000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"DeepSeek\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"deepseek-v4-pro-0813-livebench-mathematics","modelId":"deepseek-v4-pro-0813","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"95,1 %","value":95.0863,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-pro-0813","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-pro-0813","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"grok-4-6":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"grok-4-6-livebench-reasoning","modelId":"grok-4-6","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"90,5 %","value":90.5095,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.6","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.6","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"grok-4-6-livebench-data-analysis","modelId":"grok-4-6","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"73,9 %","value":73.857,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.6","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.6","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"grok-4-6-livebench-language","modelId":"grok-4-6","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"83,7 %","value":83.697,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.6","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.6","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"grok-4-6-livebench-instruction-following","modelId":"grok-4-6","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"71,9 %","value":71.8665,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.6","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.6","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"grok-4-6-livebench-agentic-coding","modelId":"grok-4-6","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"57,0 %","value":57.02,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.6","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.6","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"established","independentFamilies":3,"organizations":3,"observations":[{"id":"grok-4-6-terminal-bench-4","modelId":"grok-4-6","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"20,30 %","value":20.3,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 17,21 à 23,39 %","low":17.21,"high":23.39,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Grok Build 1.0.5","effort":"Non publié","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"Réglage non publié","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","crossSourceExclusion":"Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé.","configuration":{"version":"grok-4-6","effort":"not-published","modelSetting":"Réglage non publié","effortSetting":"Non publié","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-xai-grok-4-6-none-grok-build.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-xai-grok-4-6-none-grok-build.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.6. Date de sortie déclarée par Terminal-Bench : 2026-08-12. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé."},{"id":"grok-4-6-livebench-coding","modelId":"grok-4-6","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"76,8 %","value":76.776,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.6","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.6","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"grok-4-6-vals-code-migration","modelId":"grok-4-6","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":44.572,"display":"44,572 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.479,"display":"Erreur standard publiée : 4,479 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"grok/grok-4.6\",\"temperature\":0.7,\"top_p\":0.95,\"max_output_tokens\":null,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"SpaceXAI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.6. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"Trois équipes extérieures indépendantes ont mesuré ce modèle dans le même domaine."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"grok-4-6-livebench-mathematics","modelId":"grok-4-6","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"92,6 %","value":92.568,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : grok-4.6","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"grok-4.6","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"gemini-3-7-flash":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"gemini-3-7-flash-livebench-reasoning","modelId":"gemini-3-7-flash","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"87,8 %","value":87.798,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.7-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.7-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-7-flash-livebench-data-analysis","modelId":"gemini-3-7-flash","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"68,0 %","value":67.9643,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.7-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.7-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-7-flash-livebench-language","modelId":"gemini-3-7-flash","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"85,5 %","value":85.455,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.7-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.7-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-7-flash-livebench-instruction-following","modelId":"gemini-3-7-flash","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"79,9 %","value":79.9253,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.7-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.7-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gemini-3-7-flash-livebench-agentic-coding","modelId":"gemini-3-7-flash","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"58,3 %","value":58.283,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.7-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.7-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"established","independentFamilies":3,"organizations":3,"observations":[{"id":"gemini-3-7-flash-terminal-bench-4","modelId":"gemini-3-7-flash","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"11,21 %","value":11.21,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 8,76 à 13,66 %","low":8.76,"high":13.66,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"mini-SWE-agent 2.4.6","effort":"high","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"gemini-3-7-flash","effort":"high","modelSetting":"high","effortSetting":"high","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-02-gemini-gemini-3-7-flash-high-mini-swe-agent.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-02-gemini-gemini-3-7-flash-high-mini-swe-agent.json","accessedAt":"2026-09-05","publishedAt":"2026-09-03","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/4eb279f8d4acd122c4f6db12e312f7cb31556604"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.7-flash. Date de sortie déclarée par Terminal-Bench : 2026-08-13."},{"id":"gemini-3-7-flash-livebench-coding","modelId":"gemini-3-7-flash","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"78,9 %","value":78.8885,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.7-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.7-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gemini-3-7-flash","effort":"high","modelSetting":"gemini-3.7-flash-high","effortSetting":"Réglage publié : gemini-3.7-flash-high","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"gemini-3-7-flash-vals-code-migration","modelId":"gemini-3-7-flash","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":34.8,"display":"34,8 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.225,"display":"Erreur standard publiée : 4,225 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"google/gemini-3.7-flash\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gemini-3-7-flash","effort":"high","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"google/gemini-3.7-flash\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","effortSetting":"reasoning_effort publié : high"}}],"rationale":"Trois équipes extérieures indépendantes ont mesuré ce modèle dans le même domaine."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gemini-3-7-flash-livebench-mathematics","modelId":"gemini-3-7-flash","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"93,5 %","value":93.468,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.7-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.7-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"qwen3-8-27b":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"qwen3-8-27b-livebench-reasoning","modelId":"qwen3-8-27b","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"80,0 %","value":80.0288,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-8-27b-livebench-data-analysis","modelId":"qwen3-8-27b","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"76,6 %","value":76.5857,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-8-27b-livebench-language","modelId":"qwen3-8-27b","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"74,3 %","value":74.3457,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-8-27b-livebench-instruction-following","modelId":"qwen3-8-27b","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"72,7 %","value":72.6583,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"qwen3-8-27b-livebench-agentic-coding","modelId":"qwen3-8-27b","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"61,4 %","value":61.3637,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"qwen3-8-27b-livebench-coding","modelId":"qwen3-8-27b","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"75,7 %","value":75.689,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-8-27b-vals-code-migration","modelId":"qwen3-8-27b","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":14.157,"display":"14,157 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.189,"display":"Erreur standard publiée : 4,189 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : xhigh","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"alibaba/qwen3.8-27b\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"xhigh\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Alibaba\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/qwen/qwen3.8-27b-20260814/endpoints. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"qwen3-8-27b-livebench-mathematics","modelId":"qwen3-8-27b","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"86,2 %","value":86.2128,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-27b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-27b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"deepseek-v4-flash-vision-exp":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"deepseek-v4-flash-vision-exp-livebench-reasoning","modelId":"deepseek-v4-flash-vision-exp","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"85,4 %","value":85.399,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-vision-exp","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-vision-exp","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-flash-vision-exp-livebench-data-analysis","modelId":"deepseek-v4-flash-vision-exp","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"79,5 %","value":79.4767,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-vision-exp","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-vision-exp","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-flash-vision-exp-livebench-language","modelId":"deepseek-v4-flash-vision-exp","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"80,4 %","value":80.3597,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-vision-exp","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-vision-exp","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"deepseek-v4-flash-vision-exp-livebench-instruction-following","modelId":"deepseek-v4-flash-vision-exp","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"71,0 %","value":70.9582,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-vision-exp","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-vision-exp","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"deepseek-v4-flash-vision-exp-livebench-agentic-coding","modelId":"deepseek-v4-flash-vision-exp","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"65,1 %","value":65.101,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-vision-exp","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-vision-exp","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"deepseek-v4-flash-vision-exp-livebench-coding","modelId":"deepseek-v4-flash-vision-exp","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"68,2 %","value":68.2025,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-vision-exp","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-vision-exp","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"deepseek-v4-flash-vision-exp-livebench-mathematics","modelId":"deepseek-v4-flash-vision-exp","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"87,8 %","value":87.8068,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : deepseek-v4-flash-vision-exp","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"deepseek-v4-flash-vision-exp","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"glm-5-3":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"glm-5-3-livebench-reasoning","modelId":"glm-5-3","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"85,8 %","value":85.803,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"glm-5-3-livebench-data-analysis","modelId":"glm-5-3","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"70,2 %","value":70.2443,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"glm-5-3-livebench-language","modelId":"glm-5-3","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"79,9 %","value":79.8563,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"glm-5-3-livebench-instruction-following","modelId":"glm-5-3","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"69,3 %","value":69.304,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"glm-5-3-livebench-agentic-coding","modelId":"glm-5-3","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"60,9 %","value":60.909,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"established","independentFamilies":3,"organizations":3,"observations":[{"id":"glm-5-3-terminal-bench-4","modelId":"glm-5-3","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"41,82 %","value":41.82,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 38,59 à 45,05 %","low":38.59,"high":45.05,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"Claude Code 2.1.207","effort":"max","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"max","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","crossSourceExclusion":"Effort max chez Terminal-Bench ; effort LiveBench non publié. Aucune équivalence supposée.","configuration":{"version":"glm-5-3","effort":"max","modelSetting":"max","effortSetting":"max","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-glm-5-3-max-claude-code.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-glm-5-3-max-claude-code.json","accessedAt":"2026-09-05","publishedAt":"2026-08-28","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/37d0c6e752365435ac58677d1d425b8e4c07cb31"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/glm-5.3. Date de sortie déclarée par Terminal-Bench : 2026-08-14. Fabricant Z.ai ; préfixe source anthropic/, fournisseur du point d’accès non publié. Effort max chez Terminal-Bench ; effort LiveBench non publié. Aucune équivalence supposée."},{"id":"glm-5-3-livebench-coding","modelId":"glm-5-3","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"79,0 %","value":78.95,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"glm-5-3-vals-code-migration","modelId":"glm-5-3","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":44.222,"display":"44,222 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.289,"display":"Erreur standard publiée : 4,289 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"zai/glm-5.3\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Zhipu AI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.3. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"Trois équipes extérieures indépendantes ont mesuré ce modèle dans le même domaine."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"glm-5-3-livebench-mathematics","modelId":"glm-5-3","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"87,9 %","value":87.898,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"glm-5-3-flash":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"glm-5-3-flash-livebench-reasoning","modelId":"glm-5-3-flash","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"77,6 %","value":77.6443,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"glm-5-3-flash-livebench-data-analysis","modelId":"glm-5-3-flash","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"76,4 %","value":76.401,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"glm-5-3-flash-livebench-language","modelId":"glm-5-3-flash","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"77,3 %","value":77.3073,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"glm-5-3-flash-livebench-instruction-following","modelId":"glm-5-3-flash","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"52,8 %","value":52.8208,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"glm-5-3-flash-livebench-agentic-coding","modelId":"glm-5-3-flash","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"56,8 %","value":56.7677,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"glm-5-3-flash-livebench-coding","modelId":"glm-5-3-flash","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"79,0 %","value":78.95,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"glm-5-3-flash-vals-code-migration","modelId":"glm-5-3-flash","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":20.515,"display":"20,515 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.207,"display":"Erreur standard publiée : 4,207 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : max","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"zai/glm-5.3-flash\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":\"max\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Zhipu AI\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/vlm/glm-5.3-flash. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"glm-5-3-flash-livebench-mathematics","modelId":"glm-5-3-flash","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"81,2 %","value":81.2445,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : glm-5.3-flash","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"glm-5.3-flash","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"qwen3-8-flash-next":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"qwen3-8-flash-next-livebench-reasoning","modelId":"qwen3-8-flash-next","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"87,4 %","value":87.3798,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-flash-next","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-flash-next","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-8-flash-next-livebench-data-analysis","modelId":"qwen3-8-flash-next","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"74,2 %","value":74.24,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-flash-next","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-flash-next","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-8-flash-next-livebench-language","modelId":"qwen3-8-flash-next","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"74,6 %","value":74.643,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-flash-next","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-flash-next","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"qwen3-8-flash-next-livebench-instruction-following","modelId":"qwen3-8-flash-next","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"77,1 %","value":77.1085,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-flash-next","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-flash-next","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"qwen3-8-flash-next-livebench-agentic-coding","modelId":"qwen3-8-flash-next","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"61,6 %","value":61.6163,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-flash-next","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-flash-next","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"qwen3-8-flash-next-livebench-coding","modelId":"qwen3-8-flash-next","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"72,6 %","value":72.5505,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-flash-next","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-flash-next","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"qwen3-8-flash-next-livebench-mathematics","modelId":"qwen3-8-flash-next","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"85,8 %","value":85.821,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : qwen3.8-flash-next","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"qwen3.8-flash-next","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"nemotron-3-ultra":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"nemotron-3-ultra-livebench-reasoning","modelId":"nemotron-3-ultra","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"74,7 %","value":74.697,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : nemotron-3-ultra-550b-a55b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"nemotron-3-ultra-550b-a55b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"nemotron-3-ultra-livebench-data-analysis","modelId":"nemotron-3-ultra","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"54,5 %","value":54.4567,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : nemotron-3-ultra-550b-a55b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"nemotron-3-ultra-550b-a55b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"nemotron-3-ultra-livebench-language","modelId":"nemotron-3-ultra","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"70,8 %","value":70.8113,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : nemotron-3-ultra-550b-a55b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"nemotron-3-ultra-550b-a55b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"nemotron-3-ultra-livebench-instruction-following","modelId":"nemotron-3-ultra","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"73,4 %","value":73.4455,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : nemotron-3-ultra-550b-a55b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"nemotron-3-ultra-550b-a55b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"nemotron-3-ultra-livebench-agentic-coding","modelId":"nemotron-3-ultra","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"38,7 %","value":38.7373,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : nemotron-3-ultra-550b-a55b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"nemotron-3-ultra-550b-a55b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":2,"organizations":2,"observations":[{"id":"nemotron-3-ultra-livebench-coding","modelId":"nemotron-3-ultra","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"70,7 %","value":70.698,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : nemotron-3-ultra-550b-a55b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"nemotron-3-ultra-550b-a55b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"nemotron-3-ultra-vals-code-migration","modelId":"nemotron-3-ultra","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":4.905,"display":"4,905 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.589,"display":"Erreur standard publiée : 1,589 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"nvidia/nemotron-3-ultra-550b-a55b\",\"temperature\":null,\"top_p\":0.95,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Nvidia\",\"harness\":null}","crossSourceExclusion":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://build.nvidia.com/nvidia/nemotron-3-ultra-550b-a55b. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"2 sources indépendantes, issues de 2 organismes, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"nemotron-3-ultra-livebench-mathematics","modelId":"nemotron-3-ultra","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"88,7 %","value":88.6633,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : nemotron-3-ultra-550b-a55b","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"nemotron-3-ultra-550b-a55b","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"gemini-3-8-flash":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"gemini-3-8-flash-livebench-reasoning","modelId":"gemini-3-8-flash","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"89,3 %","value":89.2933,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.8-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.8-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-8-flash-livebench-data-analysis","modelId":"gemini-3-8-flash","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"54,0 %","value":54.0057,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.8-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.8-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-8-flash-livebench-language","modelId":"gemini-3-8-flash","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"87,8 %","value":87.7927,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.8-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.8-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"gemini-3-8-flash-livebench-instruction-following","modelId":"gemini-3-8-flash","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"81,4 %","value":81.4125,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.8-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.8-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gemini-3-8-flash-livebench-agentic-coding","modelId":"gemini-3-8-flash","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"54,2 %","value":54.2423,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.8-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.8-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"established","independentFamilies":3,"organizations":3,"observations":[{"id":"gemini-3-8-flash-terminal-bench-4","modelId":"gemini-3-8-flash","domain":"coding","constructId":"terminal-software-tasks","familyId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","result":{"display":"19,09 %","value":19.09,"unit":"percent","better":"higher","dispersion":{"kind":"interval","display":"IC à 95 % publié par la source, erreur standard par tâche : 15,73 à 22,45 %","low":15.73,"high":22.45,"confidence":95}},"sample":{"size":66,"unit":"tâches","runs":5},"protocol":{"harness":"mini-SWE-agent 2.4.6","effort":"high","scoring":"Part des essais réussis sur 330, les erreurs comptent comme des échecs","judge":"Vérificateur propre à chaque tâche, puis revue par IA des essais réussis et arbitrage des mainteneurs pour les disqualifications"},"benchmarkVersion":"4.0.0","modelSetting":"high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"terminal-bench-v4-0","configuration":{"version":"gemini-3-8-flash","effort":"high","modelSetting":"high","effortSetting":"high","evidenceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-01-gemini-gemini-3-8-flash-high-mini-swe-agent.json"},"riskOfBias":{"testSetAccess":"public","verification":"mixed","itemLevelResults":"available","harnessComparable":"different"},"source":{"url":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-01-gemini-gemini-3-8-flash-high-mini-swe-agent.json","accessedAt":"2026-09-05","publishedAt":"2026-09-03","publicationUrl":"https://github.com/harbor-framework/terminal-bench/commit/83c7a6172d629c6575b785ab12c8db787bb2e323"},"dependencies":["terminal-bench-v4-0","terminal-bench-family"],"limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.8-flash. Date de sortie déclarée par Terminal-Bench : 2026-09-02."},{"id":"gemini-3-8-flash-livebench-coding","modelId":"gemini-3-8-flash","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"72,5 %","value":72.489,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.8-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.8-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","configuration":{"version":"gemini-3-8-flash","effort":"high","modelSetting":"gemini-3.8-flash-high","effortSetting":"Réglage publié : gemini-3.8-flash-high","evidenceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js"}},{"id":"gemini-3-8-flash-vals-code-migration","modelId":"gemini-3-8-flash","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":36.546,"display":"36,546 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.184,"display":"Erreur standard publiée : 4,184 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"google/gemini-3.8-flash\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","configuration":{"version":"gemini-3-8-flash","effort":"high","evidenceUrl":"https://www.vals.ai/benchmarks/code-migration","modelSetting":"{\"id\":\"google/gemini-3.8-flash\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","effortSetting":"reasoning_effort publié : high"}}],"rationale":"Trois équipes extérieures indépendantes ont mesuré ce modèle dans le même domaine."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gemini-3-8-flash-livebench-mathematics","modelId":"gemini-3-8-flash","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"91,6 %","value":91.5643,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : gemini-3.8-flash-high","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"gemini-3.8-flash-high","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"muse-spark-1-3":{"general":{"domain":"general","status":"provisional","independentFamilies":4,"organizations":1,"observations":[{"id":"muse-spark-1-3-livebench-reasoning","modelId":"muse-spark-1-3","domain":"general","constructId":"reasoning","familyId":"livebench-reasoning-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","result":{"display":"89,7 %","value":89.6538,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":202,"unit":"questions de raisonnement","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.3-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.3-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"muse-spark-1-3-livebench-data-analysis","modelId":"muse-spark-1-3","domain":"general","constructId":"data-analysis","familyId":"livebench-data-analysis-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","result":{"display":"79,6 %","value":79.5653,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions d’analyse de données","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.3-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.3-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"muse-spark-1-3-livebench-language","modelId":"muse-spark-1-3","domain":"general","constructId":"language","familyId":"livebench-language-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","result":{"display":"82,8 %","value":82.7937,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":150,"unit":"questions de langue","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.3-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.3-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."},{"id":"muse-spark-1-3-livebench-instruction-following","modelId":"muse-spark-1-3","domain":"general","constructId":"instruction-following","familyId":"livebench-instruction-following-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","result":{"display":"78,0 %","value":78.0043,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":200,"unit":"consignes","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.3-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.3-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"4 sources indépendantes, issues de 1 organisme, ont mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"agentic":{"domain":"agentic","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"muse-spark-1-3-livebench-agentic-coding","modelId":"muse-spark-1-3","domain":"agentic","constructId":"agentic-coding","familyId":"livebench-agentic-coding-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","result":{"display":"64,1 %","value":64.091,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":72,"unit":"tâches de code autonome","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.3-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.3-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"muse-spark-1-3-livebench-coding","modelId":"muse-spark-1-3","domain":"coding","constructId":"code-generation","familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","result":{"display":"81,1 %","value":81.0625,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":117,"unit":"questions de code","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.3-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.3-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"muse-spark-1-3-livebench-mathematics","modelId":"muse-spark-1-3","domain":"mathScience","constructId":"mathematics","familyId":"livebench-mathematics-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","result":{"display":"96,0 %","value":95.95,"unit":"percent","better":"higher","dispersion":{"kind":"not-published","display":"Dispersion non publiée"}},"sample":{"size":379,"unit":"problèmes de mathématiques","runs":"not-published"},"protocol":{"harness":"Protocole commun LiveBench 2026-06-25","effort":"Réglage publié : muse-spark-1.3-xhigh","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","judge":"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA"},"benchmarkVersion":"2026-06-25","modelSetting":"muse-spark-1.3-xhigh","executedAt":"not-published","unitOfAnalysis":"model","sourceId":"livebench-2026-06-25","riskOfBias":{"testSetAccess":"refreshed","verification":"mechanical","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","accessedAt":"2026-09-04","publishedAt":"2026-06-25","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité."}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"glm-5-1":{"general":{"domain":"general","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"agentic":{"domain":"agentic","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"glm-5-1-vals-code-migration","modelId":"glm-5-1","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":25.768,"display":"25,768 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.087,"display":"Erreur standard publiée : 4,087 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"zai/glm-5.1\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":131072,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Zhipu AI\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.1. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"mimo-v2-5-pro":{"general":{"domain":"general","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"agentic":{"domain":"agentic","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"mimo-v2-5-pro-vals-code-migration","modelId":"mimo-v2-5-pro","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":21.557,"display":"21,557 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":4.127,"display":"Erreur standard publiée : 4,127 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"xiaomi/mimo-v2.5-pro\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Xiaomi\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"mimo-v2-5":{"general":{"domain":"general","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"agentic":{"domain":"agentic","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"mimo-v2-5-vals-code-migration","modelId":"mimo-v2-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":14.228,"display":"14,228 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":3.687,"display":"Erreur standard publiée : 3,687 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"xiaomi/mimo-v2.5\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":128000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Xiaomi\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"inkling-small":{"general":{"domain":"general","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"agentic":{"domain":"agentic","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"inkling-small-vals-code-migration","modelId":"inkling-small","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":13.675,"display":"13,675 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":3.81,"display":"Erreur standard publiée : 3,81 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : 0.99","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"thinkingmachines/inkling-small\",\"temperature\":1,\"top_p\":1,\"max_output_tokens\":262000,\"reasoning\":null,\"reasoning_effort\":\"0.99\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Thinkingmachines\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"qwen3-7-plus":{"general":{"domain":"general","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"agentic":{"domain":"agentic","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"qwen3-7-plus-vals-code-migration","modelId":"qwen3-7-plus","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":12.856,"display":"12,856 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":2.931,"display":"Erreur standard publiée : 2,931 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"alibaba/qwen3.7-plus\",\"temperature\":0.7,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Alibaba\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"minimax-m2-7":{"general":{"domain":"general","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"agentic":{"domain":"agentic","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"minimax-m2-7-vals-code-migration","modelId":"minimax-m2-7","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":8.685,"display":"8,685 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.786,"display":"Erreur standard publiée : 1,786 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"minimax/MiniMax-M2.7\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":80000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"MiniMax\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"claude-haiku-4-5":{"general":{"domain":"general","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"agentic":{"domain":"agentic","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"claude-haiku-4-5-vals-code-migration","modelId":"claude-haiku-4-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":7.551,"display":"7,551 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.056,"display":"Erreur standard publiée : 1,056 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"anthropic/claude-haiku-4-5-20251001-thinking\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":64000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Anthropic\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"gemini-3-flash-preview":{"general":{"domain":"general","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"agentic":{"domain":"agentic","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gemini-3-flash-preview-vals-code-migration","modelId":"gemini-3-flash-preview","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":6.391,"display":"6,391 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.093,"display":"Erreur standard publiée : 1,093 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"google/gemini-3-flash-preview\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"mistral-medium-3-5":{"general":{"domain":"general","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"agentic":{"domain":"agentic","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"mistral-medium-3-5-vals-code-migration","modelId":"mistral-medium-3-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":5.127,"display":"5,127 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.369,"display":"Erreur standard publiée : 1,369 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"mistralai/mistral-medium-3.5\",\"temperature\":0.7,\"top_p\":0.95,\"max_output_tokens\":80000,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Mistral AI\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.mistral.ai/models/mistral-medium-3-5-26-04. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"gemini-3-1-flash-lite-preview":{"general":{"domain":"general","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"agentic":{"domain":"agentic","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"gemini-3-1-flash-lite-preview-vals-code-migration","modelId":"gemini-3-1-flash-lite-preview","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":4.609,"display":"4,609 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":1.069,"display":"Erreur standard publiée : 1,069 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"reasoning_effort publié : high","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"google/gemini-3.1-flash-lite-preview\",\"temperature\":1,\"top_p\":null,\"max_output_tokens\":65536,\"reasoning\":null,\"reasoning_effort\":\"high\",\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Google\",\"harness\":null}","crossSourceExclusion":"Disponibilité de cette version non vérifiée ; mesure historique conservée.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"nemotron-lightning-3-5":{"general":{"domain":"general","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"agentic":{"domain":"agentic","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"nemotron-lightning-3-5-vals-code-migration","modelId":"nemotron-lightning-3-5","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":2.951,"display":"2,951 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":0.951,"display":"Erreur standard publiée : 0,951 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"fireworks/nemotron-lightning-3p5-30b-a3b\",\"temperature\":1,\"top_p\":0.95,\"max_output_tokens\":131072,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Fireworks AI\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"grok-4-20-0309-reasoning":{"general":{"domain":"general","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"agentic":{"domain":"agentic","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"grok-4-20-0309-reasoning-vals-code-migration","modelId":"grok-4-20-0309-reasoning","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":0.314,"display":"0,314 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":0.11,"display":"Erreur standard publiée : 0,11 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"grok/grok-4.20-0309-reasoning\",\"temperature\":0.7,\"top_p\":0.95,\"max_output_tokens\":2000000,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"SpaceXAI\",\"harness\":null}","crossSourceExclusion":"Aucune mesure LiveBench code pour cette version dans le registre.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.20-0309-reasoning. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}},"ling-3-0-flash-2607":{"general":{"domain":"general","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"agentic":{"domain":"agentic","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"coding":{"domain":"coding","status":"provisional","independentFamilies":1,"organizations":1,"observations":[{"id":"ling-3-0-flash-2607-vals-code-migration","modelId":"ling-3-0-flash-2607","domain":"coding","constructId":"code-migration","familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","result":{"value":0,"display":"0 %","unit":"percent","better":"higher","dispersion":{"kind":"standard-error","value":0,"display":"Erreur standard publiée : 0 points. Pas un intervalle de confiance."}},"sample":{"size":40,"unit":"dépôts (30 CLI et 10 COBOL), pondérés également","runs":"not-published"},"protocol":{"harness":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.","effort":"Non publié ; aucune valeur par défaut supposée.","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","judge":"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.","selection":"56 résultats overall sur 56 importés, aucune sélection par performance."},"benchmarkVersion":"1","modelSetting":"{\"id\":\"ant/ling-3.0-flash-2607\",\"temperature\":0.6,\"top_p\":0.95,\"max_output_tokens\":131072,\"reasoning\":null,\"reasoning_effort\":null,\"compute_effort\":null,\"verbosity\":null,\"provider\":\"Ant\",\"harness\":null}","crossSourceExclusion":"Disponibilité de cette version non vérifiée ; mesure historique conservée.","executedAt":"not-published","unitOfAnalysis":"model","riskOfBias":{"testSetAccess":"private","verification":"mixed","itemLevelResults":"not-published","harnessComparable":"same"},"source":{"url":"https://www.vals.ai/benchmarks/code-migration","publishedAt":"2026-09-03","accessedAt":"2026-09-04","runReviewStatus":"not-disclosed"},"dependencies":[],"limitation":"Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints. Dossier complet : /benchmarks/vals-2026-09.json"}],"rationale":"1 source indépendante, issue de 1 organisme, a mesuré ce modèle dans ce domaine. Trois sources indépendantes sont nécessaires pour une preuve solide."},"legal":{"domain":"legal","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"finance":{"domain":"finance","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"healthcare":{"domain":"healthcare","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"mathScience":{"domain":"mathScience","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"computerUse":{"domain":"computerUse","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"longContext":{"domain":"longContext","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"factuality":{"domain":"factuality","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"vision":{"domain":"vision","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"voice":{"domain":"voice","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"education":{"domain":"education","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"cybersecurity":{"domain":"cybersecurity","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."},"efficiency":{"domain":"efficiency","status":"insufficient","independentFamilies":0,"organizations":0,"observations":[],"rationale":"Aucun résultat extérieur vérifié dans le registre."}}},"rankAggregations":[{"domain":"general","principal":{"scope":"principal","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":1,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":49,"message":"Agrégation en attente de couverture, 0 modèles communs sur 49."},"rankings":[],"sources":[],"candidateSources":[{"organization":"Artificial Analysis","sourceId":"aa-intelligence-v4-1-1","familyId":"aa-intelligence-v4-1-1","independenceLevel":2,"status":"excluded","reason":"Visible dans l’analyse élargie, hors analyse principale plus stricte."},{"organization":"Epoch AI","sourceId":"epoch-eci-2026-09","familyId":"epoch-eci-2026-09","independenceLevel":1,"status":"excluded","reason":"Source non indépendante, inactive ou ne mesurant pas le modèle seul."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-reasoning-2026-06-25","independenceLevel":1,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-data-analysis-2026-06-25","independenceLevel":1,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-language-2026-06-25","independenceLevel":1,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-instruction-following-2026-06-25","independenceLevel":1,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."}],"concordance":null,"ties":[],"excludedSources":[{"organization":"Artificial Analysis","sourceId":"aa-intelligence-v4-1-1","familyId":"aa-intelligence-v4-1-1","reason":"Visible dans l’analyse élargie, hors analyse principale plus stricte."},{"organization":"Epoch AI","sourceId":"epoch-eci-2026-09","familyId":"epoch-eci-2026-09","reason":"Source non indépendante, inactive ou ne mesurant pas le modèle seul."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-reasoning-2026-06-25","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-data-analysis-2026-06-25","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-language-2026-06-25","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-instruction-following-2026-06-25","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."}],"citable":null},"expanded":{"scope":"expanded","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[{"organizationId":"artificial-analysis","organization":"Artificial Analysis","modelCount":2,"eligible":false,"reason":"2 modèles du panel, 5 requis ; contribution descriptive seulement."},{"organizationId":"livebench","organization":"LiveBench","modelCount":2,"eligible":false,"reason":"2 modèles du panel, 5 requis ; contribution descriptive seulement."}],"sourceCount":2,"candidateSourceCount":2,"modelCount":2,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":49,"message":"Agrégation en attente de couverture, 2 modèles communs sur 49."},"rankings":[],"sources":[{"organizationId":"artificial-analysis","organization":"Artificial Analysis","familyId":"aa-intelligence-v4-1-1","sourceIds":["aa-intelligence-v4-1-1"],"familyIds":["aa-intelligence-v4-1-1"],"independenceLevel":2,"rankings":[{"modelId":"fable-5-1","rank":1},{"modelId":"sol","rank":2}]},{"organizationId":"livebench","organization":"LiveBench","familyId":null,"sourceIds":["livebench-2026-06-25"],"familyIds":["livebench-reasoning-2026-06-25","livebench-data-analysis-2026-06-25","livebench-language-2026-06-25","livebench-instruction-following-2026-06-25"],"independenceLevel":1,"rankings":[{"modelId":"fable-5-1","rank":1},{"modelId":"sol","rank":2}]}],"candidateSources":[{"organization":"Artificial Analysis","sourceId":"aa-intelligence-v4-1-1","familyId":"aa-intelligence-v4-1-1","independenceLevel":2,"status":"included","reason":null},{"organization":"Epoch AI","sourceId":"epoch-eci-2026-09","familyId":"epoch-eci-2026-09","independenceLevel":1,"status":"excluded","reason":"Source non indépendante, inactive ou ne mesurant pas le modèle seul."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-reasoning-2026-06-25","independenceLevel":1,"status":"included","reason":null},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-data-analysis-2026-06-25","independenceLevel":1,"status":"included","reason":null},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-language-2026-06-25","independenceLevel":1,"status":"included","reason":null},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-instruction-following-2026-06-25","independenceLevel":1,"status":"included","reason":null}],"concordance":null,"ties":[],"excludedSources":[{"organization":"Epoch AI","sourceId":"epoch-eci-2026-09","familyId":"epoch-eci-2026-09","reason":"Source non indépendante, inactive ou ne mesurant pas le modèle seul."}],"citable":null},"sensitivity":{"changed":true,"rankingChanged":false,"sourceCountDelta":2,"candidateSourceCountDelta":1,"concordanceDelta":null,"summary":"Aucun classement n’est calculable dans les deux analyses."}},{"domain":"agentic","principal":{"scope":"principal","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":2,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":49,"message":"Agrégation en attente de couverture, 0 modèles communs sur 49."},"rankings":[],"sources":[],"candidateSources":[{"organization":"ARC Prize","sourceId":"arc-agi-3","familyId":"arc-agi-3-astra","independenceLevel":1,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."},{"organization":"Mercor","sourceId":"mercor-apex-agents","familyId":"mercor-apex-agents","independenceLevel":2,"status":"excluded","reason":"Visible dans l’analyse élargie, hors analyse principale plus stricte."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-agentic-coding-2026-06-25","independenceLevel":1,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."}],"concordance":null,"ties":[],"excludedSources":[{"organization":"Mercor","sourceId":"mercor-apex-agents","familyId":"mercor-apex-agents","reason":"Visible dans l’analyse élargie, hors analyse principale plus stricte."},{"organization":"ARC Prize","sourceId":"arc-agi-3","familyId":"arc-agi-3-astra","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-agentic-coding-2026-06-25","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."}],"citable":null},"expanded":{"scope":"expanded","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":3,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":49,"message":"Agrégation en attente de couverture, 0 modèles communs sur 49."},"rankings":[],"sources":[],"candidateSources":[{"organization":"ARC Prize","sourceId":"arc-agi-3","familyId":"arc-agi-3-astra","independenceLevel":1,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."},{"organization":"Mercor","sourceId":"mercor-apex-agents","familyId":"mercor-apex-agents","independenceLevel":2,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-agentic-coding-2026-06-25","independenceLevel":1,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."}],"concordance":null,"ties":[],"excludedSources":[{"organization":"ARC Prize","sourceId":"arc-agi-3","familyId":"arc-agi-3-astra","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."},{"organization":"Mercor","sourceId":"mercor-apex-agents","familyId":"mercor-apex-agents","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-agentic-coding-2026-06-25","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."}],"citable":null},"sensitivity":{"changed":true,"rankingChanged":false,"sourceCountDelta":0,"candidateSourceCountDelta":1,"concordanceDelta":null,"summary":"Aucun classement n’est calculable dans les deux analyses."}},{"domain":"coding","principal":{"scope":"principal","available":true,"solid":false,"solidSourceCount":2,"solidSourceCoverage":[{"organizationId":"terminal-bench","organization":"Terminal-Bench","modelCount":13,"eligible":true,"reason":"13 modèles du panel, 5 requis ; compte vers la preuve solide."},{"organizationId":"livebench","organization":"LiveBench","modelCount":13,"eligible":true,"reason":"13 modèles du panel, 5 requis ; compte vers la preuve solide."}],"sourceCount":2,"candidateSourceCount":2,"modelCount":13,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":49,"message":"Agrégation calculée sur 2 sources et 13 modèles, preuve à confirmer : 2 organismes couvrent au moins 5 modèles, 3 requis."},"rankings":[{"modelId":"fable-5-1","averageRank":1.25,"rank":1,"sourceCount":2,"tied":false},{"modelId":"fable-5","averageRank":3,"rank":2,"sourceCount":2,"tied":false},{"modelId":"sol","averageRank":3.5,"rank":3,"sourceCount":2,"tied":false},{"modelId":"opus-5","averageRank":3.75,"rank":4,"sourceCount":2,"tied":false},{"modelId":"glm-5-3","averageRank":6,"rank":5,"sourceCount":2,"tied":false},{"modelId":"luna","averageRank":6.75,"rank":6,"sourceCount":2,"tied":false},{"modelId":"claude-opus-4-8","averageRank":7.25,"rank":7,"sourceCount":2,"tied":false},{"modelId":"claude-sonnet-5","averageRank":8.25,"rank":8,"sourceCount":2,"tied":false},{"modelId":"gemini-3-7-flash","averageRank":9.25,"rank":9,"sourceCount":2,"tied":false},{"modelId":"terra","averageRank":9.75,"rank":10,"sourceCount":2,"tied":false},{"modelId":"grok-4-6","averageRank":10.25,"rank":11,"sourceCount":2,"tied":false},{"modelId":"gemini-3-8-flash","averageRank":10.75,"rank":12,"sourceCount":2,"tied":false},{"modelId":"grok-4-5","averageRank":11.25,"rank":13,"sourceCount":2,"tied":false}],"sources":[{"organizationId":"terminal-bench","organization":"Terminal-Bench","familyId":"terminal-bench-v4-0","sourceIds":["terminal-bench-v4-0"],"familyIds":["terminal-bench-v4-0"],"independenceLevel":1,"rankings":[{"modelId":"fable-5-1","rank":1.5},{"modelId":"opus-5","rank":1.5},{"modelId":"fable-5","rank":4},{"modelId":"glm-5-3","rank":4},{"modelId":"sol","rank":4},{"modelId":"claude-opus-4-8","rank":9.5},{"modelId":"claude-sonnet-5","rank":9.5},{"modelId":"gemini-3-7-flash","rank":9.5},{"modelId":"gemini-3-8-flash","rank":9.5},{"modelId":"grok-4-5","rank":9.5},{"modelId":"grok-4-6","rank":9.5},{"modelId":"luna","rank":9.5},{"modelId":"terra","rank":9.5}]},{"organizationId":"livebench","organization":"LiveBench","familyId":"livebench-coding-2026-06-25","sourceIds":["livebench-2026-06-25"],"familyIds":["livebench-coding-2026-06-25"],"independenceLevel":1,"rankings":[{"modelId":"fable-5-1","rank":1},{"modelId":"fable-5","rank":2},{"modelId":"sol","rank":3},{"modelId":"luna","rank":4},{"modelId":"claude-opus-4-8","rank":5},{"modelId":"opus-5","rank":6},{"modelId":"claude-sonnet-5","rank":7},{"modelId":"glm-5-3","rank":8},{"modelId":"gemini-3-7-flash","rank":9},{"modelId":"terra","rank":10},{"modelId":"grok-4-6","rank":11},{"modelId":"gemini-3-8-flash","rank":12},{"modelId":"grok-4-5","rank":13}]}],"candidateSources":[{"organization":"Artificial Analysis","sourceId":"aa-coding-agent-v1-4","familyId":"aa-coding-agent-v1-4","independenceLevel":2,"status":"excluded","reason":"Visible dans l’analyse élargie, hors analyse principale plus stricte."},{"organization":"Terminal-Bench","sourceId":"terminal-bench-v4-0","familyId":"terminal-bench-v4-0","independenceLevel":1,"status":"included","reason":null},{"organization":"SWE-bench","sourceId":"swe-bench-verified-2026","familyId":"swe-bench-verified-mini-v2-2026-02","independenceLevel":1,"status":"excluded","reason":"Origine d’exécution non vérifiée : résultat publié mais non compté, la soumission ne prouve pas le contrôle par l’équipe."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-coding-2026-06-25","independenceLevel":1,"status":"included","reason":null},{"organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","familyId":"vals-code-migration-v1-2026-09-03","independenceLevel":2,"status":"excluded","reason":"Visible dans l’analyse élargie, hors analyse principale plus stricte."}],"concordance":{"value":0.8161,"low":0.8161,"high":1,"confidence":95,"method":"Kendall W généralisé, rangs incomplets et ex aequo corrigés","bootstrapSamples":2000,"validSamples":2000},"ties":[{"level":"source","organization":"Terminal-Bench","familyId":"terminal-bench-v4-0","modelIds":["fable-5-1","opus-5"],"rank":1.5,"reason":"Les fourchettes publiées se recouvrent."},{"level":"source","organization":"Terminal-Bench","familyId":"terminal-bench-v4-0","modelIds":["fable-5","glm-5-3","sol"],"rank":4,"reason":"Les fourchettes publiées se recouvrent."},{"level":"source","organization":"Terminal-Bench","familyId":"terminal-bench-v4-0","modelIds":["claude-opus-4-8","terra","grok-4-6","gemini-3-8-flash","luna","claude-sonnet-5","grok-4-5","gemini-3-7-flash"],"rank":9.5,"reason":"Les fourchettes publiées se recouvrent."}],"excludedSources":[{"organization":"Artificial Analysis","sourceId":"aa-coding-agent-v1-4","familyId":"aa-coding-agent-v1-4","reason":"Visible dans l’analyse élargie, hors analyse principale plus stricte."},{"organization":"SWE-bench","sourceId":"swe-bench-verified-2026","familyId":"swe-bench-verified-mini-v2-2026-02","reason":"Origine d’exécution non vérifiée : résultat publié mais non compté, la soumission ne prouve pas le contrôle par l’équipe."},{"organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","familyId":"vals-code-migration-v1-2026-09-03","reason":"Visible dans l’analyse élargie, hors analyse principale plus stricte."}],"citable":"Méta-analyse par agrégation de rangs, 2 sources, 13 modèles, W = 0,8161."},"expanded":{"scope":"expanded","available":true,"solid":true,"solidSourceCount":3,"solidSourceCoverage":[{"organizationId":"terminal-bench","organization":"Terminal-Bench","modelCount":13,"eligible":true,"reason":"13 modèles du panel, 5 requis ; compte vers la preuve solide."},{"organizationId":"livebench","organization":"LiveBench","modelCount":41,"eligible":true,"reason":"41 modèles du panel, 5 requis ; compte vers la preuve solide."},{"organizationId":"vals-ai","organization":"Vals AI","modelCount":41,"eligible":true,"reason":"41 modèles du panel, 5 requis ; compte vers la preuve solide."}],"sourceCount":3,"candidateSourceCount":4,"modelCount":41,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":56,"message":"Agrégation calculée sur 3 sources et 41 modèles."},"rankings":[{"modelId":"fable-5-1","averageRank":1.8333,"rank":1,"sourceCount":3,"tied":false},{"modelId":"fable-5","averageRank":2.6667,"rank":2,"sourceCount":3,"tied":false},{"modelId":"opus-5","averageRank":3.6667,"rank":3.5,"sourceCount":3,"tied":true},{"modelId":"sol","averageRank":3.6667,"rank":3.5,"sourceCount":3,"tied":true},{"modelId":"gpt-5-5","averageRank":6,"rank":5,"sourceCount":2,"tied":false},{"modelId":"claude-opus-4-8","averageRank":7.5,"rank":6.5,"sourceCount":3,"tied":true},{"modelId":"luna","averageRank":7.5,"rank":6.5,"sourceCount":3,"tied":true},{"modelId":"claude-opus-4-7","averageRank":9,"rank":8,"sourceCount":2,"tied":false},{"modelId":"glm-5-3","averageRank":9.5,"rank":9,"sourceCount":3,"tied":false},{"modelId":"claude-sonnet-5","averageRank":9.8333,"rank":10,"sourceCount":3,"tied":false},{"modelId":"terra","averageRank":10.5,"rank":11,"sourceCount":3,"tied":false},{"modelId":"claude-sonnet-4-6","averageRank":13,"rank":12,"sourceCount":2,"tied":false},{"modelId":"glm-5-2","averageRank":13.5,"rank":13,"sourceCount":2,"tied":false},{"modelId":"grok-4-6","averageRank":14.1667,"rank":14,"sourceCount":3,"tied":false},{"modelId":"gemini-3-7-flash","averageRank":14.8333,"rank":15,"sourceCount":3,"tied":false},{"modelId":"deepseek-v4-pro-0813","averageRank":18.25,"rank":16,"sourceCount":2,"tied":false},{"modelId":"kimi-k2-6","averageRank":20,"rank":17,"sourceCount":2,"tied":false},{"modelId":"gemini-3-8-flash","averageRank":20.1667,"rank":18,"sourceCount":3,"tied":false},{"modelId":"gpt-5-4","averageRank":20.25,"rank":19.5,"sourceCount":2,"tied":true},{"modelId":"kimi-k3","averageRank":20.25,"rank":19.5,"sourceCount":2,"tied":true},{"modelId":"gemini-3-6-flash","averageRank":21,"rank":21,"sourceCount":2,"tied":false},{"modelId":"glm-5-3-flash","averageRank":21.25,"rank":22,"sourceCount":2,"tied":false},{"modelId":"gemini-3-5-flash","averageRank":21.75,"rank":23,"sourceCount":2,"tied":false},{"modelId":"deepseek-v4-flash-0731","averageRank":22,"rank":24,"sourceCount":2,"tied":false},{"modelId":"grok-4-5","averageRank":22.1667,"rank":25,"sourceCount":3,"tied":false},{"modelId":"muse-spark-1-1","averageRank":22.25,"rank":26.5,"sourceCount":2,"tied":true},{"modelId":"muse-spark-1-2","averageRank":22.25,"rank":26.5,"sourceCount":2,"tied":true},{"modelId":"qwen3-6-plus","averageRank":28.25,"rank":28,"sourceCount":2,"tied":false},{"modelId":"gemini-3-1-pro-preview","averageRank":28.5,"rank":29,"sourceCount":2,"tied":false},{"modelId":"kimi-k2-7-code","averageRank":29,"rank":30,"sourceCount":2,"tied":false},{"modelId":"qwen3-8-max","averageRank":30,"rank":31,"sourceCount":2,"tied":false},{"modelId":"qwen3-8-27b","averageRank":31,"rank":32,"sourceCount":2,"tied":false},{"modelId":"deepseek-v4-pro","averageRank":32,"rank":33,"sourceCount":2,"tied":false},{"modelId":"qwen3-7-max","averageRank":32.5,"rank":34,"sourceCount":2,"tied":false},{"modelId":"gemini-3-5-flash-lite","averageRank":33.5,"rank":35,"sourceCount":2,"tied":false},{"modelId":"gpt-5-4-nano","averageRank":34.5,"rank":36,"sourceCount":2,"tied":false},{"modelId":"gpt-5-4-mini","averageRank":35,"rank":37,"sourceCount":2,"tied":false},{"modelId":"minimax-m3","averageRank":35.5,"rank":38,"sourceCount":2,"tied":false},{"modelId":"inkling","averageRank":36,"rank":39,"sourceCount":2,"tied":false},{"modelId":"grok-4-3","averageRank":39,"rank":40.5,"sourceCount":2,"tied":true},{"modelId":"nemotron-3-ultra","averageRank":39,"rank":40.5,"sourceCount":2,"tied":true}],"sources":[{"organizationId":"terminal-bench","organization":"Terminal-Bench","familyId":"terminal-bench-v4-0","sourceIds":["terminal-bench-v4-0"],"familyIds":["terminal-bench-v4-0"],"independenceLevel":1,"rankings":[{"modelId":"fable-5-1","rank":1.5},{"modelId":"opus-5","rank":1.5},{"modelId":"fable-5","rank":4},{"modelId":"glm-5-3","rank":4},{"modelId":"sol","rank":4},{"modelId":"claude-opus-4-8","rank":9.5},{"modelId":"claude-sonnet-5","rank":9.5},{"modelId":"gemini-3-7-flash","rank":9.5},{"modelId":"gemini-3-8-flash","rank":9.5},{"modelId":"grok-4-5","rank":9.5},{"modelId":"grok-4-6","rank":9.5},{"modelId":"luna","rank":9.5},{"modelId":"terra","rank":9.5}]},{"organizationId":"livebench","organization":"LiveBench","familyId":"livebench-coding-2026-06-25","sourceIds":["livebench-2026-06-25"],"familyIds":["livebench-coding-2026-06-25"],"independenceLevel":1,"rankings":[{"modelId":"fable-5-1","rank":1},{"modelId":"fable-5","rank":2},{"modelId":"sol","rank":3},{"modelId":"luna","rank":4},{"modelId":"gpt-5-5","rank":5},{"modelId":"claude-opus-4-7","rank":6},{"modelId":"claude-opus-4-8","rank":7},{"modelId":"kimi-k3","rank":8.5},{"modelId":"opus-5","rank":8.5},{"modelId":"claude-sonnet-5","rank":10},{"modelId":"glm-5-2","rank":11},{"modelId":"claude-sonnet-4-6","rank":12},{"modelId":"glm-5-3","rank":13.5},{"modelId":"glm-5-3-flash","rank":13.5},{"modelId":"gemini-3-7-flash","rank":15},{"modelId":"kimi-k2-6","rank":16},{"modelId":"terra","rank":17},{"modelId":"gemini-3-5-flash","rank":18.5},{"modelId":"qwen3-6-plus","rank":18.5},{"modelId":"gemini-3-6-flash","rank":20},{"modelId":"gpt-5-4","rank":21.5},{"modelId":"muse-spark-1-2","rank":21.5},{"modelId":"deepseek-v4-pro-0813","rank":23.5},{"modelId":"muse-spark-1-1","rank":23.5},{"modelId":"grok-4-6","rank":25},{"modelId":"gemini-3-1-pro-preview","rank":26},{"modelId":"gemini-3-5-flash-lite","rank":27},{"modelId":"qwen3-8-27b","rank":28},{"modelId":"deepseek-v4-flash-0731","rank":29},{"modelId":"qwen3-7-max","rank":30},{"modelId":"kimi-k2-7-code","rank":31},{"modelId":"qwen3-8-max","rank":32},{"modelId":"gemini-3-8-flash","rank":33},{"modelId":"gpt-5-4-mini","rank":34},{"modelId":"inkling","rank":35},{"modelId":"gpt-5-4-nano","rank":36},{"modelId":"nemotron-3-ultra","rank":37},{"modelId":"deepseek-v4-pro","rank":38},{"modelId":"grok-4-3","rank":39},{"modelId":"grok-4-5","rank":40},{"modelId":"minimax-m3","rank":41}]},{"organizationId":"vals-ai","organization":"Vals AI","familyId":"vals-code-migration-v1-2026-09-03","sourceIds":["vals-code-migration-v1-2026-09-03"],"familyIds":["vals-code-migration-v1-2026-09-03"],"independenceLevel":2,"rankings":[{"modelId":"opus-5","rank":1},{"modelId":"fable-5","rank":2},{"modelId":"fable-5-1","rank":3},{"modelId":"sol","rank":4},{"modelId":"terra","rank":5},{"modelId":"claude-opus-4-8","rank":6},{"modelId":"gpt-5-5","rank":7},{"modelId":"grok-4-6","rank":8},{"modelId":"luna","rank":9},{"modelId":"claude-sonnet-5","rank":10},{"modelId":"glm-5-3","rank":11},{"modelId":"claude-opus-4-7","rank":12},{"modelId":"deepseek-v4-pro-0813","rank":13},{"modelId":"claude-sonnet-4-6","rank":14},{"modelId":"deepseek-v4-flash-0731","rank":15},{"modelId":"glm-5-2","rank":16},{"modelId":"grok-4-5","rank":17},{"modelId":"gemini-3-8-flash","rank":18},{"modelId":"gpt-5-4","rank":19},{"modelId":"gemini-3-7-flash","rank":20},{"modelId":"muse-spark-1-1","rank":21},{"modelId":"gemini-3-6-flash","rank":22},{"modelId":"muse-spark-1-2","rank":23},{"modelId":"kimi-k2-6","rank":24},{"modelId":"gemini-3-5-flash","rank":25},{"modelId":"deepseek-v4-pro","rank":26},{"modelId":"kimi-k2-7-code","rank":27},{"modelId":"qwen3-8-max","rank":28},{"modelId":"glm-5-3-flash","rank":29},{"modelId":"minimax-m3","rank":30},{"modelId":"gemini-3-1-pro-preview","rank":31},{"modelId":"kimi-k3","rank":32},{"modelId":"gpt-5-4-nano","rank":33},{"modelId":"qwen3-8-27b","rank":34},{"modelId":"qwen3-7-max","rank":35},{"modelId":"gpt-5-4-mini","rank":36},{"modelId":"inkling","rank":37},{"modelId":"qwen3-6-plus","rank":38},{"modelId":"grok-4-3","rank":39},{"modelId":"gemini-3-5-flash-lite","rank":40},{"modelId":"nemotron-3-ultra","rank":41}]}],"candidateSources":[{"organization":"Artificial Analysis","sourceId":"aa-coding-agent-v1-4","familyId":"aa-coding-agent-v1-4","independenceLevel":2,"status":"excluded","reason":"Dépend d’une autre source retenue, Terminal-Bench 4.0. Écartée pour éviter de compter deux fois la même famille de tâches."},{"organization":"Terminal-Bench","sourceId":"terminal-bench-v4-0","familyId":"terminal-bench-v4-0","independenceLevel":1,"status":"included","reason":null},{"organization":"SWE-bench","sourceId":"swe-bench-verified-2026","familyId":"swe-bench-verified-mini-v2-2026-02","independenceLevel":1,"status":"excluded","reason":"Origine d’exécution non vérifiée : résultat publié mais non compté, la soumission ne prouve pas le contrôle par l’équipe."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-coding-2026-06-25","independenceLevel":1,"status":"included","reason":null},{"organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","familyId":"vals-code-migration-v1-2026-09-03","independenceLevel":2,"status":"included","reason":null}],"concordance":{"value":0.8012,"low":0.8012,"high":1,"confidence":95,"method":"Kendall W généralisé, rangs incomplets et ex aequo corrigés","bootstrapSamples":2000,"validSamples":2000},"ties":[{"level":"source","organization":"Terminal-Bench","familyId":"terminal-bench-v4-0","modelIds":["fable-5-1","opus-5"],"rank":1.5,"reason":"Les fourchettes publiées se recouvrent."},{"level":"source","organization":"Terminal-Bench","familyId":"terminal-bench-v4-0","modelIds":["fable-5","glm-5-3","sol"],"rank":4,"reason":"Les fourchettes publiées se recouvrent."},{"level":"source","organization":"Terminal-Bench","familyId":"terminal-bench-v4-0","modelIds":["claude-opus-4-8","terra","grok-4-6","gemini-3-8-flash","luna","claude-sonnet-5","grok-4-5","gemini-3-7-flash"],"rank":9.5,"reason":"Les fourchettes publiées se recouvrent."},{"level":"source","organization":"LiveBench","familyId":"livebench-coding-2026-06-25","modelIds":["kimi-k3","opus-5"],"rank":8.5,"reason":"Les scores publiés sont identiques."},{"level":"source","organization":"LiveBench","familyId":"livebench-coding-2026-06-25","modelIds":["glm-5-3","glm-5-3-flash"],"rank":13.5,"reason":"Les scores publiés sont identiques."},{"level":"source","organization":"LiveBench","familyId":"livebench-coding-2026-06-25","modelIds":["gemini-3-5-flash","qwen3-6-plus"],"rank":18.5,"reason":"Les scores publiés sont identiques."},{"level":"source","organization":"LiveBench","familyId":"livebench-coding-2026-06-25","modelIds":["gpt-5-4","muse-spark-1-2"],"rank":21.5,"reason":"Les scores publiés sont identiques."},{"level":"source","organization":"LiveBench","familyId":"livebench-coding-2026-06-25","modelIds":["deepseek-v4-pro-0813","muse-spark-1-1"],"rank":23.5,"reason":"Les scores publiés sont identiques."},{"level":"aggregate","organization":null,"familyId":null,"modelIds":["opus-5","sol"],"rank":3.5,"reason":"Même rang moyen après combinaison des sources."},{"level":"aggregate","organization":null,"familyId":null,"modelIds":["claude-opus-4-8","luna"],"rank":6.5,"reason":"Même rang moyen après combinaison des sources."},{"level":"aggregate","organization":null,"familyId":null,"modelIds":["gpt-5-4","kimi-k3"],"rank":19.5,"reason":"Même rang moyen après combinaison des sources."},{"level":"aggregate","organization":null,"familyId":null,"modelIds":["muse-spark-1-1","muse-spark-1-2"],"rank":26.5,"reason":"Même rang moyen après combinaison des sources."},{"level":"aggregate","organization":null,"familyId":null,"modelIds":["grok-4-3","nemotron-3-ultra"],"rank":40.5,"reason":"Même rang moyen après combinaison des sources."}],"excludedSources":[{"organization":"SWE-bench","sourceId":"swe-bench-verified-2026","familyId":"swe-bench-verified-mini-v2-2026-02","reason":"Origine d’exécution non vérifiée : résultat publié mais non compté, la soumission ne prouve pas le contrôle par l’équipe."},{"organization":"Artificial Analysis","sourceId":"aa-coding-agent-v1-4","familyId":"aa-coding-agent-v1-4","reason":"Dépend d’une autre source retenue, Terminal-Bench 4.0. Écartée pour éviter de compter deux fois la même famille de tâches."}],"citable":"Méta-analyse par agrégation de rangs, 3 sources, 41 modèles, W = 0,8012."},"sensitivity":{"changed":true,"rankingChanged":true,"sourceCountDelta":1,"candidateSourceCountDelta":2,"concordanceDelta":-0.0149,"summary":"Le résultat change quand les sources commerciales extérieures sont ajoutées."}},{"domain":"legal","principal":{"scope":"principal","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[{"organization":"Mercor","sourceId":"mercor-apex-legal","familyId":"mercor-apex-agents-legal-mean-score","independenceLevel":2,"status":"excluded","reason":"Visible dans l’analyse élargie, hors analyse principale plus stricte."},{"organization":"Mercor","sourceId":"mercor-apex-legal","familyId":"mercor-apex-agents-legal-all-criteria","independenceLevel":2,"status":"excluded","reason":"Visible dans l’analyse élargie, hors analyse principale plus stricte."}],"concordance":null,"ties":[],"excludedSources":[{"organization":"Mercor","sourceId":"mercor-apex-legal","familyId":"mercor-apex-agents-legal-mean-score","reason":"Visible dans l’analyse élargie, hors analyse principale plus stricte."},{"organization":"Mercor","sourceId":"mercor-apex-legal","familyId":"mercor-apex-agents-legal-all-criteria","reason":"Visible dans l’analyse élargie, hors analyse principale plus stricte."}],"citable":null},"expanded":{"scope":"expanded","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":1,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":3,"message":"Agrégation en attente de couverture, 0 modèles communs sur 3."},"rankings":[],"sources":[],"candidateSources":[{"organization":"Mercor","sourceId":"mercor-apex-legal","familyId":"mercor-apex-agents-legal-mean-score","independenceLevel":2,"status":"excluded","reason":"Dépend d’une autre source retenue, APEX-Agents Corporate Lawyer, tâches sans erreur. Écartée pour éviter de compter deux fois la même famille de tâches."},{"organization":"Mercor","sourceId":"mercor-apex-legal","familyId":"mercor-apex-agents-legal-all-criteria","independenceLevel":2,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."}],"concordance":null,"ties":[],"excludedSources":[{"organization":"Mercor","sourceId":"mercor-apex-legal","familyId":"mercor-apex-agents-legal-mean-score","reason":"Dépend d’une autre source retenue, APEX-Agents Corporate Lawyer, tâches sans erreur. Écartée pour éviter de compter deux fois la même famille de tâches."},{"organization":"Mercor","sourceId":"mercor-apex-legal","familyId":"mercor-apex-agents-legal-all-criteria","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."}],"citable":null},"sensitivity":{"changed":true,"rankingChanged":false,"sourceCountDelta":0,"candidateSourceCountDelta":1,"concordanceDelta":null,"summary":"Aucun classement n’est calculable dans les deux analyses."}},{"domain":"finance","principal":{"scope":"principal","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[{"organization":"Mercor","sourceId":"mercor-apex-finance","familyId":"mercor-apex-agents-finance-mean-score","independenceLevel":2,"status":"excluded","reason":"Visible dans l’analyse élargie, hors analyse principale plus stricte."}],"concordance":null,"ties":[],"excludedSources":[{"organization":"Mercor","sourceId":"mercor-apex-finance","familyId":"mercor-apex-agents-finance-mean-score","reason":"Visible dans l’analyse élargie, hors analyse principale plus stricte."}],"citable":null},"expanded":{"scope":"expanded","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":1,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":3,"message":"Agrégation en attente de couverture, 0 modèles communs sur 3."},"rankings":[],"sources":[],"candidateSources":[{"organization":"Mercor","sourceId":"mercor-apex-finance","familyId":"mercor-apex-agents-finance-mean-score","independenceLevel":2,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."}],"concordance":null,"ties":[],"excludedSources":[{"organization":"Mercor","sourceId":"mercor-apex-finance","familyId":"mercor-apex-agents-finance-mean-score","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."}],"citable":null},"sensitivity":{"changed":true,"rankingChanged":false,"sourceCountDelta":0,"candidateSourceCountDelta":1,"concordanceDelta":null,"summary":"Aucun classement n’est calculable dans les deux analyses."}},{"domain":"healthcare","principal":{"scope":"principal","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[{"organization":"OpenAI","sourceId":"openai-healthbench-professional","familyId":"openai-healthbench-professional","independenceLevel":3,"status":"excluded","reason":"Source non indépendante, inactive ou ne mesurant pas le modèle seul."}],"concordance":null,"ties":[],"excludedSources":[{"organization":"OpenAI","sourceId":"openai-healthbench-professional","familyId":"openai-healthbench-professional","reason":"Source non indépendante, inactive ou ne mesurant pas le modèle seul."}],"citable":null},"expanded":{"scope":"expanded","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[{"organization":"OpenAI","sourceId":"openai-healthbench-professional","familyId":"openai-healthbench-professional","independenceLevel":3,"status":"excluded","reason":"Source non indépendante, inactive ou ne mesurant pas le modèle seul."}],"concordance":null,"ties":[],"excludedSources":[{"organization":"OpenAI","sourceId":"openai-healthbench-professional","familyId":"openai-healthbench-professional","reason":"Source non indépendante, inactive ou ne mesurant pas le modèle seul."}],"citable":null},"sensitivity":{"changed":false,"rankingChanged":false,"sourceCountDelta":0,"candidateSourceCountDelta":0,"concordanceDelta":null,"summary":"Aucun classement n’est calculable dans les deux analyses."}},{"domain":"mathScience","principal":{"scope":"principal","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[{"organizationId":"epoch-ai","organization":"Epoch AI","modelCount":2,"eligible":false,"reason":"2 modèles du panel, 5 requis ; contribution descriptive seulement."},{"organizationId":"livebench","organization":"LiveBench","modelCount":2,"eligible":false,"reason":"2 modèles du panel, 5 requis ; contribution descriptive seulement."}],"sourceCount":2,"candidateSourceCount":2,"modelCount":2,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":49,"message":"Agrégation en attente de couverture, 2 modèles communs sur 49."},"rankings":[],"sources":[{"organizationId":"epoch-ai","organization":"Epoch AI","familyId":"epoch-frontiermath-erdos","sourceIds":["epoch-frontiermath-erdos"],"familyIds":["epoch-frontiermath-erdos"],"independenceLevel":1,"rankings":[{"modelId":"fable-5-1","rank":1.5},{"modelId":"sol","rank":1.5}]},{"organizationId":"livebench","organization":"LiveBench","familyId":"livebench-mathematics-2026-06-25","sourceIds":["livebench-2026-06-25"],"familyIds":["livebench-mathematics-2026-06-25"],"independenceLevel":1,"rankings":[{"modelId":"fable-5-1","rank":1},{"modelId":"sol","rank":2}]}],"candidateSources":[{"organization":"Epoch AI","sourceId":"epoch-frontiermath-erdos","familyId":"epoch-frontiermath-erdos","independenceLevel":1,"status":"included","reason":null},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-mathematics-2026-06-25","independenceLevel":1,"status":"included","reason":null}],"concordance":null,"ties":[{"level":"source","organization":"Epoch AI","familyId":"epoch-frontiermath-erdos","modelIds":["fable-5-1","sol"],"rank":1.5,"reason":"Les scores publiés sont identiques."}],"excludedSources":[],"citable":null},"expanded":{"scope":"expanded","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[{"organizationId":"epoch-ai","organization":"Epoch AI","modelCount":2,"eligible":false,"reason":"2 modèles du panel, 5 requis ; contribution descriptive seulement."},{"organizationId":"livebench","organization":"LiveBench","modelCount":2,"eligible":false,"reason":"2 modèles du panel, 5 requis ; contribution descriptive seulement."}],"sourceCount":2,"candidateSourceCount":2,"modelCount":2,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":49,"message":"Agrégation en attente de couverture, 2 modèles communs sur 49."},"rankings":[],"sources":[{"organizationId":"epoch-ai","organization":"Epoch AI","familyId":"epoch-frontiermath-erdos","sourceIds":["epoch-frontiermath-erdos"],"familyIds":["epoch-frontiermath-erdos"],"independenceLevel":1,"rankings":[{"modelId":"fable-5-1","rank":1.5},{"modelId":"sol","rank":1.5}]},{"organizationId":"livebench","organization":"LiveBench","familyId":"livebench-mathematics-2026-06-25","sourceIds":["livebench-2026-06-25"],"familyIds":["livebench-mathematics-2026-06-25"],"independenceLevel":1,"rankings":[{"modelId":"fable-5-1","rank":1},{"modelId":"sol","rank":2}]}],"candidateSources":[{"organization":"Epoch AI","sourceId":"epoch-frontiermath-erdos","familyId":"epoch-frontiermath-erdos","independenceLevel":1,"status":"included","reason":null},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-mathematics-2026-06-25","independenceLevel":1,"status":"included","reason":null}],"concordance":null,"ties":[{"level":"source","organization":"Epoch AI","familyId":"epoch-frontiermath-erdos","modelIds":["fable-5-1","sol"],"rank":1.5,"reason":"Les scores publiés sont identiques."}],"excludedSources":[],"citable":null},"sensitivity":{"changed":false,"rankingChanged":false,"sourceCountDelta":0,"candidateSourceCountDelta":0,"concordanceDelta":null,"summary":"Aucun classement n’est calculable dans les deux analyses."}},{"domain":"computerUse","principal":{"scope":"principal","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[],"concordance":null,"ties":[],"excludedSources":[],"citable":null},"expanded":{"scope":"expanded","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[],"concordance":null,"ties":[],"excludedSources":[],"citable":null},"sensitivity":{"changed":false,"rankingChanged":false,"sourceCountDelta":0,"candidateSourceCountDelta":0,"concordanceDelta":null,"summary":"Aucun classement n’est calculable dans les deux analyses."}},{"domain":"longContext","principal":{"scope":"principal","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[],"concordance":null,"ties":[],"excludedSources":[],"citable":null},"expanded":{"scope":"expanded","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[],"concordance":null,"ties":[],"excludedSources":[],"citable":null},"sensitivity":{"changed":false,"rankingChanged":false,"sourceCountDelta":0,"candidateSourceCountDelta":0,"concordanceDelta":null,"summary":"Aucun classement n’est calculable dans les deux analyses."}},{"domain":"factuality","principal":{"scope":"principal","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[{"organization":"Artificial Analysis","sourceId":"aa-omniscience-2026-09","familyId":"aa-omniscience-2026-09","independenceLevel":2,"status":"excluded","reason":"Visible dans l’analyse élargie, hors analyse principale plus stricte."}],"concordance":null,"ties":[],"excludedSources":[{"organization":"Artificial Analysis","sourceId":"aa-omniscience-2026-09","familyId":"aa-omniscience-2026-09","reason":"Visible dans l’analyse élargie, hors analyse principale plus stricte."}],"citable":null},"expanded":{"scope":"expanded","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":1,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":2,"message":"Agrégation en attente de couverture, 0 modèles communs sur 2."},"rankings":[],"sources":[],"candidateSources":[{"organization":"Artificial Analysis","sourceId":"aa-omniscience-2026-09","familyId":"aa-omniscience-2026-09","independenceLevel":2,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."}],"concordance":null,"ties":[],"excludedSources":[{"organization":"Artificial Analysis","sourceId":"aa-omniscience-2026-09","familyId":"aa-omniscience-2026-09","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."}],"citable":null},"sensitivity":{"changed":true,"rankingChanged":false,"sourceCountDelta":0,"candidateSourceCountDelta":1,"concordanceDelta":null,"summary":"Aucun classement n’est calculable dans les deux analyses."}},{"domain":"vision","principal":{"scope":"principal","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[],"concordance":null,"ties":[],"excludedSources":[],"citable":null},"expanded":{"scope":"expanded","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[],"concordance":null,"ties":[],"excludedSources":[],"citable":null},"sensitivity":{"changed":false,"rankingChanged":false,"sourceCountDelta":0,"candidateSourceCountDelta":0,"concordanceDelta":null,"summary":"Aucun classement n’est calculable dans les deux analyses."}},{"domain":"voice","principal":{"scope":"principal","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[],"concordance":null,"ties":[],"excludedSources":[],"citable":null},"expanded":{"scope":"expanded","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[],"concordance":null,"ties":[],"excludedSources":[],"citable":null},"sensitivity":{"changed":false,"rankingChanged":false,"sourceCountDelta":0,"candidateSourceCountDelta":0,"concordanceDelta":null,"summary":"Aucun classement n’est calculable dans les deux analyses."}},{"domain":"education","principal":{"scope":"principal","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[],"concordance":null,"ties":[],"excludedSources":[],"citable":null},"expanded":{"scope":"expanded","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[],"concordance":null,"ties":[],"excludedSources":[],"citable":null},"sensitivity":{"changed":false,"rankingChanged":false,"sourceCountDelta":0,"candidateSourceCountDelta":0,"concordanceDelta":null,"summary":"Aucun classement n’est calculable dans les deux analyses."}},{"domain":"cybersecurity","principal":{"scope":"principal","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[],"concordance":null,"ties":[],"excludedSources":[],"citable":null},"expanded":{"scope":"expanded","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[],"concordance":null,"ties":[],"excludedSources":[],"citable":null},"sensitivity":{"changed":false,"rankingChanged":false,"sourceCountDelta":0,"candidateSourceCountDelta":0,"concordanceDelta":null,"summary":"Aucun classement n’est calculable dans les deux analyses."}},{"domain":"efficiency","principal":{"scope":"principal","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[],"concordance":null,"ties":[],"excludedSources":[],"citable":null},"expanded":{"scope":"expanded","available":false,"solid":false,"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"coverage":{"minimumModels":5,"minimumSourcesForSolid":3,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0."},"rankings":[],"sources":[],"candidateSources":[],"concordance":null,"ties":[],"excludedSources":[],"citable":null},"sensitivity":{"changed":false,"rankingChanged":false,"sourceCountDelta":0,"candidateSourceCountDelta":0,"concordanceDelta":null,"summary":"Aucun classement n’est calculable dans les deux analyses."}}],"scoreManifests":[{"editionId":"origin-general-2026-09-non-constituee","domain":"general","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Aucune référence de quinze modèles communs à au moins deux équipes indépendantes n’est constituée dans le registre actuel.","selectionRationale":"Aucun socle sélectionné : la couverture intégrée ne permet pas encore de réunir quinze modèles communs à deux équipes indépendantes.","catalogRule":"available-at-cutoff","catalogExclusionReason":"Aucun catalogue constitué pour cet usage.","eligibleModelIds":[],"catalogFingerprint":"score-v1-741638a568efd6f9","tests":[],"referenceModelIds":[],"observationIds":[],"observationSelectionPolicy":"unique-cell-or-explicit-observation-id","snapshot":"[]","snapshotFingerprint":"score-v1-741638a568efd6f9"},{"editionId":"origin-agentic-2026-09-non-constituee","domain":"agentic","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Aucune référence de quinze modèles communs à au moins deux équipes indépendantes n’est constituée dans le registre actuel.","selectionRationale":"Aucun socle sélectionné : la couverture intégrée ne permet pas encore de réunir quinze modèles communs à deux équipes indépendantes.","catalogRule":"available-at-cutoff","catalogExclusionReason":"Aucun catalogue constitué pour cet usage.","eligibleModelIds":[],"catalogFingerprint":"score-v1-741638a568efd6f9","tests":[],"referenceModelIds":[],"observationIds":[],"observationSelectionPolicy":"unique-cell-or-explicit-observation-id","snapshot":"[]","snapshotFingerprint":"score-v1-741638a568efd6f9"},{"editionId":"origin-coding-2026-09-04-v1","domain":"coding","cutoffDate":"2026-09-04","status":"constituted","reason":"Référence constituée sur un socle explicite et figé.","selectionRationale":"Deux auteurs : génération de code LiveBench et migration Vals. Toutes les configurations documentées communes, sans sélection par score. 56 lignes Vals instruites ; les différences de tâches et dispositifs restent explicites.","catalogRule":"available-at-cutoff","catalogExclusionReason":"Disponibilité actuelle non vérifiée dans le dossier Vals 56/56, ou modèle absent de ce dossier de disponibilité. Valeurs conservées.","eligibleModelIds":["astra","claude-haiku-4-5","claude-opus-4-7","claude-opus-4-8","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash-0731","deepseek-v4-pro","deepseek-v4-pro-0813","fable-5","fable-5-1","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","gemini-3-flash-preview","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","luna","mimo-v2-5","mimo-v2-5-pro","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","nemotron-3-ultra","nemotron-lightning-3-5","opus-5","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-max","sol","terra"],"catalogFingerprint":"score-v1-75d29ba85a85befc","tests":[{"familyId":"livebench-coding-2026-06-25","sourceId":"livebench-2026-06-25","sourceAtClose":{"id":"livebench-2026-06-25","organization":"LiveBench","independenceLevel":1,"resultOrigin":"evaluator-run","commercialRelationshipWithRankedLabs":"no","coverage":{"status":"partial","publishedEntries":53,"includedEntries":49,"reason":"Trois entrées portent sur des modèles sortis en 2025. Une entrée anonyme ne possède pas d’annonce fabricant datée."},"vitality":{"status":"active","checkedAt":"2026-09-04"}},"sourceFingerprint":"score-v1-2b83c083fa261bcf","organization":"LiveBench","organizationId":"livebench","benchmark":"LiveBench : code","benchmarkVersion":"2026-06-25","resultUnit":"percent","resultDirection":"higher","scoring":"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench","allowedProtocolVariations":["effort","modelSetting"],"protocolVariationRationale":"Réglages par modèle publiés et conservés. La jointure exige version nominale et effort normalisé documentés ; tâches et dispositifs différents entre auteurs admis.","dependencyIds":[],"countableAtClose":true},{"familyId":"vals-code-migration-v1-2026-09-03","sourceId":"vals-code-migration-v1-2026-09-03","sourceAtClose":{"id":"vals-code-migration-v1-2026-09-03","organization":"Vals AI","organizationId":"vals-ai","independenceLevel":2,"resultOrigin":"evaluator-run","commercialRelationshipWithRankedLabs":"not-disclosed","coverage":{"status":"complete","publishedEntries":56,"includedEntries":56,"reason":null},"vitality":{"status":"active","checkedAt":"2026-09-04"}},"sourceFingerprint":"score-v1-ce47d18638b2cf0a","organization":"Vals AI","organizationId":"vals-ai","benchmark":"Vals Code Migration : réécrire un programme","benchmarkVersion":"1","resultUnit":"percent","resultDirection":"higher","scoring":"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.","allowedProtocolVariations":["effort","modelSetting"],"protocolVariationRationale":"Réglages par modèle publiés et conservés. La jointure exige version nominale et effort normalisé documentés ; tâches et dispositifs différents entre auteurs admis.","dependencyIds":[],"countableAtClose":true}],"referenceModelIds":["claude-opus-4-8","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","gpt-5-4","gpt-5-4-mini","gpt-5-5","inkling","luna","muse-spark-1-1","muse-spark-1-2","opus-5","sol","terra"],"observationIds":["astra-vals-code-migration","claude-haiku-4-5-vals-code-migration","claude-opus-4-6-livebench-coding","claude-opus-4-7-livebench-coding","claude-opus-4-7-vals-code-migration","claude-opus-4-8-livebench-coding","claude-opus-4-8-vals-code-migration","claude-sonnet-4-6-livebench-coding","claude-sonnet-4-6-vals-code-migration","claude-sonnet-5-livebench-coding","claude-sonnet-5-vals-code-migration","deepseek-v4-flash-0731-livebench-coding","deepseek-v4-flash-0731-vals-code-migration","deepseek-v4-flash-livebench-coding","deepseek-v4-flash-vision-exp-livebench-coding","deepseek-v4-pro-0813-livebench-coding","deepseek-v4-pro-0813-vals-code-migration","deepseek-v4-pro-livebench-coding","deepseek-v4-pro-vals-code-migration","fable-5-1-livebench-coding","fable-5-1-vals-code-migration","fable-5-livebench-coding","fable-5-vals-code-migration","gemini-3-1-flash-lite-preview-vals-code-migration","gemini-3-1-pro-preview-livebench-coding","gemini-3-1-pro-preview-vals-code-migration","gemini-3-5-flash-lite-livebench-coding","gemini-3-5-flash-lite-vals-code-migration","gemini-3-5-flash-livebench-coding","gemini-3-5-flash-vals-code-migration","gemini-3-6-flash-livebench-coding","gemini-3-6-flash-vals-code-migration","gemini-3-7-flash-livebench-coding","gemini-3-7-flash-vals-code-migration","gemini-3-8-flash-livebench-coding","gemini-3-8-flash-vals-code-migration","gemini-3-flash-preview-vals-code-migration","glm-5-1-vals-code-migration","glm-5-2-livebench-coding","glm-5-2-vals-code-migration","glm-5-3-flash-livebench-coding","glm-5-3-flash-vals-code-migration","glm-5-3-livebench-coding","glm-5-3-vals-code-migration","gpt-5-4-livebench-coding","gpt-5-4-mini-livebench-coding","gpt-5-4-mini-vals-code-migration","gpt-5-4-nano-livebench-coding","gpt-5-4-nano-vals-code-migration","gpt-5-4-vals-code-migration","gpt-5-5-livebench-coding","gpt-5-5-vals-code-migration","grok-4-20-0309-reasoning-vals-code-migration","grok-4-3-livebench-coding","grok-4-3-vals-code-migration","grok-4-5-livebench-coding","grok-4-5-vals-code-migration","grok-4-6-livebench-coding","grok-4-6-vals-code-migration","grok-build-0-1-livebench-coding","inkling-livebench-coding","inkling-small-vals-code-migration","inkling-vals-code-migration","kimi-k2-5-vals-code-migration","kimi-k2-6-livebench-coding","kimi-k2-6-vals-code-migration","kimi-k2-7-code-livebench-coding","kimi-k2-7-code-vals-code-migration","kimi-k3-livebench-coding","kimi-k3-vals-code-migration","ling-3-0-flash-2607-vals-code-migration","luna-livebench-coding","luna-vals-code-migration","mimo-v2-5-pro-vals-code-migration","mimo-v2-5-vals-code-migration","minimax-m2-7-vals-code-migration","minimax-m3-livebench-coding","minimax-m3-vals-code-migration","mistral-medium-3-5-vals-code-migration","muse-spark-1-1-livebench-coding","muse-spark-1-1-vals-code-migration","muse-spark-1-2-livebench-coding","muse-spark-1-2-vals-code-migration","muse-spark-1-3-livebench-coding","nemotron-3-ultra-livebench-coding","nemotron-3-ultra-vals-code-migration","nemotron-lightning-3-5-vals-code-migration","opus-5-livebench-coding","opus-5-vals-code-migration","qwen3-6-27b-livebench-coding","qwen3-6-plus-livebench-coding","qwen3-6-plus-vals-code-migration","qwen3-7-max-livebench-coding","qwen3-7-max-vals-code-migration","qwen3-7-plus-vals-code-migration","qwen3-8-27b-livebench-coding","qwen3-8-27b-vals-code-migration","qwen3-8-flash-next-livebench-coding","qwen3-8-max-livebench-coding","qwen3-8-max-vals-code-migration","smaug-agentic-livebench-coding","sol-livebench-coding","sol-vals-code-migration","terra-livebench-coding","terra-vals-code-migration"],"observationSelectionPolicy":"unique-cell-or-explicit-observation-id","snapshot":"[{\"id\":\"astra-vals-code-migration\",\"modelId\":\"astra\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"openai/gpt-6-astra\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"max\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"OpenAI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":67.74,\"display\":\"67,74 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.216,\"display\":\"Erreur standard publiée : 4,216 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Aucune mesure LiveBench code pour cette version dans le registre.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"claude-haiku-4-5-vals-code-migration\",\"modelId\":\"claude-haiku-4-5\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"anthropic/claude-haiku-4-5-20251001-thinking\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":64000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Anthropic\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":7.551,\"display\":\"7,551 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":1.056,\"display\":\"Erreur standard publiée : 1,056 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Aucune mesure LiveBench code pour cette version dans le registre.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"claude-opus-4-6-livebench-coding\",\"modelId\":\"claude-opus-4-6\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"claude-opus-4-6-thinking-auto-high-effort\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"78,2 %\",\"value\":78.1845,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : claude-opus-4-6-thinking-auto-high-effort\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"claude-opus-4-7-livebench-coding\",\"modelId\":\"claude-opus-4-7\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"claude-opus-4-7-xhigh-effort\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"82,1 %\",\"value\":82.088,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : claude-opus-4-7-xhigh-effort\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"claude-opus-4-7-vals-code-migration\",\"modelId\":\"claude-opus-4-7\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"anthropic/claude-opus-4-7\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":\\\"max\\\",\\\"verbosity\\\":null,\\\"provider\\\":\\\"Anthropic\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":43.878,\"display\":\"43,878 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.22,\"display\":\"Erreur standard publiée : 4,22 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Efforts différents entre Vals et LiveBench.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"compute_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"claude-opus-4-8-livebench-coding\",\"modelId\":\"claude-opus-4-8\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"claude-opus-4-8-max-effort\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"81,8 %\",\"value\":81.828,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"claude-opus-4-8\",\"effort\":\"max\",\"modelSetting\":\"claude-opus-4-8-max-effort\",\"effortSetting\":\"Réglage publié : claude-opus-4-8-max-effort\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : claude-opus-4-8-max-effort\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"claude-opus-4-8-vals-code-migration\",\"modelId\":\"claude-opus-4-8\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"anthropic/claude-opus-4-8\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":\\\"max\\\",\\\"verbosity\\\":null,\\\"provider\\\":\\\"Anthropic\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":47.25,\"display\":\"47,25 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.176,\"display\":\"Erreur standard publiée : 4,176 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"claude-opus-4-8\",\"effort\":\"max\",\"evidenceUrl\":\"https://www.vals.ai/benchmarks/code-migration\",\"modelSetting\":\"{\\\"id\\\":\\\"anthropic/claude-opus-4-8\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":\\\"max\\\",\\\"verbosity\\\":null,\\\"provider\\\":\\\"Anthropic\\\",\\\"harness\\\":null}\",\"effortSetting\":\"compute_effort publié : max\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"compute_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"claude-sonnet-4-6-livebench-coding\",\"modelId\":\"claude-sonnet-4-6\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"claude-sonnet-4-6-thinking-auto-medium-effort\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"79,3 %\",\"value\":79.2715,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : claude-sonnet-4-6-thinking-auto-medium-effort\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"claude-sonnet-4-6-vals-code-migration\",\"modelId\":\"claude-sonnet-4-6\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"anthropic/claude-sonnet-4-6\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":true,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":\\\"max\\\",\\\"verbosity\\\":null,\\\"provider\\\":\\\"Anthropic\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":39.892,\"display\":\"39,892 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.138,\"display\":\"Erreur standard publiée : 4,138 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Efforts différents entre Vals et LiveBench.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"compute_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"claude-sonnet-5-livebench-coding\",\"modelId\":\"claude-sonnet-5\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"claude-sonnet-5-xhigh-effort\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"80,7 %\",\"value\":80.68,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : claude-sonnet-5-xhigh-effort\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"claude-sonnet-5-vals-code-migration\",\"modelId\":\"claude-sonnet-5\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"anthropic/claude-sonnet-5\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":\\\"max\\\",\\\"verbosity\\\":null,\\\"provider\\\":\\\"Anthropic\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":44.392,\"display\":\"44,392 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.246,\"display\":\"Erreur standard publiée : 4,246 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Efforts différents entre Vals et LiveBench.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"compute_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"deepseek-v4-flash-0731-livebench-coding\",\"modelId\":\"deepseek-v4-flash-0731\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"deepseek-v4-flash-0731\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"75,0 %\",\"value\":74.9845,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : deepseek-v4-flash-0731\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"deepseek-v4-flash-0731-vals-code-migration\",\"modelId\":\"deepseek-v4-flash-0731\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"deepseek/deepseek-v4-flash-0731\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":384000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"DeepSeek\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":38.631,\"display\":\"38,631 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.382,\"display\":\"Erreur standard publiée : 4,382 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : high\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"deepseek-v4-flash-livebench-coding\",\"modelId\":\"deepseek-v4-flash\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"deepseek-v4-flash\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"69,2 %\",\"value\":69.228,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : deepseek-v4-flash\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"deepseek-v4-flash-vision-exp-livebench-coding\",\"modelId\":\"deepseek-v4-flash-vision-exp\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"deepseek-v4-flash-vision-exp\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"68,2 %\",\"value\":68.2025,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : deepseek-v4-flash-vision-exp\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"deepseek-v4-pro-0813-livebench-coding\",\"modelId\":\"deepseek-v4-pro-0813\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"deepseek-v4-pro-0813\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"77,2 %\",\"value\":77.1585,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : deepseek-v4-pro-0813\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"deepseek-v4-pro-0813-vals-code-migration\",\"modelId\":\"deepseek-v4-pro-0813\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"deepseek/deepseek-v4-pro-0813\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":384000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"max\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"DeepSeek\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":41.54,\"display\":\"41,54 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.301,\"display\":\"Erreur standard publiée : 4,301 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"deepseek-v4-pro-livebench-coding\",\"modelId\":\"deepseek-v4-pro\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"deepseek-v4-pro\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"70,0 %\",\"value\":69.994,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : deepseek-v4-pro\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"deepseek-v4-pro-vals-code-migration\",\"modelId\":\"deepseek-v4-pro\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"deepseek/deepseek-v4-pro\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":384000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"max\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"DeepSeek\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":26.201,\"display\":\"26,201 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.037,\"display\":\"Erreur standard publiée : 4,037 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"fable-5-1-livebench-coding\",\"modelId\":\"fable-5-1\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"claude-fable-5-1-max-effort\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"86,4 %\",\"value\":86.375,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : claude-fable-5-1-max-effort\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"fable-5-1-vals-code-migration\",\"modelId\":\"fable-5-1\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"anthropic/claude-fable-5-1\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":\\\"max\\\",\\\"verbosity\\\":null,\\\"provider\\\":\\\"Anthropic\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":54.607,\"display\":\"54,607 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.812,\"display\":\"Erreur standard publiée : 4,812 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Politique de repli non documentée entre les évaluateurs.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"compute_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"fable-5-livebench-coding\",\"modelId\":\"fable-5\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"claude-fable-5-max-effort\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"86,0 %\",\"value\":85.992,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : claude-fable-5-max-effort\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"fable-5-vals-code-migration\",\"modelId\":\"fable-5\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"anthropic/claude-fable-5\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":\\\"max\\\",\\\"verbosity\\\":null,\\\"provider\\\":\\\"Anthropic\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":55.065,\"display\":\"55,065 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.605,\"display\":\"Erreur standard publiée : 4,605 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Politique de repli non documentée entre les évaluateurs.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"compute_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gemini-3-1-flash-lite-preview-vals-code-migration\",\"modelId\":\"gemini-3-1-flash-lite-preview\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"google/gemini-3.1-flash-lite-preview\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Google\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":4.609,\"display\":\"4,609 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":1.069,\"display\":\"Erreur standard publiée : 1,069 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Disponibilité de cette version non vérifiée ; mesure historique conservée.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : high\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gemini-3-1-pro-preview-livebench-coding\",\"modelId\":\"gemini-3-1-pro-preview\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"gemini-3.1-pro-preview-high\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"76,5 %\",\"value\":76.4545,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"gemini-3-1-pro-preview\",\"effort\":\"high\",\"modelSetting\":\"gemini-3.1-pro-preview-high\",\"effortSetting\":\"Réglage publié : gemini-3.1-pro-preview-high\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : gemini-3.1-pro-preview-high\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gemini-3-1-pro-preview-vals-code-migration\",\"modelId\":\"gemini-3-1-pro-preview\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"google/gemini-3.1-pro-preview\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Google\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":17.313,\"display\":\"17,313 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":3.933,\"display\":\"Erreur standard publiée : 3,933 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"gemini-3-1-pro-preview\",\"effort\":\"high\",\"evidenceUrl\":\"https://www.vals.ai/benchmarks/code-migration\",\"modelSetting\":\"{\\\"id\\\":\\\"google/gemini-3.1-pro-preview\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Google\\\",\\\"harness\\\":null}\",\"effortSetting\":\"reasoning_effort publié : high\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : high\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gemini-3-5-flash-lite-livebench-coding\",\"modelId\":\"gemini-3-5-flash-lite\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"gemini-3.5-flash-lite-high\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"76,1 %\",\"value\":76.0715,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"gemini-3-5-flash-lite\",\"effort\":\"high\",\"modelSetting\":\"gemini-3.5-flash-lite-high\",\"effortSetting\":\"Réglage publié : gemini-3.5-flash-lite-high\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : gemini-3.5-flash-lite-high\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gemini-3-5-flash-lite-vals-code-migration\",\"modelId\":\"gemini-3-5-flash-lite\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"google/gemini-3.5-flash-lite\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Google\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":6.148,\"display\":\"6,148 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":1.708,\"display\":\"Erreur standard publiée : 1,708 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"gemini-3-5-flash-lite\",\"effort\":\"high\",\"evidenceUrl\":\"https://www.vals.ai/benchmarks/code-migration\",\"modelSetting\":\"{\\\"id\\\":\\\"google/gemini-3.5-flash-lite\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Google\\\",\\\"harness\\\":null}\",\"effortSetting\":\"reasoning_effort publié : high\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : high\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gemini-3-5-flash-livebench-coding\",\"modelId\":\"gemini-3-5-flash\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"gemini-3.5-flash-high\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"78,2 %\",\"value\":78.1845,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"gemini-3-5-flash\",\"effort\":\"high\",\"modelSetting\":\"gemini-3.5-flash-high\",\"effortSetting\":\"Réglage publié : gemini-3.5-flash-high\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : gemini-3.5-flash-high\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gemini-3-5-flash-vals-code-migration\",\"modelId\":\"gemini-3-5-flash\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"google/gemini-3.5-flash\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Google\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":26.745,\"display\":\"26,745 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.104,\"display\":\"Erreur standard publiée : 4,104 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"gemini-3-5-flash\",\"effort\":\"high\",\"evidenceUrl\":\"https://www.vals.ai/benchmarks/code-migration\",\"modelSetting\":\"{\\\"id\\\":\\\"google/gemini-3.5-flash\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Google\\\",\\\"harness\\\":null}\",\"effortSetting\":\"reasoning_effort publié : high\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : high\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gemini-3-6-flash-livebench-coding\",\"modelId\":\"gemini-3-6-flash\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"gemini-3.6-flash-high\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"77,9 %\",\"value\":77.863,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"gemini-3-6-flash\",\"effort\":\"high\",\"modelSetting\":\"gemini-3.6-flash-high\",\"effortSetting\":\"Réglage publié : gemini-3.6-flash-high\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : gemini-3.6-flash-high\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gemini-3-6-flash-vals-code-migration\",\"modelId\":\"gemini-3-6-flash\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"google/gemini-3.6-flash\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Google\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":30.928,\"display\":\"30,928 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.068,\"display\":\"Erreur standard publiée : 4,068 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"gemini-3-6-flash\",\"effort\":\"high\",\"evidenceUrl\":\"https://www.vals.ai/benchmarks/code-migration\",\"modelSetting\":\"{\\\"id\\\":\\\"google/gemini-3.6-flash\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Google\\\",\\\"harness\\\":null}\",\"effortSetting\":\"reasoning_effort publié : high\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : high\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gemini-3-7-flash-livebench-coding\",\"modelId\":\"gemini-3-7-flash\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"gemini-3.7-flash-high\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"78,9 %\",\"value\":78.8885,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"gemini-3-7-flash\",\"effort\":\"high\",\"modelSetting\":\"gemini-3.7-flash-high\",\"effortSetting\":\"Réglage publié : gemini-3.7-flash-high\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : gemini-3.7-flash-high\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gemini-3-7-flash-vals-code-migration\",\"modelId\":\"gemini-3-7-flash\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"google/gemini-3.7-flash\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Google\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":34.8,\"display\":\"34,8 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.225,\"display\":\"Erreur standard publiée : 4,225 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"gemini-3-7-flash\",\"effort\":\"high\",\"evidenceUrl\":\"https://www.vals.ai/benchmarks/code-migration\",\"modelSetting\":\"{\\\"id\\\":\\\"google/gemini-3.7-flash\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Google\\\",\\\"harness\\\":null}\",\"effortSetting\":\"reasoning_effort publié : high\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : high\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gemini-3-8-flash-livebench-coding\",\"modelId\":\"gemini-3-8-flash\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"gemini-3.8-flash-high\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"72,5 %\",\"value\":72.489,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"gemini-3-8-flash\",\"effort\":\"high\",\"modelSetting\":\"gemini-3.8-flash-high\",\"effortSetting\":\"Réglage publié : gemini-3.8-flash-high\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : gemini-3.8-flash-high\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gemini-3-8-flash-vals-code-migration\",\"modelId\":\"gemini-3-8-flash\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"google/gemini-3.8-flash\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Google\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":36.546,\"display\":\"36,546 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.184,\"display\":\"Erreur standard publiée : 4,184 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"gemini-3-8-flash\",\"effort\":\"high\",\"evidenceUrl\":\"https://www.vals.ai/benchmarks/code-migration\",\"modelSetting\":\"{\\\"id\\\":\\\"google/gemini-3.8-flash\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Google\\\",\\\"harness\\\":null}\",\"effortSetting\":\"reasoning_effort publié : high\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : high\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gemini-3-flash-preview-vals-code-migration\",\"modelId\":\"gemini-3-flash-preview\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"google/gemini-3-flash-preview\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Google\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":6.391,\"display\":\"6,391 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":1.093,\"display\":\"Erreur standard publiée : 1,093 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Aucune mesure LiveBench code pour cette version dans le registre.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : high\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"glm-5-1-vals-code-migration\",\"modelId\":\"glm-5-1\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"zai/glm-5.1\\\",\\\"temperature\\\":1,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":131072,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Zhipu AI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":25.768,\"display\":\"25,768 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.087,\"display\":\"Erreur standard publiée : 4,087 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Aucune mesure LiveBench code pour cette version dans le registre.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"glm-5-2-livebench-coding\",\"modelId\":\"glm-5-2\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"glm-5.2\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"79,7 %\",\"value\":79.654,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : glm-5.2\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"glm-5-2-vals-code-migration\",\"modelId\":\"glm-5-2\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"zai/glm-5.2\\\",\\\"temperature\\\":1,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":131072,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"max\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Zhipu AI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":37.87,\"display\":\"37,87 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.143,\"display\":\"Erreur standard publiée : 4,143 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"glm-5-3-flash-livebench-coding\",\"modelId\":\"glm-5-3-flash\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"glm-5.3-flash\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"79,0 %\",\"value\":78.95,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : glm-5.3-flash\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"glm-5-3-flash-vals-code-migration\",\"modelId\":\"glm-5-3-flash\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"zai/glm-5.3-flash\\\",\\\"temperature\\\":1,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"max\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Zhipu AI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":20.515,\"display\":\"20,515 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.207,\"display\":\"Erreur standard publiée : 4,207 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"glm-5-3-livebench-coding\",\"modelId\":\"glm-5-3\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"glm-5.3\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"79,0 %\",\"value\":78.95,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : glm-5.3\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"glm-5-3-vals-code-migration\",\"modelId\":\"glm-5-3\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"zai/glm-5.3\\\",\\\"temperature\\\":1,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"max\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Zhipu AI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":44.222,\"display\":\"44,222 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.289,\"display\":\"Erreur standard publiée : 4,289 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gpt-5-4-livebench-coding\",\"modelId\":\"gpt-5-4\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"gpt-5.4-xhigh\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"77,5 %\",\"value\":77.5415,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"gpt-5.4-2026-03-05\",\"effort\":\"xhigh\",\"modelSetting\":\"gpt-5.4-xhigh\",\"effortSetting\":\"Réglage publié : gpt-5.4-xhigh\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : gpt-5.4-xhigh\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gpt-5-4-mini-livebench-coding\",\"modelId\":\"gpt-5-4-mini\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"gpt-5.4-mini-xhigh\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"71,6 %\",\"value\":71.624,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"gpt-5.4-mini-2026-03-17\",\"effort\":\"xhigh\",\"modelSetting\":\"gpt-5.4-mini-xhigh\",\"effortSetting\":\"Réglage publié : gpt-5.4-mini-xhigh\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : gpt-5.4-mini-xhigh\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gpt-5-4-mini-vals-code-migration\",\"modelId\":\"gpt-5-4-mini\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"openai/gpt-5.4-mini-2026-03-17\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"xhigh\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"OpenAI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":12.936,\"display\":\"12,936 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":3.641,\"display\":\"Erreur standard publiée : 3,641 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"gpt-5.4-mini-2026-03-17\",\"effort\":\"xhigh\",\"evidenceUrl\":\"https://www.vals.ai/benchmarks/code-migration\",\"modelSetting\":\"{\\\"id\\\":\\\"openai/gpt-5.4-mini-2026-03-17\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"xhigh\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"OpenAI\\\",\\\"harness\\\":null}\",\"effortSetting\":\"reasoning_effort publié : xhigh\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : xhigh\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gpt-5-4-nano-livebench-coding\",\"modelId\":\"gpt-5-4-nano\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"gpt-5.4-nano-xhigh\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"70,8 %\",\"value\":70.8385,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : gpt-5.4-nano-xhigh\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gpt-5-4-nano-vals-code-migration\",\"modelId\":\"gpt-5-4-nano\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"openai/gpt-5.4-nano-2026-03-17\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"OpenAI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":14.467,\"display\":\"14,467 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.025,\"display\":\"Erreur standard publiée : 4,025 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Efforts différents entre Vals et LiveBench.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : high\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gpt-5-4-vals-code-migration\",\"modelId\":\"gpt-5-4\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"openai/gpt-5.4-2026-03-05\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"xhigh\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"OpenAI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":34.984,\"display\":\"34,984 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.113,\"display\":\"Erreur standard publiée : 4,113 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"gpt-5.4-2026-03-05\",\"effort\":\"xhigh\",\"evidenceUrl\":\"https://www.vals.ai/benchmarks/code-migration\",\"modelSetting\":\"{\\\"id\\\":\\\"openai/gpt-5.4-2026-03-05\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"xhigh\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"OpenAI\\\",\\\"harness\\\":null}\",\"effortSetting\":\"reasoning_effort publié : xhigh\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : xhigh\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gpt-5-5-livebench-coding\",\"modelId\":\"gpt-5-5\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"gpt-5.5-xhigh\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"82,1 %\",\"value\":82.1495,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"gpt-5-5\",\"effort\":\"xhigh\",\"modelSetting\":\"gpt-5.5-xhigh\",\"effortSetting\":\"Réglage publié : gpt-5.5-xhigh\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : gpt-5.5-xhigh\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"gpt-5-5-vals-code-migration\",\"modelId\":\"gpt-5-5\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"openai/gpt-5.5\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"xhigh\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"OpenAI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":45.161,\"display\":\"45,161 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.164,\"display\":\"Erreur standard publiée : 4,164 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"gpt-5-5\",\"effort\":\"xhigh\",\"evidenceUrl\":\"https://www.vals.ai/benchmarks/code-migration\",\"modelSetting\":\"{\\\"id\\\":\\\"openai/gpt-5.5\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"xhigh\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"OpenAI\\\",\\\"harness\\\":null}\",\"effortSetting\":\"reasoning_effort publié : xhigh\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : xhigh\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"grok-4-20-0309-reasoning-vals-code-migration\",\"modelId\":\"grok-4-20-0309-reasoning\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"grok/grok-4.20-0309-reasoning\\\",\\\"temperature\\\":0.7,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":2000000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"SpaceXAI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":0.314,\"display\":\"0,314 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":0.11,\"display\":\"Erreur standard publiée : 0,11 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Aucune mesure LiveBench code pour cette version dans le registre.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"grok-4-3-livebench-coding\",\"modelId\":\"grok-4-3\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"grok-4.3\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"69,9 %\",\"value\":69.9325,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : grok-4.3\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"grok-4-3-vals-code-migration\",\"modelId\":\"grok-4-3\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"grok/grok-4.3\\\",\\\"temperature\\\":0.7,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":null,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"SpaceXAI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":6.795,\"display\":\"6,795 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":1.195,\"display\":\"Erreur standard publiée : 1,195 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : high\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"grok-4-5-livebench-coding\",\"modelId\":\"grok-4-5\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"grok-4.5\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"68,6 %\",\"value\":68.5855,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : grok-4.5\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"grok-4-5-vals-code-migration\",\"modelId\":\"grok-4-5\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"grok/grok-4.5\\\",\\\"temperature\\\":0.7,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":null,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"SpaceXAI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":36.596,\"display\":\"36,596 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.141,\"display\":\"Erreur standard publiée : 4,141 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : high\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"grok-4-6-livebench-coding\",\"modelId\":\"grok-4-6\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"grok-4.6\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"76,8 %\",\"value\":76.776,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : grok-4.6\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"grok-4-6-vals-code-migration\",\"modelId\":\"grok-4-6\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"grok/grok-4.6\\\",\\\"temperature\\\":0.7,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":null,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"SpaceXAI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":44.572,\"display\":\"44,572 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.479,\"display\":\"Erreur standard publiée : 4,479 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : high\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"grok-build-0-1-livebench-coding\",\"modelId\":\"grok-build-0-1\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"grok-build-0.1\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"65,4 %\",\"value\":65.3855,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : grok-build-0.1\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"inkling-livebench-coding\",\"modelId\":\"inkling\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"inkling-xhigh\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"71,0 %\",\"value\":71.0195,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"inkling\",\"effort\":\"xhigh\",\"modelSetting\":\"inkling-xhigh\",\"effortSetting\":\"Réglage publié : inkling-xhigh\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : inkling-xhigh\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"inkling-small-vals-code-migration\",\"modelId\":\"inkling-small\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"thinkingmachines/inkling-small\\\",\\\"temperature\\\":1,\\\"top_p\\\":1,\\\"max_output_tokens\\\":262000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"0.99\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Thinkingmachines\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":13.675,\"display\":\"13,675 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":3.81,\"display\":\"Erreur standard publiée : 3,81 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Aucune mesure LiveBench code pour cette version dans le registre.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : 0.99\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"inkling-vals-code-migration\",\"modelId\":\"inkling\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"thinkingmachines/inkling\\\",\\\"temperature\\\":1,\\\"top_p\\\":1,\\\"max_output_tokens\\\":256000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"0.99\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Thinkingmachines\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":11.79,\"display\":\"11,79 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":3.396,\"display\":\"Erreur standard publiée : 3,396 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"inkling\",\"effort\":\"xhigh\",\"evidenceUrl\":\"https://tinker-docs.thinkingmachines.ai/cookbook/inkling/thinking-effort/\",\"modelSetting\":\"{\\\"id\\\":\\\"thinkingmachines/inkling\\\",\\\"temperature\\\":1,\\\"top_p\\\":1,\\\"max_output_tokens\\\":256000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"0.99\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Thinkingmachines\\\",\\\"harness\\\":null}\",\"effortSetting\":\"reasoning_effort publié : 0.99 ; xhigh = 0,99 selon Tinker.\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : 0.99 ; xhigh = 0,99 selon Tinker.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"kimi-k2-5-vals-code-migration\",\"modelId\":\"kimi-k2-5\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"kimi/kimi-k2.5-thinking\\\",\\\"temperature\\\":null,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Moonshot AI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":6.962,\"display\":\"6,962 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":1.29,\"display\":\"Erreur standard publiée : 1,29 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Aucune mesure LiveBench code pour cette version dans le registre.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"kimi-k2-6-livebench-coding\",\"modelId\":\"kimi-k2-6\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"kimi-k2.6-thinking\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"78,6 %\",\"value\":78.567,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : kimi-k2.6-thinking\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"kimi-k2-6-vals-code-migration\",\"modelId\":\"kimi-k2-6\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"kimi/kimi-k2.6\\\",\\\"temperature\\\":null,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Moonshot AI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":27.768,\"display\":\"27,768 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.144,\"display\":\"Erreur standard publiée : 4,144 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"kimi-k2-7-code-livebench-coding\",\"modelId\":\"kimi-k2-7-code\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"kimi-k2.7-code\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"74,0 %\",\"value\":73.959,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : kimi-k2.7-code\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"kimi-k2-7-code-vals-code-migration\",\"modelId\":\"kimi-k2-7-code\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"kimi/kimi-k2.7-code\\\",\\\"temperature\\\":null,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":32768,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Moonshot AI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":25.392,\"display\":\"25,392 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.161,\"display\":\"Erreur standard publiée : 4,161 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"kimi-k3-livebench-coding\",\"modelId\":\"kimi-k3\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"kimi-k3\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"81,4 %\",\"value\":81.4455,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : kimi-k3\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"kimi-k3-vals-code-migration\",\"modelId\":\"kimi-k3\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"kimi/kimi-k3\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":262144,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"max\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Moonshot AI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":16.099,\"display\":\"16,099 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.101,\"display\":\"Erreur standard publiée : 4,101 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"ling-3-0-flash-2607-vals-code-migration\",\"modelId\":\"ling-3-0-flash-2607\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"ant/ling-3.0-flash-2607\\\",\\\"temperature\\\":0.6,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":131072,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Ant\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":0,\"display\":\"0 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":0,\"display\":\"Erreur standard publiée : 0 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Disponibilité de cette version non vérifiée ; mesure historique conservée.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"luna-livebench-coding\",\"modelId\":\"luna\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"gpt-5.6-luna-max\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"82,9 %\",\"value\":82.915,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"luna\",\"effort\":\"max\",\"modelSetting\":\"gpt-5.6-luna-max\",\"effortSetting\":\"Réglage publié : gpt-5.6-luna-max\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : gpt-5.6-luna-max\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"luna-vals-code-migration\",\"modelId\":\"luna\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"openai/gpt-5.6-luna\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"max\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"OpenAI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":44.55,\"display\":\"44,55 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.244,\"display\":\"Erreur standard publiée : 4,244 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"luna\",\"effort\":\"max\",\"evidenceUrl\":\"https://www.vals.ai/benchmarks/code-migration\",\"modelSetting\":\"{\\\"id\\\":\\\"openai/gpt-5.6-luna\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"max\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"OpenAI\\\",\\\"harness\\\":null}\",\"effortSetting\":\"reasoning_effort publié : max\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"mimo-v2-5-pro-vals-code-migration\",\"modelId\":\"mimo-v2-5-pro\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"xiaomi/mimo-v2.5-pro\\\",\\\"temperature\\\":1,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Xiaomi\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":21.557,\"display\":\"21,557 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.127,\"display\":\"Erreur standard publiée : 4,127 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Aucune mesure LiveBench code pour cette version dans le registre.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"mimo-v2-5-vals-code-migration\",\"modelId\":\"mimo-v2-5\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"xiaomi/mimo-v2.5\\\",\\\"temperature\\\":1,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Xiaomi\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":14.228,\"display\":\"14,228 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":3.687,\"display\":\"Erreur standard publiée : 3,687 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Aucune mesure LiveBench code pour cette version dans le registre.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"minimax-m2-7-vals-code-migration\",\"modelId\":\"minimax-m2-7\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"minimax/MiniMax-M2.7\\\",\\\"temperature\\\":1,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":80000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"MiniMax\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":8.685,\"display\":\"8,685 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":1.786,\"display\":\"Erreur standard publiée : 1,786 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Aucune mesure LiveBench code pour cette version dans le registre.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"minimax-m3-livebench-coding\",\"modelId\":\"minimax-m3\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"minimax-m3\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"68,2 %\",\"value\":68.2025,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : minimax-m3\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"minimax-m3-vals-code-migration\",\"modelId\":\"minimax-m3\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"minimax/MiniMax-M3\\\",\\\"temperature\\\":1,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":512000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"MiniMax\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":19.925,\"display\":\"19,925 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":3.944,\"display\":\"Erreur standard publiée : 3,944 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"mistral-medium-3-5-vals-code-migration\",\"modelId\":\"mistral-medium-3-5\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"mistralai/mistral-medium-3.5\\\",\\\"temperature\\\":0.7,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":80000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"high\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Mistral AI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":5.127,\"display\":\"5,127 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":1.369,\"display\":\"Erreur standard publiée : 1,369 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Aucune mesure LiveBench code pour cette version dans le registre.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : high\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"muse-spark-1-1-livebench-coding\",\"modelId\":\"muse-spark-1-1\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"muse-spark-1.1-xhigh\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"77,2 %\",\"value\":77.1585,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"muse-spark-1-1\",\"effort\":\"xhigh\",\"modelSetting\":\"muse-spark-1.1-xhigh\",\"effortSetting\":\"Réglage publié : muse-spark-1.1-xhigh\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : muse-spark-1.1-xhigh\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"muse-spark-1-1-vals-code-migration\",\"modelId\":\"muse-spark-1-1\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"meta/muse_spark_1_1\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":256000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"xhigh\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Meta\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":31.115,\"display\":\"31,115 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.068,\"display\":\"Erreur standard publiée : 4,068 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"muse-spark-1-1\",\"effort\":\"xhigh\",\"evidenceUrl\":\"https://www.vals.ai/benchmarks/code-migration\",\"modelSetting\":\"{\\\"id\\\":\\\"meta/muse_spark_1_1\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":256000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"xhigh\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Meta\\\",\\\"harness\\\":null}\",\"effortSetting\":\"reasoning_effort publié : xhigh\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : xhigh\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"muse-spark-1-2-livebench-coding\",\"modelId\":\"muse-spark-1-2\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"muse-spark-1.2-xhigh\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"77,5 %\",\"value\":77.5415,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"muse-spark-1-2\",\"effort\":\"xhigh\",\"modelSetting\":\"muse-spark-1.2-xhigh\",\"effortSetting\":\"Réglage publié : muse-spark-1.2-xhigh\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : muse-spark-1.2-xhigh\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"muse-spark-1-2-vals-code-migration\",\"modelId\":\"muse-spark-1-2\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"meta/muse_spark_1_2\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":131072,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"xhigh\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Meta\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":29.954,\"display\":\"29,954 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.023,\"display\":\"Erreur standard publiée : 4,023 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"muse-spark-1-2\",\"effort\":\"xhigh\",\"evidenceUrl\":\"https://www.vals.ai/benchmarks/code-migration\",\"modelSetting\":\"{\\\"id\\\":\\\"meta/muse_spark_1_2\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":131072,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"xhigh\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Meta\\\",\\\"harness\\\":null}\",\"effortSetting\":\"reasoning_effort publié : xhigh\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : xhigh\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"muse-spark-1-3-livebench-coding\",\"modelId\":\"muse-spark-1-3\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"muse-spark-1.3-xhigh\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"81,1 %\",\"value\":81.0625,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : muse-spark-1.3-xhigh\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"nemotron-3-ultra-livebench-coding\",\"modelId\":\"nemotron-3-ultra\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"nemotron-3-ultra-550b-a55b\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"70,7 %\",\"value\":70.698,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : nemotron-3-ultra-550b-a55b\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"nemotron-3-ultra-vals-code-migration\",\"modelId\":\"nemotron-3-ultra\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"nvidia/nemotron-3-ultra-550b-a55b\\\",\\\"temperature\\\":null,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Nvidia\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":4.905,\"display\":\"4,905 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":1.589,\"display\":\"Erreur standard publiée : 1,589 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"nemotron-lightning-3-5-vals-code-migration\",\"modelId\":\"nemotron-lightning-3-5\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"fireworks/nemotron-lightning-3p5-30b-a3b\\\",\\\"temperature\\\":1,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":131072,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Fireworks AI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":2.951,\"display\":\"2,951 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":0.951,\"display\":\"Erreur standard publiée : 0,951 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Aucune mesure LiveBench code pour cette version dans le registre.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"opus-5-livebench-coding\",\"modelId\":\"opus-5\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"claude-opus-5-max-effort\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"81,4 %\",\"value\":81.4455,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"opus-5\",\"effort\":\"max\",\"modelSetting\":\"claude-opus-5-max-effort\",\"effortSetting\":\"Réglage publié : claude-opus-5-max-effort\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : claude-opus-5-max-effort\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"opus-5-vals-code-migration\",\"modelId\":\"opus-5\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"anthropic/claude-opus-5\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":\\\"max\\\",\\\"verbosity\\\":null,\\\"provider\\\":\\\"Anthropic\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":57.473,\"display\":\"57,473 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.371,\"display\":\"Erreur standard publiée : 4,371 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"opus-5\",\"effort\":\"max\",\"evidenceUrl\":\"https://www.vals.ai/benchmarks/code-migration\",\"modelSetting\":\"{\\\"id\\\":\\\"anthropic/claude-opus-5\\\",\\\"temperature\\\":1,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":\\\"max\\\",\\\"verbosity\\\":null,\\\"provider\\\":\\\"Anthropic\\\",\\\"harness\\\":null}\",\"effortSetting\":\"compute_effort publié : max\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"compute_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"qwen3-6-27b-livebench-coding\",\"modelId\":\"qwen3-6-27b\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"qwen3.6-27b\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"71,8 %\",\"value\":71.785,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : qwen3.6-27b\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"qwen3-6-plus-livebench-coding\",\"modelId\":\"qwen3-6-plus\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"qwen3.6-plus\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"78,2 %\",\"value\":78.1845,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : qwen3.6-plus\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"qwen3-6-plus-vals-code-migration\",\"modelId\":\"qwen3-6-plus\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"alibaba/qwen3.6-plus\\\",\\\"temperature\\\":0.7,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Alibaba\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":11.102,\"display\":\"11,102 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":1.312,\"display\":\"Erreur standard publiée : 1,312 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"qwen3-7-max-livebench-coding\",\"modelId\":\"qwen3-7-max\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"qwen3.7-max\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"74,2 %\",\"value\":74.219,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : qwen3.7-max\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"qwen3-7-max-vals-code-migration\",\"modelId\":\"qwen3-7-max\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"alibaba/qwen3.7-max\\\",\\\"temperature\\\":0.7,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Alibaba\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":13.069,\"display\":\"13,069 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":2.858,\"display\":\"Erreur standard publiée : 2,858 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"qwen3-7-plus-vals-code-migration\",\"modelId\":\"qwen3-7-plus\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"alibaba/qwen3.7-plus\\\",\\\"temperature\\\":0.7,\\\"top_p\\\":null,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Alibaba\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":12.856,\"display\":\"12,856 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":2.931,\"display\":\"Erreur standard publiée : 2,931 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Aucune mesure LiveBench code pour cette version dans le registre.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"qwen3-8-27b-livebench-coding\",\"modelId\":\"qwen3-8-27b\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"qwen3.8-27b\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"75,7 %\",\"value\":75.689,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : qwen3.8-27b\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"qwen3-8-27b-vals-code-migration\",\"modelId\":\"qwen3-8-27b\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"alibaba/qwen3.8-27b\\\",\\\"temperature\\\":1,\\\"top_p\\\":0.95,\\\"max_output_tokens\\\":65536,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"xhigh\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Alibaba\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":14.157,\"display\":\"14,157 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.189,\"display\":\"Erreur standard publiée : 4,189 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : xhigh\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"qwen3-8-flash-next-livebench-coding\",\"modelId\":\"qwen3-8-flash-next\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"qwen3.8-flash-next\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"72,6 %\",\"value\":72.5505,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : qwen3.8-flash-next\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"qwen3-8-max-livebench-coding\",\"modelId\":\"qwen3-8-max\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"qwen3.8-max\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"72,9 %\",\"value\":72.872,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : qwen3.8-max\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"qwen3-8-max-vals-code-migration\",\"modelId\":\"qwen3-8-max\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"alibaba/qwen3.8-max\\\",\\\"temperature\\\":0.7,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":null,\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"Alibaba\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":23.958,\"display\":\"23,958 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.309,\"display\":\"Erreur standard publiée : 4,309 points. Pas un intervalle de confiance.\"}},\"crossSourceExclusion\":\"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.\",\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"Non publié ; aucune valeur par défaut supposée.\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"smaug-agentic-livebench-coding\",\"modelId\":\"smaug-agentic\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"smaug-agentic\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"82,5 %\",\"value\":82.471,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : smaug-agentic\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"sol-livebench-coding\",\"modelId\":\"sol\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"gpt-5.6-sol-max\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"83,9 %\",\"value\":83.941,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"sol\",\"effort\":\"max\",\"modelSetting\":\"gpt-5.6-sol-max\",\"effortSetting\":\"Réglage publié : gpt-5.6-sol-max\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : gpt-5.6-sol-max\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"sol-vals-code-migration\",\"modelId\":\"sol\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"openai/gpt-5.6-sol\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"max\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"OpenAI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":52.916,\"display\":\"52,916 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.353,\"display\":\"Erreur standard publiée : 4,353 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"sol\",\"effort\":\"max\",\"evidenceUrl\":\"https://www.vals.ai/benchmarks/code-migration\",\"modelSetting\":\"{\\\"id\\\":\\\"openai/gpt-5.6-sol\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"max\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"OpenAI\\\",\\\"harness\\\":null}\",\"effortSetting\":\"reasoning_effort publié : max\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"terra-livebench-coding\",\"modelId\":\"terra\",\"familyId\":\"livebench-coding-2026-06-25\",\"sourceId\":\"livebench-2026-06-25\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"LiveBench : code\",\"benchmarkVersion\":\"2026-06-25\",\"modelSetting\":\"gpt-5.6-terra-max\",\"executedAt\":\"not-published\",\"result\":{\"display\":\"78,2 %\",\"value\":78.2455,\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"not-published\",\"display\":\"Dispersion non publiée\"}},\"configuration\":{\"version\":\"terra\",\"effort\":\"max\",\"modelSetting\":\"gpt-5.6-terra-max\",\"effortSetting\":\"Réglage publié : gpt-5.6-terra-max\",\"evidenceUrl\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/src/Table/modelLinks.js\"},\"protocol\":{\"harness\":\"Protocole commun LiveBench 2026-06-25\",\"effort\":\"Réglage publié : gpt-5.6-terra-max\",\"scoring\":\"Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench\",\"judge\":\"Réponses comparées à une réponse vérifiable, sans correction par un autre modèle d’IA\"},\"dependencies\":[],\"source\":{\"url\":\"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv\",\"accessedAt\":\"2026-09-04\",\"publishedAt\":\"2026-06-25\",\"runReviewStatus\":\"not-disclosed\"}},{\"id\":\"terra-vals-code-migration\",\"modelId\":\"terra\",\"familyId\":\"vals-code-migration-v1-2026-09-03\",\"sourceId\":\"vals-code-migration-v1-2026-09-03\",\"unitOfAnalysis\":\"model\",\"benchmark\":\"Vals Code Migration : réécrire un programme\",\"benchmarkVersion\":\"1\",\"modelSetting\":\"{\\\"id\\\":\\\"openai/gpt-5.6-terra\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"max\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"OpenAI\\\",\\\"harness\\\":null}\",\"executedAt\":\"not-published\",\"result\":{\"value\":47.804,\"display\":\"47,804 %\",\"unit\":\"percent\",\"better\":\"higher\",\"dispersion\":{\"kind\":\"standard-error\",\"value\":4.28,\"display\":\"Erreur standard publiée : 4,28 points. Pas un intervalle de confiance.\"}},\"configuration\":{\"version\":\"terra\",\"effort\":\"max\",\"evidenceUrl\":\"https://www.vals.ai/benchmarks/code-migration\",\"modelSetting\":\"{\\\"id\\\":\\\"openai/gpt-5.6-terra\\\",\\\"temperature\\\":null,\\\"top_p\\\":null,\\\"max_output_tokens\\\":128000,\\\"reasoning\\\":null,\\\"reasoning_effort\\\":\\\"max\\\",\\\"compute_effort\\\":null,\\\"verbosity\\\":null,\\\"provider\\\":\\\"OpenAI\\\",\\\"harness\\\":null}\",\"effortSetting\":\"reasoning_effort publié : max\"},\"protocol\":{\"harness\":\"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.\",\"effort\":\"reasoning_effort publié : max\",\"scoring\":\"Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score.\",\"judge\":\"Tests exécutables cachés et contrôle anti-triche décrit par Vals ; implémentation de ce contrôle non publiée.\",\"selection\":\"56 résultats overall sur 56 importés, aucune sélection par performance.\"},\"dependencies\":[],\"source\":{\"url\":\"https://www.vals.ai/benchmarks/code-migration\",\"publishedAt\":\"2026-09-03\",\"accessedAt\":\"2026-09-04\",\"runReviewStatus\":\"not-disclosed\"}}]","snapshotFingerprint":"score-v1-d6f40303e872842f"},{"editionId":"origin-legal-2026-09-non-constituee","domain":"legal","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Aucune référence de quinze modèles communs à au moins deux équipes indépendantes n’est constituée dans le registre actuel.","selectionRationale":"Aucun socle sélectionné : la couverture intégrée ne permet pas encore de réunir quinze modèles communs à deux équipes indépendantes.","catalogRule":"available-at-cutoff","catalogExclusionReason":"Aucun catalogue constitué pour cet usage.","eligibleModelIds":[],"catalogFingerprint":"score-v1-741638a568efd6f9","tests":[],"referenceModelIds":[],"observationIds":[],"observationSelectionPolicy":"unique-cell-or-explicit-observation-id","snapshot":"[]","snapshotFingerprint":"score-v1-741638a568efd6f9"},{"editionId":"origin-finance-2026-09-non-constituee","domain":"finance","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Aucune référence de quinze modèles communs à au moins deux équipes indépendantes n’est constituée dans le registre actuel.","selectionRationale":"Aucun socle sélectionné : la couverture intégrée ne permet pas encore de réunir quinze modèles communs à deux équipes indépendantes.","catalogRule":"available-at-cutoff","catalogExclusionReason":"Aucun catalogue constitué pour cet usage.","eligibleModelIds":[],"catalogFingerprint":"score-v1-741638a568efd6f9","tests":[],"referenceModelIds":[],"observationIds":[],"observationSelectionPolicy":"unique-cell-or-explicit-observation-id","snapshot":"[]","snapshotFingerprint":"score-v1-741638a568efd6f9"},{"editionId":"origin-healthcare-2026-09-non-constituee","domain":"healthcare","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Aucune référence de quinze modèles communs à au moins deux équipes indépendantes n’est constituée dans le registre actuel.","selectionRationale":"Aucun socle sélectionné : la couverture intégrée ne permet pas encore de réunir quinze modèles communs à deux équipes indépendantes.","catalogRule":"available-at-cutoff","catalogExclusionReason":"Aucun catalogue constitué pour cet usage.","eligibleModelIds":[],"catalogFingerprint":"score-v1-741638a568efd6f9","tests":[],"referenceModelIds":[],"observationIds":[],"observationSelectionPolicy":"unique-cell-or-explicit-observation-id","snapshot":"[]","snapshotFingerprint":"score-v1-741638a568efd6f9"},{"editionId":"origin-mathScience-2026-09-non-constituee","domain":"mathScience","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Aucune référence de quinze modèles communs à au moins deux équipes indépendantes n’est constituée dans le registre actuel.","selectionRationale":"Aucun socle sélectionné : la couverture intégrée ne permet pas encore de réunir quinze modèles communs à deux équipes indépendantes.","catalogRule":"available-at-cutoff","catalogExclusionReason":"Aucun catalogue constitué pour cet usage.","eligibleModelIds":[],"catalogFingerprint":"score-v1-741638a568efd6f9","tests":[],"referenceModelIds":[],"observationIds":[],"observationSelectionPolicy":"unique-cell-or-explicit-observation-id","snapshot":"[]","snapshotFingerprint":"score-v1-741638a568efd6f9"},{"editionId":"origin-computerUse-2026-09-non-constituee","domain":"computerUse","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Aucune référence de quinze modèles communs à au moins deux équipes indépendantes n’est constituée dans le registre actuel.","selectionRationale":"Aucun socle sélectionné : la couverture intégrée ne permet pas encore de réunir quinze modèles communs à deux équipes indépendantes.","catalogRule":"available-at-cutoff","catalogExclusionReason":"Aucun catalogue constitué pour cet usage.","eligibleModelIds":[],"catalogFingerprint":"score-v1-741638a568efd6f9","tests":[],"referenceModelIds":[],"observationIds":[],"observationSelectionPolicy":"unique-cell-or-explicit-observation-id","snapshot":"[]","snapshotFingerprint":"score-v1-741638a568efd6f9"},{"editionId":"origin-longContext-2026-09-non-constituee","domain":"longContext","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Aucune référence de quinze modèles communs à au moins deux équipes indépendantes n’est constituée dans le registre actuel.","selectionRationale":"Aucun socle sélectionné : la couverture intégrée ne permet pas encore de réunir quinze modèles communs à deux équipes indépendantes.","catalogRule":"available-at-cutoff","catalogExclusionReason":"Aucun catalogue constitué pour cet usage.","eligibleModelIds":[],"catalogFingerprint":"score-v1-741638a568efd6f9","tests":[],"referenceModelIds":[],"observationIds":[],"observationSelectionPolicy":"unique-cell-or-explicit-observation-id","snapshot":"[]","snapshotFingerprint":"score-v1-741638a568efd6f9"},{"editionId":"origin-factuality-2026-09-non-constituee","domain":"factuality","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Aucune référence de quinze modèles communs à au moins deux équipes indépendantes n’est constituée dans le registre actuel.","selectionRationale":"Aucun socle sélectionné : la couverture intégrée ne permet pas encore de réunir quinze modèles communs à deux équipes indépendantes.","catalogRule":"available-at-cutoff","catalogExclusionReason":"Aucun catalogue constitué pour cet usage.","eligibleModelIds":[],"catalogFingerprint":"score-v1-741638a568efd6f9","tests":[],"referenceModelIds":[],"observationIds":[],"observationSelectionPolicy":"unique-cell-or-explicit-observation-id","snapshot":"[]","snapshotFingerprint":"score-v1-741638a568efd6f9"},{"editionId":"origin-vision-2026-09-non-constituee","domain":"vision","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Aucune référence de quinze modèles communs à au moins deux équipes indépendantes n’est constituée dans le registre actuel.","selectionRationale":"Aucun socle sélectionné : la couverture intégrée ne permet pas encore de réunir quinze modèles communs à deux équipes indépendantes.","catalogRule":"available-at-cutoff","catalogExclusionReason":"Aucun catalogue constitué pour cet usage.","eligibleModelIds":[],"catalogFingerprint":"score-v1-741638a568efd6f9","tests":[],"referenceModelIds":[],"observationIds":[],"observationSelectionPolicy":"unique-cell-or-explicit-observation-id","snapshot":"[]","snapshotFingerprint":"score-v1-741638a568efd6f9"},{"editionId":"origin-voice-2026-09-non-constituee","domain":"voice","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Aucune référence de quinze modèles communs à au moins deux équipes indépendantes n’est constituée dans le registre actuel.","selectionRationale":"Aucun socle sélectionné : la couverture intégrée ne permet pas encore de réunir quinze modèles communs à deux équipes indépendantes.","catalogRule":"available-at-cutoff","catalogExclusionReason":"Aucun catalogue constitué pour cet usage.","eligibleModelIds":[],"catalogFingerprint":"score-v1-741638a568efd6f9","tests":[],"referenceModelIds":[],"observationIds":[],"observationSelectionPolicy":"unique-cell-or-explicit-observation-id","snapshot":"[]","snapshotFingerprint":"score-v1-741638a568efd6f9"},{"editionId":"origin-education-2026-09-non-constituee","domain":"education","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Aucune référence de quinze modèles communs à au moins deux équipes indépendantes n’est constituée dans le registre actuel.","selectionRationale":"Aucun socle sélectionné : la couverture intégrée ne permet pas encore de réunir quinze modèles communs à deux équipes indépendantes.","catalogRule":"available-at-cutoff","catalogExclusionReason":"Aucun catalogue constitué pour cet usage.","eligibleModelIds":[],"catalogFingerprint":"score-v1-741638a568efd6f9","tests":[],"referenceModelIds":[],"observationIds":[],"observationSelectionPolicy":"unique-cell-or-explicit-observation-id","snapshot":"[]","snapshotFingerprint":"score-v1-741638a568efd6f9"},{"editionId":"origin-cybersecurity-2026-09-non-constituee","domain":"cybersecurity","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Aucune référence de quinze modèles communs à au moins deux équipes indépendantes n’est constituée dans le registre actuel.","selectionRationale":"Aucun socle sélectionné : la couverture intégrée ne permet pas encore de réunir quinze modèles communs à deux équipes indépendantes.","catalogRule":"available-at-cutoff","catalogExclusionReason":"Aucun catalogue constitué pour cet usage.","eligibleModelIds":[],"catalogFingerprint":"score-v1-741638a568efd6f9","tests":[],"referenceModelIds":[],"observationIds":[],"observationSelectionPolicy":"unique-cell-or-explicit-observation-id","snapshot":"[]","snapshotFingerprint":"score-v1-741638a568efd6f9"},{"editionId":"origin-efficiency-2026-09-non-constituee","domain":"efficiency","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Aucune référence de quinze modèles communs à au moins deux équipes indépendantes n’est constituée dans le registre actuel.","selectionRationale":"Aucun socle sélectionné : la couverture intégrée ne permet pas encore de réunir quinze modèles communs à deux équipes indépendantes.","catalogRule":"available-at-cutoff","catalogExclusionReason":"Aucun catalogue constitué pour cet usage.","eligibleModelIds":[],"catalogFingerprint":"score-v1-741638a568efd6f9","tests":[],"referenceModelIds":[],"observationIds":[],"observationSelectionPolicy":"unique-cell-or-explicit-observation-id","snapshot":"[]","snapshotFingerprint":"score-v1-741638a568efd6f9"}],"normalizedScores":[{"domain":"general","available":false,"edition":{"editionId":"origin-general-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : couverture actuelle, 4 tests au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[{"familyId":"epoch-eci-2026-09","sourceId":"epoch-eci-2026-09","benchmark":"Epoch Capabilities Index","organization":"Epoch AI","organizationId":"epoch-ai","modelCount":3,"reason":"Source non indépendante, inactive ou ne mesurant pas le modèle seul."},{"familyId":"aa-intelligence-v4-1-1","sourceId":"aa-intelligence-v4-1-1","benchmark":"Artificial Analysis Intelligence Index v4.1.1","organization":"Artificial Analysis","organizationId":"artificial-analysis","modelCount":3,"reason":"3 modèles mesurés, minimum pratique 15."},{"familyId":"livebench-reasoning-2026-06-25","sourceId":"livebench-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","organizationId":"livebench","modelCount":49,"reason":"Hors socle : aucune édition Origin n’est constituée pour cet usage."},{"familyId":"livebench-data-analysis-2026-06-25","sourceId":"livebench-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","organizationId":"livebench","modelCount":49,"reason":"Hors socle : aucune édition Origin n’est constituée pour cet usage."},{"familyId":"livebench-language-2026-06-25","sourceId":"livebench-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","organizationId":"livebench","modelCount":49,"reason":"Hors socle : aucune édition Origin n’est constituée pour cet usage."},{"familyId":"livebench-instruction-following-2026-06-25","sourceId":"livebench-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","organizationId":"livebench","modelCount":49,"reason":"Hors socle : aucune édition Origin n’est constituée pour cet usage."}],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":4,"organizationCount":1,"referenceModelCount":0},"message":"Note Origin indisponible : couverture actuelle, 4 tests au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},{"domain":"agentic","available":false,"edition":{"editionId":"origin-agentic-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : couverture actuelle, 1 test au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[{"familyId":"arc-agi-3-astra","sourceId":"arc-agi-3","benchmark":"ARC-AGI-3, tâches partiellement cachées, configuration standard","organization":"ARC Prize","organizationId":"arc-prize","modelCount":1,"reason":"1 modèles mesurés, minimum pratique 15."},{"familyId":"mercor-apex-agents","sourceId":"mercor-apex-agents","benchmark":"APEX-Agents","organization":"Mercor","organizationId":"mercor","modelCount":2,"reason":"2 modèles mesurés, minimum pratique 15."},{"familyId":"livebench-agentic-coding-2026-06-25","sourceId":"livebench-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","organizationId":"livebench","modelCount":49,"reason":"Hors socle : aucune édition Origin n’est constituée pour cet usage."}],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":1,"organizationCount":1,"referenceModelCount":0},"message":"Note Origin indisponible : couverture actuelle, 1 test au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},{"domain":"coding","available":true,"edition":{"editionId":"origin-coding-2026-09-04-v1","cutoffDate":"2026-09-04","status":"constituted","reason":"Référence constituée sur un socle explicite et figé.","snapshotFingerprint":"score-v1-d6f40303e872842f"},"panelModelIds":["claude-opus-4-8","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","gpt-5-4","gpt-5-4-mini","gpt-5-5","inkling","luna","muse-spark-1-1","muse-spark-1-2","opus-5","sol","terra"],"qualifiedTests":[{"familyId":"livebench-coding-2026-06-25","sourceId":"livebench-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","modelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","sourceId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","modelCount":17}],"excludedTests":[{"familyId":"swe-bench-verified-mini-v2-2026-02","sourceId":"swe-bench-verified-2026","benchmark":"SWE-bench Verified","organization":"SWE-bench","organizationId":"swe-bench","modelCount":4,"reason":"Origine d’exécution non vérifiée : résultat publié mais non compté, la soumission ne prouve pas le contrôle par l’équipe."},{"familyId":"aa-coding-agent-v1-4","sourceId":"aa-coding-agent-v1-4","benchmark":"Artificial Analysis Coding Agent Index v1.4","organization":"Artificial Analysis","organizationId":"artificial-analysis","modelCount":5,"reason":"Dépend d’une autre source retenue, Terminal-Bench 4.0. Écartée pour éviter de compter deux fois la même famille de tâches."},{"familyId":"terminal-bench-v4-0","sourceId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","organizationId":"terminal-bench","modelCount":13,"reason":"Hors socle de l’édition origin-coding-2026-09-04-v1."}],"partialModels":[{"modelId":"astra","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"67,74 %"}]},{"modelId":"claude-haiku-4-5","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"7,551 %"}]},{"modelId":"claude-opus-4-6","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Version ou effort non publié et documenté dans au moins un test.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"78,2 %"}]},{"modelId":"claude-opus-4-7","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Efforts différents entre Vals et LiveBench.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"82,1 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"43,878 %"}]},{"modelId":"claude-sonnet-4-6","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Efforts différents entre Vals et LiveBench.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"79,3 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"39,892 %"}]},{"modelId":"claude-sonnet-5","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Efforts différents entre Vals et LiveBench.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"80,7 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"44,392 %"}]},{"modelId":"deepseek-v4-flash","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Version ou effort non publié et documenté dans au moins un test.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"69,2 %"}]},{"modelId":"deepseek-v4-flash-0731","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"75,0 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"38,631 %"}]},{"modelId":"deepseek-v4-flash-vision-exp","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Version ou effort non publié et documenté dans au moins un test.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"68,2 %"}]},{"modelId":"deepseek-v4-pro","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"70,0 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"26,201 %"}]},{"modelId":"deepseek-v4-pro-0813","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"77,2 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"41,54 %"}]},{"modelId":"fable-5","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Politique de repli non documentée entre les évaluateurs.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"86,0 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"55,065 %"}]},{"modelId":"fable-5-1","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Politique de repli non documentée entre les évaluateurs.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"86,4 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"54,607 %"}]},{"modelId":"gemini-3-1-flash-lite-preview","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Disponibilité de cette version non vérifiée ; mesure historique conservée.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"4,609 %"}]},{"modelId":"gemini-3-flash-preview","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"6,391 %"}]},{"modelId":"glm-5-1","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"25,768 %"}]},{"modelId":"glm-5-2","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"79,7 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"37,87 %"}]},{"modelId":"glm-5-3","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"79,0 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"44,222 %"}]},{"modelId":"glm-5-3-flash","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"79,0 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"20,515 %"}]},{"modelId":"gpt-5-4-nano","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Efforts différents entre Vals et LiveBench.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"70,8 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"14,467 %"}]},{"modelId":"grok-4-20-0309-reasoning","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"0,314 %"}]},{"modelId":"grok-4-3","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"69,9 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"6,795 %"}]},{"modelId":"grok-4-5","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"68,6 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"36,596 %"}]},{"modelId":"grok-4-6","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"76,8 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"44,572 %"}]},{"modelId":"grok-build-0-1","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Version ou effort non publié et documenté dans au moins un test.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"65,4 %"}]},{"modelId":"inkling-small","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"13,675 %"}]},{"modelId":"kimi-k2-5","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"6,962 %"}]},{"modelId":"kimi-k2-6","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"78,6 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"27,768 %"}]},{"modelId":"kimi-k2-7-code","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"74,0 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"25,392 %"}]},{"modelId":"kimi-k3","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"81,4 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"16,099 %"}]},{"modelId":"ling-3-0-flash-2607","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Disponibilité de cette version non vérifiée ; mesure historique conservée.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"0 %"}]},{"modelId":"mimo-v2-5","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"14,228 %"}]},{"modelId":"mimo-v2-5-pro","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"21,557 %"}]},{"modelId":"minimax-m2-7","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"8,685 %"}]},{"modelId":"minimax-m3","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"68,2 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"19,925 %"}]},{"modelId":"mistral-medium-3-5","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"5,127 %"}]},{"modelId":"muse-spark-1-3","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Version ou effort non publié et documenté dans au moins un test.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"81,1 %"}]},{"modelId":"nemotron-3-ultra","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"70,7 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"4,905 %"}]},{"modelId":"nemotron-lightning-3-5","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"2,951 %"}]},{"modelId":"qwen3-6-27b","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Version ou effort non publié et documenté dans au moins un test.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"71,8 %"}]},{"modelId":"qwen3-6-plus","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"78,2 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"11,102 %"}]},{"modelId":"qwen3-7-max","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"74,2 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"13,069 %"}]},{"modelId":"qwen3-7-plus","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"12,856 %"}]},{"modelId":"qwen3-8-27b","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"75,7 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"14,157 %"}]},{"modelId":"qwen3-8-flash-next","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Version ou effort non publié et documenté dans au moins un test.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"72,6 %"}]},{"modelId":"qwen3-8-max","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"72,9 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"23,958 %"}]},{"modelId":"smaug-agentic","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Version ou effort non publié et documenté dans au moins un test.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"82,5 %"}]}],"scores":[{"modelId":"sol","score":96.88,"testCount":2,"organizationCount":2,"agreement":{"minimum":93.75,"maximum":100,"spread":6.25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":100,"rank":1,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":93.75,"rank":2,"comparisonModelCount":17}]},{"modelId":"opus-5","score":87.5,"testCount":2,"organizationCount":2,"agreement":{"minimum":75,"maximum":100,"spread":25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":75,"rank":5,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":100,"rank":1,"comparisonModelCount":17}]},{"modelId":"claude-opus-4-8","score":81.25,"testCount":2,"organizationCount":2,"agreement":{"minimum":81.25,"maximum":81.25,"spread":0},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":81.25,"rank":4,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":81.25,"rank":4,"comparisonModelCount":17}]},{"modelId":"gpt-5-5","score":81.25,"testCount":2,"organizationCount":2,"agreement":{"minimum":75,"maximum":87.5,"spread":12.5},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":87.5,"rank":3,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":75,"rank":5,"comparisonModelCount":17}]},{"modelId":"luna","score":81.25,"testCount":2,"organizationCount":2,"agreement":{"minimum":68.75,"maximum":93.75,"spread":25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":93.75,"rank":2,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":68.75,"rank":6,"comparisonModelCount":17}]},{"modelId":"terra","score":75,"testCount":2,"organizationCount":2,"agreement":{"minimum":62.5,"maximum":87.5,"spread":25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":62.5,"rank":7,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":87.5,"rank":3,"comparisonModelCount":17}]},{"modelId":"gemini-3-7-flash","score":59.38,"testCount":2,"organizationCount":2,"agreement":{"minimum":50,"maximum":68.75,"spread":18.75},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":68.75,"rank":6,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":50,"rank":9,"comparisonModelCount":17}]},{"modelId":"gpt-5-4","score":48.44,"testCount":2,"organizationCount":2,"agreement":{"minimum":40.63,"maximum":56.25,"spread":15.63},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":40.625,"rank":10.5,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":56.25,"rank":8,"comparisonModelCount":17}]},{"modelId":"gemini-3-6-flash","score":43.75,"testCount":2,"organizationCount":2,"agreement":{"minimum":37.5,"maximum":50,"spread":12.5},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":50,"rank":9,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":37.5,"rank":11,"comparisonModelCount":17}]},{"modelId":"gemini-3-5-flash","score":40.63,"testCount":2,"organizationCount":2,"agreement":{"minimum":25,"maximum":56.25,"spread":31.25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":56.25,"rank":8,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":25,"rank":13,"comparisonModelCount":17}]},{"modelId":"gemini-3-8-flash","score":37.5,"testCount":2,"organizationCount":2,"agreement":{"minimum":12.5,"maximum":62.5,"spread":50},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":12.5,"rank":15,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":62.5,"rank":7,"comparisonModelCount":17}]},{"modelId":"muse-spark-1-1","score":37.5,"testCount":2,"organizationCount":2,"agreement":{"minimum":31.25,"maximum":43.75,"spread":12.5},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":31.25,"rank":12,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":43.75,"rank":10,"comparisonModelCount":17}]},{"modelId":"muse-spark-1-2","score":35.94,"testCount":2,"organizationCount":2,"agreement":{"minimum":31.25,"maximum":40.63,"spread":9.38},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":40.625,"rank":10.5,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":31.25,"rank":12,"comparisonModelCount":17}]},{"modelId":"gemini-3-1-pro-preview","score":21.88,"testCount":2,"organizationCount":2,"agreement":{"minimum":18.75,"maximum":25,"spread":6.25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":25,"rank":13,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":18.75,"rank":14,"comparisonModelCount":17}]},{"modelId":"gemini-3-5-flash-lite","score":9.38,"testCount":2,"organizationCount":2,"agreement":{"minimum":0,"maximum":18.75,"spread":18.75},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":18.75,"rank":14,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":0,"rank":17,"comparisonModelCount":17}]},{"modelId":"gpt-5-4-mini","score":9.38,"testCount":2,"organizationCount":2,"agreement":{"minimum":6.25,"maximum":12.5,"spread":6.25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":6.25,"rank":16,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":12.5,"rank":15,"comparisonModelCount":17}]},{"modelId":"inkling","score":3.13,"testCount":2,"organizationCount":2,"agreement":{"minimum":0,"maximum":6.25,"spread":6.25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":0,"rank":17,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":6.25,"rank":16,"comparisonModelCount":17}]}],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":2,"organizationCount":2,"referenceModelCount":17},"message":"Note Origin disponible pour 17 modèles sur 2 tests de 2 équipes indépendantes, édition origin-coding-2026-09-04-v1.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},{"domain":"legal","available":false,"edition":{"editionId":"origin-legal-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[{"familyId":"mercor-apex-agents-legal-mean-score","sourceId":"mercor-apex-legal","benchmark":"APEX-Agents Corporate Lawyer, moyenne des critères","organization":"Mercor","organizationId":"mercor","modelCount":3,"reason":"Dépend d’une autre source retenue, APEX-Agents Corporate Lawyer, tâches sans erreur. Écartée pour éviter de compter deux fois la même famille de tâches."},{"familyId":"mercor-apex-agents-legal-all-criteria","sourceId":"mercor-apex-legal","benchmark":"APEX-Agents Corporate Lawyer, tâches sans erreur","organization":"Mercor","organizationId":"mercor","modelCount":3,"reason":"3 modèles mesurés, minimum pratique 15."}],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},{"domain":"finance","available":false,"edition":{"editionId":"origin-finance-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[{"familyId":"mercor-apex-agents-finance-mean-score","sourceId":"mercor-apex-finance","benchmark":"APEX-Agents Investment Banking Analyst, moyenne des critères","organization":"Mercor","organizationId":"mercor","modelCount":3,"reason":"3 modèles mesurés, minimum pratique 15."}],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},{"domain":"healthcare","available":false,"edition":{"editionId":"origin-healthcare-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[{"familyId":"openai-healthbench-professional","sourceId":"openai-healthbench-professional","benchmark":"HealthBench Professional","organization":"OpenAI","organizationId":"openai","modelCount":2,"reason":"Source non indépendante, inactive ou ne mesurant pas le modèle seul."}],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},{"domain":"mathScience","available":false,"edition":{"editionId":"origin-mathScience-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : couverture actuelle, 1 test au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[{"familyId":"epoch-frontiermath-erdos","sourceId":"epoch-frontiermath-erdos","benchmark":"FrontierMath Erdős","organization":"Epoch AI","organizationId":"epoch-ai","modelCount":3,"reason":"3 modèles mesurés, minimum pratique 15."},{"familyId":"livebench-mathematics-2026-06-25","sourceId":"livebench-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","organizationId":"livebench","modelCount":49,"reason":"Hors socle : aucune édition Origin n’est constituée pour cet usage."}],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":1,"organizationCount":1,"referenceModelCount":0},"message":"Note Origin indisponible : couverture actuelle, 1 test au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},{"domain":"computerUse","available":false,"edition":{"editionId":"origin-computerUse-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},{"domain":"longContext","available":false,"edition":{"editionId":"origin-longContext-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},{"domain":"factuality","available":false,"edition":{"editionId":"origin-factuality-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[{"familyId":"aa-omniscience-2026-09","sourceId":"aa-omniscience-2026-09","benchmark":"AA-Omniscience, réponses inventées","organization":"Artificial Analysis","organizationId":"artificial-analysis","modelCount":2,"reason":"2 modèles mesurés, minimum pratique 15."}],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},{"domain":"vision","available":false,"edition":{"editionId":"origin-vision-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},{"domain":"voice","available":false,"edition":{"editionId":"origin-voice-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},{"domain":"education","available":false,"edition":{"editionId":"origin-education-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},{"domain":"cybersecurity","available":false,"edition":{"editionId":"origin-cybersecurity-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},{"domain":"efficiency","available":false,"edition":{"editionId":"origin-efficiency-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"}],"cockpit":{"defaultUsageId":"coding","modelCount":66,"observationCount":447,"models":[{"id":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/"},{"id":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1"},{"id":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5"},{"id":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5"},{"id":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/"},{"id":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text"},{"id":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6"},{"id":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5"},{"id":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5"},{"id":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7"},{"id":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6"},{"id":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5"},{"id":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash"},{"id":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro"},{"id":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations"},{"id":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations"},{"id":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2"},{"id":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/"},{"id":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/"},{"id":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/"},{"id":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5"},{"id":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement"},{"id":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes"},{"id":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes"},{"id":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6"},{"id":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code"},{"id":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3"},{"id":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B"},{"id":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/"},{"id":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max"},{"id":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/"},{"id":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/"},{"id":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api"},{"id":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3"},{"id":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling"},{"id":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations"},{"id":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations"},{"id":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8"},{"id":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731"},{"id":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B"},{"id":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2"},{"id":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic"},{"id":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813"},{"id":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6"},{"id":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations"},{"id":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B"},{"id":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp"},{"id":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3"},{"id":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash"},{"id":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next"},{"id":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4"},{"id":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations"},{"id":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3"},{"id":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1"},{"id":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content"},{"id":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content"},{"id":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/"},{"id":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model"},{"id":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro"},{"id":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations"},{"id":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations"},{"id":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04"},{"id":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations"},{"id":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b"},{"id":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning"},{"id":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints"}],"usages":[{"id":"general","label":"Raisonnement général","question":"Quel modèle pour raisonner sur des sujets variés ?","verdict":"Claude Fable 5.1 arrive en tête sur LiveBench : raisonnement.","limitation":"Une seule équipe porte ce podium. Les autres tests de raisonnement général restent affichés séparément.","viewMode":"single-source","averageRank":null,"primaryFamilyId":"livebench-reasoning-2026-06-25","primaryFamilyLabel":"LiveBench : raisonnement","rankLabel":"Rang sur LiveBench : raisonnement","stars":2,"starsLabel":"Une équipe extérieure, confirmation manquante","isTopTie":false,"families":[{"id":"aa-intelligence-v4-1-1","label":"Artificial Analysis Intelligence Index v4.1.1","organization":"Artificial Analysis","scaleLabel":"Valeurs exactes, sans barre","betterLabel":"Plus haut est meilleur","constructId":"general-composite","sourceType":2,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"fable-5-1-aa-intelligence","label":"Artificial Analysis Intelligence Index v4.1.1","display":"66 points","value":66,"unit":"index","dispersion":"Marge annoncée à 95 % : moins de ±1 point","sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Outils et réglages propres à chacun des neuf tests. Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %.","limitation":"Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.","visual":{"kind":"none"},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1,"medal":"or"},{"observationId":"astra-aa-intelligence","label":"Artificial Analysis Intelligence Index v4.1.1","display":"61 points","value":61,"unit":"index","dispersion":"Marge annoncée à 95 % : moins de ±1 point","sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Outils et réglages propres à chacun des neuf tests. Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %.","limitation":"Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.","visual":{"kind":"none"},"modelId":"astra","modelName":"GPT-6 Astra","rank":2.5,"medal":null},{"observationId":"sol-aa-intelligence","label":"Artificial Analysis Intelligence Index v4.1.1","display":"61 points","value":61,"unit":"index","dispersion":"Marge annoncée à 95 % : moins de ±1 point","sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Outils et réglages propres à chacun des neuf tests. Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %.","limitation":"Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.","visual":{"kind":"none"},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":2.5,"medal":null}]},{"id":"epoch-eci-2026-09","label":"Epoch Capabilities Index","organization":"Epoch AI","scaleLabel":"Valeurs exactes, sans barre","betterLabel":"Plus haut est meilleur","constructId":"general-composite","sourceType":1,"isCountable":false,"isManufacturer":false,"measurements":[{"observationId":"astra-epoch-eci","label":"Epoch Capabilities Index","display":"169 points Epoch","value":169,"unit":"index","dispersion":"Fourchette probable à 90 % : 165 à 174","sourceUrl":"https://epoch.ai/models/gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Sources mélangées","isManufacturer":false,"protocol":"Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants. Calcul tenant compte du niveau de difficulté de chaque test.","limitation":"Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.","visual":{"kind":"none"},"modelId":"astra","modelName":"GPT-6 Astra","rank":2,"medal":null},{"observationId":"fable-5-1-epoch-eci","label":"Epoch Capabilities Index","display":"163 points Epoch","value":163,"unit":"index","dispersion":"Fourchette probable à 90 % : 160 à 166","sourceUrl":"https://epoch.ai/models/claude-fable-5-1","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Sources mélangées","isManufacturer":false,"protocol":"Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants. Calcul tenant compte du niveau de difficulté de chaque test.","limitation":"Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.","visual":{"kind":"none"},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":2,"medal":null},{"observationId":"sol-epoch-eci","label":"Epoch Capabilities Index","display":"162 points Epoch","value":162,"unit":"index","dispersion":"Fourchette probable à 90 % : 160 à 165","sourceUrl":"https://epoch.ai/models/gpt-5-6-sol","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Sources mélangées","isManufacturer":false,"protocol":"Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants. Calcul tenant compte du niveau de difficulté de chaque test.","limitation":"Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.","visual":{"kind":"none"},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":2,"medal":null}]},{"id":"livebench-reasoning-2026-06-25","label":"LiveBench : raisonnement","organization":"LiveBench","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"reasoning","sourceType":1,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"fable-5-1-livebench-reasoning","label":"LiveBench : raisonnement","display":"91,7 %","value":91.6923,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.6923},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1,"medal":"or"},{"observationId":"sol-livebench-reasoning","label":"LiveBench : raisonnement","display":"91,7 %","value":91.6538,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.6538},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":2,"medal":"argent"},{"observationId":"opus-5-livebench-reasoning","label":"LiveBench : raisonnement","display":"91,2 %","value":91.2115,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.2115},"modelId":"opus-5","modelName":"Claude Opus 5","rank":3,"medal":"bronze"},{"observationId":"kimi-k3-livebench-reasoning","label":"LiveBench : raisonnement","display":"90,7 %","value":90.673,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.673},"modelId":"kimi-k3","modelName":"Kimi K3","rank":4,"medal":null},{"observationId":"terra-livebench-reasoning","label":"LiveBench : raisonnement","display":"90,6 %","value":90.6345,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.6345},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":5,"medal":null},{"observationId":"grok-4-6-livebench-reasoning","label":"LiveBench : raisonnement","display":"90,5 %","value":90.5095,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.5095},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":6,"medal":null},{"observationId":"smaug-agentic-livebench-reasoning","label":"LiveBench : raisonnement","display":"90,3 %","value":90.274,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.274},"modelId":"smaug-agentic","modelName":"Smaug-Agentic","rank":7,"medal":null},{"observationId":"muse-spark-1-2-livebench-reasoning","label":"LiveBench : raisonnement","display":"90,0 %","value":90.0048,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.0048},"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","rank":8,"medal":null},{"observationId":"gpt-5-5-livebench-reasoning","label":"LiveBench : raisonnement","display":"89,7 %","value":89.6538,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.6538},"modelId":"gpt-5-5","modelName":"GPT-5.5","rank":10,"medal":null},{"observationId":"fable-5-livebench-reasoning","label":"LiveBench : raisonnement","display":"89,7 %","value":89.6538,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.6538},"modelId":"fable-5","modelName":"Claude Fable 5","rank":10,"medal":null},{"observationId":"muse-spark-1-3-livebench-reasoning","label":"LiveBench : raisonnement","display":"89,7 %","value":89.6538,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.6538},"modelId":"muse-spark-1-3","modelName":"Muse Spark 1.3","rank":10,"medal":null},{"observationId":"gemini-3-8-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"89,3 %","value":89.2933,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.2933},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":12,"medal":null},{"observationId":"claude-opus-4-8-livebench-reasoning","label":"LiveBench : raisonnement","display":"89,2 %","value":89.1923,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.1923},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":13,"medal":null},{"observationId":"claude-sonnet-5-livebench-reasoning","label":"LiveBench : raisonnement","display":"88,7 %","value":88.6923,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.6923},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":14,"medal":null},{"observationId":"claude-opus-4-6-livebench-reasoning","label":"LiveBench : raisonnement","display":"88,7 %","value":88.673,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.673},"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","rank":15,"medal":null},{"observationId":"qwen3-8-max-livebench-reasoning","label":"LiveBench : raisonnement","display":"88,2 %","value":88.2115,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.2115},"modelId":"qwen3-8-max","modelName":"Qwen 3.8 Max","rank":16,"medal":null},{"observationId":"gpt-5-4-livebench-reasoning","label":"LiveBench : raisonnement","display":"88,1 %","value":88.1155,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.1155},"modelId":"gpt-5-4","modelName":"GPT-5.4","rank":17,"medal":null},{"observationId":"gemini-3-7-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"87,8 %","value":87.798,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.798},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":18,"medal":null},{"observationId":"muse-spark-1-1-livebench-reasoning","label":"LiveBench : raisonnement","display":"87,7 %","value":87.7308,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.7308},"modelId":"muse-spark-1-1","modelName":"Muse Spark 1.1","rank":19,"medal":null},{"observationId":"qwen3-8-flash-next-livebench-reasoning","label":"LiveBench : raisonnement","display":"87,4 %","value":87.3798,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.3798},"modelId":"qwen3-8-flash-next","modelName":"Qwen 3.8 Flash Next","rank":20,"medal":null},{"observationId":"claude-opus-4-7-livebench-reasoning","label":"LiveBench : raisonnement","display":"87,2 %","value":87.1923,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.1923},"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","rank":21,"medal":null},{"observationId":"grok-4-5-livebench-reasoning","label":"LiveBench : raisonnement","display":"87,2 %","value":87.173,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.173},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":22,"medal":null},{"observationId":"deepseek-v4-flash-0731-livebench-reasoning","label":"LiveBench : raisonnement","display":"86,6 %","value":86.6345,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.6345},"modelId":"deepseek-v4-flash-0731","modelName":"DeepSeek V4 Flash 0731","rank":23,"medal":null},{"observationId":"deepseek-v4-pro-0813-livebench-reasoning","label":"LiveBench : raisonnement","display":"85,8 %","value":85.8413,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.8413},"modelId":"deepseek-v4-pro-0813","modelName":"DeepSeek V4 Pro 0813","rank":24,"medal":null},{"observationId":"glm-5-3-livebench-reasoning","label":"LiveBench : raisonnement","display":"85,8 %","value":85.803,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.803},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":25,"medal":null},{"observationId":"luna-livebench-reasoning","label":"LiveBench : raisonnement","display":"85,6 %","value":85.6443,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.6443},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":26,"medal":null},{"observationId":"deepseek-v4-flash-vision-exp-livebench-reasoning","label":"LiveBench : raisonnement","display":"85,4 %","value":85.399,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.399},"modelId":"deepseek-v4-flash-vision-exp","modelName":"DeepSeek V4 Flash Vision Exp","rank":27,"medal":null},{"observationId":"gemini-3-6-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"85,1 %","value":85.149,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.149},"modelId":"gemini-3-6-flash","modelName":"Gemini 3.6 Flash","rank":28,"medal":null},{"observationId":"claude-sonnet-4-6-livebench-reasoning","label":"LiveBench : raisonnement","display":"84,8 %","value":84.7693,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.7693},"modelId":"claude-sonnet-4-6","modelName":"Claude Sonnet 4.6","rank":29,"medal":null},{"observationId":"gemini-3-1-pro-preview-livebench-reasoning","label":"LiveBench : raisonnement","display":"84,0 %","value":84.0048,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.0048},"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","rank":30,"medal":null},{"observationId":"qwen3-7-max-livebench-reasoning","label":"LiveBench : raisonnement","display":"83,3 %","value":83.3365,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.3365},"modelId":"qwen3-7-max","modelName":"Qwen 3.7 Max","rank":31,"medal":null},{"observationId":"kimi-k2-7-code-livebench-reasoning","label":"LiveBench : raisonnement","display":"82,8 %","value":82.8078,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.8078},"modelId":"kimi-k2-7-code","modelName":"Kimi K2.7 Code","rank":32,"medal":null},{"observationId":"deepseek-v4-pro-livebench-reasoning","label":"LiveBench : raisonnement","display":"82,7 %","value":82.6923,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.6923},"modelId":"deepseek-v4-pro","modelName":"DeepSeek V4 Pro","rank":33,"medal":null},{"observationId":"gemini-3-5-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"82,0 %","value":82.0048,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.0048},"modelId":"gemini-3-5-flash","modelName":"Gemini 3.5 Flash","rank":34,"medal":null},{"observationId":"gpt-5-4-nano-livebench-reasoning","label":"LiveBench : raisonnement","display":"81,1 %","value":81.097,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.097},"modelId":"gpt-5-4-nano","modelName":"GPT-5.4 nano","rank":35,"medal":null},{"observationId":"qwen3-8-27b-livebench-reasoning","label":"LiveBench : raisonnement","display":"80,0 %","value":80.0288,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":80.0288},"modelId":"qwen3-8-27b","modelName":"Qwen 3.8 27B","rank":36,"medal":null},{"observationId":"kimi-k2-6-livebench-reasoning","label":"LiveBench : raisonnement","display":"79,4 %","value":79.375,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.375},"modelId":"kimi-k2-6","modelName":"Kimi K2.6","rank":37,"medal":null},{"observationId":"glm-5-2-livebench-reasoning","label":"LiveBench : raisonnement","display":"78,6 %","value":78.625,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.625},"modelId":"glm-5-2","modelName":"GLM 5.2","rank":38,"medal":null},{"observationId":"inkling-livebench-reasoning","label":"LiveBench : raisonnement","display":"78,3 %","value":78.3463,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.3463},"modelId":"inkling","modelName":"Inkling","rank":39,"medal":null},{"observationId":"glm-5-3-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"77,6 %","value":77.6443,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.6443},"modelId":"glm-5-3-flash","modelName":"GLM 5.3 Flash","rank":40,"medal":null},{"observationId":"grok-build-0-1-livebench-reasoning","label":"LiveBench : raisonnement","display":"76,4 %","value":76.3703,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.3703},"modelId":"grok-build-0-1","modelName":"Grok Build 0.1","rank":41,"medal":null},{"observationId":"qwen3-6-plus-livebench-reasoning","label":"LiveBench : raisonnement","display":"75,8 %","value":75.827,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.827},"modelId":"qwen3-6-plus","modelName":"Qwen 3.6 Plus","rank":42,"medal":null},{"observationId":"nemotron-3-ultra-livebench-reasoning","label":"LiveBench : raisonnement","display":"74,7 %","value":74.697,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.697},"modelId":"nemotron-3-ultra","modelName":"Nemotron 3 Ultra 550B A55B","rank":43,"medal":null},{"observationId":"minimax-m3-livebench-reasoning","label":"LiveBench : raisonnement","display":"74,5 %","value":74.4808,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.4808},"modelId":"minimax-m3","modelName":"MiniMax M3","rank":44,"medal":null},{"observationId":"gpt-5-4-mini-livebench-reasoning","label":"LiveBench : raisonnement","display":"71,3 %","value":71.3238,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.3238},"modelId":"gpt-5-4-mini","modelName":"GPT-5.4 mini","rank":45,"medal":null},{"observationId":"grok-4-3-livebench-reasoning","label":"LiveBench : raisonnement","display":"70,8 %","value":70.822,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.822},"modelId":"grok-4-3","modelName":"Grok 4.3","rank":46,"medal":null},{"observationId":"deepseek-v4-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"70,6 %","value":70.5818,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.5818},"modelId":"deepseek-v4-flash","modelName":"DeepSeek V4 Flash","rank":47,"medal":null},{"observationId":"qwen3-6-27b-livebench-reasoning","label":"LiveBench : raisonnement","display":"70,3 %","value":70.2838,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.2838},"modelId":"qwen3-6-27b","modelName":"Qwen 3.6 27B","rank":48,"medal":null},{"observationId":"gemini-3-5-flash-lite-livebench-reasoning","label":"LiveBench : raisonnement","display":"60,2 %","value":60.1875,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":60.1875},"modelId":"gemini-3-5-flash-lite","modelName":"Gemini 3.5 Flash-Lite","rank":49,"medal":null}]},{"id":"livebench-data-analysis-2026-06-25","label":"LiveBench : analyse de données","organization":"LiveBench","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"data-analysis","sourceType":1,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"gpt-5-5-livebench-data-analysis","label":"LiveBench : analyse de données","display":"81,6 %","value":81.5757,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.5757},"modelId":"gpt-5-5","modelName":"GPT-5.5","rank":1,"medal":"or"},{"observationId":"fable-5-livebench-data-analysis","label":"LiveBench : analyse de données","display":"80,5 %","value":80.5377,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":80.5377},"modelId":"fable-5","modelName":"Claude Fable 5","rank":2,"medal":"argent"},{"observationId":"fable-5-1-livebench-data-analysis","label":"LiveBench : analyse de données","display":"80,3 %","value":80.2757,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":80.2757},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":3,"medal":"bronze"},{"observationId":"smaug-agentic-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,9 %","value":79.8983,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.8983},"modelId":"smaug-agentic","modelName":"Smaug-Agentic","rank":4,"medal":null},{"observationId":"sol-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,8 %","value":79.8407,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.8407},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":5,"medal":null},{"observationId":"muse-spark-1-3-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,6 %","value":79.5653,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.5653},"modelId":"muse-spark-1-3","modelName":"Muse Spark 1.3","rank":6,"medal":null},{"observationId":"deepseek-v4-flash-vision-exp-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,5 %","value":79.4767,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.4767},"modelId":"deepseek-v4-flash-vision-exp","modelName":"DeepSeek V4 Flash Vision Exp","rank":7,"medal":null},{"observationId":"deepseek-v4-flash-0731-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,3 %","value":79.3273,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.3273},"modelId":"deepseek-v4-flash-0731","modelName":"DeepSeek V4 Flash 0731","rank":8,"medal":null},{"observationId":"gpt-5-4-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,3 %","value":79.3133,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.3133},"modelId":"gpt-5-4","modelName":"GPT-5.4","rank":9,"medal":null},{"observationId":"terra-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,3 %","value":79.3067,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.3067},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":10,"medal":null},{"observationId":"deepseek-v4-pro-0813-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,2 %","value":79.2433,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.2433},"modelId":"deepseek-v4-pro-0813","modelName":"DeepSeek V4 Pro 0813","rank":11,"medal":null},{"observationId":"kimi-k3-livebench-data-analysis","label":"LiveBench : analyse de données","display":"78,7 %","value":78.7337,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.7337},"modelId":"kimi-k3","modelName":"Kimi K3","rank":12,"medal":null},{"observationId":"gemini-3-1-pro-preview-livebench-data-analysis","label":"LiveBench : analyse de données","display":"78,5 %","value":78.5413,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.5413},"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","rank":13,"medal":null},{"observationId":"qwen3-8-max-livebench-data-analysis","label":"LiveBench : analyse de données","display":"78,4 %","value":78.413,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.413},"modelId":"qwen3-8-max","modelName":"Qwen 3.8 Max","rank":14,"medal":null},{"observationId":"claude-opus-4-7-livebench-data-analysis","label":"LiveBench : analyse de données","display":"78,3 %","value":78.2637,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.2637},"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","rank":15,"medal":null},{"observationId":"luna-livebench-data-analysis","label":"LiveBench : analyse de données","display":"78,0 %","value":78.0333,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.0333},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":16,"medal":null},{"observationId":"claude-sonnet-4-6-livebench-data-analysis","label":"LiveBench : analyse de données","display":"77,9 %","value":77.946,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.946},"modelId":"claude-sonnet-4-6","modelName":"Claude Sonnet 4.6","rank":17,"medal":null},{"observationId":"qwen3-8-27b-livebench-data-analysis","label":"LiveBench : analyse de données","display":"76,6 %","value":76.5857,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.5857},"modelId":"qwen3-8-27b","modelName":"Qwen 3.8 27B","rank":18,"medal":null},{"observationId":"muse-spark-1-2-livebench-data-analysis","label":"LiveBench : analyse de données","display":"76,5 %","value":76.4583,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.4583},"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","rank":19,"medal":null},{"observationId":"glm-5-3-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"76,4 %","value":76.401,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.401},"modelId":"glm-5-3-flash","modelName":"GLM 5.3 Flash","rank":20,"medal":null},{"observationId":"minimax-m3-livebench-data-analysis","label":"LiveBench : analyse de données","display":"76,2 %","value":76.1663,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.1663},"modelId":"minimax-m3","modelName":"MiniMax M3","rank":21,"medal":null},{"observationId":"opus-5-livebench-data-analysis","label":"LiveBench : analyse de données","display":"74,6 %","value":74.5503,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.5503},"modelId":"opus-5","modelName":"Claude Opus 5","rank":22,"medal":null},{"observationId":"deepseek-v4-pro-livebench-data-analysis","label":"LiveBench : analyse de données","display":"74,5 %","value":74.5377,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.5377},"modelId":"deepseek-v4-pro","modelName":"DeepSeek V4 Pro","rank":23,"medal":null},{"observationId":"qwen3-8-flash-next-livebench-data-analysis","label":"LiveBench : analyse de données","display":"74,2 %","value":74.24,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.24},"modelId":"qwen3-8-flash-next","modelName":"Qwen 3.8 Flash Next","rank":24,"medal":null},{"observationId":"grok-4-6-livebench-data-analysis","label":"LiveBench : analyse de données","display":"73,9 %","value":73.857,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.857},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":25,"medal":null},{"observationId":"glm-5-2-livebench-data-analysis","label":"LiveBench : analyse de données","display":"73,7 %","value":73.7397,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.7397},"modelId":"glm-5-2","modelName":"GLM 5.2","rank":26,"medal":null},{"observationId":"grok-4-5-livebench-data-analysis","label":"LiveBench : analyse de données","display":"73,0 %","value":73.0377,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.0377},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":27,"medal":null},{"observationId":"inkling-livebench-data-analysis","label":"LiveBench : analyse de données","display":"72,8 %","value":72.778,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.778},"modelId":"inkling","modelName":"Inkling","rank":28,"medal":null},{"observationId":"muse-spark-1-1-livebench-data-analysis","label":"LiveBench : analyse de données","display":"72,5 %","value":72.548,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.548},"modelId":"muse-spark-1-1","modelName":"Muse Spark 1.1","rank":29,"medal":null},{"observationId":"qwen3-7-max-livebench-data-analysis","label":"LiveBench : analyse de données","display":"71,8 %","value":71.786,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.786},"modelId":"qwen3-7-max","modelName":"Qwen 3.7 Max","rank":30,"medal":null},{"observationId":"claude-sonnet-5-livebench-data-analysis","label":"LiveBench : analyse de données","display":"71,7 %","value":71.7407,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.7407},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":31,"medal":null},{"observationId":"grok-build-0-1-livebench-data-analysis","label":"LiveBench : analyse de données","display":"70,8 %","value":70.794,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.794},"modelId":"grok-build-0-1","modelName":"Grok Build 0.1","rank":32,"medal":null},{"observationId":"gpt-5-4-mini-livebench-data-analysis","label":"LiveBench : analyse de données","display":"70,8 %","value":70.7857,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.7857},"modelId":"gpt-5-4-mini","modelName":"GPT-5.4 mini","rank":33,"medal":null},{"observationId":"qwen3-6-27b-livebench-data-analysis","label":"LiveBench : analyse de données","display":"70,4 %","value":70.4267,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.4267},"modelId":"qwen3-6-27b","modelName":"Qwen 3.6 27B","rank":34,"medal":null},{"observationId":"glm-5-3-livebench-data-analysis","label":"LiveBench : analyse de données","display":"70,2 %","value":70.2443,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.2443},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":35,"medal":null},{"observationId":"qwen3-6-plus-livebench-data-analysis","label":"LiveBench : analyse de données","display":"69,9 %","value":69.9117,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.9117},"modelId":"qwen3-6-plus","modelName":"Qwen 3.6 Plus","rank":36,"medal":null},{"observationId":"claude-opus-4-6-livebench-data-analysis","label":"LiveBench : analyse de données","display":"69,9 %","value":69.893,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.893},"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","rank":37,"medal":null},{"observationId":"deepseek-v4-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"68,0 %","value":68.023,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":68.023},"modelId":"deepseek-v4-flash","modelName":"DeepSeek V4 Flash","rank":38,"medal":null},{"observationId":"gemini-3-7-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"68,0 %","value":67.9643,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":67.9643},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":39,"medal":null},{"observationId":"gpt-5-4-nano-livebench-data-analysis","label":"LiveBench : analyse de données","display":"67,6 %","value":67.6427,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":67.6427},"modelId":"gpt-5-4-nano","modelName":"GPT-5.4 nano","rank":40,"medal":null},{"observationId":"claude-opus-4-8-livebench-data-analysis","label":"LiveBench : analyse de données","display":"66,0 %","value":66.0333,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":66.0333},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":41,"medal":null},{"observationId":"kimi-k2-6-livebench-data-analysis","label":"LiveBench : analyse de données","display":"65,1 %","value":65.1343,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.1343},"modelId":"kimi-k2-6","modelName":"Kimi K2.6","rank":42,"medal":null},{"observationId":"gemini-3-5-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"64,9 %","value":64.8573,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.8573},"modelId":"gemini-3-5-flash","modelName":"Gemini 3.5 Flash","rank":43,"medal":null},{"observationId":"gemini-3-6-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"63,0 %","value":62.9993,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.9993},"modelId":"gemini-3-6-flash","modelName":"Gemini 3.6 Flash","rank":44,"medal":null},{"observationId":"kimi-k2-7-code-livebench-data-analysis","label":"LiveBench : analyse de données","display":"62,7 %","value":62.6573,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.6573},"modelId":"kimi-k2-7-code","modelName":"Kimi K2.7 Code","rank":45,"medal":null},{"observationId":"grok-4-3-livebench-data-analysis","label":"LiveBench : analyse de données","display":"55,8 %","value":55.7727,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":55.7727},"modelId":"grok-4-3","modelName":"Grok 4.3","rank":46,"medal":null},{"observationId":"nemotron-3-ultra-livebench-data-analysis","label":"LiveBench : analyse de données","display":"54,5 %","value":54.4567,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":54.4567},"modelId":"nemotron-3-ultra","modelName":"Nemotron 3 Ultra 550B A55B","rank":47,"medal":null},{"observationId":"gemini-3-8-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"54,0 %","value":54.0057,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":54.0057},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":48,"medal":null},{"observationId":"gemini-3-5-flash-lite-livebench-data-analysis","label":"LiveBench : analyse de données","display":"53,2 %","value":53.2497,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":53.2497},"modelId":"gemini-3-5-flash-lite","modelName":"Gemini 3.5 Flash-Lite","rank":49,"medal":null}]},{"id":"livebench-language-2026-06-25","label":"LiveBench : langue","organization":"LiveBench","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"language","sourceType":1,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"fable-5-livebench-language","label":"LiveBench : langue","display":"90,7 %","value":90.684,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.684},"modelId":"fable-5","modelName":"Claude Fable 5","rank":1,"medal":"or"},{"observationId":"fable-5-1-livebench-language","label":"LiveBench : langue","display":"89,5 %","value":89.501,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.501},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":2,"medal":"argent"},{"observationId":"opus-5-livebench-language","label":"LiveBench : langue","display":"88,7 %","value":88.688,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.688},"modelId":"opus-5","modelName":"Claude Opus 5","rank":3,"medal":"bronze"},{"observationId":"gemini-3-8-flash-livebench-language","label":"LiveBench : langue","display":"87,8 %","value":87.7927,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.7927},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":4,"medal":null},{"observationId":"sol-livebench-language","label":"LiveBench : langue","display":"87,7 %","value":87.6837,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.6837},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":5,"medal":null},{"observationId":"gpt-5-5-livebench-language","label":"LiveBench : langue","display":"87,4 %","value":87.363,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.363},"modelId":"gpt-5-5","modelName":"GPT-5.5","rank":6,"medal":null},{"observationId":"kimi-k3-livebench-language","label":"LiveBench : langue","display":"85,5 %","value":85.528,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.528},"modelId":"kimi-k3","modelName":"Kimi K3","rank":7,"medal":null},{"observationId":"gemini-3-7-flash-livebench-language","label":"LiveBench : langue","display":"85,5 %","value":85.455,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.455},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":8,"medal":null},{"observationId":"gemini-3-1-pro-preview-livebench-language","label":"LiveBench : langue","display":"85,4 %","value":85.376,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.376},"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","rank":9,"medal":null},{"observationId":"gemini-3-5-flash-livebench-language","label":"LiveBench : langue","display":"84,6 %","value":84.5843,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.5843},"modelId":"gemini-3-5-flash","modelName":"Gemini 3.5 Flash","rank":10,"medal":null},{"observationId":"smaug-agentic-livebench-language","label":"LiveBench : langue","display":"84,4 %","value":84.3567,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.3567},"modelId":"smaug-agentic","modelName":"Smaug-Agentic","rank":11,"medal":null},{"observationId":"gemini-3-6-flash-livebench-language","label":"LiveBench : langue","display":"83,9 %","value":83.8977,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.8977},"modelId":"gemini-3-6-flash","modelName":"Gemini 3.6 Flash","rank":12,"medal":null},{"observationId":"grok-4-6-livebench-language","label":"LiveBench : langue","display":"83,7 %","value":83.697,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.697},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":13,"medal":null},{"observationId":"claude-opus-4-6-livebench-language","label":"LiveBench : langue","display":"83,3 %","value":83.2697,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.2697},"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","rank":14,"medal":null},{"observationId":"terra-livebench-language","label":"LiveBench : langue","display":"82,9 %","value":82.8927,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.8927},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":15,"medal":null},{"observationId":"grok-4-5-livebench-language","label":"LiveBench : langue","display":"82,8 %","value":82.7953,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.7953},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":16,"medal":null},{"observationId":"muse-spark-1-3-livebench-language","label":"LiveBench : langue","display":"82,8 %","value":82.7937,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.7937},"modelId":"muse-spark-1-3","modelName":"Muse Spark 1.3","rank":17,"medal":null},{"observationId":"gpt-5-4-livebench-language","label":"LiveBench : langue","display":"82,6 %","value":82.6337,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.6337},"modelId":"gpt-5-4","modelName":"GPT-5.4","rank":18,"medal":null},{"observationId":"deepseek-v4-pro-0813-livebench-language","label":"LiveBench : langue","display":"82,1 %","value":82.074,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.074},"modelId":"deepseek-v4-pro-0813","modelName":"DeepSeek V4 Pro 0813","rank":19,"medal":null},{"observationId":"deepseek-v4-flash-vision-exp-livebench-language","label":"LiveBench : langue","display":"80,4 %","value":80.3597,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":80.3597},"modelId":"deepseek-v4-flash-vision-exp","modelName":"DeepSeek V4 Flash Vision Exp","rank":20,"medal":null},{"observationId":"glm-5-3-livebench-language","label":"LiveBench : langue","display":"79,9 %","value":79.8563,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.8563},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":21,"medal":null},{"observationId":"qwen3-7-max-livebench-language","label":"LiveBench : langue","display":"79,7 %","value":79.739,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.739},"modelId":"qwen3-7-max","modelName":"Qwen 3.7 Max","rank":22,"medal":null},{"observationId":"qwen3-8-max-livebench-language","label":"LiveBench : langue","display":"79,7 %","value":79.6873,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.6873},"modelId":"qwen3-8-max","modelName":"Qwen 3.8 Max","rank":23,"medal":null},{"observationId":"claude-opus-4-8-livebench-language","label":"LiveBench : langue","display":"79,7 %","value":79.6593,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.6593},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":24,"medal":null},{"observationId":"deepseek-v4-flash-0731-livebench-language","label":"LiveBench : langue","display":"79,2 %","value":79.175,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.175},"modelId":"deepseek-v4-flash-0731","modelName":"DeepSeek V4 Flash 0731","rank":25,"medal":null},{"observationId":"muse-spark-1-2-livebench-language","label":"LiveBench : langue","display":"78,6 %","value":78.5747,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.5747},"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","rank":26,"medal":null},{"observationId":"deepseek-v4-pro-livebench-language","label":"LiveBench : langue","display":"78,1 %","value":78.1303,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.1303},"modelId":"deepseek-v4-pro","modelName":"DeepSeek V4 Pro","rank":27,"medal":null},{"observationId":"claude-opus-4-7-livebench-language","label":"LiveBench : langue","display":"77,9 %","value":77.914,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.914},"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","rank":28,"medal":null},{"observationId":"kimi-k2-7-code-livebench-language","label":"LiveBench : langue","display":"77,9 %","value":77.9057,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.9057},"modelId":"kimi-k2-7-code","modelName":"Kimi K2.7 Code","rank":29,"medal":null},{"observationId":"glm-5-3-flash-livebench-language","label":"LiveBench : langue","display":"77,3 %","value":77.3073,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.3073},"modelId":"glm-5-3-flash","modelName":"GLM 5.3 Flash","rank":30,"medal":null},{"observationId":"minimax-m3-livebench-language","label":"LiveBench : langue","display":"76,8 %","value":76.8357,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.8357},"modelId":"minimax-m3","modelName":"MiniMax M3","rank":31,"medal":null},{"observationId":"glm-5-2-livebench-language","label":"LiveBench : langue","display":"76,2 %","value":76.2417,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.2417},"modelId":"glm-5-2","modelName":"GLM 5.2","rank":32,"medal":null},{"observationId":"claude-sonnet-4-6-livebench-language","label":"LiveBench : langue","display":"76,1 %","value":76.1027,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.1027},"modelId":"claude-sonnet-4-6","modelName":"Claude Sonnet 4.6","rank":33,"medal":null},{"observationId":"kimi-k2-6-livebench-language","label":"LiveBench : langue","display":"75,1 %","value":75.1413,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.1413},"modelId":"kimi-k2-6","modelName":"Kimi K2.6","rank":34,"medal":null},{"observationId":"qwen3-6-plus-livebench-language","label":"LiveBench : langue","display":"75,0 %","value":74.9893,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.9893},"modelId":"qwen3-6-plus","modelName":"Qwen 3.6 Plus","rank":35,"medal":null},{"observationId":"claude-sonnet-5-livebench-language","label":"LiveBench : langue","display":"75,0 %","value":74.9703,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.9703},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":36,"medal":null},{"observationId":"qwen3-8-flash-next-livebench-language","label":"LiveBench : langue","display":"74,6 %","value":74.643,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.643},"modelId":"qwen3-8-flash-next","modelName":"Qwen 3.8 Flash Next","rank":37,"medal":null},{"observationId":"qwen3-8-27b-livebench-language","label":"LiveBench : langue","display":"74,3 %","value":74.3457,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.3457},"modelId":"qwen3-8-27b","modelName":"Qwen 3.8 27B","rank":38,"medal":null},{"observationId":"muse-spark-1-1-livebench-language","label":"LiveBench : langue","display":"74,3 %","value":74.342,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.342},"modelId":"muse-spark-1-1","modelName":"Muse Spark 1.1","rank":39,"medal":null},{"observationId":"grok-4-3-livebench-language","label":"LiveBench : langue","display":"73,6 %","value":73.58,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.58},"modelId":"grok-4-3","modelName":"Grok 4.3","rank":40,"medal":null},{"observationId":"inkling-livebench-language","label":"LiveBench : langue","display":"73,5 %","value":73.4587,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.4587},"modelId":"inkling","modelName":"Inkling","rank":41,"medal":null},{"observationId":"luna-livebench-language","label":"LiveBench : langue","display":"72,6 %","value":72.567,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.567},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":42,"medal":null},{"observationId":"grok-build-0-1-livebench-language","label":"LiveBench : langue","display":"72,5 %","value":72.46,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.46},"modelId":"grok-build-0-1","modelName":"Grok Build 0.1","rank":43,"medal":null},{"observationId":"gemini-3-5-flash-lite-livebench-language","label":"LiveBench : langue","display":"71,8 %","value":71.8203,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.8203},"modelId":"gemini-3-5-flash-lite","modelName":"Gemini 3.5 Flash-Lite","rank":44,"medal":null},{"observationId":"gpt-5-4-mini-livebench-language","label":"LiveBench : langue","display":"71,0 %","value":70.9517,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.9517},"modelId":"gpt-5-4-mini","modelName":"GPT-5.4 mini","rank":45,"medal":null},{"observationId":"nemotron-3-ultra-livebench-language","label":"LiveBench : langue","display":"70,8 %","value":70.8113,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.8113},"modelId":"nemotron-3-ultra","modelName":"Nemotron 3 Ultra 550B A55B","rank":46,"medal":null},{"observationId":"deepseek-v4-flash-livebench-language","label":"LiveBench : langue","display":"70,1 %","value":70.124,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.124},"modelId":"deepseek-v4-flash","modelName":"DeepSeek V4 Flash","rank":47,"medal":null},{"observationId":"qwen3-6-27b-livebench-language","label":"LiveBench : langue","display":"63,3 %","value":63.3043,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.3043},"modelId":"qwen3-6-27b","modelName":"Qwen 3.6 27B","rank":48,"medal":null},{"observationId":"gpt-5-4-nano-livebench-language","label":"LiveBench : langue","display":"62,5 %","value":62.507,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.507},"modelId":"gpt-5-4-nano","modelName":"GPT-5.4 nano","rank":49,"medal":null}]},{"id":"livebench-instruction-following-2026-06-25","label":"LiveBench : suivi des consignes","organization":"LiveBench","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"instruction-following","sourceType":1,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"gemini-3-8-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"81,4 %","value":81.4125,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.4125},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":1,"medal":"or"},{"observationId":"gemini-3-7-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"79,9 %","value":79.9253,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.9253},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":2,"medal":"argent"},{"observationId":"gemini-3-1-pro-preview-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"79,1 %","value":79.1,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.1},"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","rank":3,"medal":"bronze"},{"observationId":"muse-spark-1-3-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"78,0 %","value":78.0043,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.0043},"modelId":"muse-spark-1-3","modelName":"Muse Spark 1.3","rank":4,"medal":null},{"observationId":"qwen3-8-flash-next-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"77,1 %","value":77.1085,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.1085},"modelId":"qwen3-8-flash-next","modelName":"Qwen 3.8 Flash Next","rank":5,"medal":null},{"observationId":"fable-5-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"75,8 %","value":75.7708,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.7708},"modelId":"fable-5","modelName":"Claude Fable 5","rank":6,"medal":null},{"observationId":"gemini-3-5-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"75,6 %","value":75.6,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.6},"modelId":"gemini-3-5-flash","modelName":"Gemini 3.5 Flash","rank":7,"medal":null},{"observationId":"gemini-3-6-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"75,4 %","value":75.3668,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.3668},"modelId":"gemini-3-6-flash","modelName":"Gemini 3.6 Flash","rank":8,"medal":null},{"observationId":"muse-spark-1-2-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"74,3 %","value":74.325,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.325},"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","rank":9,"medal":null},{"observationId":"qwen3-8-max-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"74,1 %","value":74.0835,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.0835},"modelId":"qwen3-8-max","modelName":"Qwen 3.8 Max","rank":10,"medal":null},{"observationId":"qwen3-7-max-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"74,0 %","value":74.0415,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.0415},"modelId":"qwen3-7-max","modelName":"Qwen 3.7 Max","rank":11,"medal":null},{"observationId":"nemotron-3-ultra-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"73,4 %","value":73.4455,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.4455},"modelId":"nemotron-3-ultra","modelName":"Nemotron 3 Ultra 550B A55B","rank":12,"medal":null},{"observationId":"fable-5-1-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"73,0 %","value":72.9878,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.9878},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":13,"medal":null},{"observationId":"qwen3-8-27b-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"72,7 %","value":72.6583,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.6583},"modelId":"qwen3-8-27b","modelName":"Qwen 3.8 27B","rank":14,"medal":null},{"observationId":"claude-opus-4-8-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"72,0 %","value":72.0335,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.0335},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":15,"medal":null},{"observationId":"grok-4-6-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,9 %","value":71.8665,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.8665},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":16,"medal":null},{"observationId":"sol-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,8 %","value":71.846,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.846},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":17,"medal":null},{"observationId":"grok-4-5-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,5 %","value":71.5293,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.5293},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":18,"medal":null},{"observationId":"kimi-k3-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,4 %","value":71.3628,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.3628},"modelId":"kimi-k3","modelName":"Kimi K3","rank":19,"medal":null},{"observationId":"smaug-agentic-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,0 %","value":70.9918,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.9918},"modelId":"smaug-agentic","modelName":"Smaug-Agentic","rank":20,"medal":null},{"observationId":"deepseek-v4-flash-vision-exp-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,0 %","value":70.9582,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.9582},"modelId":"deepseek-v4-flash-vision-exp","modelName":"DeepSeek V4 Flash Vision Exp","rank":21,"medal":null},{"observationId":"gpt-5-5-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"70,7 %","value":70.7293,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.7293},"modelId":"gpt-5-5","modelName":"GPT-5.5","rank":22,"medal":null},{"observationId":"gpt-5-4-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"70,2 %","value":70.2168,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.2168},"modelId":"gpt-5-4","modelName":"GPT-5.4","rank":23,"medal":null},{"observationId":"inkling-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"70,1 %","value":70.0958,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.0958},"modelId":"inkling","modelName":"Inkling","rank":24,"medal":null},{"observationId":"muse-spark-1-1-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"69,6 %","value":69.6375,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.6375},"modelId":"muse-spark-1-1","modelName":"Muse Spark 1.1","rank":25,"medal":null},{"observationId":"glm-5-3-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"69,3 %","value":69.304,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.304},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":26,"medal":null},{"observationId":"deepseek-v4-pro-0813-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"67,7 %","value":67.7,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":67.7},"modelId":"deepseek-v4-pro-0813","modelName":"DeepSeek V4 Pro 0813","rank":27,"medal":null},{"observationId":"gemini-3-5-flash-lite-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"67,2 %","value":67.2378,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":67.2378},"modelId":"gemini-3-5-flash-lite","modelName":"Gemini 3.5 Flash-Lite","rank":28,"medal":null},{"observationId":"gpt-5-4-nano-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"67,2 %","value":67.2048,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":67.2048},"modelId":"gpt-5-4-nano","modelName":"GPT-5.4 nano","rank":29,"medal":null},{"observationId":"claude-opus-4-7-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"66,7 %","value":66.7375,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":66.7375},"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","rank":30,"medal":null},{"observationId":"deepseek-v4-flash-0731-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"65,5 %","value":65.5168,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.5168},"modelId":"deepseek-v4-flash-0731","modelName":"DeepSeek V4 Flash 0731","rank":31,"medal":null},{"observationId":"grok-build-0-1-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"65,2 %","value":65.2208,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.2208},"modelId":"grok-build-0-1","modelName":"Grok Build 0.1","rank":32,"medal":null},{"observationId":"terra-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"64,6 %","value":64.6165,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.6165},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":33,"medal":null},{"observationId":"kimi-k2-6-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"64,4 %","value":64.3583,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.3583},"modelId":"kimi-k2-6","modelName":"Kimi K2.6","rank":34,"medal":null},{"observationId":"claude-sonnet-5-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"63,9 %","value":63.8585,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.8585},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":35,"medal":null},{"observationId":"opus-5-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"63,8 %","value":63.7665,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.7665},"modelId":"opus-5","modelName":"Claude Opus 5","rank":36,"medal":null},{"observationId":"claude-opus-4-6-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"63,3 %","value":63.3125,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.3125},"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","rank":37,"medal":null},{"observationId":"claude-sonnet-4-6-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"63,2 %","value":63.2208,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.2208},"modelId":"claude-sonnet-4-6","modelName":"Claude Sonnet 4.6","rank":38,"medal":null},{"observationId":"deepseek-v4-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"63,1 %","value":63.1375,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.1375},"modelId":"deepseek-v4-flash","modelName":"DeepSeek V4 Flash","rank":39,"medal":null},{"observationId":"grok-4-3-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"62,8 %","value":62.75,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.75},"modelId":"grok-4-3","modelName":"Grok 4.3","rank":40,"medal":null},{"observationId":"deepseek-v4-pro-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"62,4 %","value":62.35,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.35},"modelId":"deepseek-v4-pro","modelName":"DeepSeek V4 Pro","rank":41,"medal":null},{"observationId":"glm-5-2-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"62,3 %","value":62.2918,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.2918},"modelId":"glm-5-2","modelName":"GLM 5.2","rank":42,"medal":null},{"observationId":"luna-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"60,1 %","value":60.121,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":60.121},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":43,"medal":null},{"observationId":"gpt-5-4-mini-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"59,8 %","value":59.804,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":59.804},"modelId":"gpt-5-4-mini","modelName":"GPT-5.4 mini","rank":44,"medal":null},{"observationId":"qwen3-6-plus-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"58,3 %","value":58.342,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":58.342},"modelId":"qwen3-6-plus","modelName":"Qwen 3.6 Plus","rank":45,"medal":null},{"observationId":"minimax-m3-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"57,5 %","value":57.5083,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":57.5083},"modelId":"minimax-m3","modelName":"MiniMax M3","rank":46,"medal":null},{"observationId":"kimi-k2-7-code-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"56,3 %","value":56.2918,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":56.2918},"modelId":"kimi-k2-7-code","modelName":"Kimi K2.7 Code","rank":47,"medal":null},{"observationId":"qwen3-6-27b-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"53,2 %","value":53.229,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":53.229},"modelId":"qwen3-6-27b","modelName":"Qwen 3.6 27B","rank":48,"medal":null},{"observationId":"glm-5-3-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"52,8 %","value":52.8208,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":52.8208},"modelId":"glm-5-3-flash","modelName":"GLM 5.3 Flash","rank":49,"medal":null}]}],"rows":[{"modelId":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[{"observationId":"astra-aa-intelligence","label":"Artificial Analysis Intelligence Index v4.1.1","display":"61 points","value":61,"unit":"index","dispersion":"Marge annoncée à 95 % : moins de ±1 point","sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Outils et réglages propres à chacun des neuf tests. Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %.","limitation":"Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.","visual":{"kind":"none"},"modelId":"astra","modelName":"GPT-6 Astra","rank":2.5,"medal":null}],"epoch-eci-2026-09":[{"observationId":"astra-epoch-eci","label":"Epoch Capabilities Index","display":"169 points Epoch","value":169,"unit":"index","dispersion":"Fourchette probable à 90 % : 165 à 174","sourceUrl":"https://epoch.ai/models/gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Sources mélangées","isManufacturer":false,"protocol":"Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants. Calcul tenant compte du niveau de difficulté de chaque test.","limitation":"Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.","visual":{"kind":"none"},"modelId":"astra","modelName":"GPT-6 Astra","rank":2,"medal":null}],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}},{"modelId":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","measured":true,"independentTeams":2,"stars":2,"starsLabel":"Une équipe extérieure","rank":1,"averageRank":null,"normalizedScore":null,"rankLabel":"1er","medal":"or","manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[{"observationId":"fable-5-1-aa-intelligence","label":"Artificial Analysis Intelligence Index v4.1.1","display":"66 points","value":66,"unit":"index","dispersion":"Marge annoncée à 95 % : moins de ±1 point","sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Outils et réglages propres à chacun des neuf tests. Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %.","limitation":"Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.","visual":{"kind":"none"},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1,"medal":"or"}],"epoch-eci-2026-09":[{"observationId":"fable-5-1-epoch-eci","label":"Epoch Capabilities Index","display":"163 points Epoch","value":163,"unit":"index","dispersion":"Fourchette probable à 90 % : 160 à 166","sourceUrl":"https://epoch.ai/models/claude-fable-5-1","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Sources mélangées","isManufacturer":false,"protocol":"Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants. Calcul tenant compte du niveau de difficulté de chaque test.","limitation":"Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.","visual":{"kind":"none"},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":2,"medal":null}],"livebench-reasoning-2026-06-25":[{"observationId":"fable-5-1-livebench-reasoning","label":"LiveBench : raisonnement","display":"91,7 %","value":91.6923,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.6923},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1,"medal":"or"}],"livebench-data-analysis-2026-06-25":[{"observationId":"fable-5-1-livebench-data-analysis","label":"LiveBench : analyse de données","display":"80,3 %","value":80.2757,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":80.2757},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":3,"medal":"bronze"}],"livebench-language-2026-06-25":[{"observationId":"fable-5-1-livebench-language","label":"LiveBench : langue","display":"89,5 %","value":89.501,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.501},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":2,"medal":"argent"}],"livebench-instruction-following-2026-06-25":[{"observationId":"fable-5-1-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"73,0 %","value":72.9878,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.9878},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":13,"medal":null}]}},{"modelId":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":10,"averageRank":null,"normalizedScore":null,"rankLabel":"10e ex aequo","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"fable-5-livebench-reasoning","label":"LiveBench : raisonnement","display":"89,7 %","value":89.6538,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.6538},"modelId":"fable-5","modelName":"Claude Fable 5","rank":10,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"fable-5-livebench-data-analysis","label":"LiveBench : analyse de données","display":"80,5 %","value":80.5377,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":80.5377},"modelId":"fable-5","modelName":"Claude Fable 5","rank":2,"medal":"argent"}],"livebench-language-2026-06-25":[{"observationId":"fable-5-livebench-language","label":"LiveBench : langue","display":"90,7 %","value":90.684,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.684},"modelId":"fable-5","modelName":"Claude Fable 5","rank":1,"medal":"or"}],"livebench-instruction-following-2026-06-25":[{"observationId":"fable-5-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"75,8 %","value":75.7708,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.7708},"modelId":"fable-5","modelName":"Claude Fable 5","rank":6,"medal":null}]}},{"modelId":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":3,"averageRank":null,"normalizedScore":null,"rankLabel":"3e","medal":"bronze","manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"opus-5-livebench-reasoning","label":"LiveBench : raisonnement","display":"91,2 %","value":91.2115,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.2115},"modelId":"opus-5","modelName":"Claude Opus 5","rank":3,"medal":"bronze"}],"livebench-data-analysis-2026-06-25":[{"observationId":"opus-5-livebench-data-analysis","label":"LiveBench : analyse de données","display":"74,6 %","value":74.5503,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.5503},"modelId":"opus-5","modelName":"Claude Opus 5","rank":22,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"opus-5-livebench-language","label":"LiveBench : langue","display":"88,7 %","value":88.688,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.688},"modelId":"opus-5","modelName":"Claude Opus 5","rank":3,"medal":"bronze"}],"livebench-instruction-following-2026-06-25":[{"observationId":"opus-5-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"63,8 %","value":63.7665,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.7665},"modelId":"opus-5","modelName":"Claude Opus 5","rank":36,"medal":null}]}},{"modelId":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":true,"independentTeams":2,"stars":2,"starsLabel":"Une équipe extérieure","rank":2,"averageRank":null,"normalizedScore":null,"rankLabel":"2e","medal":"argent","manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[{"observationId":"sol-aa-intelligence","label":"Artificial Analysis Intelligence Index v4.1.1","display":"61 points","value":61,"unit":"index","dispersion":"Marge annoncée à 95 % : moins de ±1 point","sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Outils et réglages propres à chacun des neuf tests. Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %.","limitation":"Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.","visual":{"kind":"none"},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":2.5,"medal":null}],"epoch-eci-2026-09":[{"observationId":"sol-epoch-eci","label":"Epoch Capabilities Index","display":"162 points Epoch","value":162,"unit":"index","dispersion":"Fourchette probable à 90 % : 160 à 165","sourceUrl":"https://epoch.ai/models/gpt-5-6-sol","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Sources mélangées","isManufacturer":false,"protocol":"Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants. Calcul tenant compte du niveau de difficulté de chaque test.","limitation":"Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.","visual":{"kind":"none"},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":2,"medal":null}],"livebench-reasoning-2026-06-25":[{"observationId":"sol-livebench-reasoning","label":"LiveBench : raisonnement","display":"91,7 %","value":91.6538,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.6538},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":2,"medal":"argent"}],"livebench-data-analysis-2026-06-25":[{"observationId":"sol-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,8 %","value":79.8407,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.8407},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":5,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"sol-livebench-language","label":"LiveBench : langue","display":"87,7 %","value":87.6837,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.6837},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":5,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"sol-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,8 %","value":71.846,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.846},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":17,"medal":null}]}},{"modelId":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}},{"modelId":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":15,"averageRank":null,"normalizedScore":null,"rankLabel":"15e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"claude-opus-4-6-livebench-reasoning","label":"LiveBench : raisonnement","display":"88,7 %","value":88.673,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.673},"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","rank":15,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"claude-opus-4-6-livebench-data-analysis","label":"LiveBench : analyse de données","display":"69,9 %","value":69.893,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.893},"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","rank":37,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"claude-opus-4-6-livebench-language","label":"LiveBench : langue","display":"83,3 %","value":83.2697,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.2697},"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","rank":14,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"claude-opus-4-6-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"63,3 %","value":63.3125,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.3125},"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","rank":37,"medal":null}]}},{"modelId":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}},{"modelId":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}},{"modelId":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":21,"averageRank":null,"normalizedScore":null,"rankLabel":"21e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"claude-opus-4-7-livebench-reasoning","label":"LiveBench : raisonnement","display":"87,2 %","value":87.1923,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.1923},"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","rank":21,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"claude-opus-4-7-livebench-data-analysis","label":"LiveBench : analyse de données","display":"78,3 %","value":78.2637,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.2637},"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","rank":15,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"claude-opus-4-7-livebench-language","label":"LiveBench : langue","display":"77,9 %","value":77.914,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.914},"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","rank":28,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"claude-opus-4-7-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"66,7 %","value":66.7375,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":66.7375},"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","rank":30,"medal":null}]}},{"modelId":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":29,"averageRank":null,"normalizedScore":null,"rankLabel":"29e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"claude-sonnet-4-6-livebench-reasoning","label":"LiveBench : raisonnement","display":"84,8 %","value":84.7693,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.7693},"modelId":"claude-sonnet-4-6","modelName":"Claude Sonnet 4.6","rank":29,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"claude-sonnet-4-6-livebench-data-analysis","label":"LiveBench : analyse de données","display":"77,9 %","value":77.946,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.946},"modelId":"claude-sonnet-4-6","modelName":"Claude Sonnet 4.6","rank":17,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"claude-sonnet-4-6-livebench-language","label":"LiveBench : langue","display":"76,1 %","value":76.1027,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.1027},"modelId":"claude-sonnet-4-6","modelName":"Claude Sonnet 4.6","rank":33,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"claude-sonnet-4-6-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"63,2 %","value":63.2208,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.2208},"modelId":"claude-sonnet-4-6","modelName":"Claude Sonnet 4.6","rank":38,"medal":null}]}},{"modelId":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":14,"averageRank":null,"normalizedScore":null,"rankLabel":"14e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"claude-sonnet-5-livebench-reasoning","label":"LiveBench : raisonnement","display":"88,7 %","value":88.6923,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.6923},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":14,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"claude-sonnet-5-livebench-data-analysis","label":"LiveBench : analyse de données","display":"71,7 %","value":71.7407,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.7407},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":31,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"claude-sonnet-5-livebench-language","label":"LiveBench : langue","display":"75,0 %","value":74.9703,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.9703},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":36,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"claude-sonnet-5-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"63,9 %","value":63.8585,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.8585},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":35,"medal":null}]}},{"modelId":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":47,"averageRank":null,"normalizedScore":null,"rankLabel":"47e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"deepseek-v4-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"70,6 %","value":70.5818,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.5818},"modelId":"deepseek-v4-flash","modelName":"DeepSeek V4 Flash","rank":47,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"deepseek-v4-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"68,0 %","value":68.023,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":68.023},"modelId":"deepseek-v4-flash","modelName":"DeepSeek V4 Flash","rank":38,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"deepseek-v4-flash-livebench-language","label":"LiveBench : langue","display":"70,1 %","value":70.124,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.124},"modelId":"deepseek-v4-flash","modelName":"DeepSeek V4 Flash","rank":47,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"deepseek-v4-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"63,1 %","value":63.1375,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.1375},"modelId":"deepseek-v4-flash","modelName":"DeepSeek V4 Flash","rank":39,"medal":null}]}},{"modelId":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":33,"averageRank":null,"normalizedScore":null,"rankLabel":"33e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"deepseek-v4-pro-livebench-reasoning","label":"LiveBench : raisonnement","display":"82,7 %","value":82.6923,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.6923},"modelId":"deepseek-v4-pro","modelName":"DeepSeek V4 Pro","rank":33,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"deepseek-v4-pro-livebench-data-analysis","label":"LiveBench : analyse de données","display":"74,5 %","value":74.5377,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.5377},"modelId":"deepseek-v4-pro","modelName":"DeepSeek V4 Pro","rank":23,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"deepseek-v4-pro-livebench-language","label":"LiveBench : langue","display":"78,1 %","value":78.1303,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.1303},"modelId":"deepseek-v4-pro","modelName":"DeepSeek V4 Pro","rank":27,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"deepseek-v4-pro-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"62,4 %","value":62.35,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.35},"modelId":"deepseek-v4-pro","modelName":"DeepSeek V4 Pro","rank":41,"medal":null}]}},{"modelId":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":30,"averageRank":null,"normalizedScore":null,"rankLabel":"30e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"gemini-3-1-pro-preview-livebench-reasoning","label":"LiveBench : raisonnement","display":"84,0 %","value":84.0048,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.0048},"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","rank":30,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"gemini-3-1-pro-preview-livebench-data-analysis","label":"LiveBench : analyse de données","display":"78,5 %","value":78.5413,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.5413},"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","rank":13,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"gemini-3-1-pro-preview-livebench-language","label":"LiveBench : langue","display":"85,4 %","value":85.376,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.376},"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","rank":9,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"gemini-3-1-pro-preview-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"79,1 %","value":79.1,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.1},"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","rank":3,"medal":"bronze"}]}},{"modelId":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":34,"averageRank":null,"normalizedScore":null,"rankLabel":"34e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"gemini-3-5-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"82,0 %","value":82.0048,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.0048},"modelId":"gemini-3-5-flash","modelName":"Gemini 3.5 Flash","rank":34,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"gemini-3-5-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"64,9 %","value":64.8573,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.8573},"modelId":"gemini-3-5-flash","modelName":"Gemini 3.5 Flash","rank":43,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"gemini-3-5-flash-livebench-language","label":"LiveBench : langue","display":"84,6 %","value":84.5843,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.5843},"modelId":"gemini-3-5-flash","modelName":"Gemini 3.5 Flash","rank":10,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"gemini-3-5-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"75,6 %","value":75.6,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.6},"modelId":"gemini-3-5-flash","modelName":"Gemini 3.5 Flash","rank":7,"medal":null}]}},{"modelId":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":38,"averageRank":null,"normalizedScore":null,"rankLabel":"38e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"glm-5-2-livebench-reasoning","label":"LiveBench : raisonnement","display":"78,6 %","value":78.625,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.625},"modelId":"glm-5-2","modelName":"GLM 5.2","rank":38,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"glm-5-2-livebench-data-analysis","label":"LiveBench : analyse de données","display":"73,7 %","value":73.7397,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.7397},"modelId":"glm-5-2","modelName":"GLM 5.2","rank":26,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"glm-5-2-livebench-language","label":"LiveBench : langue","display":"76,2 %","value":76.2417,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.2417},"modelId":"glm-5-2","modelName":"GLM 5.2","rank":32,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"glm-5-2-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"62,3 %","value":62.2918,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.2918},"modelId":"glm-5-2","modelName":"GLM 5.2","rank":42,"medal":null}]}},{"modelId":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":45,"averageRank":null,"normalizedScore":null,"rankLabel":"45e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"gpt-5-4-mini-livebench-reasoning","label":"LiveBench : raisonnement","display":"71,3 %","value":71.3238,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.3238},"modelId":"gpt-5-4-mini","modelName":"GPT-5.4 mini","rank":45,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"gpt-5-4-mini-livebench-data-analysis","label":"LiveBench : analyse de données","display":"70,8 %","value":70.7857,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.7857},"modelId":"gpt-5-4-mini","modelName":"GPT-5.4 mini","rank":33,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"gpt-5-4-mini-livebench-language","label":"LiveBench : langue","display":"71,0 %","value":70.9517,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.9517},"modelId":"gpt-5-4-mini","modelName":"GPT-5.4 mini","rank":45,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"gpt-5-4-mini-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"59,8 %","value":59.804,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":59.804},"modelId":"gpt-5-4-mini","modelName":"GPT-5.4 mini","rank":44,"medal":null}]}},{"modelId":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":35,"averageRank":null,"normalizedScore":null,"rankLabel":"35e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"gpt-5-4-nano-livebench-reasoning","label":"LiveBench : raisonnement","display":"81,1 %","value":81.097,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.097},"modelId":"gpt-5-4-nano","modelName":"GPT-5.4 nano","rank":35,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"gpt-5-4-nano-livebench-data-analysis","label":"LiveBench : analyse de données","display":"67,6 %","value":67.6427,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":67.6427},"modelId":"gpt-5-4-nano","modelName":"GPT-5.4 nano","rank":40,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"gpt-5-4-nano-livebench-language","label":"LiveBench : langue","display":"62,5 %","value":62.507,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.507},"modelId":"gpt-5-4-nano","modelName":"GPT-5.4 nano","rank":49,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"gpt-5-4-nano-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"67,2 %","value":67.2048,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":67.2048},"modelId":"gpt-5-4-nano","modelName":"GPT-5.4 nano","rank":29,"medal":null}]}},{"modelId":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":17,"averageRank":null,"normalizedScore":null,"rankLabel":"17e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"gpt-5-4-livebench-reasoning","label":"LiveBench : raisonnement","display":"88,1 %","value":88.1155,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.1155},"modelId":"gpt-5-4","modelName":"GPT-5.4","rank":17,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"gpt-5-4-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,3 %","value":79.3133,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.3133},"modelId":"gpt-5-4","modelName":"GPT-5.4","rank":9,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"gpt-5-4-livebench-language","label":"LiveBench : langue","display":"82,6 %","value":82.6337,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.6337},"modelId":"gpt-5-4","modelName":"GPT-5.4","rank":18,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"gpt-5-4-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"70,2 %","value":70.2168,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.2168},"modelId":"gpt-5-4","modelName":"GPT-5.4","rank":23,"medal":null}]}},{"modelId":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":10,"averageRank":null,"normalizedScore":null,"rankLabel":"10e ex aequo","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"gpt-5-5-livebench-reasoning","label":"LiveBench : raisonnement","display":"89,7 %","value":89.6538,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.6538},"modelId":"gpt-5-5","modelName":"GPT-5.5","rank":10,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"gpt-5-5-livebench-data-analysis","label":"LiveBench : analyse de données","display":"81,6 %","value":81.5757,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.5757},"modelId":"gpt-5-5","modelName":"GPT-5.5","rank":1,"medal":"or"}],"livebench-language-2026-06-25":[{"observationId":"gpt-5-5-livebench-language","label":"LiveBench : langue","display":"87,4 %","value":87.363,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.363},"modelId":"gpt-5-5","modelName":"GPT-5.5","rank":6,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"gpt-5-5-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"70,7 %","value":70.7293,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.7293},"modelId":"gpt-5-5","modelName":"GPT-5.5","rank":22,"medal":null}]}},{"modelId":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":46,"averageRank":null,"normalizedScore":null,"rankLabel":"46e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"grok-4-3-livebench-reasoning","label":"LiveBench : raisonnement","display":"70,8 %","value":70.822,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.822},"modelId":"grok-4-3","modelName":"Grok 4.3","rank":46,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"grok-4-3-livebench-data-analysis","label":"LiveBench : analyse de données","display":"55,8 %","value":55.7727,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":55.7727},"modelId":"grok-4-3","modelName":"Grok 4.3","rank":46,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"grok-4-3-livebench-language","label":"LiveBench : langue","display":"73,6 %","value":73.58,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.58},"modelId":"grok-4-3","modelName":"Grok 4.3","rank":40,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"grok-4-3-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"62,8 %","value":62.75,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.75},"modelId":"grok-4-3","modelName":"Grok 4.3","rank":40,"medal":null}]}},{"modelId":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":22,"averageRank":null,"normalizedScore":null,"rankLabel":"22e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"grok-4-5-livebench-reasoning","label":"LiveBench : raisonnement","display":"87,2 %","value":87.173,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.173},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":22,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"grok-4-5-livebench-data-analysis","label":"LiveBench : analyse de données","display":"73,0 %","value":73.0377,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.0377},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":27,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"grok-4-5-livebench-language","label":"LiveBench : langue","display":"82,8 %","value":82.7953,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.7953},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":16,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"grok-4-5-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,5 %","value":71.5293,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.5293},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":18,"medal":null}]}},{"modelId":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":41,"averageRank":null,"normalizedScore":null,"rankLabel":"41e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"grok-build-0-1-livebench-reasoning","label":"LiveBench : raisonnement","display":"76,4 %","value":76.3703,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.3703},"modelId":"grok-build-0-1","modelName":"Grok Build 0.1","rank":41,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"grok-build-0-1-livebench-data-analysis","label":"LiveBench : analyse de données","display":"70,8 %","value":70.794,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.794},"modelId":"grok-build-0-1","modelName":"Grok Build 0.1","rank":32,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"grok-build-0-1-livebench-language","label":"LiveBench : langue","display":"72,5 %","value":72.46,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.46},"modelId":"grok-build-0-1","modelName":"Grok Build 0.1","rank":43,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"grok-build-0-1-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"65,2 %","value":65.2208,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.2208},"modelId":"grok-build-0-1","modelName":"Grok Build 0.1","rank":32,"medal":null}]}},{"modelId":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":37,"averageRank":null,"normalizedScore":null,"rankLabel":"37e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"kimi-k2-6-livebench-reasoning","label":"LiveBench : raisonnement","display":"79,4 %","value":79.375,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.375},"modelId":"kimi-k2-6","modelName":"Kimi K2.6","rank":37,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"kimi-k2-6-livebench-data-analysis","label":"LiveBench : analyse de données","display":"65,1 %","value":65.1343,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.1343},"modelId":"kimi-k2-6","modelName":"Kimi K2.6","rank":42,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"kimi-k2-6-livebench-language","label":"LiveBench : langue","display":"75,1 %","value":75.1413,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.1413},"modelId":"kimi-k2-6","modelName":"Kimi K2.6","rank":34,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"kimi-k2-6-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"64,4 %","value":64.3583,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.3583},"modelId":"kimi-k2-6","modelName":"Kimi K2.6","rank":34,"medal":null}]}},{"modelId":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":32,"averageRank":null,"normalizedScore":null,"rankLabel":"32e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"kimi-k2-7-code-livebench-reasoning","label":"LiveBench : raisonnement","display":"82,8 %","value":82.8078,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.8078},"modelId":"kimi-k2-7-code","modelName":"Kimi K2.7 Code","rank":32,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"kimi-k2-7-code-livebench-data-analysis","label":"LiveBench : analyse de données","display":"62,7 %","value":62.6573,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.6573},"modelId":"kimi-k2-7-code","modelName":"Kimi K2.7 Code","rank":45,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"kimi-k2-7-code-livebench-language","label":"LiveBench : langue","display":"77,9 %","value":77.9057,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.9057},"modelId":"kimi-k2-7-code","modelName":"Kimi K2.7 Code","rank":29,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"kimi-k2-7-code-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"56,3 %","value":56.2918,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":56.2918},"modelId":"kimi-k2-7-code","modelName":"Kimi K2.7 Code","rank":47,"medal":null}]}},{"modelId":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":44,"averageRank":null,"normalizedScore":null,"rankLabel":"44e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"minimax-m3-livebench-reasoning","label":"LiveBench : raisonnement","display":"74,5 %","value":74.4808,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.4808},"modelId":"minimax-m3","modelName":"MiniMax M3","rank":44,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"minimax-m3-livebench-data-analysis","label":"LiveBench : analyse de données","display":"76,2 %","value":76.1663,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.1663},"modelId":"minimax-m3","modelName":"MiniMax M3","rank":21,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"minimax-m3-livebench-language","label":"LiveBench : langue","display":"76,8 %","value":76.8357,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.8357},"modelId":"minimax-m3","modelName":"MiniMax M3","rank":31,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"minimax-m3-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"57,5 %","value":57.5083,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":57.5083},"modelId":"minimax-m3","modelName":"MiniMax M3","rank":46,"medal":null}]}},{"modelId":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":48,"averageRank":null,"normalizedScore":null,"rankLabel":"48e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"qwen3-6-27b-livebench-reasoning","label":"LiveBench : raisonnement","display":"70,3 %","value":70.2838,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.2838},"modelId":"qwen3-6-27b","modelName":"Qwen 3.6 27B","rank":48,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"qwen3-6-27b-livebench-data-analysis","label":"LiveBench : analyse de données","display":"70,4 %","value":70.4267,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.4267},"modelId":"qwen3-6-27b","modelName":"Qwen 3.6 27B","rank":34,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"qwen3-6-27b-livebench-language","label":"LiveBench : langue","display":"63,3 %","value":63.3043,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.3043},"modelId":"qwen3-6-27b","modelName":"Qwen 3.6 27B","rank":48,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"qwen3-6-27b-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"53,2 %","value":53.229,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":53.229},"modelId":"qwen3-6-27b","modelName":"Qwen 3.6 27B","rank":48,"medal":null}]}},{"modelId":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":42,"averageRank":null,"normalizedScore":null,"rankLabel":"42e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"qwen3-6-plus-livebench-reasoning","label":"LiveBench : raisonnement","display":"75,8 %","value":75.827,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.827},"modelId":"qwen3-6-plus","modelName":"Qwen 3.6 Plus","rank":42,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"qwen3-6-plus-livebench-data-analysis","label":"LiveBench : analyse de données","display":"69,9 %","value":69.9117,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.9117},"modelId":"qwen3-6-plus","modelName":"Qwen 3.6 Plus","rank":36,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"qwen3-6-plus-livebench-language","label":"LiveBench : langue","display":"75,0 %","value":74.9893,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.9893},"modelId":"qwen3-6-plus","modelName":"Qwen 3.6 Plus","rank":35,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"qwen3-6-plus-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"58,3 %","value":58.342,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":58.342},"modelId":"qwen3-6-plus","modelName":"Qwen 3.6 Plus","rank":45,"medal":null}]}},{"modelId":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":31,"averageRank":null,"normalizedScore":null,"rankLabel":"31e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"qwen3-7-max-livebench-reasoning","label":"LiveBench : raisonnement","display":"83,3 %","value":83.3365,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.3365},"modelId":"qwen3-7-max","modelName":"Qwen 3.7 Max","rank":31,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"qwen3-7-max-livebench-data-analysis","label":"LiveBench : analyse de données","display":"71,8 %","value":71.786,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.786},"modelId":"qwen3-7-max","modelName":"Qwen 3.7 Max","rank":30,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"qwen3-7-max-livebench-language","label":"LiveBench : langue","display":"79,7 %","value":79.739,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.739},"modelId":"qwen3-7-max","modelName":"Qwen 3.7 Max","rank":22,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"qwen3-7-max-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"74,0 %","value":74.0415,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.0415},"modelId":"qwen3-7-max","modelName":"Qwen 3.7 Max","rank":11,"medal":null}]}},{"modelId":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":5,"averageRank":null,"normalizedScore":null,"rankLabel":"5e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"terra-livebench-reasoning","label":"LiveBench : raisonnement","display":"90,6 %","value":90.6345,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.6345},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":5,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"terra-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,3 %","value":79.3067,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.3067},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":10,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"terra-livebench-language","label":"LiveBench : langue","display":"82,9 %","value":82.8927,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.8927},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":15,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"terra-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"64,6 %","value":64.6165,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.6165},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":33,"medal":null}]}},{"modelId":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":26,"averageRank":null,"normalizedScore":null,"rankLabel":"26e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"luna-livebench-reasoning","label":"LiveBench : raisonnement","display":"85,6 %","value":85.6443,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.6443},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":26,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"luna-livebench-data-analysis","label":"LiveBench : analyse de données","display":"78,0 %","value":78.0333,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.0333},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":16,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"luna-livebench-language","label":"LiveBench : langue","display":"72,6 %","value":72.567,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.567},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":42,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"luna-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"60,1 %","value":60.121,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":60.121},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":43,"medal":null}]}},{"modelId":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":19,"averageRank":null,"normalizedScore":null,"rankLabel":"19e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"muse-spark-1-1-livebench-reasoning","label":"LiveBench : raisonnement","display":"87,7 %","value":87.7308,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.7308},"modelId":"muse-spark-1-1","modelName":"Muse Spark 1.1","rank":19,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"muse-spark-1-1-livebench-data-analysis","label":"LiveBench : analyse de données","display":"72,5 %","value":72.548,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.548},"modelId":"muse-spark-1-1","modelName":"Muse Spark 1.1","rank":29,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"muse-spark-1-1-livebench-language","label":"LiveBench : langue","display":"74,3 %","value":74.342,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.342},"modelId":"muse-spark-1-1","modelName":"Muse Spark 1.1","rank":39,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"muse-spark-1-1-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"69,6 %","value":69.6375,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.6375},"modelId":"muse-spark-1-1","modelName":"Muse Spark 1.1","rank":25,"medal":null}]}},{"modelId":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":4,"averageRank":null,"normalizedScore":null,"rankLabel":"4e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"kimi-k3-livebench-reasoning","label":"LiveBench : raisonnement","display":"90,7 %","value":90.673,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.673},"modelId":"kimi-k3","modelName":"Kimi K3","rank":4,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"kimi-k3-livebench-data-analysis","label":"LiveBench : analyse de données","display":"78,7 %","value":78.7337,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.7337},"modelId":"kimi-k3","modelName":"Kimi K3","rank":12,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"kimi-k3-livebench-language","label":"LiveBench : langue","display":"85,5 %","value":85.528,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.528},"modelId":"kimi-k3","modelName":"Kimi K3","rank":7,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"kimi-k3-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,4 %","value":71.3628,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.3628},"modelId":"kimi-k3","modelName":"Kimi K3","rank":19,"medal":null}]}},{"modelId":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":39,"averageRank":null,"normalizedScore":null,"rankLabel":"39e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"inkling-livebench-reasoning","label":"LiveBench : raisonnement","display":"78,3 %","value":78.3463,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.3463},"modelId":"inkling","modelName":"Inkling","rank":39,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"inkling-livebench-data-analysis","label":"LiveBench : analyse de données","display":"72,8 %","value":72.778,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.778},"modelId":"inkling","modelName":"Inkling","rank":28,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"inkling-livebench-language","label":"LiveBench : langue","display":"73,5 %","value":73.4587,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.4587},"modelId":"inkling","modelName":"Inkling","rank":41,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"inkling-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"70,1 %","value":70.0958,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.0958},"modelId":"inkling","modelName":"Inkling","rank":24,"medal":null}]}},{"modelId":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":49,"averageRank":null,"normalizedScore":null,"rankLabel":"49e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"gemini-3-5-flash-lite-livebench-reasoning","label":"LiveBench : raisonnement","display":"60,2 %","value":60.1875,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":60.1875},"modelId":"gemini-3-5-flash-lite","modelName":"Gemini 3.5 Flash-Lite","rank":49,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"gemini-3-5-flash-lite-livebench-data-analysis","label":"LiveBench : analyse de données","display":"53,2 %","value":53.2497,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":53.2497},"modelId":"gemini-3-5-flash-lite","modelName":"Gemini 3.5 Flash-Lite","rank":49,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"gemini-3-5-flash-lite-livebench-language","label":"LiveBench : langue","display":"71,8 %","value":71.8203,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.8203},"modelId":"gemini-3-5-flash-lite","modelName":"Gemini 3.5 Flash-Lite","rank":44,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"gemini-3-5-flash-lite-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"67,2 %","value":67.2378,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":67.2378},"modelId":"gemini-3-5-flash-lite","modelName":"Gemini 3.5 Flash-Lite","rank":28,"medal":null}]}},{"modelId":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":28,"averageRank":null,"normalizedScore":null,"rankLabel":"28e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"gemini-3-6-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"85,1 %","value":85.149,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.149},"modelId":"gemini-3-6-flash","modelName":"Gemini 3.6 Flash","rank":28,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"gemini-3-6-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"63,0 %","value":62.9993,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.9993},"modelId":"gemini-3-6-flash","modelName":"Gemini 3.6 Flash","rank":44,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"gemini-3-6-flash-livebench-language","label":"LiveBench : langue","display":"83,9 %","value":83.8977,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.8977},"modelId":"gemini-3-6-flash","modelName":"Gemini 3.6 Flash","rank":12,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"gemini-3-6-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"75,4 %","value":75.3668,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.3668},"modelId":"gemini-3-6-flash","modelName":"Gemini 3.6 Flash","rank":8,"medal":null}]}},{"modelId":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":13,"averageRank":null,"normalizedScore":null,"rankLabel":"13e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"claude-opus-4-8-livebench-reasoning","label":"LiveBench : raisonnement","display":"89,2 %","value":89.1923,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.1923},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":13,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"claude-opus-4-8-livebench-data-analysis","label":"LiveBench : analyse de données","display":"66,0 %","value":66.0333,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":66.0333},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":41,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"claude-opus-4-8-livebench-language","label":"LiveBench : langue","display":"79,7 %","value":79.6593,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.6593},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":24,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"claude-opus-4-8-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"72,0 %","value":72.0335,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.0335},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":15,"medal":null}]}},{"modelId":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":23,"averageRank":null,"normalizedScore":null,"rankLabel":"23e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"deepseek-v4-flash-0731-livebench-reasoning","label":"LiveBench : raisonnement","display":"86,6 %","value":86.6345,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.6345},"modelId":"deepseek-v4-flash-0731","modelName":"DeepSeek V4 Flash 0731","rank":23,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"deepseek-v4-flash-0731-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,3 %","value":79.3273,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.3273},"modelId":"deepseek-v4-flash-0731","modelName":"DeepSeek V4 Flash 0731","rank":8,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"deepseek-v4-flash-0731-livebench-language","label":"LiveBench : langue","display":"79,2 %","value":79.175,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.175},"modelId":"deepseek-v4-flash-0731","modelName":"DeepSeek V4 Flash 0731","rank":25,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"deepseek-v4-flash-0731-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"65,5 %","value":65.5168,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.5168},"modelId":"deepseek-v4-flash-0731","modelName":"DeepSeek V4 Flash 0731","rank":31,"medal":null}]}},{"modelId":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":16,"averageRank":null,"normalizedScore":null,"rankLabel":"16e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"qwen3-8-max-livebench-reasoning","label":"LiveBench : raisonnement","display":"88,2 %","value":88.2115,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.2115},"modelId":"qwen3-8-max","modelName":"Qwen 3.8 Max","rank":16,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"qwen3-8-max-livebench-data-analysis","label":"LiveBench : analyse de données","display":"78,4 %","value":78.413,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.413},"modelId":"qwen3-8-max","modelName":"Qwen 3.8 Max","rank":14,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"qwen3-8-max-livebench-language","label":"LiveBench : langue","display":"79,7 %","value":79.6873,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.6873},"modelId":"qwen3-8-max","modelName":"Qwen 3.8 Max","rank":23,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"qwen3-8-max-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"74,1 %","value":74.0835,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.0835},"modelId":"qwen3-8-max","modelName":"Qwen 3.8 Max","rank":10,"medal":null}]}},{"modelId":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":8,"averageRank":null,"normalizedScore":null,"rankLabel":"8e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"muse-spark-1-2-livebench-reasoning","label":"LiveBench : raisonnement","display":"90,0 %","value":90.0048,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.0048},"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","rank":8,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"muse-spark-1-2-livebench-data-analysis","label":"LiveBench : analyse de données","display":"76,5 %","value":76.4583,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.4583},"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","rank":19,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"muse-spark-1-2-livebench-language","label":"LiveBench : langue","display":"78,6 %","value":78.5747,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.5747},"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","rank":26,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"muse-spark-1-2-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"74,3 %","value":74.325,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.325},"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","rank":9,"medal":null}]}},{"modelId":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":7,"averageRank":null,"normalizedScore":null,"rankLabel":"7e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"smaug-agentic-livebench-reasoning","label":"LiveBench : raisonnement","display":"90,3 %","value":90.274,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.274},"modelId":"smaug-agentic","modelName":"Smaug-Agentic","rank":7,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"smaug-agentic-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,9 %","value":79.8983,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.8983},"modelId":"smaug-agentic","modelName":"Smaug-Agentic","rank":4,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"smaug-agentic-livebench-language","label":"LiveBench : langue","display":"84,4 %","value":84.3567,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.3567},"modelId":"smaug-agentic","modelName":"Smaug-Agentic","rank":11,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"smaug-agentic-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,0 %","value":70.9918,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.9918},"modelId":"smaug-agentic","modelName":"Smaug-Agentic","rank":20,"medal":null}]}},{"modelId":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":24,"averageRank":null,"normalizedScore":null,"rankLabel":"24e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"deepseek-v4-pro-0813-livebench-reasoning","label":"LiveBench : raisonnement","display":"85,8 %","value":85.8413,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.8413},"modelId":"deepseek-v4-pro-0813","modelName":"DeepSeek V4 Pro 0813","rank":24,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"deepseek-v4-pro-0813-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,2 %","value":79.2433,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.2433},"modelId":"deepseek-v4-pro-0813","modelName":"DeepSeek V4 Pro 0813","rank":11,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"deepseek-v4-pro-0813-livebench-language","label":"LiveBench : langue","display":"82,1 %","value":82.074,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.074},"modelId":"deepseek-v4-pro-0813","modelName":"DeepSeek V4 Pro 0813","rank":19,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"deepseek-v4-pro-0813-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"67,7 %","value":67.7,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":67.7},"modelId":"deepseek-v4-pro-0813","modelName":"DeepSeek V4 Pro 0813","rank":27,"medal":null}]}},{"modelId":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":6,"averageRank":null,"normalizedScore":null,"rankLabel":"6e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"grok-4-6-livebench-reasoning","label":"LiveBench : raisonnement","display":"90,5 %","value":90.5095,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.5095},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":6,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"grok-4-6-livebench-data-analysis","label":"LiveBench : analyse de données","display":"73,9 %","value":73.857,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.857},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":25,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"grok-4-6-livebench-language","label":"LiveBench : langue","display":"83,7 %","value":83.697,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.697},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":13,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"grok-4-6-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,9 %","value":71.8665,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.8665},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":16,"medal":null}]}},{"modelId":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":18,"averageRank":null,"normalizedScore":null,"rankLabel":"18e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"gemini-3-7-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"87,8 %","value":87.798,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.798},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":18,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"gemini-3-7-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"68,0 %","value":67.9643,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":67.9643},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":39,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"gemini-3-7-flash-livebench-language","label":"LiveBench : langue","display":"85,5 %","value":85.455,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.455},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":8,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"gemini-3-7-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"79,9 %","value":79.9253,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.9253},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":2,"medal":"argent"}]}},{"modelId":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":36,"averageRank":null,"normalizedScore":null,"rankLabel":"36e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"qwen3-8-27b-livebench-reasoning","label":"LiveBench : raisonnement","display":"80,0 %","value":80.0288,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":80.0288},"modelId":"qwen3-8-27b","modelName":"Qwen 3.8 27B","rank":36,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"qwen3-8-27b-livebench-data-analysis","label":"LiveBench : analyse de données","display":"76,6 %","value":76.5857,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.5857},"modelId":"qwen3-8-27b","modelName":"Qwen 3.8 27B","rank":18,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"qwen3-8-27b-livebench-language","label":"LiveBench : langue","display":"74,3 %","value":74.3457,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.3457},"modelId":"qwen3-8-27b","modelName":"Qwen 3.8 27B","rank":38,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"qwen3-8-27b-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"72,7 %","value":72.6583,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.6583},"modelId":"qwen3-8-27b","modelName":"Qwen 3.8 27B","rank":14,"medal":null}]}},{"modelId":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":27,"averageRank":null,"normalizedScore":null,"rankLabel":"27e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"deepseek-v4-flash-vision-exp-livebench-reasoning","label":"LiveBench : raisonnement","display":"85,4 %","value":85.399,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.399},"modelId":"deepseek-v4-flash-vision-exp","modelName":"DeepSeek V4 Flash Vision Exp","rank":27,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"deepseek-v4-flash-vision-exp-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,5 %","value":79.4767,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.4767},"modelId":"deepseek-v4-flash-vision-exp","modelName":"DeepSeek V4 Flash Vision Exp","rank":7,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"deepseek-v4-flash-vision-exp-livebench-language","label":"LiveBench : langue","display":"80,4 %","value":80.3597,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":80.3597},"modelId":"deepseek-v4-flash-vision-exp","modelName":"DeepSeek V4 Flash Vision Exp","rank":20,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"deepseek-v4-flash-vision-exp-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,0 %","value":70.9582,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.9582},"modelId":"deepseek-v4-flash-vision-exp","modelName":"DeepSeek V4 Flash Vision Exp","rank":21,"medal":null}]}},{"modelId":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":25,"averageRank":null,"normalizedScore":null,"rankLabel":"25e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"glm-5-3-livebench-reasoning","label":"LiveBench : raisonnement","display":"85,8 %","value":85.803,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.803},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":25,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"glm-5-3-livebench-data-analysis","label":"LiveBench : analyse de données","display":"70,2 %","value":70.2443,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.2443},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":35,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"glm-5-3-livebench-language","label":"LiveBench : langue","display":"79,9 %","value":79.8563,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.8563},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":21,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"glm-5-3-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"69,3 %","value":69.304,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.304},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":26,"medal":null}]}},{"modelId":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":40,"averageRank":null,"normalizedScore":null,"rankLabel":"40e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"glm-5-3-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"77,6 %","value":77.6443,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.6443},"modelId":"glm-5-3-flash","modelName":"GLM 5.3 Flash","rank":40,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"glm-5-3-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"76,4 %","value":76.401,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.401},"modelId":"glm-5-3-flash","modelName":"GLM 5.3 Flash","rank":20,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"glm-5-3-flash-livebench-language","label":"LiveBench : langue","display":"77,3 %","value":77.3073,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.3073},"modelId":"glm-5-3-flash","modelName":"GLM 5.3 Flash","rank":30,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"glm-5-3-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"52,8 %","value":52.8208,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":52.8208},"modelId":"glm-5-3-flash","modelName":"GLM 5.3 Flash","rank":49,"medal":null}]}},{"modelId":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":20,"averageRank":null,"normalizedScore":null,"rankLabel":"20e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"qwen3-8-flash-next-livebench-reasoning","label":"LiveBench : raisonnement","display":"87,4 %","value":87.3798,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.3798},"modelId":"qwen3-8-flash-next","modelName":"Qwen 3.8 Flash Next","rank":20,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"qwen3-8-flash-next-livebench-data-analysis","label":"LiveBench : analyse de données","display":"74,2 %","value":74.24,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.24},"modelId":"qwen3-8-flash-next","modelName":"Qwen 3.8 Flash Next","rank":24,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"qwen3-8-flash-next-livebench-language","label":"LiveBench : langue","display":"74,6 %","value":74.643,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.643},"modelId":"qwen3-8-flash-next","modelName":"Qwen 3.8 Flash Next","rank":37,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"qwen3-8-flash-next-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"77,1 %","value":77.1085,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.1085},"modelId":"qwen3-8-flash-next","modelName":"Qwen 3.8 Flash Next","rank":5,"medal":null}]}},{"modelId":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":43,"averageRank":null,"normalizedScore":null,"rankLabel":"43e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"nemotron-3-ultra-livebench-reasoning","label":"LiveBench : raisonnement","display":"74,7 %","value":74.697,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.697},"modelId":"nemotron-3-ultra","modelName":"Nemotron 3 Ultra 550B A55B","rank":43,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"nemotron-3-ultra-livebench-data-analysis","label":"LiveBench : analyse de données","display":"54,5 %","value":54.4567,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":54.4567},"modelId":"nemotron-3-ultra","modelName":"Nemotron 3 Ultra 550B A55B","rank":47,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"nemotron-3-ultra-livebench-language","label":"LiveBench : langue","display":"70,8 %","value":70.8113,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.8113},"modelId":"nemotron-3-ultra","modelName":"Nemotron 3 Ultra 550B A55B","rank":46,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"nemotron-3-ultra-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"73,4 %","value":73.4455,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.4455},"modelId":"nemotron-3-ultra","modelName":"Nemotron 3 Ultra 550B A55B","rank":12,"medal":null}]}},{"modelId":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":12,"averageRank":null,"normalizedScore":null,"rankLabel":"12e","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"gemini-3-8-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"89,3 %","value":89.2933,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.2933},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":12,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"gemini-3-8-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"54,0 %","value":54.0057,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":54.0057},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":48,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"gemini-3-8-flash-livebench-language","label":"LiveBench : langue","display":"87,8 %","value":87.7927,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.7927},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":4,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"gemini-3-8-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"81,4 %","value":81.4125,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.4125},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":1,"medal":"or"}]}},{"modelId":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":10,"averageRank":null,"normalizedScore":null,"rankLabel":"10e ex aequo","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[{"observationId":"muse-spark-1-3-livebench-reasoning","label":"LiveBench : raisonnement","display":"89,7 %","value":89.6538,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.6538},"modelId":"muse-spark-1-3","modelName":"Muse Spark 1.3","rank":10,"medal":null}],"livebench-data-analysis-2026-06-25":[{"observationId":"muse-spark-1-3-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,6 %","value":79.5653,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.5653},"modelId":"muse-spark-1-3","modelName":"Muse Spark 1.3","rank":6,"medal":null}],"livebench-language-2026-06-25":[{"observationId":"muse-spark-1-3-livebench-language","label":"LiveBench : langue","display":"82,8 %","value":82.7937,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.7937},"modelId":"muse-spark-1-3","modelName":"Muse Spark 1.3","rank":17,"medal":null}],"livebench-instruction-following-2026-06-25":[{"observationId":"muse-spark-1-3-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"78,0 %","value":78.0043,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.0043},"modelId":"muse-spark-1-3","modelName":"Muse Spark 1.3","rank":4,"medal":null}]}},{"modelId":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}},{"modelId":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}},{"modelId":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}},{"modelId":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}},{"modelId":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}},{"modelId":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}},{"modelId":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}},{"modelId":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}},{"modelId":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}},{"modelId":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}},{"modelId":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}},{"modelId":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}},{"modelId":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-intelligence-v4-1-1":[],"epoch-eci-2026-09":[],"livebench-reasoning-2026-06-25":[],"livebench-data-analysis-2026-06-25":[],"livebench-language-2026-06-25":[],"livebench-instruction-following-2026-06-25":[]}}],"podiumModelIds":["fable-5-1","sol","opus-5"],"sortOrders":{"rank":["fable-5-1","sol","opus-5","kimi-k3","terra","grok-4-6","smaug-agentic","muse-spark-1-2","fable-5","gpt-5-5","muse-spark-1-3","gemini-3-8-flash","claude-opus-4-8","claude-sonnet-5","claude-opus-4-6","qwen3-8-max","gpt-5-4","gemini-3-7-flash","muse-spark-1-1","qwen3-8-flash-next","claude-opus-4-7","grok-4-5","deepseek-v4-flash-0731","deepseek-v4-pro-0813","glm-5-3","luna","deepseek-v4-flash-vision-exp","gemini-3-6-flash","claude-sonnet-4-6","gemini-3-1-pro-preview","qwen3-7-max","kimi-k2-7-code","deepseek-v4-pro","gemini-3-5-flash","gpt-5-4-nano","qwen3-8-27b","kimi-k2-6","glm-5-2","inkling","glm-5-3-flash","grok-build-0-1","qwen3-6-plus","nemotron-3-ultra","minimax-m3","gpt-5-4-mini","grok-4-3","deepseek-v4-flash","qwen3-6-27b","gemini-3-5-flash-lite","claude-haiku-4-5","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","glm-5","glm-5-1","astra","grok-4-20-0309-reasoning","inkling-small","kimi-k2-5","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","mistral-medium-3-5","nemotron-lightning-3-5","qwen3-7-plus"],"model":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"maker":["smaug-agentic","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","ling-3-0-flash-2607","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","nemotron-3-ultra","nemotron-lightning-3-5","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","inkling","inkling-small","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","mimo-v2-5","mimo-v2-5-pro","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash"],"date":["glm-5-1","mimo-v2-5-pro","mimo-v2-5","inkling-small","qwen3-7-plus","minimax-m2-7","claude-haiku-4-5","gemini-3-flash-preview","mistral-medium-3-5","gemini-3-1-flash-lite-preview","nemotron-lightning-3-5","grok-4-20-0309-reasoning","ling-3-0-flash-2607","astra","gemini-3-8-flash","muse-spark-1-3","fable-5-1","glm-5-3-flash","qwen3-8-flash-next","deepseek-v4-flash-vision-exp","qwen3-8-27b","glm-5-3","deepseek-v4-pro-0813","gemini-3-7-flash","grok-4-6","smaug-agentic","muse-spark-1-2","qwen3-8-max","deepseek-v4-flash-0731","opus-5","gemini-3-5-flash-lite","gemini-3-6-flash","kimi-k3","inkling","sol","terra","luna","muse-spark-1-1","grok-4-5","claude-sonnet-5","glm-5-2","kimi-k2-7-code","fable-5","qwen3-7-max","nemotron-3-ultra","minimax-m3","claude-opus-4-8","gemini-3-5-flash","grok-build-0-1","grok-4-3","deepseek-v4-flash","deepseek-v4-pro","gpt-5-5","qwen3-6-27b","kimi-k2-6","claude-opus-4-7","qwen3-6-plus","gpt-5-4-mini","gpt-5-4-nano","gpt-5-4","gemini-3-1-pro-preview","claude-sonnet-4-6","minimax-m2-5","glm-5","claude-opus-4-6","kimi-k2-5"],"teams":["fable-5-1","sol","fable-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","astra","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","kimi-k2-6","kimi-k2-7-code","kimi-k3","minimax-m3","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic","claude-haiku-4-5","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","glm-5","glm-5-1","grok-4-20-0309-reasoning","inkling-small","kimi-k2-5","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","mistral-medium-3-5","nemotron-lightning-3-5","qwen3-7-plus"],"score":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:aa-intelligence-v4-1-1":["fable-5-1","sol","astra","fable-5","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:epoch-eci-2026-09":["astra","fable-5-1","sol","fable-5","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:livebench-reasoning-2026-06-25":["fable-5-1","sol","opus-5","kimi-k3","terra","grok-4-6","smaug-agentic","muse-spark-1-2","fable-5","gpt-5-5","muse-spark-1-3","gemini-3-8-flash","claude-opus-4-8","claude-sonnet-5","claude-opus-4-6","qwen3-8-max","gpt-5-4","gemini-3-7-flash","muse-spark-1-1","qwen3-8-flash-next","claude-opus-4-7","grok-4-5","deepseek-v4-flash-0731","deepseek-v4-pro-0813","glm-5-3","luna","deepseek-v4-flash-vision-exp","gemini-3-6-flash","claude-sonnet-4-6","gemini-3-1-pro-preview","qwen3-7-max","kimi-k2-7-code","deepseek-v4-pro","gemini-3-5-flash","gpt-5-4-nano","qwen3-8-27b","kimi-k2-6","glm-5-2","inkling","glm-5-3-flash","grok-build-0-1","qwen3-6-plus","nemotron-3-ultra","minimax-m3","gpt-5-4-mini","grok-4-3","deepseek-v4-flash","qwen3-6-27b","gemini-3-5-flash-lite","claude-haiku-4-5","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","glm-5","glm-5-1","astra","grok-4-20-0309-reasoning","inkling-small","kimi-k2-5","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","mistral-medium-3-5","nemotron-lightning-3-5","qwen3-7-plus"],"family:livebench-data-analysis-2026-06-25":["gpt-5-5","fable-5","fable-5-1","smaug-agentic","sol","muse-spark-1-3","deepseek-v4-flash-vision-exp","deepseek-v4-flash-0731","gpt-5-4","terra","deepseek-v4-pro-0813","kimi-k3","gemini-3-1-pro-preview","qwen3-8-max","claude-opus-4-7","luna","claude-sonnet-4-6","qwen3-8-27b","muse-spark-1-2","glm-5-3-flash","minimax-m3","opus-5","deepseek-v4-pro","qwen3-8-flash-next","grok-4-6","glm-5-2","grok-4-5","inkling","muse-spark-1-1","qwen3-7-max","claude-sonnet-5","grok-build-0-1","gpt-5-4-mini","qwen3-6-27b","glm-5-3","qwen3-6-plus","claude-opus-4-6","deepseek-v4-flash","gemini-3-7-flash","gpt-5-4-nano","claude-opus-4-8","kimi-k2-6","gemini-3-5-flash","gemini-3-6-flash","kimi-k2-7-code","grok-4-3","nemotron-3-ultra","gemini-3-8-flash","gemini-3-5-flash-lite","claude-haiku-4-5","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","glm-5","glm-5-1","astra","grok-4-20-0309-reasoning","inkling-small","kimi-k2-5","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","mistral-medium-3-5","nemotron-lightning-3-5","qwen3-7-plus"],"family:livebench-language-2026-06-25":["fable-5","fable-5-1","opus-5","gemini-3-8-flash","sol","gpt-5-5","kimi-k3","gemini-3-7-flash","gemini-3-1-pro-preview","gemini-3-5-flash","smaug-agentic","gemini-3-6-flash","grok-4-6","claude-opus-4-6","terra","grok-4-5","muse-spark-1-3","gpt-5-4","deepseek-v4-pro-0813","deepseek-v4-flash-vision-exp","glm-5-3","qwen3-7-max","qwen3-8-max","claude-opus-4-8","deepseek-v4-flash-0731","muse-spark-1-2","deepseek-v4-pro","claude-opus-4-7","kimi-k2-7-code","glm-5-3-flash","minimax-m3","glm-5-2","claude-sonnet-4-6","kimi-k2-6","qwen3-6-plus","claude-sonnet-5","qwen3-8-flash-next","qwen3-8-27b","muse-spark-1-1","grok-4-3","inkling","luna","grok-build-0-1","gemini-3-5-flash-lite","gpt-5-4-mini","nemotron-3-ultra","deepseek-v4-flash","qwen3-6-27b","gpt-5-4-nano","claude-haiku-4-5","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","glm-5","glm-5-1","astra","grok-4-20-0309-reasoning","inkling-small","kimi-k2-5","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","mistral-medium-3-5","nemotron-lightning-3-5","qwen3-7-plus"],"family:livebench-instruction-following-2026-06-25":["gemini-3-8-flash","gemini-3-7-flash","gemini-3-1-pro-preview","muse-spark-1-3","qwen3-8-flash-next","fable-5","gemini-3-5-flash","gemini-3-6-flash","muse-spark-1-2","qwen3-8-max","qwen3-7-max","nemotron-3-ultra","fable-5-1","qwen3-8-27b","claude-opus-4-8","grok-4-6","sol","grok-4-5","kimi-k3","smaug-agentic","deepseek-v4-flash-vision-exp","gpt-5-5","gpt-5-4","inkling","muse-spark-1-1","glm-5-3","deepseek-v4-pro-0813","gemini-3-5-flash-lite","gpt-5-4-nano","claude-opus-4-7","deepseek-v4-flash-0731","grok-build-0-1","terra","kimi-k2-6","claude-sonnet-5","opus-5","claude-opus-4-6","claude-sonnet-4-6","deepseek-v4-flash","grok-4-3","deepseek-v4-pro","glm-5-2","luna","gpt-5-4-mini","qwen3-6-plus","minimax-m3","kimi-k2-7-code","qwen3-6-27b","glm-5-3-flash","claude-haiku-4-5","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","glm-5","glm-5-1","astra","grok-4-20-0309-reasoning","inkling-small","kimi-k2-5","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","mistral-medium-3-5","nemotron-lightning-3-5","qwen3-7-plus"]},"contradictions":[],"concordance":"Agrégation en attente de couverture, 2 modèles communs sur 49.","normalizedScore":{"domain":"general","available":false,"edition":{"editionId":"origin-general-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : couverture actuelle, 4 tests au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[{"familyId":"epoch-eci-2026-09","sourceId":"epoch-eci-2026-09","benchmark":"Epoch Capabilities Index","organization":"Epoch AI","organizationId":"epoch-ai","modelCount":3,"reason":"Source non indépendante, inactive ou ne mesurant pas le modèle seul."},{"familyId":"aa-intelligence-v4-1-1","sourceId":"aa-intelligence-v4-1-1","benchmark":"Artificial Analysis Intelligence Index v4.1.1","organization":"Artificial Analysis","organizationId":"artificial-analysis","modelCount":3,"reason":"3 modèles mesurés, minimum pratique 15."},{"familyId":"livebench-reasoning-2026-06-25","sourceId":"livebench-2026-06-25","benchmark":"LiveBench : raisonnement","organization":"LiveBench","organizationId":"livebench","modelCount":49,"reason":"Hors socle : aucune édition Origin n’est constituée pour cet usage."},{"familyId":"livebench-data-analysis-2026-06-25","sourceId":"livebench-2026-06-25","benchmark":"LiveBench : analyse de données","organization":"LiveBench","organizationId":"livebench","modelCount":49,"reason":"Hors socle : aucune édition Origin n’est constituée pour cet usage."},{"familyId":"livebench-language-2026-06-25","sourceId":"livebench-2026-06-25","benchmark":"LiveBench : langue","organization":"LiveBench","organizationId":"livebench","modelCount":49,"reason":"Hors socle : aucune édition Origin n’est constituée pour cet usage."},{"familyId":"livebench-instruction-following-2026-06-25","sourceId":"livebench-2026-06-25","benchmark":"LiveBench : suivi des consignes","organization":"LiveBench","organizationId":"livebench","modelCount":49,"reason":"Hors socle : aucune édition Origin n’est constituée pour cet usage."}],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":4,"organizationCount":1,"referenceModelCount":0},"message":"Note Origin indisponible : couverture actuelle, 4 tests au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},"aggregation":null,"aggregationCoverage":{"solidSourceCount":0,"solidSourceCoverage":[{"organizationId":"artificial-analysis","organization":"Artificial Analysis","modelCount":2,"eligible":false,"reason":"2 modèles du panel, 5 requis ; contribution descriptive seulement."},{"organizationId":"livebench","organization":"LiveBench","modelCount":2,"eligible":false,"reason":"2 modèles du panel, 5 requis ; contribution descriptive seulement."}],"sourceCount":2,"candidateSourceCount":2,"modelCount":2,"panelModelCount":49,"message":"Agrégation en attente de couverture, 2 modèles communs sur 49.","candidateSources":[{"organization":"Artificial Analysis","sourceId":"aa-intelligence-v4-1-1","familyId":"aa-intelligence-v4-1-1","independenceLevel":2,"status":"included","reason":null},{"organization":"Epoch AI","sourceId":"epoch-eci-2026-09","familyId":"epoch-eci-2026-09","independenceLevel":1,"status":"excluded","reason":"Source non indépendante, inactive ou ne mesurant pas le modèle seul."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-reasoning-2026-06-25","independenceLevel":1,"status":"included","reason":null},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-data-analysis-2026-06-25","independenceLevel":1,"status":"included","reason":null},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-language-2026-06-25","independenceLevel":1,"status":"included","reason":null},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-instruction-following-2026-06-25","independenceLevel":1,"status":"included","reason":null}]}},{"id":"agentic","label":"Missions longues","question":"Quel modèle pour mener une mission longue ?","verdict":"Claude Fable 5.1 arrive en tête sur LiveBench : code autonome.","limitation":"Une seule équipe porte ce podium. Les autres tests de missions longues restent affichés séparément.","viewMode":"single-source","averageRank":null,"primaryFamilyId":"livebench-agentic-coding-2026-06-25","primaryFamilyLabel":"LiveBench : code autonome","rankLabel":"Rang sur LiveBench : code autonome","stars":2,"starsLabel":"Une équipe extérieure, confirmation manquante","isTopTie":false,"families":[{"id":"arc-agi-3-astra","label":"ARC-AGI-3, tâches partiellement cachées, configuration standard","organization":"ARC Prize","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"novel-rule-learning","sourceType":1,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"astra-arc-agi-3-adapter","label":"ARC-AGI-3, tâches partiellement cachées, configuration fournisseur","display":"99,9 %","value":99.95,"unit":"percent","dispersion":null,"sourceUrl":"https://arcprize.org/results/openai-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"ARC Prize","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"État de raisonnement opaque conservé et contexte compacté par le fournisseur. Objectifs atteints dans des environnements inconnus.","limitation":"Même série de tâches que la configuration standard. Ce résultat ne constitue pas une seconde confirmation indépendante.","visual":{"kind":"bar","valuePercent":99.95},"modelId":"astra","modelName":"GPT-6 Astra","rank":1,"medal":"or"},{"observationId":"astra-arc-agi-3-standard","label":"ARC-AGI-3, tâches partiellement cachées, configuration standard","display":"62,7 %","value":62.71,"unit":"percent","dispersion":null,"sourceUrl":"https://arcprize.org/results/openai-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"ARC Prize","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Interface minimale commune, notes visibles gérées par le modèle. Objectifs atteints dans des environnements inconnus.","limitation":"Mesure ciblée d’apprentissage de règles nouvelles. Elle ne mesure pas un pourcentage d’intelligence générale.","visual":{"kind":"bar","valuePercent":62.71},"modelId":"astra","modelName":"GPT-6 Astra","rank":2,"medal":"argent"}]},{"id":"mercor-apex-agents","label":"APEX-Agents","organization":"Mercor","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"professional-workflow","sourceType":2,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"astra-apex-agents","label":"APEX-Agents","display":"62,4 %","value":62.4,"unit":"percent","dispersion":"± 3,6 points","sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions utilisant plusieurs applications de travail. Part moyenne des critères réussis.","limitation":"Les tâches et critères viennent de professionnels, mais une partie de la correction repose sur un autre modèle d’IA.","visual":{"kind":"interval","valuePercent":62.4,"lowPercent":58.8,"highPercent":66,"spanPercent":7.200000000000003},"modelId":"astra","modelName":"GPT-6 Astra","rank":1.5,"medal":null},{"observationId":"fable-5-1-apex-agents","label":"APEX-Agents","display":"62,0 %","value":62,"unit":"percent","dispersion":"± 3,5 points","sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions utilisant plusieurs applications de travail. Part moyenne des critères réussis.","limitation":"Les tâches et critères viennent de professionnels, mais une partie de la correction repose sur un autre modèle d’IA.","visual":{"kind":"interval","valuePercent":62,"lowPercent":58.5,"highPercent":65.5,"spanPercent":7},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1.5,"medal":null}]},{"id":"livebench-agentic-coding-2026-06-25","label":"LiveBench : code autonome","organization":"LiveBench","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"agentic-coding","sourceType":1,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"fable-5-1-livebench-agentic-coding","label":"LiveBench : code autonome","display":"66,1 %","value":66.0607,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":66.0607},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1,"medal":"or"},{"observationId":"opus-5-livebench-agentic-coding","label":"LiveBench : code autonome","display":"65,2 %","value":65.202,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.202},"modelId":"opus-5","modelName":"Claude Opus 5","rank":2,"medal":"argent"},{"observationId":"deepseek-v4-flash-vision-exp-livebench-agentic-coding","label":"LiveBench : code autonome","display":"65,1 %","value":65.101,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.101},"modelId":"deepseek-v4-flash-vision-exp","modelName":"DeepSeek V4 Flash Vision Exp","rank":3,"medal":"bronze"},{"observationId":"qwen3-8-max-livebench-agentic-coding","label":"LiveBench : code autonome","display":"64,6 %","value":64.6467,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.6467},"modelId":"qwen3-8-max","modelName":"Qwen 3.8 Max","rank":4.5,"medal":null},{"observationId":"smaug-agentic-livebench-agentic-coding","label":"LiveBench : code autonome","display":"64,6 %","value":64.6467,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.6467},"modelId":"smaug-agentic","modelName":"Smaug-Agentic","rank":4.5,"medal":null},{"observationId":"muse-spark-1-3-livebench-agentic-coding","label":"LiveBench : code autonome","display":"64,1 %","value":64.091,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.091},"modelId":"muse-spark-1-3","modelName":"Muse Spark 1.3","rank":6,"medal":null},{"observationId":"fable-5-livebench-agentic-coding","label":"LiveBench : code autonome","display":"62,2 %","value":62.1717,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.1717},"modelId":"fable-5","modelName":"Claude Fable 5","rank":7.5,"medal":null},{"observationId":"kimi-k3-livebench-agentic-coding","label":"LiveBench : code autonome","display":"62,2 %","value":62.1717,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.1717},"modelId":"kimi-k3","modelName":"Kimi K3","rank":7.5,"medal":null},{"observationId":"qwen3-8-flash-next-livebench-agentic-coding","label":"LiveBench : code autonome","display":"61,6 %","value":61.6163,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":61.6163},"modelId":"qwen3-8-flash-next","modelName":"Qwen 3.8 Flash Next","rank":9,"medal":null},{"observationId":"qwen3-8-27b-livebench-agentic-coding","label":"LiveBench : code autonome","display":"61,4 %","value":61.3637,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":61.3637},"modelId":"qwen3-8-27b","modelName":"Qwen 3.8 27B","rank":10,"medal":null},{"observationId":"glm-5-3-livebench-agentic-coding","label":"LiveBench : code autonome","display":"60,9 %","value":60.909,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":60.909},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":11,"medal":null},{"observationId":"claude-sonnet-5-livebench-agentic-coding","label":"LiveBench : code autonome","display":"59,4 %","value":59.394,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":59.394},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":12,"medal":null},{"observationId":"muse-spark-1-1-livebench-agentic-coding","label":"LiveBench : code autonome","display":"58,5 %","value":58.5353,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":58.5353},"modelId":"muse-spark-1-1","modelName":"Muse Spark 1.1","rank":13,"medal":null},{"observationId":"gemini-3-7-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"58,3 %","value":58.283,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":58.283},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":14,"medal":null},{"observationId":"muse-spark-1-2-livebench-agentic-coding","label":"LiveBench : code autonome","display":"57,6 %","value":57.5757,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":57.5757},"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","rank":15,"medal":null},{"observationId":"grok-4-6-livebench-agentic-coding","label":"LiveBench : code autonome","display":"57,0 %","value":57.02,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":57.02},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":16,"medal":null},{"observationId":"glm-5-3-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"56,8 %","value":56.7677,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":56.7677},"modelId":"glm-5-3-flash","modelName":"GLM 5.3 Flash","rank":17,"medal":null},{"observationId":"grok-4-5-livebench-agentic-coding","label":"LiveBench : code autonome","display":"56,5 %","value":56.4647,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":56.4647},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":18,"medal":null},{"observationId":"sol-livebench-agentic-coding","label":"LiveBench : code autonome","display":"56,2 %","value":56.212,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":56.212},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":19,"medal":null},{"observationId":"terra-livebench-agentic-coding","label":"LiveBench : code autonome","display":"54,9 %","value":54.9497,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":54.9497},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":20.5,"medal":null},{"observationId":"deepseek-v4-pro-0813-livebench-agentic-coding","label":"LiveBench : code autonome","display":"54,9 %","value":54.9497,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":54.9497},"modelId":"deepseek-v4-pro-0813","modelName":"DeepSeek V4 Pro 0813","rank":20.5,"medal":null},{"observationId":"gemini-3-8-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"54,2 %","value":54.2423,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":54.2423},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":22,"medal":null},{"observationId":"gpt-5-5-livebench-agentic-coding","label":"LiveBench : code autonome","display":"54,0 %","value":53.9897,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":53.9897},"modelId":"gpt-5-5","modelName":"GPT-5.5","rank":23,"medal":null},{"observationId":"gpt-5-4-livebench-agentic-coding","label":"LiveBench : code autonome","display":"53,8 %","value":53.8383,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":53.8383},"modelId":"gpt-5-4","modelName":"GPT-5.4","rank":24,"medal":null},{"observationId":"glm-5-2-livebench-agentic-coding","label":"LiveBench : code autonome","display":"51,8 %","value":51.7677,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":51.7677},"modelId":"glm-5-2","modelName":"GLM 5.2","rank":25,"medal":null},{"observationId":"claude-opus-4-7-livebench-agentic-coding","label":"LiveBench : code autonome","display":"50,7 %","value":50.6563,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":50.6563},"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","rank":26,"medal":null},{"observationId":"claude-opus-4-8-livebench-agentic-coding","label":"LiveBench : code autonome","display":"50,5 %","value":50.505,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":50.505},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":27,"medal":null},{"observationId":"inkling-livebench-agentic-coding","label":"LiveBench : code autonome","display":"49,4 %","value":49.394,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":49.394},"modelId":"inkling","modelName":"Inkling","rank":28,"medal":null},{"observationId":"claude-opus-4-6-livebench-agentic-coding","label":"LiveBench : code autonome","display":"49,0 %","value":48.9897,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":48.9897},"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","rank":29.5,"medal":null},{"observationId":"gemini-3-5-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"49,0 %","value":48.9897,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":48.9897},"modelId":"gemini-3-5-flash","modelName":"Gemini 3.5 Flash","rank":29.5,"medal":null},{"observationId":"luna-livebench-agentic-coding","label":"LiveBench : code autonome","display":"48,4 %","value":48.4343,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":48.4343},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":31,"medal":null},{"observationId":"kimi-k2-6-livebench-agentic-coding","label":"LiveBench : code autonome","display":"46,9 %","value":46.9193,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":46.9193},"modelId":"kimi-k2-6","modelName":"Kimi K2.6","rank":32,"medal":null},{"observationId":"gpt-5-4-nano-livebench-agentic-coding","label":"LiveBench : code autonome","display":"46,8 %","value":46.7677,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":46.7677},"modelId":"gpt-5-4-nano","modelName":"GPT-5.4 nano","rank":33.5,"medal":null},{"observationId":"deepseek-v4-flash-0731-livebench-agentic-coding","label":"LiveBench : code autonome","display":"46,8 %","value":46.7677,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":46.7677},"modelId":"deepseek-v4-flash-0731","modelName":"DeepSeek V4 Flash 0731","rank":33.5,"medal":null},{"observationId":"grok-build-0-1-livebench-agentic-coding","label":"LiveBench : code autonome","display":"45,8 %","value":45.808,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":45.808},"modelId":"grok-build-0-1","modelName":"Grok Build 0.1","rank":35,"medal":null},{"observationId":"kimi-k2-7-code-livebench-agentic-coding","label":"LiveBench : code autonome","display":"45,7 %","value":45.6563,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":45.6563},"modelId":"kimi-k2-7-code","modelName":"Kimi K2.7 Code","rank":36,"medal":null},{"observationId":"gemini-3-5-flash-lite-livebench-agentic-coding","label":"LiveBench : code autonome","display":"45,3 %","value":45.2527,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":45.2527},"modelId":"gemini-3-5-flash-lite","modelName":"Gemini 3.5 Flash-Lite","rank":37,"medal":null},{"observationId":"gemini-3-1-pro-preview-livebench-agentic-coding","label":"LiveBench : code autonome","display":"44,1 %","value":44.1413,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":44.1413},"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","rank":38,"medal":null},{"observationId":"qwen3-7-max-livebench-agentic-coding","label":"LiveBench : code autonome","display":"43,6 %","value":43.586,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":43.586},"modelId":"qwen3-7-max","modelName":"Qwen 3.7 Max","rank":39,"medal":null},{"observationId":"gemini-3-6-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"43,4 %","value":43.4343,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":43.4343},"modelId":"gemini-3-6-flash","modelName":"Gemini 3.6 Flash","rank":40,"medal":null},{"observationId":"claude-sonnet-4-6-livebench-agentic-coding","label":"LiveBench : code autonome","display":"42,6 %","value":42.626,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":42.626},"modelId":"claude-sonnet-4-6","modelName":"Claude Sonnet 4.6","rank":41.5,"medal":null},{"observationId":"deepseek-v4-pro-livebench-agentic-coding","label":"LiveBench : code autonome","display":"42,6 %","value":42.626,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":42.626},"modelId":"deepseek-v4-pro","modelName":"DeepSeek V4 Pro","rank":41.5,"medal":null},{"observationId":"gpt-5-4-mini-livebench-agentic-coding","label":"LiveBench : code autonome","display":"41,7 %","value":41.6667,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":41.6667},"modelId":"gpt-5-4-mini","modelName":"GPT-5.4 mini","rank":43,"medal":null},{"observationId":"qwen3-6-plus-livebench-agentic-coding","label":"LiveBench : code autonome","display":"41,4 %","value":41.3637,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":41.3637},"modelId":"qwen3-6-plus","modelName":"Qwen 3.6 Plus","rank":44,"medal":null},{"observationId":"minimax-m3-livebench-agentic-coding","label":"LiveBench : code autonome","display":"40,7 %","value":40.6563,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":40.6563},"modelId":"minimax-m3","modelName":"MiniMax M3","rank":45,"medal":null},{"observationId":"qwen3-6-27b-livebench-agentic-coding","label":"LiveBench : code autonome","display":"39,3 %","value":39.2927,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":39.2927},"modelId":"qwen3-6-27b","modelName":"Qwen 3.6 27B","rank":46,"medal":null},{"observationId":"nemotron-3-ultra-livebench-agentic-coding","label":"LiveBench : code autonome","display":"38,7 %","value":38.7373,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":38.7373},"modelId":"nemotron-3-ultra","modelName":"Nemotron 3 Ultra 550B A55B","rank":47,"medal":null},{"observationId":"deepseek-v4-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"37,6 %","value":37.626,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":37.626},"modelId":"deepseek-v4-flash","modelName":"DeepSeek V4 Flash","rank":48,"medal":null},{"observationId":"grok-4-3-livebench-agentic-coding","label":"LiveBench : code autonome","display":"18,5 %","value":18.5353,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":18.5353},"modelId":"grok-4-3","modelName":"Grok 4.3","rank":49,"medal":null}]}],"rows":[{"modelId":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","measured":true,"independentTeams":2,"stars":2,"starsLabel":"Une équipe extérieure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[{"observationId":"astra-arc-agi-3-adapter","label":"ARC-AGI-3, tâches partiellement cachées, configuration fournisseur","display":"99,9 %","value":99.95,"unit":"percent","dispersion":null,"sourceUrl":"https://arcprize.org/results/openai-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"ARC Prize","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"État de raisonnement opaque conservé et contexte compacté par le fournisseur. Objectifs atteints dans des environnements inconnus.","limitation":"Même série de tâches que la configuration standard. Ce résultat ne constitue pas une seconde confirmation indépendante.","visual":{"kind":"bar","valuePercent":99.95},"modelId":"astra","modelName":"GPT-6 Astra","rank":1,"medal":"or"},{"observationId":"astra-arc-agi-3-standard","label":"ARC-AGI-3, tâches partiellement cachées, configuration standard","display":"62,7 %","value":62.71,"unit":"percent","dispersion":null,"sourceUrl":"https://arcprize.org/results/openai-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"ARC Prize","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Interface minimale commune, notes visibles gérées par le modèle. Objectifs atteints dans des environnements inconnus.","limitation":"Mesure ciblée d’apprentissage de règles nouvelles. Elle ne mesure pas un pourcentage d’intelligence générale.","visual":{"kind":"bar","valuePercent":62.71},"modelId":"astra","modelName":"GPT-6 Astra","rank":2,"medal":"argent"}],"mercor-apex-agents":[{"observationId":"astra-apex-agents","label":"APEX-Agents","display":"62,4 %","value":62.4,"unit":"percent","dispersion":"± 3,6 points","sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions utilisant plusieurs applications de travail. Part moyenne des critères réussis.","limitation":"Les tâches et critères viennent de professionnels, mais une partie de la correction repose sur un autre modèle d’IA.","visual":{"kind":"interval","valuePercent":62.4,"lowPercent":58.8,"highPercent":66,"spanPercent":7.200000000000003},"modelId":"astra","modelName":"GPT-6 Astra","rank":1.5,"medal":null}],"livebench-agentic-coding-2026-06-25":[]}},{"modelId":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","measured":true,"independentTeams":2,"stars":2,"starsLabel":"Une équipe extérieure","rank":1,"averageRank":null,"normalizedScore":null,"rankLabel":"1er","medal":"or","manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[{"observationId":"fable-5-1-apex-agents","label":"APEX-Agents","display":"62,0 %","value":62,"unit":"percent","dispersion":"± 3,5 points","sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions utilisant plusieurs applications de travail. Part moyenne des critères réussis.","limitation":"Les tâches et critères viennent de professionnels, mais une partie de la correction repose sur un autre modèle d’IA.","visual":{"kind":"interval","valuePercent":62,"lowPercent":58.5,"highPercent":65.5,"spanPercent":7},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1.5,"medal":null}],"livebench-agentic-coding-2026-06-25":[{"observationId":"fable-5-1-livebench-agentic-coding","label":"LiveBench : code autonome","display":"66,1 %","value":66.0607,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":66.0607},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1,"medal":"or"}]}},{"modelId":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":7.5,"averageRank":null,"normalizedScore":null,"rankLabel":"7e ex aequo","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"fable-5-livebench-agentic-coding","label":"LiveBench : code autonome","display":"62,2 %","value":62.1717,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.1717},"modelId":"fable-5","modelName":"Claude Fable 5","rank":7.5,"medal":null}]}},{"modelId":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":2,"averageRank":null,"normalizedScore":null,"rankLabel":"2e","medal":"argent","manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"opus-5-livebench-agentic-coding","label":"LiveBench : code autonome","display":"65,2 %","value":65.202,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.202},"modelId":"opus-5","modelName":"Claude Opus 5","rank":2,"medal":"argent"}]}},{"modelId":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":19,"averageRank":null,"normalizedScore":null,"rankLabel":"19e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"sol-livebench-agentic-coding","label":"LiveBench : code autonome","display":"56,2 %","value":56.212,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":56.212},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":19,"medal":null}]}},{"modelId":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[]}},{"modelId":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":29.5,"averageRank":null,"normalizedScore":null,"rankLabel":"29e ex aequo","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"claude-opus-4-6-livebench-agentic-coding","label":"LiveBench : code autonome","display":"49,0 %","value":48.9897,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":48.9897},"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","rank":29.5,"medal":null}]}},{"modelId":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[]}},{"modelId":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[]}},{"modelId":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":26,"averageRank":null,"normalizedScore":null,"rankLabel":"26e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"claude-opus-4-7-livebench-agentic-coding","label":"LiveBench : code autonome","display":"50,7 %","value":50.6563,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":50.6563},"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","rank":26,"medal":null}]}},{"modelId":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":41.5,"averageRank":null,"normalizedScore":null,"rankLabel":"41e ex aequo","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"claude-sonnet-4-6-livebench-agentic-coding","label":"LiveBench : code autonome","display":"42,6 %","value":42.626,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":42.626},"modelId":"claude-sonnet-4-6","modelName":"Claude Sonnet 4.6","rank":41.5,"medal":null}]}},{"modelId":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":12,"averageRank":null,"normalizedScore":null,"rankLabel":"12e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"claude-sonnet-5-livebench-agentic-coding","label":"LiveBench : code autonome","display":"59,4 %","value":59.394,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":59.394},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":12,"medal":null}]}},{"modelId":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":48,"averageRank":null,"normalizedScore":null,"rankLabel":"48e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"deepseek-v4-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"37,6 %","value":37.626,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":37.626},"modelId":"deepseek-v4-flash","modelName":"DeepSeek V4 Flash","rank":48,"medal":null}]}},{"modelId":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":41.5,"averageRank":null,"normalizedScore":null,"rankLabel":"41e ex aequo","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"deepseek-v4-pro-livebench-agentic-coding","label":"LiveBench : code autonome","display":"42,6 %","value":42.626,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":42.626},"modelId":"deepseek-v4-pro","modelName":"DeepSeek V4 Pro","rank":41.5,"medal":null}]}},{"modelId":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":38,"averageRank":null,"normalizedScore":null,"rankLabel":"38e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"gemini-3-1-pro-preview-livebench-agentic-coding","label":"LiveBench : code autonome","display":"44,1 %","value":44.1413,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":44.1413},"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","rank":38,"medal":null}]}},{"modelId":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":29.5,"averageRank":null,"normalizedScore":null,"rankLabel":"29e ex aequo","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"gemini-3-5-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"49,0 %","value":48.9897,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":48.9897},"modelId":"gemini-3-5-flash","modelName":"Gemini 3.5 Flash","rank":29.5,"medal":null}]}},{"modelId":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":25,"averageRank":null,"normalizedScore":null,"rankLabel":"25e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"glm-5-2-livebench-agentic-coding","label":"LiveBench : code autonome","display":"51,8 %","value":51.7677,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":51.7677},"modelId":"glm-5-2","modelName":"GLM 5.2","rank":25,"medal":null}]}},{"modelId":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":43,"averageRank":null,"normalizedScore":null,"rankLabel":"43e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"gpt-5-4-mini-livebench-agentic-coding","label":"LiveBench : code autonome","display":"41,7 %","value":41.6667,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":41.6667},"modelId":"gpt-5-4-mini","modelName":"GPT-5.4 mini","rank":43,"medal":null}]}},{"modelId":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":33.5,"averageRank":null,"normalizedScore":null,"rankLabel":"33e ex aequo","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"gpt-5-4-nano-livebench-agentic-coding","label":"LiveBench : code autonome","display":"46,8 %","value":46.7677,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":46.7677},"modelId":"gpt-5-4-nano","modelName":"GPT-5.4 nano","rank":33.5,"medal":null}]}},{"modelId":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":24,"averageRank":null,"normalizedScore":null,"rankLabel":"24e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"gpt-5-4-livebench-agentic-coding","label":"LiveBench : code autonome","display":"53,8 %","value":53.8383,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":53.8383},"modelId":"gpt-5-4","modelName":"GPT-5.4","rank":24,"medal":null}]}},{"modelId":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":23,"averageRank":null,"normalizedScore":null,"rankLabel":"23e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"gpt-5-5-livebench-agentic-coding","label":"LiveBench : code autonome","display":"54,0 %","value":53.9897,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":53.9897},"modelId":"gpt-5-5","modelName":"GPT-5.5","rank":23,"medal":null}]}},{"modelId":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":49,"averageRank":null,"normalizedScore":null,"rankLabel":"49e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"grok-4-3-livebench-agentic-coding","label":"LiveBench : code autonome","display":"18,5 %","value":18.5353,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":18.5353},"modelId":"grok-4-3","modelName":"Grok 4.3","rank":49,"medal":null}]}},{"modelId":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":18,"averageRank":null,"normalizedScore":null,"rankLabel":"18e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"grok-4-5-livebench-agentic-coding","label":"LiveBench : code autonome","display":"56,5 %","value":56.4647,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":56.4647},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":18,"medal":null}]}},{"modelId":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":35,"averageRank":null,"normalizedScore":null,"rankLabel":"35e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"grok-build-0-1-livebench-agentic-coding","label":"LiveBench : code autonome","display":"45,8 %","value":45.808,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":45.808},"modelId":"grok-build-0-1","modelName":"Grok Build 0.1","rank":35,"medal":null}]}},{"modelId":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":32,"averageRank":null,"normalizedScore":null,"rankLabel":"32e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"kimi-k2-6-livebench-agentic-coding","label":"LiveBench : code autonome","display":"46,9 %","value":46.9193,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":46.9193},"modelId":"kimi-k2-6","modelName":"Kimi K2.6","rank":32,"medal":null}]}},{"modelId":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":36,"averageRank":null,"normalizedScore":null,"rankLabel":"36e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"kimi-k2-7-code-livebench-agentic-coding","label":"LiveBench : code autonome","display":"45,7 %","value":45.6563,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":45.6563},"modelId":"kimi-k2-7-code","modelName":"Kimi K2.7 Code","rank":36,"medal":null}]}},{"modelId":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":45,"averageRank":null,"normalizedScore":null,"rankLabel":"45e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"minimax-m3-livebench-agentic-coding","label":"LiveBench : code autonome","display":"40,7 %","value":40.6563,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":40.6563},"modelId":"minimax-m3","modelName":"MiniMax M3","rank":45,"medal":null}]}},{"modelId":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":46,"averageRank":null,"normalizedScore":null,"rankLabel":"46e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"qwen3-6-27b-livebench-agentic-coding","label":"LiveBench : code autonome","display":"39,3 %","value":39.2927,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":39.2927},"modelId":"qwen3-6-27b","modelName":"Qwen 3.6 27B","rank":46,"medal":null}]}},{"modelId":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":44,"averageRank":null,"normalizedScore":null,"rankLabel":"44e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"qwen3-6-plus-livebench-agentic-coding","label":"LiveBench : code autonome","display":"41,4 %","value":41.3637,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":41.3637},"modelId":"qwen3-6-plus","modelName":"Qwen 3.6 Plus","rank":44,"medal":null}]}},{"modelId":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":39,"averageRank":null,"normalizedScore":null,"rankLabel":"39e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"qwen3-7-max-livebench-agentic-coding","label":"LiveBench : code autonome","display":"43,6 %","value":43.586,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":43.586},"modelId":"qwen3-7-max","modelName":"Qwen 3.7 Max","rank":39,"medal":null}]}},{"modelId":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":20.5,"averageRank":null,"normalizedScore":null,"rankLabel":"20e ex aequo","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"terra-livebench-agentic-coding","label":"LiveBench : code autonome","display":"54,9 %","value":54.9497,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":54.9497},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":20.5,"medal":null}]}},{"modelId":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":31,"averageRank":null,"normalizedScore":null,"rankLabel":"31e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"luna-livebench-agentic-coding","label":"LiveBench : code autonome","display":"48,4 %","value":48.4343,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":48.4343},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":31,"medal":null}]}},{"modelId":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":13,"averageRank":null,"normalizedScore":null,"rankLabel":"13e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"muse-spark-1-1-livebench-agentic-coding","label":"LiveBench : code autonome","display":"58,5 %","value":58.5353,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":58.5353},"modelId":"muse-spark-1-1","modelName":"Muse Spark 1.1","rank":13,"medal":null}]}},{"modelId":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":7.5,"averageRank":null,"normalizedScore":null,"rankLabel":"7e ex aequo","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"kimi-k3-livebench-agentic-coding","label":"LiveBench : code autonome","display":"62,2 %","value":62.1717,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.1717},"modelId":"kimi-k3","modelName":"Kimi K3","rank":7.5,"medal":null}]}},{"modelId":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":28,"averageRank":null,"normalizedScore":null,"rankLabel":"28e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"inkling-livebench-agentic-coding","label":"LiveBench : code autonome","display":"49,4 %","value":49.394,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":49.394},"modelId":"inkling","modelName":"Inkling","rank":28,"medal":null}]}},{"modelId":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":37,"averageRank":null,"normalizedScore":null,"rankLabel":"37e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"gemini-3-5-flash-lite-livebench-agentic-coding","label":"LiveBench : code autonome","display":"45,3 %","value":45.2527,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":45.2527},"modelId":"gemini-3-5-flash-lite","modelName":"Gemini 3.5 Flash-Lite","rank":37,"medal":null}]}},{"modelId":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":40,"averageRank":null,"normalizedScore":null,"rankLabel":"40e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"gemini-3-6-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"43,4 %","value":43.4343,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":43.4343},"modelId":"gemini-3-6-flash","modelName":"Gemini 3.6 Flash","rank":40,"medal":null}]}},{"modelId":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":27,"averageRank":null,"normalizedScore":null,"rankLabel":"27e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"claude-opus-4-8-livebench-agentic-coding","label":"LiveBench : code autonome","display":"50,5 %","value":50.505,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":50.505},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":27,"medal":null}]}},{"modelId":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":33.5,"averageRank":null,"normalizedScore":null,"rankLabel":"33e ex aequo","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"deepseek-v4-flash-0731-livebench-agentic-coding","label":"LiveBench : code autonome","display":"46,8 %","value":46.7677,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":46.7677},"modelId":"deepseek-v4-flash-0731","modelName":"DeepSeek V4 Flash 0731","rank":33.5,"medal":null}]}},{"modelId":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":4.5,"averageRank":null,"normalizedScore":null,"rankLabel":"4e ex aequo","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"qwen3-8-max-livebench-agentic-coding","label":"LiveBench : code autonome","display":"64,6 %","value":64.6467,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.6467},"modelId":"qwen3-8-max","modelName":"Qwen 3.8 Max","rank":4.5,"medal":null}]}},{"modelId":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":15,"averageRank":null,"normalizedScore":null,"rankLabel":"15e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"muse-spark-1-2-livebench-agentic-coding","label":"LiveBench : code autonome","display":"57,6 %","value":57.5757,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":57.5757},"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","rank":15,"medal":null}]}},{"modelId":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":4.5,"averageRank":null,"normalizedScore":null,"rankLabel":"4e ex aequo","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"smaug-agentic-livebench-agentic-coding","label":"LiveBench : code autonome","display":"64,6 %","value":64.6467,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.6467},"modelId":"smaug-agentic","modelName":"Smaug-Agentic","rank":4.5,"medal":null}]}},{"modelId":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":20.5,"averageRank":null,"normalizedScore":null,"rankLabel":"20e ex aequo","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"deepseek-v4-pro-0813-livebench-agentic-coding","label":"LiveBench : code autonome","display":"54,9 %","value":54.9497,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":54.9497},"modelId":"deepseek-v4-pro-0813","modelName":"DeepSeek V4 Pro 0813","rank":20.5,"medal":null}]}},{"modelId":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":16,"averageRank":null,"normalizedScore":null,"rankLabel":"16e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"grok-4-6-livebench-agentic-coding","label":"LiveBench : code autonome","display":"57,0 %","value":57.02,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":57.02},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":16,"medal":null}]}},{"modelId":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":14,"averageRank":null,"normalizedScore":null,"rankLabel":"14e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"gemini-3-7-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"58,3 %","value":58.283,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":58.283},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":14,"medal":null}]}},{"modelId":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":10,"averageRank":null,"normalizedScore":null,"rankLabel":"10e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"qwen3-8-27b-livebench-agentic-coding","label":"LiveBench : code autonome","display":"61,4 %","value":61.3637,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":61.3637},"modelId":"qwen3-8-27b","modelName":"Qwen 3.8 27B","rank":10,"medal":null}]}},{"modelId":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":3,"averageRank":null,"normalizedScore":null,"rankLabel":"3e","medal":"bronze","manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"deepseek-v4-flash-vision-exp-livebench-agentic-coding","label":"LiveBench : code autonome","display":"65,1 %","value":65.101,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.101},"modelId":"deepseek-v4-flash-vision-exp","modelName":"DeepSeek V4 Flash Vision Exp","rank":3,"medal":"bronze"}]}},{"modelId":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":11,"averageRank":null,"normalizedScore":null,"rankLabel":"11e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"glm-5-3-livebench-agentic-coding","label":"LiveBench : code autonome","display":"60,9 %","value":60.909,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":60.909},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":11,"medal":null}]}},{"modelId":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":17,"averageRank":null,"normalizedScore":null,"rankLabel":"17e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"glm-5-3-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"56,8 %","value":56.7677,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":56.7677},"modelId":"glm-5-3-flash","modelName":"GLM 5.3 Flash","rank":17,"medal":null}]}},{"modelId":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":9,"averageRank":null,"normalizedScore":null,"rankLabel":"9e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"qwen3-8-flash-next-livebench-agentic-coding","label":"LiveBench : code autonome","display":"61,6 %","value":61.6163,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":61.6163},"modelId":"qwen3-8-flash-next","modelName":"Qwen 3.8 Flash Next","rank":9,"medal":null}]}},{"modelId":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":47,"averageRank":null,"normalizedScore":null,"rankLabel":"47e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"nemotron-3-ultra-livebench-agentic-coding","label":"LiveBench : code autonome","display":"38,7 %","value":38.7373,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":38.7373},"modelId":"nemotron-3-ultra","modelName":"Nemotron 3 Ultra 550B A55B","rank":47,"medal":null}]}},{"modelId":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":22,"averageRank":null,"normalizedScore":null,"rankLabel":"22e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"gemini-3-8-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"54,2 %","value":54.2423,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":54.2423},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":22,"medal":null}]}},{"modelId":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":6,"averageRank":null,"normalizedScore":null,"rankLabel":"6e","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[{"observationId":"muse-spark-1-3-livebench-agentic-coding","label":"LiveBench : code autonome","display":"64,1 %","value":64.091,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.091},"modelId":"muse-spark-1-3","modelName":"Muse Spark 1.3","rank":6,"medal":null}]}},{"modelId":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[]}},{"modelId":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[]}},{"modelId":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[]}},{"modelId":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[]}},{"modelId":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[]}},{"modelId":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[]}},{"modelId":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[]}},{"modelId":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[]}},{"modelId":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[]}},{"modelId":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[]}},{"modelId":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[]}},{"modelId":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[]}},{"modelId":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"arc-agi-3-astra":[],"mercor-apex-agents":[],"livebench-agentic-coding-2026-06-25":[]}}],"podiumModelIds":["fable-5-1","opus-5","deepseek-v4-flash-vision-exp"],"sortOrders":{"rank":["fable-5-1","opus-5","deepseek-v4-flash-vision-exp","qwen3-8-max","smaug-agentic","muse-spark-1-3","fable-5","kimi-k3","qwen3-8-flash-next","qwen3-8-27b","glm-5-3","claude-sonnet-5","muse-spark-1-1","gemini-3-7-flash","muse-spark-1-2","grok-4-6","glm-5-3-flash","grok-4-5","sol","deepseek-v4-pro-0813","terra","gemini-3-8-flash","gpt-5-5","gpt-5-4","glm-5-2","claude-opus-4-7","claude-opus-4-8","inkling","claude-opus-4-6","gemini-3-5-flash","luna","kimi-k2-6","deepseek-v4-flash-0731","gpt-5-4-nano","grok-build-0-1","kimi-k2-7-code","gemini-3-5-flash-lite","gemini-3-1-pro-preview","qwen3-7-max","gemini-3-6-flash","claude-sonnet-4-6","deepseek-v4-pro","gpt-5-4-mini","qwen3-6-plus","minimax-m3","qwen3-6-27b","nemotron-3-ultra","deepseek-v4-flash","grok-4-3","claude-haiku-4-5","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","glm-5","glm-5-1","astra","grok-4-20-0309-reasoning","inkling-small","kimi-k2-5","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","mistral-medium-3-5","nemotron-lightning-3-5","qwen3-7-plus"],"model":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"maker":["smaug-agentic","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","ling-3-0-flash-2607","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","nemotron-3-ultra","nemotron-lightning-3-5","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","inkling","inkling-small","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","mimo-v2-5","mimo-v2-5-pro","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash"],"date":["glm-5-1","mimo-v2-5-pro","mimo-v2-5","inkling-small","qwen3-7-plus","minimax-m2-7","claude-haiku-4-5","gemini-3-flash-preview","mistral-medium-3-5","gemini-3-1-flash-lite-preview","nemotron-lightning-3-5","grok-4-20-0309-reasoning","ling-3-0-flash-2607","astra","gemini-3-8-flash","muse-spark-1-3","fable-5-1","glm-5-3-flash","qwen3-8-flash-next","deepseek-v4-flash-vision-exp","qwen3-8-27b","glm-5-3","deepseek-v4-pro-0813","gemini-3-7-flash","grok-4-6","smaug-agentic","muse-spark-1-2","qwen3-8-max","deepseek-v4-flash-0731","opus-5","gemini-3-5-flash-lite","gemini-3-6-flash","kimi-k3","inkling","sol","terra","luna","muse-spark-1-1","grok-4-5","claude-sonnet-5","glm-5-2","kimi-k2-7-code","fable-5","qwen3-7-max","nemotron-3-ultra","minimax-m3","claude-opus-4-8","gemini-3-5-flash","grok-build-0-1","grok-4-3","deepseek-v4-flash","deepseek-v4-pro","gpt-5-5","qwen3-6-27b","kimi-k2-6","claude-opus-4-7","qwen3-6-plus","gpt-5-4-mini","gpt-5-4-nano","gpt-5-4","gemini-3-1-pro-preview","claude-sonnet-4-6","minimax-m2-5","glm-5","claude-opus-4-6","kimi-k2-5"],"teams":["fable-5-1","astra","fable-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","kimi-k2-6","kimi-k2-7-code","kimi-k3","minimax-m3","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic","claude-haiku-4-5","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","glm-5","glm-5-1","grok-4-20-0309-reasoning","inkling-small","kimi-k2-5","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","mistral-medium-3-5","nemotron-lightning-3-5","qwen3-7-plus"],"score":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:arc-agi-3-astra":["astra","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:mercor-apex-agents":["astra","fable-5-1","fable-5","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:livebench-agentic-coding-2026-06-25":["fable-5-1","opus-5","deepseek-v4-flash-vision-exp","qwen3-8-max","smaug-agentic","muse-spark-1-3","fable-5","kimi-k3","qwen3-8-flash-next","qwen3-8-27b","glm-5-3","claude-sonnet-5","muse-spark-1-1","gemini-3-7-flash","muse-spark-1-2","grok-4-6","glm-5-3-flash","grok-4-5","sol","deepseek-v4-pro-0813","terra","gemini-3-8-flash","gpt-5-5","gpt-5-4","glm-5-2","claude-opus-4-7","claude-opus-4-8","inkling","claude-opus-4-6","gemini-3-5-flash","luna","kimi-k2-6","deepseek-v4-flash-0731","gpt-5-4-nano","grok-build-0-1","kimi-k2-7-code","gemini-3-5-flash-lite","gemini-3-1-pro-preview","qwen3-7-max","gemini-3-6-flash","claude-sonnet-4-6","deepseek-v4-pro","gpt-5-4-mini","qwen3-6-plus","minimax-m3","qwen3-6-27b","nemotron-3-ultra","deepseek-v4-flash","grok-4-3","claude-haiku-4-5","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","glm-5","glm-5-1","astra","grok-4-20-0309-reasoning","inkling-small","kimi-k2-5","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","mistral-medium-3-5","nemotron-lightning-3-5","qwen3-7-plus"]},"contradictions":[],"concordance":"Agrégation en attente de couverture, 0 modèles communs sur 49.","normalizedScore":{"domain":"agentic","available":false,"edition":{"editionId":"origin-agentic-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : couverture actuelle, 1 test au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[{"familyId":"arc-agi-3-astra","sourceId":"arc-agi-3","benchmark":"ARC-AGI-3, tâches partiellement cachées, configuration standard","organization":"ARC Prize","organizationId":"arc-prize","modelCount":1,"reason":"1 modèles mesurés, minimum pratique 15."},{"familyId":"mercor-apex-agents","sourceId":"mercor-apex-agents","benchmark":"APEX-Agents","organization":"Mercor","organizationId":"mercor","modelCount":2,"reason":"2 modèles mesurés, minimum pratique 15."},{"familyId":"livebench-agentic-coding-2026-06-25","sourceId":"livebench-2026-06-25","benchmark":"LiveBench : code autonome","organization":"LiveBench","organizationId":"livebench","modelCount":49,"reason":"Hors socle : aucune édition Origin n’est constituée pour cet usage."}],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":1,"organizationCount":1,"referenceModelCount":0},"message":"Note Origin indisponible : couverture actuelle, 1 test au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},"aggregation":null,"aggregationCoverage":{"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":3,"modelCount":0,"panelModelCount":49,"message":"Agrégation en attente de couverture, 0 modèles communs sur 49.","candidateSources":[{"organization":"ARC Prize","sourceId":"arc-agi-3","familyId":"arc-agi-3-astra","independenceLevel":1,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."},{"organization":"Mercor","sourceId":"mercor-apex-agents","familyId":"mercor-apex-agents","independenceLevel":2,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-agentic-coding-2026-06-25","independenceLevel":1,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."}]}},{"id":"coding","label":"Développement logiciel","question":"Quel modèle pour développer un logiciel ?","verdict":"Claude Fable 5.1 arrive en tête. Analyse élargie, 3 organismes, 41 modèles.","limitation":"Proximité des classements, Kendall W : 0,8, fourchette à 95 % de 0,8 à 1. Couverture : Terminal-Bench : 13 modèles du panel, 5 requis ; compte vers la preuve solide. LiveBench : 41 modèles du panel, 5 requis ; compte vers la preuve solide. Vals AI : 41 modèles du panel, 5 requis ; compte vers la preuve solide.","viewMode":"aggregated","averageRank":1.8333,"primaryFamilyId":"vals-code-migration-v1-2026-09-03","primaryFamilyLabel":"Vals Code Migration : réécrire un programme","rankLabel":"Analyse élargie, 3 organismes, 41 modèles. Rang moyen sur 3 sources","stars":3,"starsLabel":"3 organismes couvrent au moins 5 modèles ; 3 requis pour une preuve solide","isTopTie":false,"families":[{"id":"aa-coding-agent-v1-4","label":"Artificial Analysis Coding Agent Index v1.4","organization":"Artificial Analysis","scaleLabel":"Valeurs exactes, sans barre","betterLabel":"Plus haut est meilleur","constructId":"software-agent","sourceType":2,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"fable-5-1-aa-coding","label":"Artificial Analysis Coding Agent Index v1.4","display":"70 points","value":70,"unit":"index","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.","limitation":"Le score mesure Claude Fable 5.1 avec un agent précis. Changer cet agent peut changer le résultat.","visual":{"kind":"none"},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1,"medal":"or"},{"observationId":"opus-5-aa-coding","label":"Artificial Analysis Coding Agent Index v1.4","display":"68 points","value":68,"unit":"index","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.","limitation":"Le score mesure Claude Opus 5 avec un agent précis. Changer cet agent peut changer le résultat.","visual":{"kind":"none"},"modelId":"opus-5","modelName":"Claude Opus 5","rank":2,"medal":"argent"},{"observationId":"astra-aa-coding","label":"Artificial Analysis Coding Agent Index v1.4","display":"67 points","value":67,"unit":"index","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent Codex. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.","limitation":"Le score mesure GPT-6 Astra avec un agent précis. Changer cet agent peut changer le résultat.","visual":{"kind":"none"},"modelId":"astra","modelName":"GPT-6 Astra","rank":3.5,"medal":null},{"observationId":"fable-5-aa-coding","label":"Artificial Analysis Coding Agent Index v1.4","display":"67 points","value":67,"unit":"index","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.","limitation":"Le score mesure Claude Fable 5 avec un agent précis. Changer cet agent peut changer le résultat.","visual":{"kind":"none"},"modelId":"fable-5","modelName":"Claude Fable 5","rank":3.5,"medal":null},{"observationId":"sol-aa-coding","label":"Artificial Analysis Coding Agent Index v1.4","display":"65 points","value":65,"unit":"index","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent Codex. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.","limitation":"Le score mesure GPT-5.6 Sol avec un agent précis. Changer cet agent peut changer le résultat.","visual":{"kind":"none"},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":5,"medal":null}]},{"id":"terminal-bench-v4-0","label":"Terminal-Bench 4.0","organization":"Terminal-Bench","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"terminal-software-tasks","sourceType":1,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"fable-5-1-terminal-bench-4","label":"Terminal-Bench 4.0","display":"57,88 %","value":57.88,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 54,12 à 61,64 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-02-anthropic-claude-fable-5-1-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.257. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5-1. Date de sortie déclarée par Terminal-Bench : 2026-09-01. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":57.88,"lowPercent":54.12,"highPercent":61.64,"spanPercent":7.520000000000003},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1.5,"medal":null},{"observationId":"opus-5-terminal-bench-4","label":"Terminal-Bench 4.0","display":"51,82 %","value":51.82,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 48,43 à 55,21 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-opus-5-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-5. Date de sortie déclarée par Terminal-Bench : 2026-07-24. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":51.82,"lowPercent":48.43,"highPercent":55.21,"spanPercent":6.780000000000001},"modelId":"opus-5","modelName":"Claude Opus 5","rank":1.5,"medal":null},{"observationId":"fable-5-terminal-bench-4","label":"Terminal-Bench 4.0","display":"44,55 %","value":44.55,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 40,70 à 48,40 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-fable-5-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5. Date de sortie déclarée par Terminal-Bench : 2026-06-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":44.55,"lowPercent":40.7,"highPercent":48.4,"spanPercent":7.699999999999996},"modelId":"fable-5","modelName":"Claude Fable 5","rank":4,"medal":null},{"observationId":"glm-5-3-terminal-bench-4","label":"Terminal-Bench 4.0","display":"41,82 %","value":41.82,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 38,59 à 45,05 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-glm-5-3-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.207. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/glm-5.3. Date de sortie déclarée par Terminal-Bench : 2026-08-14. Fabricant Z.ai ; préfixe source anthropic/, fournisseur du point d’accès non publié. Effort max chez Terminal-Bench ; effort LiveBench non publié. Aucune équivalence supposée. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":41.82,"lowPercent":38.59,"highPercent":45.05,"spanPercent":6.459999999999994},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":4,"medal":null},{"observationId":"sol-terminal-bench-4","label":"Terminal-Bench 4.0","display":"37,27 %","value":37.27,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 33,49 à 41,05 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-sol-max-codex.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-sol. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":37.27,"lowPercent":33.49,"highPercent":41.05,"spanPercent":7.559999999999995},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":4,"medal":null},{"observationId":"claude-opus-4-8-terminal-bench-4","label":"Terminal-Bench 4.0","display":"23,64 %","value":23.64,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 20,08 à 27,20 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-opus-4-8-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-4-8. Date de sortie déclarée par Terminal-Bench : 2026-05-28. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":23.64,"lowPercent":20.08,"highPercent":27.2,"spanPercent":7.120000000000001},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":9.5,"medal":null},{"observationId":"terra-terminal-bench-4","label":"Terminal-Bench 4.0","display":"21,52 %","value":21.52,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 18,27 à 24,77 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-terra-max-codex.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-terra. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":21.52,"lowPercent":18.27,"highPercent":24.77,"spanPercent":6.5},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":9.5,"medal":null},{"observationId":"grok-4-6-terminal-bench-4","label":"Terminal-Bench 4.0","display":"20,30 %","value":20.3,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 17,21 à 23,39 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-xai-grok-4-6-none-grok-build.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Grok Build 1.0.5. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.6. Date de sortie déclarée par Terminal-Bench : 2026-08-12. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":20.3,"lowPercent":17.21,"highPercent":23.39,"spanPercent":6.18},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":9.5,"medal":null},{"observationId":"gemini-3-8-flash-terminal-bench-4","label":"Terminal-Bench 4.0","display":"19,09 %","value":19.09,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 15,73 à 22,45 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-01-gemini-gemini-3-8-flash-high-mini-swe-agent.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"mini-SWE-agent 2.4.6. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.8-flash. Date de sortie déclarée par Terminal-Bench : 2026-09-02. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":19.09,"lowPercent":15.73,"highPercent":22.45,"spanPercent":6.719999999999999},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":9.5,"medal":null},{"observationId":"luna-terminal-bench-4","label":"Terminal-Bench 4.0","display":"17,27 %","value":17.27,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 14,42 à 20,12 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-luna-max-codex.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-luna. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":17.27,"lowPercent":14.42,"highPercent":20.12,"spanPercent":5.700000000000001},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":9.5,"medal":null},{"observationId":"claude-sonnet-5-terminal-bench-4","label":"Terminal-Bench 4.0","display":"12,42 %","value":12.42,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 9,36 à 15,48 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-sonnet-5-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-sonnet-5. Date de sortie déclarée par Terminal-Bench : 2026-06-30. Efforts différents : max chez Terminal-Bench, xhigh chez LiveBench. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":12.42,"lowPercent":9.36,"highPercent":15.48,"spanPercent":6.120000000000001},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":9.5,"medal":null},{"observationId":"grok-4-5-terminal-bench-4","label":"Terminal-Bench 4.0","display":"12,42 %","value":12.42,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 9,80 à 15,04 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-xai-grok-4-5-none-grok-build.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Grok Build 1.0.5. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.5. Date de sortie déclarée par Terminal-Bench : 2026-07-16. Écart conservé avec la date du catalogue Origin : 2026-07-08. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":12.42,"lowPercent":9.8,"highPercent":15.04,"spanPercent":5.239999999999998},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":9.5,"medal":null},{"observationId":"gemini-3-7-flash-terminal-bench-4","label":"Terminal-Bench 4.0","display":"11,21 %","value":11.21,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 8,76 à 13,66 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-02-gemini-gemini-3-7-flash-high-mini-swe-agent.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"mini-SWE-agent 2.4.6. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.7-flash. Date de sortie déclarée par Terminal-Bench : 2026-08-13. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":11.21,"lowPercent":8.76,"highPercent":13.66,"spanPercent":4.9},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":9.5,"medal":null}]},{"id":"swe-bench-verified-mini-v2-2026-02","label":"SWE-bench Verified","organization":"SWE-bench","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"repository-bug-repair","sourceType":1,"isCountable":false,"isManufacturer":false,"measurements":[{"observationId":"minimax-m2-5-swe-bench-verified","label":"SWE-bench Verified","display":"75,8 %","value":75.8,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_minimax-2-5-high/metadata.yaml","sourceAccessedAt":"2026-09-04","organization":"SWE-bench","sourceLabel":"Origine d’exécution non vérifiée","isManufacturer":false,"protocol":"mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.","limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 379 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"bar","valuePercent":75.8},"modelId":"minimax-m2-5","modelName":"MiniMax M2.5","rank":null,"medal":null},{"observationId":"claude-opus-4-6-swe-bench-verified","label":"SWE-bench Verified","display":"75,6 %","value":75.6,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_claude-4-6-opus/metadata.yaml","sourceAccessedAt":"2026-09-04","organization":"SWE-bench","sourceLabel":"Origine d’exécution non vérifiée","isManufacturer":false,"protocol":"mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.","limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 378 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Valeur révisée de 75,4 à 75,6 % le 18 février 2026 : https://github.com/SWE-bench/experiments/commit/36905bfeb728dadd82a75bb169ed612aac634551. Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"bar","valuePercent":75.6},"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","rank":null,"medal":null},{"observationId":"glm-5-swe-bench-verified","label":"SWE-bench Verified","display":"72,8 %","value":72.8,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_glm-5-high/metadata.yaml","sourceAccessedAt":"2026-09-04","organization":"SWE-bench","sourceLabel":"Origine d’exécution non vérifiée","isManufacturer":false,"protocol":"mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.","limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 364 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"bar","valuePercent":72.8},"modelId":"glm-5","modelName":"GLM 5","rank":null,"medal":null},{"observationId":"kimi-k2-5-swe-bench-verified","label":"SWE-bench Verified","display":"70,8 %","value":70.8,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_kimi-k2-5-high/metadata.yaml","sourceAccessedAt":"2026-09-04","organization":"SWE-bench","sourceLabel":"Origine d’exécution non vérifiée","isManufacturer":false,"protocol":"mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.","limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 354 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"bar","valuePercent":70.8},"modelId":"kimi-k2-5","modelName":"Kimi K2.5","rank":null,"medal":null}]},{"id":"livebench-coding-2026-06-25","label":"LiveBench : code","organization":"LiveBench","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"code-generation","sourceType":1,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"fable-5-1-livebench-coding","label":"LiveBench : code","display":"86,4 %","value":86.375,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.375},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1,"medal":"or"},{"observationId":"fable-5-livebench-coding","label":"LiveBench : code","display":"86,0 %","value":85.992,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.992},"modelId":"fable-5","modelName":"Claude Fable 5","rank":2,"medal":"argent"},{"observationId":"sol-livebench-coding","label":"LiveBench : code","display":"83,9 %","value":83.941,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.941},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":3,"medal":"bronze"},{"observationId":"luna-livebench-coding","label":"LiveBench : code","display":"82,9 %","value":82.915,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.915},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":4,"medal":null},{"observationId":"smaug-agentic-livebench-coding","label":"LiveBench : code","display":"82,5 %","value":82.471,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.471},"modelId":"smaug-agentic","modelName":"Smaug-Agentic","rank":5,"medal":null},{"observationId":"gpt-5-5-livebench-coding","label":"LiveBench : code","display":"82,1 %","value":82.1495,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.1495},"modelId":"gpt-5-5","modelName":"GPT-5.5","rank":6,"medal":null},{"observationId":"claude-opus-4-7-livebench-coding","label":"LiveBench : code","display":"82,1 %","value":82.088,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.088},"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","rank":7,"medal":null},{"observationId":"claude-opus-4-8-livebench-coding","label":"LiveBench : code","display":"81,8 %","value":81.828,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.828},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":8,"medal":null},{"observationId":"kimi-k3-livebench-coding","label":"LiveBench : code","display":"81,4 %","value":81.4455,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.4455},"modelId":"kimi-k3","modelName":"Kimi K3","rank":9.5,"medal":null},{"observationId":"opus-5-livebench-coding","label":"LiveBench : code","display":"81,4 %","value":81.4455,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.4455},"modelId":"opus-5","modelName":"Claude Opus 5","rank":9.5,"medal":null},{"observationId":"muse-spark-1-3-livebench-coding","label":"LiveBench : code","display":"81,1 %","value":81.0625,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.0625},"modelId":"muse-spark-1-3","modelName":"Muse Spark 1.3","rank":11,"medal":null},{"observationId":"claude-sonnet-5-livebench-coding","label":"LiveBench : code","display":"80,7 %","value":80.68,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":80.68},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":12,"medal":null},{"observationId":"glm-5-2-livebench-coding","label":"LiveBench : code","display":"79,7 %","value":79.654,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.654},"modelId":"glm-5-2","modelName":"GLM 5.2","rank":13,"medal":null},{"observationId":"claude-sonnet-4-6-livebench-coding","label":"LiveBench : code","display":"79,3 %","value":79.2715,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.2715},"modelId":"claude-sonnet-4-6","modelName":"Claude Sonnet 4.6","rank":14,"medal":null},{"observationId":"glm-5-3-livebench-coding","label":"LiveBench : code","display":"79,0 %","value":78.95,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.95},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":15.5,"medal":null},{"observationId":"glm-5-3-flash-livebench-coding","label":"LiveBench : code","display":"79,0 %","value":78.95,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.95},"modelId":"glm-5-3-flash","modelName":"GLM 5.3 Flash","rank":15.5,"medal":null},{"observationId":"gemini-3-7-flash-livebench-coding","label":"LiveBench : code","display":"78,9 %","value":78.8885,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.8885},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":17,"medal":null},{"observationId":"kimi-k2-6-livebench-coding","label":"LiveBench : code","display":"78,6 %","value":78.567,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.567},"modelId":"kimi-k2-6","modelName":"Kimi K2.6","rank":18,"medal":null},{"observationId":"terra-livebench-coding","label":"LiveBench : code","display":"78,2 %","value":78.2455,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.2455},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":19,"medal":null},{"observationId":"claude-opus-4-6-livebench-coding","label":"LiveBench : code","display":"78,2 %","value":78.1845,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.1845},"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","rank":21,"medal":null},{"observationId":"gemini-3-5-flash-livebench-coding","label":"LiveBench : code","display":"78,2 %","value":78.1845,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.1845},"modelId":"gemini-3-5-flash","modelName":"Gemini 3.5 Flash","rank":21,"medal":null},{"observationId":"qwen3-6-plus-livebench-coding","label":"LiveBench : code","display":"78,2 %","value":78.1845,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.1845},"modelId":"qwen3-6-plus","modelName":"Qwen 3.6 Plus","rank":21,"medal":null},{"observationId":"gemini-3-6-flash-livebench-coding","label":"LiveBench : code","display":"77,9 %","value":77.863,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.863},"modelId":"gemini-3-6-flash","modelName":"Gemini 3.6 Flash","rank":23,"medal":null},{"observationId":"gpt-5-4-livebench-coding","label":"LiveBench : code","display":"77,5 %","value":77.5415,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.5415},"modelId":"gpt-5-4","modelName":"GPT-5.4","rank":24.5,"medal":null},{"observationId":"muse-spark-1-2-livebench-coding","label":"LiveBench : code","display":"77,5 %","value":77.5415,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.5415},"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","rank":24.5,"medal":null},{"observationId":"muse-spark-1-1-livebench-coding","label":"LiveBench : code","display":"77,2 %","value":77.1585,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.1585},"modelId":"muse-spark-1-1","modelName":"Muse Spark 1.1","rank":26.5,"medal":null},{"observationId":"deepseek-v4-pro-0813-livebench-coding","label":"LiveBench : code","display":"77,2 %","value":77.1585,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.1585},"modelId":"deepseek-v4-pro-0813","modelName":"DeepSeek V4 Pro 0813","rank":26.5,"medal":null},{"observationId":"grok-4-6-livebench-coding","label":"LiveBench : code","display":"76,8 %","value":76.776,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.776},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":28,"medal":null},{"observationId":"gemini-3-1-pro-preview-livebench-coding","label":"LiveBench : code","display":"76,5 %","value":76.4545,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.4545},"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","rank":29,"medal":null},{"observationId":"gemini-3-5-flash-lite-livebench-coding","label":"LiveBench : code","display":"76,1 %","value":76.0715,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.0715},"modelId":"gemini-3-5-flash-lite","modelName":"Gemini 3.5 Flash-Lite","rank":30,"medal":null},{"observationId":"qwen3-8-27b-livebench-coding","label":"LiveBench : code","display":"75,7 %","value":75.689,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.689},"modelId":"qwen3-8-27b","modelName":"Qwen 3.8 27B","rank":31,"medal":null},{"observationId":"deepseek-v4-flash-0731-livebench-coding","label":"LiveBench : code","display":"75,0 %","value":74.9845,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.9845},"modelId":"deepseek-v4-flash-0731","modelName":"DeepSeek V4 Flash 0731","rank":32,"medal":null},{"observationId":"qwen3-7-max-livebench-coding","label":"LiveBench : code","display":"74,2 %","value":74.219,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.219},"modelId":"qwen3-7-max","modelName":"Qwen 3.7 Max","rank":33,"medal":null},{"observationId":"kimi-k2-7-code-livebench-coding","label":"LiveBench : code","display":"74,0 %","value":73.959,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.959},"modelId":"kimi-k2-7-code","modelName":"Kimi K2.7 Code","rank":34,"medal":null},{"observationId":"qwen3-8-max-livebench-coding","label":"LiveBench : code","display":"72,9 %","value":72.872,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.872},"modelId":"qwen3-8-max","modelName":"Qwen 3.8 Max","rank":35,"medal":null},{"observationId":"qwen3-8-flash-next-livebench-coding","label":"LiveBench : code","display":"72,6 %","value":72.5505,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.5505},"modelId":"qwen3-8-flash-next","modelName":"Qwen 3.8 Flash Next","rank":36,"medal":null},{"observationId":"gemini-3-8-flash-livebench-coding","label":"LiveBench : code","display":"72,5 %","value":72.489,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.489},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":37,"medal":null},{"observationId":"qwen3-6-27b-livebench-coding","label":"LiveBench : code","display":"71,8 %","value":71.785,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.785},"modelId":"qwen3-6-27b","modelName":"Qwen 3.6 27B","rank":38,"medal":null},{"observationId":"gpt-5-4-mini-livebench-coding","label":"LiveBench : code","display":"71,6 %","value":71.624,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.624},"modelId":"gpt-5-4-mini","modelName":"GPT-5.4 mini","rank":39,"medal":null},{"observationId":"inkling-livebench-coding","label":"LiveBench : code","display":"71,0 %","value":71.0195,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.0195},"modelId":"inkling","modelName":"Inkling","rank":40,"medal":null},{"observationId":"gpt-5-4-nano-livebench-coding","label":"LiveBench : code","display":"70,8 %","value":70.8385,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.8385},"modelId":"gpt-5-4-nano","modelName":"GPT-5.4 nano","rank":41,"medal":null},{"observationId":"nemotron-3-ultra-livebench-coding","label":"LiveBench : code","display":"70,7 %","value":70.698,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.698},"modelId":"nemotron-3-ultra","modelName":"Nemotron 3 Ultra 550B A55B","rank":42,"medal":null},{"observationId":"deepseek-v4-pro-livebench-coding","label":"LiveBench : code","display":"70,0 %","value":69.994,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.994},"modelId":"deepseek-v4-pro","modelName":"DeepSeek V4 Pro","rank":43,"medal":null},{"observationId":"grok-4-3-livebench-coding","label":"LiveBench : code","display":"69,9 %","value":69.9325,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.9325},"modelId":"grok-4-3","modelName":"Grok 4.3","rank":44,"medal":null},{"observationId":"deepseek-v4-flash-livebench-coding","label":"LiveBench : code","display":"69,2 %","value":69.228,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.228},"modelId":"deepseek-v4-flash","modelName":"DeepSeek V4 Flash","rank":45,"medal":null},{"observationId":"grok-4-5-livebench-coding","label":"LiveBench : code","display":"68,6 %","value":68.5855,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":68.5855},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":46,"medal":null},{"observationId":"minimax-m3-livebench-coding","label":"LiveBench : code","display":"68,2 %","value":68.2025,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":68.2025},"modelId":"minimax-m3","modelName":"MiniMax M3","rank":47.5,"medal":null},{"observationId":"deepseek-v4-flash-vision-exp-livebench-coding","label":"LiveBench : code","display":"68,2 %","value":68.2025,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":68.2025},"modelId":"deepseek-v4-flash-vision-exp","modelName":"DeepSeek V4 Flash Vision Exp","rank":47.5,"medal":null},{"observationId":"grok-build-0-1-livebench-coding","label":"LiveBench : code","display":"65,4 %","value":65.3855,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.3855},"modelId":"grok-build-0-1","modelName":"Grok Build 0.1","rank":49,"medal":null}]},{"id":"vals-code-migration-v1-2026-09-03","label":"Vals Code Migration : réécrire un programme","organization":"Vals AI","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"code-migration","sourceType":2,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"astra-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"67,74 %","value":67.74,"unit":"percent","dispersion":"Erreur standard publiée : 4,216 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-6-astra. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":67.74},"modelId":"astra","modelName":"GPT-6 Astra","rank":1,"medal":"or"},{"observationId":"opus-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"57,473 %","value":57.473,"unit":"percent","dispersion":"Erreur standard publiée : 4,371 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":57.473},"modelId":"opus-5","modelName":"Claude Opus 5","rank":2,"medal":"argent"},{"observationId":"fable-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"55,065 %","value":55.065,"unit":"percent","dispersion":"Erreur standard publiée : 4,605 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":55.065},"modelId":"fable-5","modelName":"Claude Fable 5","rank":3,"medal":"bronze"},{"observationId":"fable-5-1-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"54,607 %","value":54.607,"unit":"percent","dispersion":"Erreur standard publiée : 4,812 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":54.607},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":4,"medal":null},{"observationId":"sol-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"52,916 %","value":52.916,"unit":"percent","dispersion":"Erreur standard publiée : 4,353 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":52.916},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":5,"medal":null},{"observationId":"terra-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"47,804 %","value":47.804,"unit":"percent","dispersion":"Erreur standard publiée : 4,28 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":47.804},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":6,"medal":null},{"observationId":"claude-opus-4-8-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"47,25 %","value":47.25,"unit":"percent","dispersion":"Erreur standard publiée : 4,176 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":47.25},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":7,"medal":null},{"observationId":"gpt-5-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"45,161 %","value":45.161,"unit":"percent","dispersion":"Erreur standard publiée : 4,164 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.5. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":45.161},"modelId":"gpt-5-5","modelName":"GPT-5.5","rank":8,"medal":null},{"observationId":"grok-4-6-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"44,572 %","value":44.572,"unit":"percent","dispersion":"Erreur standard publiée : 4,479 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.6. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":44.572},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":9,"medal":null},{"observationId":"luna-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"44,55 %","value":44.55,"unit":"percent","dispersion":"Erreur standard publiée : 4,244 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":44.55},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":10,"medal":null},{"observationId":"claude-sonnet-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"44,392 %","value":44.392,"unit":"percent","dispersion":"Erreur standard publiée : 4,246 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":44.392},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":11,"medal":null},{"observationId":"glm-5-3-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"44,222 %","value":44.222,"unit":"percent","dispersion":"Erreur standard publiée : 4,289 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.3. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":44.222},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":12,"medal":null},{"observationId":"claude-opus-4-7-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"43,878 %","value":43.878,"unit":"percent","dispersion":"Erreur standard publiée : 4,22 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":43.878},"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","rank":13,"medal":null},{"observationId":"deepseek-v4-pro-0813-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"41,54 %","value":41.54,"unit":"percent","dispersion":"Erreur standard publiée : 4,301 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":41.54},"modelId":"deepseek-v4-pro-0813","modelName":"DeepSeek V4 Pro 0813","rank":14,"medal":null},{"observationId":"claude-sonnet-4-6-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"39,892 %","value":39.892,"unit":"percent","dispersion":"Erreur standard publiée : 4,138 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":39.892},"modelId":"claude-sonnet-4-6","modelName":"Claude Sonnet 4.6","rank":15,"medal":null},{"observationId":"deepseek-v4-flash-0731-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"38,631 %","value":38.631,"unit":"percent","dispersion":"Erreur standard publiée : 4,382 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":38.631},"modelId":"deepseek-v4-flash-0731","modelName":"DeepSeek V4 Flash 0731","rank":16,"medal":null},{"observationId":"glm-5-2-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"37,87 %","value":37.87,"unit":"percent","dispersion":"Erreur standard publiée : 4,143 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.2. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":37.87},"modelId":"glm-5-2","modelName":"GLM 5.2","rank":17,"medal":null},{"observationId":"grok-4-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"36,596 %","value":36.596,"unit":"percent","dispersion":"Erreur standard publiée : 4,141 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.5. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":36.596},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":18,"medal":null},{"observationId":"gemini-3-8-flash-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"36,546 %","value":36.546,"unit":"percent","dispersion":"Erreur standard publiée : 4,184 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":36.546},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":19,"medal":null},{"observationId":"gpt-5-4-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"34,984 %","value":34.984,"unit":"percent","dispersion":"Erreur standard publiée : 4,113 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":34.984},"modelId":"gpt-5-4","modelName":"GPT-5.4","rank":20,"medal":null},{"observationId":"gemini-3-7-flash-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"34,8 %","value":34.8,"unit":"percent","dispersion":"Erreur standard publiée : 4,225 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":34.8},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":21,"medal":null},{"observationId":"muse-spark-1-1-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"31,115 %","value":31.115,"unit":"percent","dispersion":"Erreur standard publiée : 4,068 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.1. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":31.115},"modelId":"muse-spark-1-1","modelName":"Muse Spark 1.1","rank":22,"medal":null},{"observationId":"gemini-3-6-flash-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"30,928 %","value":30.928,"unit":"percent","dispersion":"Erreur standard publiée : 4,068 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":30.928},"modelId":"gemini-3-6-flash","modelName":"Gemini 3.6 Flash","rank":23,"medal":null},{"observationId":"muse-spark-1-2-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"29,954 %","value":29.954,"unit":"percent","dispersion":"Erreur standard publiée : 4,023 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.2. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":29.954},"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","rank":24,"medal":null},{"observationId":"kimi-k2-6-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"27,768 %","value":27.768,"unit":"percent","dispersion":"Erreur standard publiée : 4,144 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":27.768},"modelId":"kimi-k2-6","modelName":"Kimi K2.6","rank":25,"medal":null},{"observationId":"gemini-3-5-flash-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"26,745 %","value":26.745,"unit":"percent","dispersion":"Erreur standard publiée : 4,104 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":26.745},"modelId":"gemini-3-5-flash","modelName":"Gemini 3.5 Flash","rank":26,"medal":null},{"observationId":"deepseek-v4-pro-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"26,201 %","value":26.201,"unit":"percent","dispersion":"Erreur standard publiée : 4,037 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-pro-20260423/endpoints. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":26.201},"modelId":"deepseek-v4-pro","modelName":"DeepSeek V4 Pro","rank":27,"medal":null},{"observationId":"glm-5-1-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"25,768 %","value":25.768,"unit":"percent","dispersion":"Erreur standard publiée : 4,087 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.1. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":25.768},"modelId":"glm-5-1","modelName":"GLM 5.1","rank":28,"medal":null},{"observationId":"kimi-k2-7-code-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"25,392 %","value":25.392,"unit":"percent","dispersion":"Erreur standard publiée : 4,161 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":25.392},"modelId":"kimi-k2-7-code","modelName":"Kimi K2.7 Code","rank":29,"medal":null},{"observationId":"qwen3-8-max-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"23,958 %","value":23.958,"unit":"percent","dispersion":"Erreur standard publiée : 4,309 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":23.958},"modelId":"qwen3-8-max","modelName":"Qwen 3.8 Max","rank":30,"medal":null},{"observationId":"mimo-v2-5-pro-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"21,557 %","value":21.557,"unit":"percent","dispersion":"Erreur standard publiée : 4,127 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":21.557},"modelId":"mimo-v2-5-pro","modelName":"MiMo V2.5 Pro","rank":31,"medal":null},{"observationId":"glm-5-3-flash-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"20,515 %","value":20.515,"unit":"percent","dispersion":"Erreur standard publiée : 4,207 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/vlm/glm-5.3-flash. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":20.515},"modelId":"glm-5-3-flash","modelName":"GLM 5.3 Flash","rank":32,"medal":null},{"observationId":"minimax-m3-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"19,925 %","value":19.925,"unit":"percent","dispersion":"Erreur standard publiée : 3,944 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":19.925},"modelId":"minimax-m3","modelName":"MiniMax M3","rank":33,"medal":null},{"observationId":"gemini-3-1-pro-preview-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"17,313 %","value":17.313,"unit":"percent","dispersion":"Erreur standard publiée : 3,933 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":17.313},"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","rank":34,"medal":null},{"observationId":"kimi-k3-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"16,099 %","value":16.099,"unit":"percent","dispersion":"Erreur standard publiée : 4,101 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":16.099},"modelId":"kimi-k3","modelName":"Kimi K3","rank":35,"medal":null},{"observationId":"gpt-5-4-nano-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"14,467 %","value":14.467,"unit":"percent","dispersion":"Erreur standard publiée : 4,025 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-nano. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":14.467},"modelId":"gpt-5-4-nano","modelName":"GPT-5.4 nano","rank":36,"medal":null},{"observationId":"mimo-v2-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"14,228 %","value":14.228,"unit":"percent","dispersion":"Erreur standard publiée : 3,687 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":14.228},"modelId":"mimo-v2-5","modelName":"MiMo V2.5","rank":37,"medal":null},{"observationId":"qwen3-8-27b-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"14,157 %","value":14.157,"unit":"percent","dispersion":"Erreur standard publiée : 4,189 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/qwen/qwen3.8-27b-20260814/endpoints. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":14.157},"modelId":"qwen3-8-27b","modelName":"Qwen 3.8 27B","rank":38,"medal":null},{"observationId":"inkling-small-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"13,675 %","value":13.675,"unit":"percent","dispersion":"Erreur standard publiée : 3,81 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":13.675},"modelId":"inkling-small","modelName":"Inkling Small","rank":39,"medal":null},{"observationId":"qwen3-7-max-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"13,069 %","value":13.069,"unit":"percent","dispersion":"Erreur standard publiée : 2,858 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":13.069},"modelId":"qwen3-7-max","modelName":"Qwen 3.7 Max","rank":40,"medal":null},{"observationId":"gpt-5-4-mini-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"12,936 %","value":12.936,"unit":"percent","dispersion":"Erreur standard publiée : 3,641 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-mini. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":12.936},"modelId":"gpt-5-4-mini","modelName":"GPT-5.4 mini","rank":41,"medal":null},{"observationId":"qwen3-7-plus-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"12,856 %","value":12.856,"unit":"percent","dispersion":"Erreur standard publiée : 2,931 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":12.856},"modelId":"qwen3-7-plus","modelName":"Qwen 3.7 Plus","rank":42,"medal":null},{"observationId":"inkling-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"11,79 %","value":11.79,"unit":"percent","dispersion":"Erreur standard publiée : 3,396 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":11.79},"modelId":"inkling","modelName":"Inkling","rank":43,"medal":null},{"observationId":"qwen3-6-plus-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"11,102 %","value":11.102,"unit":"percent","dispersion":"Erreur standard publiée : 1,312 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":11.102},"modelId":"qwen3-6-plus","modelName":"Qwen 3.6 Plus","rank":44,"medal":null},{"observationId":"minimax-m2-7-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"8,685 %","value":8.685,"unit":"percent","dispersion":"Erreur standard publiée : 1,786 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":8.685},"modelId":"minimax-m2-7","modelName":"MiniMax M2.7","rank":45,"medal":null},{"observationId":"claude-haiku-4-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"7,551 %","value":7.551,"unit":"percent","dispersion":"Erreur standard publiée : 1,056 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":7.551},"modelId":"claude-haiku-4-5","modelName":"Claude Haiku 4.5","rank":46,"medal":null},{"observationId":"kimi-k2-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"6,962 %","value":6.962,"unit":"percent","dispersion":"Erreur standard publiée : 1,29 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/moonshotai/kimi-k2.5-0127/endpoints. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":6.962},"modelId":"kimi-k2-5","modelName":"Kimi K2.5","rank":47,"medal":null},{"observationId":"grok-4-3-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"6,795 %","value":6.795,"unit":"percent","dispersion":"Erreur standard publiée : 1,195 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.3. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":6.795},"modelId":"grok-4-3","modelName":"Grok 4.3","rank":48,"medal":null},{"observationId":"gemini-3-flash-preview-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"6,391 %","value":6.391,"unit":"percent","dispersion":"Erreur standard publiée : 1,093 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":6.391},"modelId":"gemini-3-flash-preview","modelName":"Gemini 3 Flash Preview","rank":49,"medal":null},{"observationId":"gemini-3-5-flash-lite-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"6,148 %","value":6.148,"unit":"percent","dispersion":"Erreur standard publiée : 1,708 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":6.148},"modelId":"gemini-3-5-flash-lite","modelName":"Gemini 3.5 Flash-Lite","rank":50,"medal":null},{"observationId":"mistral-medium-3-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"5,127 %","value":5.127,"unit":"percent","dispersion":"Erreur standard publiée : 1,369 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.mistral.ai/models/mistral-medium-3-5-26-04. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":5.127},"modelId":"mistral-medium-3-5","modelName":"Mistral Medium 3.5","rank":51,"medal":null},{"observationId":"nemotron-3-ultra-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"4,905 %","value":4.905,"unit":"percent","dispersion":"Erreur standard publiée : 1,589 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://build.nvidia.com/nvidia/nemotron-3-ultra-550b-a55b. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":4.905},"modelId":"nemotron-3-ultra","modelName":"Nemotron 3 Ultra 550B A55B","rank":52,"medal":null},{"observationId":"gemini-3-1-flash-lite-preview-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"4,609 %","value":4.609,"unit":"percent","dispersion":"Erreur standard publiée : 1,069 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":4.609},"modelId":"gemini-3-1-flash-lite-preview","modelName":"Gemini 3.1 Flash Lite Preview","rank":53,"medal":null},{"observationId":"nemotron-lightning-3-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"2,951 %","value":2.951,"unit":"percent","dispersion":"Erreur standard publiée : 0,951 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":2.951},"modelId":"nemotron-lightning-3-5","modelName":"Nemotron 3.5 Lightning","rank":54,"medal":null},{"observationId":"grok-4-20-0309-reasoning-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"0,314 %","value":0.314,"unit":"percent","dispersion":"Erreur standard publiée : 0,11 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.20-0309-reasoning. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":0.314},"modelId":"grok-4-20-0309-reasoning","modelName":"Grok 4.20 0309 Reasoning","rank":55,"medal":null},{"observationId":"ling-3-0-flash-2607-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"0 %","value":0,"unit":"percent","dispersion":"Erreur standard publiée : 0 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":0},"modelId":"ling-3-0-flash-2607","modelName":"Ling 3.0 Flash 2607, version non confirmée","rank":56,"medal":null}]}],"rows":[{"modelId":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","measured":true,"independentTeams":2,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[{"observationId":"astra-aa-coding","label":"Artificial Analysis Coding Agent Index v1.4","display":"67 points","value":67,"unit":"index","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent Codex. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.","limitation":"Le score mesure GPT-6 Astra avec un agent précis. Changer cet agent peut changer le résultat.","visual":{"kind":"none"},"modelId":"astra","modelName":"GPT-6 Astra","rank":3.5,"medal":null}],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[{"observationId":"astra-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"67,74 %","value":67.74,"unit":"percent","dispersion":"Erreur standard publiée : 4,216 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-6-astra. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":67.74},"modelId":"astra","modelName":"GPT-6 Astra","rank":1,"medal":"or"}]}},{"modelId":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","measured":true,"independentTeams":3,"stars":2,"starsLabel":"3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.","rank":1,"averageRank":1.8333,"normalizedScore":null,"rankLabel":"1er, rang moyen 1,83","medal":"or","manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[{"observationId":"fable-5-1-aa-coding","label":"Artificial Analysis Coding Agent Index v1.4","display":"70 points","value":70,"unit":"index","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.","limitation":"Le score mesure Claude Fable 5.1 avec un agent précis. Changer cet agent peut changer le résultat.","visual":{"kind":"none"},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1,"medal":"or"}],"terminal-bench-v4-0":[{"observationId":"fable-5-1-terminal-bench-4","label":"Terminal-Bench 4.0","display":"57,88 %","value":57.88,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 54,12 à 61,64 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-02-anthropic-claude-fable-5-1-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.257. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5-1. Date de sortie déclarée par Terminal-Bench : 2026-09-01. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":57.88,"lowPercent":54.12,"highPercent":61.64,"spanPercent":7.520000000000003},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1.5,"medal":null}],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"fable-5-1-livebench-coding","label":"LiveBench : code","display":"86,4 %","value":86.375,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.375},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1,"medal":"or"}],"vals-code-migration-v1-2026-09-03":[{"observationId":"fable-5-1-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"54,607 %","value":54.607,"unit":"percent","dispersion":"Erreur standard publiée : 4,812 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":54.607},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":4,"medal":null}]}},{"modelId":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","measured":true,"independentTeams":3,"stars":2,"starsLabel":"3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.","rank":2,"averageRank":2.6667,"normalizedScore":null,"rankLabel":"2e, rang moyen 2,67","medal":"argent","manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[{"observationId":"fable-5-aa-coding","label":"Artificial Analysis Coding Agent Index v1.4","display":"67 points","value":67,"unit":"index","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.","limitation":"Le score mesure Claude Fable 5 avec un agent précis. Changer cet agent peut changer le résultat.","visual":{"kind":"none"},"modelId":"fable-5","modelName":"Claude Fable 5","rank":3.5,"medal":null}],"terminal-bench-v4-0":[{"observationId":"fable-5-terminal-bench-4","label":"Terminal-Bench 4.0","display":"44,55 %","value":44.55,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 40,70 à 48,40 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-fable-5-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5. Date de sortie déclarée par Terminal-Bench : 2026-06-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":44.55,"lowPercent":40.7,"highPercent":48.4,"spanPercent":7.699999999999996},"modelId":"fable-5","modelName":"Claude Fable 5","rank":4,"medal":null}],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"fable-5-livebench-coding","label":"LiveBench : code","display":"86,0 %","value":85.992,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.992},"modelId":"fable-5","modelName":"Claude Fable 5","rank":2,"medal":"argent"}],"vals-code-migration-v1-2026-09-03":[{"observationId":"fable-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"55,065 %","value":55.065,"unit":"percent","dispersion":"Erreur standard publiée : 4,605 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":55.065},"modelId":"fable-5","modelName":"Claude Fable 5","rank":3,"medal":"bronze"}]}},{"modelId":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5","measured":true,"independentTeams":3,"stars":2,"starsLabel":"3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. Fourchettes publiées recouvrantes dans un test retenu.","rank":3.5,"averageRank":3.6667,"normalizedScore":{"modelId":"opus-5","score":87.5,"testCount":2,"organizationCount":2,"agreement":{"minimum":75,"maximum":100,"spread":25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":75,"rank":5,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":100,"rank":1,"comparisonModelCount":17}]},"rankLabel":"3e ex aequo, rang moyen 3,67","medal":"bronze","manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[{"observationId":"opus-5-aa-coding","label":"Artificial Analysis Coding Agent Index v1.4","display":"68 points","value":68,"unit":"index","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.","limitation":"Le score mesure Claude Opus 5 avec un agent précis. Changer cet agent peut changer le résultat.","visual":{"kind":"none"},"modelId":"opus-5","modelName":"Claude Opus 5","rank":2,"medal":"argent"}],"terminal-bench-v4-0":[{"observationId":"opus-5-terminal-bench-4","label":"Terminal-Bench 4.0","display":"51,82 %","value":51.82,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 48,43 à 55,21 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-opus-5-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-5. Date de sortie déclarée par Terminal-Bench : 2026-07-24. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":51.82,"lowPercent":48.43,"highPercent":55.21,"spanPercent":6.780000000000001},"modelId":"opus-5","modelName":"Claude Opus 5","rank":1.5,"medal":null}],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"opus-5-livebench-coding","label":"LiveBench : code","display":"81,4 %","value":81.4455,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.4455},"modelId":"opus-5","modelName":"Claude Opus 5","rank":9.5,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"opus-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"57,473 %","value":57.473,"unit":"percent","dispersion":"Erreur standard publiée : 4,371 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":57.473},"modelId":"opus-5","modelName":"Claude Opus 5","rank":2,"medal":"argent"}]}},{"modelId":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":true,"independentTeams":3,"stars":2,"starsLabel":"3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. Fourchettes publiées recouvrantes dans un test retenu.","rank":3.5,"averageRank":3.6667,"normalizedScore":{"modelId":"sol","score":96.88,"testCount":2,"organizationCount":2,"agreement":{"minimum":93.75,"maximum":100,"spread":6.25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":100,"rank":1,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":93.75,"rank":2,"comparisonModelCount":17}]},"rankLabel":"3e ex aequo, rang moyen 3,67","medal":"bronze","manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[{"observationId":"sol-aa-coding","label":"Artificial Analysis Coding Agent Index v1.4","display":"65 points","value":65,"unit":"index","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent Codex. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.","limitation":"Le score mesure GPT-5.6 Sol avec un agent précis. Changer cet agent peut changer le résultat.","visual":{"kind":"none"},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":5,"medal":null}],"terminal-bench-v4-0":[{"observationId":"sol-terminal-bench-4","label":"Terminal-Bench 4.0","display":"37,27 %","value":37.27,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 33,49 à 41,05 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-sol-max-codex.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-sol. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":37.27,"lowPercent":33.49,"highPercent":41.05,"spanPercent":7.559999999999995},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":4,"medal":null}],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"sol-livebench-coding","label":"LiveBench : code","display":"83,9 %","value":83.941,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.941},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":3,"medal":"bronze"}],"vals-code-migration-v1-2026-09-03":[{"observationId":"sol-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"52,916 %","value":52.916,"unit":"percent","dispersion":"Erreur standard publiée : 4,353 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":52.916},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":5,"medal":null}]}},{"modelId":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text","measured":true,"independentTeams":0,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[{"observationId":"minimax-m2-5-swe-bench-verified","label":"SWE-bench Verified","display":"75,8 %","value":75.8,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_minimax-2-5-high/metadata.yaml","sourceAccessedAt":"2026-09-04","organization":"SWE-bench","sourceLabel":"Origine d’exécution non vérifiée","isManufacturer":false,"protocol":"mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.","limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 379 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"bar","valuePercent":75.8},"modelId":"minimax-m2-5","modelName":"MiniMax M2.5","rank":null,"medal":null}],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[]}},{"modelId":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[{"observationId":"claude-opus-4-6-swe-bench-verified","label":"SWE-bench Verified","display":"75,6 %","value":75.6,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_claude-4-6-opus/metadata.yaml","sourceAccessedAt":"2026-09-04","organization":"SWE-bench","sourceLabel":"Origine d’exécution non vérifiée","isManufacturer":false,"protocol":"mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.","limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 378 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Valeur révisée de 75,4 à 75,6 % le 18 février 2026 : https://github.com/SWE-bench/experiments/commit/36905bfeb728dadd82a75bb169ed612aac634551. Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"bar","valuePercent":75.6},"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","rank":null,"medal":null}],"livebench-coding-2026-06-25":[{"observationId":"claude-opus-4-6-livebench-coding","label":"LiveBench : code","display":"78,2 %","value":78.1845,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.1845},"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","rank":21,"medal":null}],"vals-code-migration-v1-2026-09-03":[]}},{"modelId":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5","measured":true,"independentTeams":0,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[{"observationId":"glm-5-swe-bench-verified","label":"SWE-bench Verified","display":"72,8 %","value":72.8,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_glm-5-high/metadata.yaml","sourceAccessedAt":"2026-09-04","organization":"SWE-bench","sourceLabel":"Origine d’exécution non vérifiée","isManufacturer":false,"protocol":"mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.","limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 364 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"bar","valuePercent":72.8},"modelId":"glm-5","modelName":"GLM 5","rank":null,"medal":null}],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[]}},{"modelId":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[{"observationId":"kimi-k2-5-swe-bench-verified","label":"SWE-bench Verified","display":"70,8 %","value":70.8,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_kimi-k2-5-high/metadata.yaml","sourceAccessedAt":"2026-09-04","organization":"SWE-bench","sourceLabel":"Origine d’exécution non vérifiée","isManufacturer":false,"protocol":"mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.","limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 354 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"bar","valuePercent":70.8},"modelId":"kimi-k2-5","modelName":"Kimi K2.5","rank":null,"medal":null}],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[{"observationId":"kimi-k2-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"6,962 %","value":6.962,"unit":"percent","dispersion":"Erreur standard publiée : 1,29 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/moonshotai/kimi-k2.5-0127/endpoints. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":6.962},"modelId":"kimi-k2-5","modelName":"Kimi K2.5","rank":47,"medal":null}]}},{"modelId":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":8,"averageRank":9,"normalizedScore":null,"rankLabel":"8e, rang moyen 9","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"claude-opus-4-7-livebench-coding","label":"LiveBench : code","display":"82,1 %","value":82.088,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.088},"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","rank":7,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"claude-opus-4-7-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"43,878 %","value":43.878,"unit":"percent","dispersion":"Erreur standard publiée : 4,22 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":43.878},"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","rank":13,"medal":null}]}},{"modelId":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":12,"averageRank":13,"normalizedScore":null,"rankLabel":"12e, rang moyen 13","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"claude-sonnet-4-6-livebench-coding","label":"LiveBench : code","display":"79,3 %","value":79.2715,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.2715},"modelId":"claude-sonnet-4-6","modelName":"Claude Sonnet 4.6","rank":14,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"claude-sonnet-4-6-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"39,892 %","value":39.892,"unit":"percent","dispersion":"Erreur standard publiée : 4,138 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":39.892},"modelId":"claude-sonnet-4-6","modelName":"Claude Sonnet 4.6","rank":15,"medal":null}]}},{"modelId":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","measured":true,"independentTeams":3,"stars":2,"starsLabel":"3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.","rank":10,"averageRank":9.8333,"normalizedScore":null,"rankLabel":"10e, rang moyen 9,83","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[{"observationId":"claude-sonnet-5-terminal-bench-4","label":"Terminal-Bench 4.0","display":"12,42 %","value":12.42,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 9,36 à 15,48 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-sonnet-5-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-sonnet-5. Date de sortie déclarée par Terminal-Bench : 2026-06-30. Efforts différents : max chez Terminal-Bench, xhigh chez LiveBench. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":12.42,"lowPercent":9.36,"highPercent":15.48,"spanPercent":6.120000000000001},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":9.5,"medal":null}],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"claude-sonnet-5-livebench-coding","label":"LiveBench : code","display":"80,7 %","value":80.68,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":80.68},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":12,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"claude-sonnet-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"44,392 %","value":44.392,"unit":"percent","dispersion":"Erreur standard publiée : 4,246 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":44.392},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":11,"medal":null}]}},{"modelId":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"deepseek-v4-flash-livebench-coding","label":"LiveBench : code","display":"69,2 %","value":69.228,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.228},"modelId":"deepseek-v4-flash","modelName":"DeepSeek V4 Flash","rank":45,"medal":null}],"vals-code-migration-v1-2026-09-03":[]}},{"modelId":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":33,"averageRank":32,"normalizedScore":null,"rankLabel":"33e, rang moyen 32","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"deepseek-v4-pro-livebench-coding","label":"LiveBench : code","display":"70,0 %","value":69.994,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.994},"modelId":"deepseek-v4-pro","modelName":"DeepSeek V4 Pro","rank":43,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"deepseek-v4-pro-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"26,201 %","value":26.201,"unit":"percent","dispersion":"Erreur standard publiée : 4,037 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-pro-20260423/endpoints. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":26.201},"modelId":"deepseek-v4-pro","modelName":"DeepSeek V4 Pro","rank":27,"medal":null}]}},{"modelId":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":29,"averageRank":28.5,"normalizedScore":{"modelId":"gemini-3-1-pro-preview","score":21.88,"testCount":2,"organizationCount":2,"agreement":{"minimum":18.75,"maximum":25,"spread":6.25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":25,"rank":13,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":18.75,"rank":14,"comparisonModelCount":17}]},"rankLabel":"29e, rang moyen 28,5","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"gemini-3-1-pro-preview-livebench-coding","label":"LiveBench : code","display":"76,5 %","value":76.4545,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.4545},"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","rank":29,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"gemini-3-1-pro-preview-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"17,313 %","value":17.313,"unit":"percent","dispersion":"Erreur standard publiée : 3,933 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":17.313},"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","rank":34,"medal":null}]}},{"modelId":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":23,"averageRank":21.75,"normalizedScore":{"modelId":"gemini-3-5-flash","score":40.63,"testCount":2,"organizationCount":2,"agreement":{"minimum":25,"maximum":56.25,"spread":31.25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":56.25,"rank":8,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":25,"rank":13,"comparisonModelCount":17}]},"rankLabel":"23e, rang moyen 21,75","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"gemini-3-5-flash-livebench-coding","label":"LiveBench : code","display":"78,2 %","value":78.1845,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.1845},"modelId":"gemini-3-5-flash","modelName":"Gemini 3.5 Flash","rank":21,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"gemini-3-5-flash-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"26,745 %","value":26.745,"unit":"percent","dispersion":"Erreur standard publiée : 4,104 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":26.745},"modelId":"gemini-3-5-flash","modelName":"Gemini 3.5 Flash","rank":26,"medal":null}]}},{"modelId":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":13,"averageRank":13.5,"normalizedScore":null,"rankLabel":"13e, rang moyen 13,5","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"glm-5-2-livebench-coding","label":"LiveBench : code","display":"79,7 %","value":79.654,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.654},"modelId":"glm-5-2","modelName":"GLM 5.2","rank":13,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"glm-5-2-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"37,87 %","value":37.87,"unit":"percent","dispersion":"Erreur standard publiée : 4,143 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.2. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":37.87},"modelId":"glm-5-2","modelName":"GLM 5.2","rank":17,"medal":null}]}},{"modelId":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":37,"averageRank":35,"normalizedScore":{"modelId":"gpt-5-4-mini","score":9.38,"testCount":2,"organizationCount":2,"agreement":{"minimum":6.25,"maximum":12.5,"spread":6.25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":6.25,"rank":16,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":12.5,"rank":15,"comparisonModelCount":17}]},"rankLabel":"37e, rang moyen 35","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"gpt-5-4-mini-livebench-coding","label":"LiveBench : code","display":"71,6 %","value":71.624,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.624},"modelId":"gpt-5-4-mini","modelName":"GPT-5.4 mini","rank":39,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"gpt-5-4-mini-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"12,936 %","value":12.936,"unit":"percent","dispersion":"Erreur standard publiée : 3,641 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-mini. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":12.936},"modelId":"gpt-5-4-mini","modelName":"GPT-5.4 mini","rank":41,"medal":null}]}},{"modelId":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":36,"averageRank":34.5,"normalizedScore":null,"rankLabel":"36e, rang moyen 34,5","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"gpt-5-4-nano-livebench-coding","label":"LiveBench : code","display":"70,8 %","value":70.8385,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.8385},"modelId":"gpt-5-4-nano","modelName":"GPT-5.4 nano","rank":41,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"gpt-5-4-nano-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"14,467 %","value":14.467,"unit":"percent","dispersion":"Erreur standard publiée : 4,025 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-nano. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":14.467},"modelId":"gpt-5-4-nano","modelName":"GPT-5.4 nano","rank":36,"medal":null}]}},{"modelId":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/","measured":true,"independentTeams":2,"stars":1,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen.","rank":19.5,"averageRank":20.25,"normalizedScore":{"modelId":"gpt-5-4","score":48.44,"testCount":2,"organizationCount":2,"agreement":{"minimum":40.63,"maximum":56.25,"spread":15.63},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":40.625,"rank":10.5,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":56.25,"rank":8,"comparisonModelCount":17}]},"rankLabel":"19e ex aequo, rang moyen 20,25","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"gpt-5-4-livebench-coding","label":"LiveBench : code","display":"77,5 %","value":77.5415,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.5415},"modelId":"gpt-5-4","modelName":"GPT-5.4","rank":24.5,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"gpt-5-4-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"34,984 %","value":34.984,"unit":"percent","dispersion":"Erreur standard publiée : 4,113 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":34.984},"modelId":"gpt-5-4","modelName":"GPT-5.4","rank":20,"medal":null}]}},{"modelId":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":5,"averageRank":6,"normalizedScore":{"modelId":"gpt-5-5","score":81.25,"testCount":2,"organizationCount":2,"agreement":{"minimum":75,"maximum":87.5,"spread":12.5},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":87.5,"rank":3,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":75,"rank":5,"comparisonModelCount":17}]},"rankLabel":"5e, rang moyen 6","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"gpt-5-5-livebench-coding","label":"LiveBench : code","display":"82,1 %","value":82.1495,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.1495},"modelId":"gpt-5-5","modelName":"GPT-5.5","rank":6,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"gpt-5-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"45,161 %","value":45.161,"unit":"percent","dispersion":"Erreur standard publiée : 4,164 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.5. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":45.161},"modelId":"gpt-5-5","modelName":"GPT-5.5","rank":8,"medal":null}]}},{"modelId":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","measured":true,"independentTeams":2,"stars":1,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen.","rank":40.5,"averageRank":39,"normalizedScore":null,"rankLabel":"40e ex aequo, rang moyen 39","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"grok-4-3-livebench-coding","label":"LiveBench : code","display":"69,9 %","value":69.9325,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.9325},"modelId":"grok-4-3","modelName":"Grok 4.3","rank":44,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"grok-4-3-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"6,795 %","value":6.795,"unit":"percent","dispersion":"Erreur standard publiée : 1,195 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.3. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":6.795},"modelId":"grok-4-3","modelName":"Grok 4.3","rank":48,"medal":null}]}},{"modelId":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":true,"independentTeams":3,"stars":2,"starsLabel":"3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.","rank":25,"averageRank":22.1667,"normalizedScore":null,"rankLabel":"25e, rang moyen 22,17","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[{"observationId":"grok-4-5-terminal-bench-4","label":"Terminal-Bench 4.0","display":"12,42 %","value":12.42,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 9,80 à 15,04 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-xai-grok-4-5-none-grok-build.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Grok Build 1.0.5. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.5. Date de sortie déclarée par Terminal-Bench : 2026-07-16. Écart conservé avec la date du catalogue Origin : 2026-07-08. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":12.42,"lowPercent":9.8,"highPercent":15.04,"spanPercent":5.239999999999998},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":9.5,"medal":null}],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"grok-4-5-livebench-coding","label":"LiveBench : code","display":"68,6 %","value":68.5855,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":68.5855},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":46,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"grok-4-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"36,596 %","value":36.596,"unit":"percent","dispersion":"Erreur standard publiée : 4,141 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.5. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":36.596},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":18,"medal":null}]}},{"modelId":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"grok-build-0-1-livebench-coding","label":"LiveBench : code","display":"65,4 %","value":65.3855,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.3855},"modelId":"grok-build-0-1","modelName":"Grok Build 0.1","rank":49,"medal":null}],"vals-code-migration-v1-2026-09-03":[]}},{"modelId":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":17,"averageRank":20,"normalizedScore":null,"rankLabel":"17e, rang moyen 20","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"kimi-k2-6-livebench-coding","label":"LiveBench : code","display":"78,6 %","value":78.567,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.567},"modelId":"kimi-k2-6","modelName":"Kimi K2.6","rank":18,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"kimi-k2-6-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"27,768 %","value":27.768,"unit":"percent","dispersion":"Erreur standard publiée : 4,144 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":27.768},"modelId":"kimi-k2-6","modelName":"Kimi K2.6","rank":25,"medal":null}]}},{"modelId":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":30,"averageRank":29,"normalizedScore":null,"rankLabel":"30e, rang moyen 29","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"kimi-k2-7-code-livebench-coding","label":"LiveBench : code","display":"74,0 %","value":73.959,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.959},"modelId":"kimi-k2-7-code","modelName":"Kimi K2.7 Code","rank":34,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"kimi-k2-7-code-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"25,392 %","value":25.392,"unit":"percent","dispersion":"Erreur standard publiée : 4,161 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":25.392},"modelId":"kimi-k2-7-code","modelName":"Kimi K2.7 Code","rank":29,"medal":null}]}},{"modelId":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":38,"averageRank":35.5,"normalizedScore":null,"rankLabel":"38e, rang moyen 35,5","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"minimax-m3-livebench-coding","label":"LiveBench : code","display":"68,2 %","value":68.2025,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":68.2025},"modelId":"minimax-m3","modelName":"MiniMax M3","rank":47.5,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"minimax-m3-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"19,925 %","value":19.925,"unit":"percent","dispersion":"Erreur standard publiée : 3,944 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":19.925},"modelId":"minimax-m3","modelName":"MiniMax M3","rank":33,"medal":null}]}},{"modelId":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"qwen3-6-27b-livebench-coding","label":"LiveBench : code","display":"71,8 %","value":71.785,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.785},"modelId":"qwen3-6-27b","modelName":"Qwen 3.6 27B","rank":38,"medal":null}],"vals-code-migration-v1-2026-09-03":[]}},{"modelId":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":28,"averageRank":28.25,"normalizedScore":null,"rankLabel":"28e, rang moyen 28,25","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"qwen3-6-plus-livebench-coding","label":"LiveBench : code","display":"78,2 %","value":78.1845,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.1845},"modelId":"qwen3-6-plus","modelName":"Qwen 3.6 Plus","rank":21,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"qwen3-6-plus-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"11,102 %","value":11.102,"unit":"percent","dispersion":"Erreur standard publiée : 1,312 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":11.102},"modelId":"qwen3-6-plus","modelName":"Qwen 3.6 Plus","rank":44,"medal":null}]}},{"modelId":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":34,"averageRank":32.5,"normalizedScore":null,"rankLabel":"34e, rang moyen 32,5","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"qwen3-7-max-livebench-coding","label":"LiveBench : code","display":"74,2 %","value":74.219,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.219},"modelId":"qwen3-7-max","modelName":"Qwen 3.7 Max","rank":33,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"qwen3-7-max-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"13,069 %","value":13.069,"unit":"percent","dispersion":"Erreur standard publiée : 2,858 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":13.069},"modelId":"qwen3-7-max","modelName":"Qwen 3.7 Max","rank":40,"medal":null}]}},{"modelId":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":true,"independentTeams":3,"stars":2,"starsLabel":"3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.","rank":11,"averageRank":10.5,"normalizedScore":{"modelId":"terra","score":75,"testCount":2,"organizationCount":2,"agreement":{"minimum":62.5,"maximum":87.5,"spread":25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":62.5,"rank":7,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":87.5,"rank":3,"comparisonModelCount":17}]},"rankLabel":"11e, rang moyen 10,5","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[{"observationId":"terra-terminal-bench-4","label":"Terminal-Bench 4.0","display":"21,52 %","value":21.52,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 18,27 à 24,77 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-terra-max-codex.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-terra. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":21.52,"lowPercent":18.27,"highPercent":24.77,"spanPercent":6.5},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":9.5,"medal":null}],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"terra-livebench-coding","label":"LiveBench : code","display":"78,2 %","value":78.2455,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.2455},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":19,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"terra-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"47,804 %","value":47.804,"unit":"percent","dispersion":"Erreur standard publiée : 4,28 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":47.804},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":6,"medal":null}]}},{"modelId":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":true,"independentTeams":3,"stars":2,"starsLabel":"3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. Fourchettes publiées recouvrantes dans un test retenu.","rank":6.5,"averageRank":7.5,"normalizedScore":{"modelId":"luna","score":81.25,"testCount":2,"organizationCount":2,"agreement":{"minimum":68.75,"maximum":93.75,"spread":25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":93.75,"rank":2,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":68.75,"rank":6,"comparisonModelCount":17}]},"rankLabel":"6e ex aequo, rang moyen 7,5","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[{"observationId":"luna-terminal-bench-4","label":"Terminal-Bench 4.0","display":"17,27 %","value":17.27,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 14,42 à 20,12 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-luna-max-codex.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-luna. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":17.27,"lowPercent":14.42,"highPercent":20.12,"spanPercent":5.700000000000001},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":9.5,"medal":null}],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"luna-livebench-coding","label":"LiveBench : code","display":"82,9 %","value":82.915,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.915},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":4,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"luna-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"44,55 %","value":44.55,"unit":"percent","dispersion":"Erreur standard publiée : 4,244 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":44.55},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":10,"medal":null}]}},{"modelId":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","measured":true,"independentTeams":2,"stars":1,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen.","rank":26.5,"averageRank":22.25,"normalizedScore":{"modelId":"muse-spark-1-1","score":37.5,"testCount":2,"organizationCount":2,"agreement":{"minimum":31.25,"maximum":43.75,"spread":12.5},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":31.25,"rank":12,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":43.75,"rank":10,"comparisonModelCount":17}]},"rankLabel":"26e ex aequo, rang moyen 22,25","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"muse-spark-1-1-livebench-coding","label":"LiveBench : code","display":"77,2 %","value":77.1585,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.1585},"modelId":"muse-spark-1-1","modelName":"Muse Spark 1.1","rank":26.5,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"muse-spark-1-1-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"31,115 %","value":31.115,"unit":"percent","dispersion":"Erreur standard publiée : 4,068 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.1. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":31.115},"modelId":"muse-spark-1-1","modelName":"Muse Spark 1.1","rank":22,"medal":null}]}},{"modelId":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","measured":true,"independentTeams":2,"stars":1,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen.","rank":19.5,"averageRank":20.25,"normalizedScore":null,"rankLabel":"19e ex aequo, rang moyen 20,25","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"kimi-k3-livebench-coding","label":"LiveBench : code","display":"81,4 %","value":81.4455,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.4455},"modelId":"kimi-k3","modelName":"Kimi K3","rank":9.5,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"kimi-k3-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"16,099 %","value":16.099,"unit":"percent","dispersion":"Erreur standard publiée : 4,101 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":16.099},"modelId":"kimi-k3","modelName":"Kimi K3","rank":35,"medal":null}]}},{"modelId":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":39,"averageRank":36,"normalizedScore":{"modelId":"inkling","score":3.13,"testCount":2,"organizationCount":2,"agreement":{"minimum":0,"maximum":6.25,"spread":6.25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":0,"rank":17,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":6.25,"rank":16,"comparisonModelCount":17}]},"rankLabel":"39e, rang moyen 36","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"inkling-livebench-coding","label":"LiveBench : code","display":"71,0 %","value":71.0195,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.0195},"modelId":"inkling","modelName":"Inkling","rank":40,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"inkling-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"11,79 %","value":11.79,"unit":"percent","dispersion":"Erreur standard publiée : 3,396 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":11.79},"modelId":"inkling","modelName":"Inkling","rank":43,"medal":null}]}},{"modelId":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":35,"averageRank":33.5,"normalizedScore":{"modelId":"gemini-3-5-flash-lite","score":9.38,"testCount":2,"organizationCount":2,"agreement":{"minimum":0,"maximum":18.75,"spread":18.75},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":18.75,"rank":14,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":0,"rank":17,"comparisonModelCount":17}]},"rankLabel":"35e, rang moyen 33,5","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"gemini-3-5-flash-lite-livebench-coding","label":"LiveBench : code","display":"76,1 %","value":76.0715,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.0715},"modelId":"gemini-3-5-flash-lite","modelName":"Gemini 3.5 Flash-Lite","rank":30,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"gemini-3-5-flash-lite-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"6,148 %","value":6.148,"unit":"percent","dispersion":"Erreur standard publiée : 1,708 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":6.148},"modelId":"gemini-3-5-flash-lite","modelName":"Gemini 3.5 Flash-Lite","rank":50,"medal":null}]}},{"modelId":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":21,"averageRank":21,"normalizedScore":{"modelId":"gemini-3-6-flash","score":43.75,"testCount":2,"organizationCount":2,"agreement":{"minimum":37.5,"maximum":50,"spread":12.5},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":50,"rank":9,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":37.5,"rank":11,"comparisonModelCount":17}]},"rankLabel":"21e, rang moyen 21","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"gemini-3-6-flash-livebench-coding","label":"LiveBench : code","display":"77,9 %","value":77.863,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.863},"modelId":"gemini-3-6-flash","modelName":"Gemini 3.6 Flash","rank":23,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"gemini-3-6-flash-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"30,928 %","value":30.928,"unit":"percent","dispersion":"Erreur standard publiée : 4,068 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":30.928},"modelId":"gemini-3-6-flash","modelName":"Gemini 3.6 Flash","rank":23,"medal":null}]}},{"modelId":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","measured":true,"independentTeams":3,"stars":2,"starsLabel":"3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen. Fourchettes publiées recouvrantes dans un test retenu.","rank":6.5,"averageRank":7.5,"normalizedScore":{"modelId":"claude-opus-4-8","score":81.25,"testCount":2,"organizationCount":2,"agreement":{"minimum":81.25,"maximum":81.25,"spread":0},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":81.25,"rank":4,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":81.25,"rank":4,"comparisonModelCount":17}]},"rankLabel":"6e ex aequo, rang moyen 7,5","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[{"observationId":"claude-opus-4-8-terminal-bench-4","label":"Terminal-Bench 4.0","display":"23,64 %","value":23.64,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 20,08 à 27,20 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-opus-4-8-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-4-8. Date de sortie déclarée par Terminal-Bench : 2026-05-28. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":23.64,"lowPercent":20.08,"highPercent":27.2,"spanPercent":7.120000000000001},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":9.5,"medal":null}],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"claude-opus-4-8-livebench-coding","label":"LiveBench : code","display":"81,8 %","value":81.828,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.828},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":8,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"claude-opus-4-8-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"47,25 %","value":47.25,"unit":"percent","dispersion":"Erreur standard publiée : 4,176 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":47.25},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":7,"medal":null}]}},{"modelId":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":24,"averageRank":22,"normalizedScore":null,"rankLabel":"24e, rang moyen 22","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"deepseek-v4-flash-0731-livebench-coding","label":"LiveBench : code","display":"75,0 %","value":74.9845,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.9845},"modelId":"deepseek-v4-flash-0731","modelName":"DeepSeek V4 Flash 0731","rank":32,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"deepseek-v4-flash-0731-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"38,631 %","value":38.631,"unit":"percent","dispersion":"Erreur standard publiée : 4,382 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":38.631},"modelId":"deepseek-v4-flash-0731","modelName":"DeepSeek V4 Flash 0731","rank":16,"medal":null}]}},{"modelId":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":31,"averageRank":30,"normalizedScore":null,"rankLabel":"31e, rang moyen 30","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"qwen3-8-max-livebench-coding","label":"LiveBench : code","display":"72,9 %","value":72.872,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.872},"modelId":"qwen3-8-max","modelName":"Qwen 3.8 Max","rank":35,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"qwen3-8-max-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"23,958 %","value":23.958,"unit":"percent","dispersion":"Erreur standard publiée : 4,309 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":23.958},"modelId":"qwen3-8-max","modelName":"Qwen 3.8 Max","rank":30,"medal":null}]}},{"modelId":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","measured":true,"independentTeams":2,"stars":1,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen.","rank":26.5,"averageRank":22.25,"normalizedScore":{"modelId":"muse-spark-1-2","score":35.94,"testCount":2,"organizationCount":2,"agreement":{"minimum":31.25,"maximum":40.63,"spread":9.38},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":40.625,"rank":10.5,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":31.25,"rank":12,"comparisonModelCount":17}]},"rankLabel":"26e ex aequo, rang moyen 22,25","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"muse-spark-1-2-livebench-coding","label":"LiveBench : code","display":"77,5 %","value":77.5415,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.5415},"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","rank":24.5,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"muse-spark-1-2-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"29,954 %","value":29.954,"unit":"percent","dispersion":"Erreur standard publiée : 4,023 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.2. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":29.954},"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","rank":24,"medal":null}]}},{"modelId":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"smaug-agentic-livebench-coding","label":"LiveBench : code","display":"82,5 %","value":82.471,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.471},"modelId":"smaug-agentic","modelName":"Smaug-Agentic","rank":5,"medal":null}],"vals-code-migration-v1-2026-09-03":[]}},{"modelId":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":16,"averageRank":18.25,"normalizedScore":null,"rankLabel":"16e, rang moyen 18,25","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"deepseek-v4-pro-0813-livebench-coding","label":"LiveBench : code","display":"77,2 %","value":77.1585,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.1585},"modelId":"deepseek-v4-pro-0813","modelName":"DeepSeek V4 Pro 0813","rank":26.5,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"deepseek-v4-pro-0813-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"41,54 %","value":41.54,"unit":"percent","dispersion":"Erreur standard publiée : 4,301 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":41.54},"modelId":"deepseek-v4-pro-0813","modelName":"DeepSeek V4 Pro 0813","rank":14,"medal":null}]}},{"modelId":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6","measured":true,"independentTeams":3,"stars":2,"starsLabel":"3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.","rank":14,"averageRank":14.1667,"normalizedScore":null,"rankLabel":"14e, rang moyen 14,17","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[{"observationId":"grok-4-6-terminal-bench-4","label":"Terminal-Bench 4.0","display":"20,30 %","value":20.3,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 17,21 à 23,39 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-xai-grok-4-6-none-grok-build.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Grok Build 1.0.5. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.6. Date de sortie déclarée par Terminal-Bench : 2026-08-12. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":20.3,"lowPercent":17.21,"highPercent":23.39,"spanPercent":6.18},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":9.5,"medal":null}],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"grok-4-6-livebench-coding","label":"LiveBench : code","display":"76,8 %","value":76.776,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.776},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":28,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"grok-4-6-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"44,572 %","value":44.572,"unit":"percent","dispersion":"Erreur standard publiée : 4,479 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.6. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":44.572},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":9,"medal":null}]}},{"modelId":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":3,"stars":2,"starsLabel":"3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.","rank":15,"averageRank":14.8333,"normalizedScore":{"modelId":"gemini-3-7-flash","score":59.38,"testCount":2,"organizationCount":2,"agreement":{"minimum":50,"maximum":68.75,"spread":18.75},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":68.75,"rank":6,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":50,"rank":9,"comparisonModelCount":17}]},"rankLabel":"15e, rang moyen 14,83","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[{"observationId":"gemini-3-7-flash-terminal-bench-4","label":"Terminal-Bench 4.0","display":"11,21 %","value":11.21,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 8,76 à 13,66 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-02-gemini-gemini-3-7-flash-high-mini-swe-agent.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"mini-SWE-agent 2.4.6. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.7-flash. Date de sortie déclarée par Terminal-Bench : 2026-08-13. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":11.21,"lowPercent":8.76,"highPercent":13.66,"spanPercent":4.9},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":9.5,"medal":null}],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"gemini-3-7-flash-livebench-coding","label":"LiveBench : code","display":"78,9 %","value":78.8885,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.8885},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":17,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"gemini-3-7-flash-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"34,8 %","value":34.8,"unit":"percent","dispersion":"Erreur standard publiée : 4,225 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":34.8},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":21,"medal":null}]}},{"modelId":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":32,"averageRank":31,"normalizedScore":null,"rankLabel":"32e, rang moyen 31","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"qwen3-8-27b-livebench-coding","label":"LiveBench : code","display":"75,7 %","value":75.689,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.689},"modelId":"qwen3-8-27b","modelName":"Qwen 3.8 27B","rank":31,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"qwen3-8-27b-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"14,157 %","value":14.157,"unit":"percent","dispersion":"Erreur standard publiée : 4,189 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/qwen/qwen3.8-27b-20260814/endpoints. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":14.157},"modelId":"qwen3-8-27b","modelName":"Qwen 3.8 27B","rank":38,"medal":null}]}},{"modelId":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"deepseek-v4-flash-vision-exp-livebench-coding","label":"LiveBench : code","display":"68,2 %","value":68.2025,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":68.2025},"modelId":"deepseek-v4-flash-vision-exp","modelName":"DeepSeek V4 Flash Vision Exp","rank":47.5,"medal":null}],"vals-code-migration-v1-2026-09-03":[]}},{"modelId":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3","measured":true,"independentTeams":3,"stars":2,"starsLabel":"3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.","rank":9,"averageRank":9.5,"normalizedScore":null,"rankLabel":"9e, rang moyen 9,5","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[{"observationId":"glm-5-3-terminal-bench-4","label":"Terminal-Bench 4.0","display":"41,82 %","value":41.82,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 38,59 à 45,05 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-glm-5-3-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.207. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/glm-5.3. Date de sortie déclarée par Terminal-Bench : 2026-08-14. Fabricant Z.ai ; préfixe source anthropic/, fournisseur du point d’accès non publié. Effort max chez Terminal-Bench ; effort LiveBench non publié. Aucune équivalence supposée. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":41.82,"lowPercent":38.59,"highPercent":45.05,"spanPercent":6.459999999999994},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":4,"medal":null}],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"glm-5-3-livebench-coding","label":"LiveBench : code","display":"79,0 %","value":78.95,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.95},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":15.5,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"glm-5-3-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"44,222 %","value":44.222,"unit":"percent","dispersion":"Erreur standard publiée : 4,289 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.3. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":44.222},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":12,"medal":null}]}},{"modelId":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","measured":true,"independentTeams":2,"stars":2,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide.","rank":22,"averageRank":21.25,"normalizedScore":null,"rankLabel":"22e, rang moyen 21,25","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"glm-5-3-flash-livebench-coding","label":"LiveBench : code","display":"79,0 %","value":78.95,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.95},"modelId":"glm-5-3-flash","modelName":"GLM 5.3 Flash","rank":15.5,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"glm-5-3-flash-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"20,515 %","value":20.515,"unit":"percent","dispersion":"Erreur standard publiée : 4,207 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/vlm/glm-5.3-flash. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":20.515},"modelId":"glm-5-3-flash","modelName":"GLM 5.3 Flash","rank":32,"medal":null}]}},{"modelId":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"qwen3-8-flash-next-livebench-coding","label":"LiveBench : code","display":"72,6 %","value":72.5505,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.5505},"modelId":"qwen3-8-flash-next","modelName":"Qwen 3.8 Flash Next","rank":36,"medal":null}],"vals-code-migration-v1-2026-09-03":[]}},{"modelId":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","measured":true,"independentTeams":2,"stars":1,"starsLabel":"2 organismes retenus ; 2 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Égalité de rang moyen.","rank":40.5,"averageRank":39,"normalizedScore":null,"rankLabel":"40e ex aequo, rang moyen 39","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"nemotron-3-ultra-livebench-coding","label":"LiveBench : code","display":"70,7 %","value":70.698,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.698},"modelId":"nemotron-3-ultra","modelName":"Nemotron 3 Ultra 550B A55B","rank":42,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"nemotron-3-ultra-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"4,905 %","value":4.905,"unit":"percent","dispersion":"Erreur standard publiée : 1,589 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://build.nvidia.com/nvidia/nemotron-3-ultra-550b-a55b. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":4.905},"modelId":"nemotron-3-ultra","modelName":"Nemotron 3 Ultra 550B A55B","rank":52,"medal":null}]}},{"modelId":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":3,"stars":2,"starsLabel":"3 organismes retenus ; 3 couvrent au moins 5 modèles, 3 requis pour une preuve solide. Une étoile retirée : Fourchettes publiées recouvrantes dans un test retenu.","rank":18,"averageRank":20.1667,"normalizedScore":{"modelId":"gemini-3-8-flash","score":37.5,"testCount":2,"organizationCount":2,"agreement":{"minimum":12.5,"maximum":62.5,"spread":50},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":12.5,"rank":15,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":62.5,"rank":7,"comparisonModelCount":17}]},"rankLabel":"18e, rang moyen 20,17","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[{"observationId":"gemini-3-8-flash-terminal-bench-4","label":"Terminal-Bench 4.0","display":"19,09 %","value":19.09,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 15,73 à 22,45 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-01-gemini-gemini-3-8-flash-high-mini-swe-agent.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"mini-SWE-agent 2.4.6. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.8-flash. Date de sortie déclarée par Terminal-Bench : 2026-09-02. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":19.09,"lowPercent":15.73,"highPercent":22.45,"spanPercent":6.719999999999999},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":9.5,"medal":null}],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"gemini-3-8-flash-livebench-coding","label":"LiveBench : code","display":"72,5 %","value":72.489,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.489},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":37,"medal":null}],"vals-code-migration-v1-2026-09-03":[{"observationId":"gemini-3-8-flash-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"36,546 %","value":36.546,"unit":"percent","dispersion":"Erreur standard publiée : 4,184 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":36.546},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":19,"medal":null}]}},{"modelId":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[{"observationId":"muse-spark-1-3-livebench-coding","label":"LiveBench : code","display":"81,1 %","value":81.0625,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.0625},"modelId":"muse-spark-1-3","modelName":"Muse Spark 1.3","rank":11,"medal":null}],"vals-code-migration-v1-2026-09-03":[]}},{"modelId":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[{"observationId":"glm-5-1-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"25,768 %","value":25.768,"unit":"percent","dispersion":"Erreur standard publiée : 4,087 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.1. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":25.768},"modelId":"glm-5-1","modelName":"GLM 5.1","rank":28,"medal":null}]}},{"modelId":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[{"observationId":"mimo-v2-5-pro-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"21,557 %","value":21.557,"unit":"percent","dispersion":"Erreur standard publiée : 4,127 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":21.557},"modelId":"mimo-v2-5-pro","modelName":"MiMo V2.5 Pro","rank":31,"medal":null}]}},{"modelId":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[{"observationId":"mimo-v2-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"14,228 %","value":14.228,"unit":"percent","dispersion":"Erreur standard publiée : 3,687 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":14.228},"modelId":"mimo-v2-5","modelName":"MiMo V2.5","rank":37,"medal":null}]}},{"modelId":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[{"observationId":"inkling-small-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"13,675 %","value":13.675,"unit":"percent","dispersion":"Erreur standard publiée : 3,81 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":13.675},"modelId":"inkling-small","modelName":"Inkling Small","rank":39,"medal":null}]}},{"modelId":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[{"observationId":"qwen3-7-plus-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"12,856 %","value":12.856,"unit":"percent","dispersion":"Erreur standard publiée : 2,931 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":12.856},"modelId":"qwen3-7-plus","modelName":"Qwen 3.7 Plus","rank":42,"medal":null}]}},{"modelId":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[{"observationId":"minimax-m2-7-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"8,685 %","value":8.685,"unit":"percent","dispersion":"Erreur standard publiée : 1,786 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":8.685},"modelId":"minimax-m2-7","modelName":"MiniMax M2.7","rank":45,"medal":null}]}},{"modelId":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[{"observationId":"claude-haiku-4-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"7,551 %","value":7.551,"unit":"percent","dispersion":"Erreur standard publiée : 1,056 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":7.551},"modelId":"claude-haiku-4-5","modelName":"Claude Haiku 4.5","rank":46,"medal":null}]}},{"modelId":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[{"observationId":"gemini-3-flash-preview-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"6,391 %","value":6.391,"unit":"percent","dispersion":"Erreur standard publiée : 1,093 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":6.391},"modelId":"gemini-3-flash-preview","modelName":"Gemini 3 Flash Preview","rank":49,"medal":null}]}},{"modelId":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[{"observationId":"mistral-medium-3-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"5,127 %","value":5.127,"unit":"percent","dispersion":"Erreur standard publiée : 1,369 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.mistral.ai/models/mistral-medium-3-5-26-04. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":5.127},"modelId":"mistral-medium-3-5","modelName":"Mistral Medium 3.5","rank":51,"medal":null}]}},{"modelId":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[{"observationId":"gemini-3-1-flash-lite-preview-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"4,609 %","value":4.609,"unit":"percent","dispersion":"Erreur standard publiée : 1,069 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":4.609},"modelId":"gemini-3-1-flash-lite-preview","modelName":"Gemini 3.1 Flash Lite Preview","rank":53,"medal":null}]}},{"modelId":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[{"observationId":"nemotron-lightning-3-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"2,951 %","value":2.951,"unit":"percent","dispersion":"Erreur standard publiée : 0,951 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":2.951},"modelId":"nemotron-lightning-3-5","modelName":"Nemotron 3.5 Lightning","rank":54,"medal":null}]}},{"modelId":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[{"observationId":"grok-4-20-0309-reasoning-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"0,314 %","value":0.314,"unit":"percent","dispersion":"Erreur standard publiée : 0,11 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.20-0309-reasoning. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":0.314},"modelId":"grok-4-20-0309-reasoning","modelName":"Grok 4.20 0309 Reasoning","rank":55,"medal":null}]}},{"modelId":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","measured":true,"independentTeams":1,"stars":1,"starsLabel":"Signal fragile : modèle hors du classement combiné, solidité plafonnée à une étoile.","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé dans l’agrégation","medal":null,"manufacturerOnly":false,"cells":{"aa-coding-agent-v1-4":[],"terminal-bench-v4-0":[],"swe-bench-verified-mini-v2-2026-02":[],"livebench-coding-2026-06-25":[],"vals-code-migration-v1-2026-09-03":[{"observationId":"ling-3-0-flash-2607-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"0 %","value":0,"unit":"percent","dispersion":"Erreur standard publiée : 0 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":0},"modelId":"ling-3-0-flash-2607","modelName":"Ling 3.0 Flash 2607, version non confirmée","rank":56,"medal":null}]}}],"podiumModelIds":["fable-5-1","fable-5","opus-5","sol"],"sortOrders":{"rank":["fable-5-1","fable-5","opus-5","sol","gpt-5-5","claude-opus-4-8","luna","claude-opus-4-7","glm-5-3","claude-sonnet-5","terra","claude-sonnet-4-6","glm-5-2","grok-4-6","gemini-3-7-flash","deepseek-v4-pro-0813","kimi-k2-6","gemini-3-8-flash","gpt-5-4","kimi-k3","gemini-3-6-flash","glm-5-3-flash","gemini-3-5-flash","deepseek-v4-flash-0731","grok-4-5","muse-spark-1-1","muse-spark-1-2","qwen3-6-plus","gemini-3-1-pro-preview","kimi-k2-7-code","qwen3-8-max","qwen3-8-27b","deepseek-v4-pro","qwen3-7-max","gemini-3-5-flash-lite","gpt-5-4-nano","gpt-5-4-mini","minimax-m3","inkling","grok-4-3","nemotron-3-ultra","claude-haiku-4-5","claude-opus-4-6","deepseek-v4-flash","deepseek-v4-flash-vision-exp","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","glm-5","glm-5-1","astra","grok-4-20-0309-reasoning","grok-build-0-1","inkling-small","kimi-k2-5","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","mistral-medium-3-5","muse-spark-1-3","nemotron-lightning-3-5","qwen3-6-27b","qwen3-7-plus","qwen3-8-flash-next","smaug-agentic"],"model":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"maker":["smaug-agentic","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","ling-3-0-flash-2607","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","nemotron-3-ultra","nemotron-lightning-3-5","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","inkling","inkling-small","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","mimo-v2-5","mimo-v2-5-pro","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash"],"date":["glm-5-1","mimo-v2-5-pro","mimo-v2-5","inkling-small","qwen3-7-plus","minimax-m2-7","claude-haiku-4-5","gemini-3-flash-preview","mistral-medium-3-5","gemini-3-1-flash-lite-preview","nemotron-lightning-3-5","grok-4-20-0309-reasoning","ling-3-0-flash-2607","astra","gemini-3-8-flash","muse-spark-1-3","fable-5-1","glm-5-3-flash","qwen3-8-flash-next","deepseek-v4-flash-vision-exp","qwen3-8-27b","glm-5-3","deepseek-v4-pro-0813","gemini-3-7-flash","grok-4-6","smaug-agentic","muse-spark-1-2","qwen3-8-max","deepseek-v4-flash-0731","opus-5","gemini-3-5-flash-lite","gemini-3-6-flash","kimi-k3","inkling","sol","terra","luna","muse-spark-1-1","grok-4-5","claude-sonnet-5","glm-5-2","kimi-k2-7-code","fable-5","qwen3-7-max","nemotron-3-ultra","minimax-m3","claude-opus-4-8","gemini-3-5-flash","grok-build-0-1","grok-4-3","deepseek-v4-flash","deepseek-v4-pro","gpt-5-5","qwen3-6-27b","kimi-k2-6","claude-opus-4-7","qwen3-6-plus","gpt-5-4-mini","gpt-5-4-nano","gpt-5-4","gemini-3-1-pro-preview","claude-sonnet-4-6","minimax-m2-5","glm-5","claude-opus-4-6","kimi-k2-5"],"teams":["fable-5","fable-5-1","claude-opus-4-8","opus-5","claude-sonnet-5","gemini-3-7-flash","gemini-3-8-flash","glm-5-3","luna","sol","terra","grok-4-5","grok-4-6","claude-opus-4-7","claude-sonnet-4-6","deepseek-v4-flash-0731","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","glm-5-2","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","astra","grok-4-3","inkling","kimi-k2-6","kimi-k2-7-code","kimi-k3","minimax-m3","muse-spark-1-1","muse-spark-1-2","nemotron-3-ultra","qwen3-6-plus","qwen3-7-max","qwen3-8-27b","qwen3-8-max","claude-haiku-4-5","claude-opus-4-6","deepseek-v4-flash","deepseek-v4-flash-vision-exp","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","glm-5-1","grok-4-20-0309-reasoning","grok-build-0-1","inkling-small","kimi-k2-5","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-7","mistral-medium-3-5","muse-spark-1-3","nemotron-lightning-3-5","qwen3-6-27b","qwen3-7-plus","qwen3-8-flash-next","smaug-agentic","glm-5","minimax-m2-5"],"score":["sol","opus-5","claude-opus-4-8","gpt-5-5","luna","terra","gemini-3-7-flash","gpt-5-4","gemini-3-6-flash","gemini-3-5-flash","gemini-3-8-flash","muse-spark-1-1","muse-spark-1-2","gemini-3-1-pro-preview","gemini-3-5-flash-lite","gpt-5-4-mini","inkling","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4-nano","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:aa-coding-agent-v1-4":["fable-5-1","opus-5","fable-5","astra","sol","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:terminal-bench-v4-0":["fable-5-1","opus-5","fable-5","glm-5-3","sol","claude-opus-4-8","terra","grok-4-6","gemini-3-8-flash","luna","claude-sonnet-5","grok-4-5","gemini-3-7-flash","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-sonnet-4-6","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","glm-5","glm-5-1","glm-5-2","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","astra","grok-4-20-0309-reasoning","grok-4-3","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:swe-bench-verified-mini-v2-2026-02":["minimax-m2-5","claude-opus-4-6","glm-5","kimi-k2-5","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:livebench-coding-2026-06-25":["fable-5-1","fable-5","sol","luna","smaug-agentic","gpt-5-5","claude-opus-4-7","claude-opus-4-8","opus-5","kimi-k3","muse-spark-1-3","claude-sonnet-5","glm-5-2","claude-sonnet-4-6","glm-5-3","glm-5-3-flash","gemini-3-7-flash","kimi-k2-6","terra","claude-opus-4-6","gemini-3-5-flash","qwen3-6-plus","gemini-3-6-flash","gpt-5-4","muse-spark-1-2","deepseek-v4-pro-0813","muse-spark-1-1","grok-4-6","gemini-3-1-pro-preview","gemini-3-5-flash-lite","qwen3-8-27b","deepseek-v4-flash-0731","qwen3-7-max","kimi-k2-7-code","qwen3-8-max","qwen3-8-flash-next","gemini-3-8-flash","qwen3-6-27b","gpt-5-4-mini","inkling","gpt-5-4-nano","nemotron-3-ultra","deepseek-v4-pro","grok-4-3","deepseek-v4-flash","grok-4-5","deepseek-v4-flash-vision-exp","minimax-m3","grok-build-0-1","claude-haiku-4-5","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","glm-5","glm-5-1","astra","grok-4-20-0309-reasoning","inkling-small","kimi-k2-5","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","mistral-medium-3-5","nemotron-lightning-3-5","qwen3-7-plus"],"family:vals-code-migration-v1-2026-09-03":["astra","opus-5","fable-5","fable-5-1","sol","terra","claude-opus-4-8","gpt-5-5","grok-4-6","luna","claude-sonnet-5","glm-5-3","claude-opus-4-7","deepseek-v4-pro-0813","claude-sonnet-4-6","deepseek-v4-flash-0731","glm-5-2","grok-4-5","gemini-3-8-flash","gpt-5-4","gemini-3-7-flash","muse-spark-1-1","gemini-3-6-flash","muse-spark-1-2","kimi-k2-6","gemini-3-5-flash","deepseek-v4-pro","glm-5-1","kimi-k2-7-code","qwen3-8-max","mimo-v2-5-pro","glm-5-3-flash","minimax-m3","gemini-3-1-pro-preview","kimi-k3","gpt-5-4-nano","mimo-v2-5","qwen3-8-27b","inkling-small","qwen3-7-max","gpt-5-4-mini","qwen3-7-plus","inkling","qwen3-6-plus","minimax-m2-7","claude-haiku-4-5","kimi-k2-5","grok-4-3","gemini-3-flash-preview","gemini-3-5-flash-lite","mistral-medium-3-5","nemotron-3-ultra","gemini-3-1-flash-lite-preview","nemotron-lightning-3-5","grok-4-20-0309-reasoning","ling-3-0-flash-2607","claude-opus-4-6","deepseek-v4-flash","deepseek-v4-flash-vision-exp","glm-5","grok-build-0-1","minimax-m2-5","muse-spark-1-3","qwen3-6-27b","qwen3-8-flash-next","smaug-agentic"]},"contradictions":[],"concordance":"Méta-analyse par agrégation de rangs, 3 sources, 41 modèles, W = 0,8012. Fourchette à 95 % : 0,8 à 1. Sensibilité : Noyau strict, 2 organismes, 13 modèles. Accord des classements (W) : 0,82. Autre podium : Claude Fable 5.1 (1er), Claude Fable 5 (2e), GPT-5.6 Sol (3e). Écarts de podium : Claude Opus 5 : 3e ex aequo dans l’analyse affichée, 4e dans cette autre analyse ; GPT-5.6 Sol : 3e ex aequo dans l’analyse affichée, 3e dans cette autre analyse. Les deux analyses restent séparées, sans moyenne.","normalizedScore":{"domain":"coding","available":true,"edition":{"editionId":"origin-coding-2026-09-04-v1","cutoffDate":"2026-09-04","status":"constituted","reason":"Référence constituée sur un socle explicite et figé.","snapshotFingerprint":"score-v1-d6f40303e872842f"},"panelModelIds":["claude-opus-4-8","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","gpt-5-4","gpt-5-4-mini","gpt-5-5","inkling","luna","muse-spark-1-1","muse-spark-1-2","opus-5","sol","terra"],"qualifiedTests":[{"familyId":"livebench-coding-2026-06-25","sourceId":"livebench-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","modelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","sourceId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","modelCount":17}],"excludedTests":[{"familyId":"swe-bench-verified-mini-v2-2026-02","sourceId":"swe-bench-verified-2026","benchmark":"SWE-bench Verified","organization":"SWE-bench","organizationId":"swe-bench","modelCount":4,"reason":"Origine d’exécution non vérifiée : résultat publié mais non compté, la soumission ne prouve pas le contrôle par l’équipe."},{"familyId":"aa-coding-agent-v1-4","sourceId":"aa-coding-agent-v1-4","benchmark":"Artificial Analysis Coding Agent Index v1.4","organization":"Artificial Analysis","organizationId":"artificial-analysis","modelCount":5,"reason":"Dépend d’une autre source retenue, Terminal-Bench 4.0. Écartée pour éviter de compter deux fois la même famille de tâches."},{"familyId":"terminal-bench-v4-0","sourceId":"terminal-bench-v4-0","benchmark":"Terminal-Bench 4.0","organization":"Terminal-Bench","organizationId":"terminal-bench","modelCount":13,"reason":"Hors socle de l’édition origin-coding-2026-09-04-v1."}],"partialModels":[{"modelId":"astra","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"67,74 %"}]},{"modelId":"claude-haiku-4-5","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"7,551 %"}]},{"modelId":"claude-opus-4-6","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Version ou effort non publié et documenté dans au moins un test.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"78,2 %"}]},{"modelId":"claude-opus-4-7","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Efforts différents entre Vals et LiveBench.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"82,1 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"43,878 %"}]},{"modelId":"claude-sonnet-4-6","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Efforts différents entre Vals et LiveBench.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"79,3 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"39,892 %"}]},{"modelId":"claude-sonnet-5","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Efforts différents entre Vals et LiveBench.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"80,7 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"44,392 %"}]},{"modelId":"deepseek-v4-flash","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Version ou effort non publié et documenté dans au moins un test.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"69,2 %"}]},{"modelId":"deepseek-v4-flash-0731","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"75,0 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"38,631 %"}]},{"modelId":"deepseek-v4-flash-vision-exp","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Version ou effort non publié et documenté dans au moins un test.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"68,2 %"}]},{"modelId":"deepseek-v4-pro","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"70,0 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"26,201 %"}]},{"modelId":"deepseek-v4-pro-0813","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"77,2 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"41,54 %"}]},{"modelId":"fable-5","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Politique de repli non documentée entre les évaluateurs.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"86,0 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"55,065 %"}]},{"modelId":"fable-5-1","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Politique de repli non documentée entre les évaluateurs.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"86,4 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"54,607 %"}]},{"modelId":"gemini-3-1-flash-lite-preview","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Disponibilité de cette version non vérifiée ; mesure historique conservée.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"4,609 %"}]},{"modelId":"gemini-3-flash-preview","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"6,391 %"}]},{"modelId":"glm-5-1","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"25,768 %"}]},{"modelId":"glm-5-2","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"79,7 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"37,87 %"}]},{"modelId":"glm-5-3","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"79,0 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"44,222 %"}]},{"modelId":"glm-5-3-flash","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"79,0 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"20,515 %"}]},{"modelId":"gpt-5-4-nano","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Efforts différents entre Vals et LiveBench.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"70,8 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"14,467 %"}]},{"modelId":"grok-4-20-0309-reasoning","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"0,314 %"}]},{"modelId":"grok-4-3","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"69,9 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"6,795 %"}]},{"modelId":"grok-4-5","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"68,6 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"36,596 %"}]},{"modelId":"grok-4-6","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"76,8 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"44,572 %"}]},{"modelId":"grok-build-0-1","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Version ou effort non publié et documenté dans au moins un test.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"65,4 %"}]},{"modelId":"inkling-small","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"13,675 %"}]},{"modelId":"kimi-k2-5","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"6,962 %"}]},{"modelId":"kimi-k2-6","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"78,6 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"27,768 %"}]},{"modelId":"kimi-k2-7-code","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"74,0 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"25,392 %"}]},{"modelId":"kimi-k3","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"81,4 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"16,099 %"}]},{"modelId":"ling-3-0-flash-2607","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Disponibilité de cette version non vérifiée ; mesure historique conservée.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"0 %"}]},{"modelId":"mimo-v2-5","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"14,228 %"}]},{"modelId":"mimo-v2-5-pro","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"21,557 %"}]},{"modelId":"minimax-m2-7","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"8,685 %"}]},{"modelId":"minimax-m3","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"68,2 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"19,925 %"}]},{"modelId":"mistral-medium-3-5","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"5,127 %"}]},{"modelId":"muse-spark-1-3","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Version ou effort non publié et documenté dans au moins un test.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"81,1 %"}]},{"modelId":"nemotron-3-ultra","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"70,7 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"4,905 %"}]},{"modelId":"nemotron-lightning-3-5","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"2,951 %"}]},{"modelId":"qwen3-6-27b","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Version ou effort non publié et documenté dans au moins un test.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"71,8 %"}]},{"modelId":"qwen3-6-plus","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"78,2 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"11,102 %"}]},{"modelId":"qwen3-7-max","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"74,2 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"13,069 %"}]},{"modelId":"qwen3-7-plus","testCount":1,"totalTestCount":2,"catalogStatus":"eligible","reason":"Aucune mesure LiveBench code pour cette version dans le registre.","measurements":[{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"12,856 %"}]},{"modelId":"qwen3-8-27b","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"75,7 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"14,157 %"}]},{"modelId":"qwen3-8-flash-next","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Version ou effort non publié et documenté dans au moins un test.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"72,6 %"}]},{"modelId":"qwen3-8-max","testCount":2,"totalTestCount":2,"catalogStatus":"eligible","reason":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"72,9 %"},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","display":"23,958 %"}]},{"modelId":"smaug-agentic","testCount":1,"totalTestCount":2,"catalogStatus":"excluded","reason":"Version ou effort non publié et documenté dans au moins un test.","measurements":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","display":"82,5 %"}]}],"scores":[{"modelId":"sol","score":96.88,"testCount":2,"organizationCount":2,"agreement":{"minimum":93.75,"maximum":100,"spread":6.25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":100,"rank":1,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":93.75,"rank":2,"comparisonModelCount":17}]},{"modelId":"opus-5","score":87.5,"testCount":2,"organizationCount":2,"agreement":{"minimum":75,"maximum":100,"spread":25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":75,"rank":5,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":100,"rank":1,"comparisonModelCount":17}]},{"modelId":"claude-opus-4-8","score":81.25,"testCount":2,"organizationCount":2,"agreement":{"minimum":81.25,"maximum":81.25,"spread":0},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":81.25,"rank":4,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":81.25,"rank":4,"comparisonModelCount":17}]},{"modelId":"gpt-5-5","score":81.25,"testCount":2,"organizationCount":2,"agreement":{"minimum":75,"maximum":87.5,"spread":12.5},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":87.5,"rank":3,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":75,"rank":5,"comparisonModelCount":17}]},{"modelId":"luna","score":81.25,"testCount":2,"organizationCount":2,"agreement":{"minimum":68.75,"maximum":93.75,"spread":25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":93.75,"rank":2,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":68.75,"rank":6,"comparisonModelCount":17}]},{"modelId":"terra","score":75,"testCount":2,"organizationCount":2,"agreement":{"minimum":62.5,"maximum":87.5,"spread":25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":62.5,"rank":7,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":87.5,"rank":3,"comparisonModelCount":17}]},{"modelId":"gemini-3-7-flash","score":59.38,"testCount":2,"organizationCount":2,"agreement":{"minimum":50,"maximum":68.75,"spread":18.75},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":68.75,"rank":6,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":50,"rank":9,"comparisonModelCount":17}]},{"modelId":"gpt-5-4","score":48.44,"testCount":2,"organizationCount":2,"agreement":{"minimum":40.63,"maximum":56.25,"spread":15.63},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":40.625,"rank":10.5,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":56.25,"rank":8,"comparisonModelCount":17}]},{"modelId":"gemini-3-6-flash","score":43.75,"testCount":2,"organizationCount":2,"agreement":{"minimum":37.5,"maximum":50,"spread":12.5},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":50,"rank":9,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":37.5,"rank":11,"comparisonModelCount":17}]},{"modelId":"gemini-3-5-flash","score":40.63,"testCount":2,"organizationCount":2,"agreement":{"minimum":25,"maximum":56.25,"spread":31.25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":56.25,"rank":8,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":25,"rank":13,"comparisonModelCount":17}]},{"modelId":"gemini-3-8-flash","score":37.5,"testCount":2,"organizationCount":2,"agreement":{"minimum":12.5,"maximum":62.5,"spread":50},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":12.5,"rank":15,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":62.5,"rank":7,"comparisonModelCount":17}]},{"modelId":"muse-spark-1-1","score":37.5,"testCount":2,"organizationCount":2,"agreement":{"minimum":31.25,"maximum":43.75,"spread":12.5},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":31.25,"rank":12,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":43.75,"rank":10,"comparisonModelCount":17}]},{"modelId":"muse-spark-1-2","score":35.94,"testCount":2,"organizationCount":2,"agreement":{"minimum":31.25,"maximum":40.63,"spread":9.38},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":40.625,"rank":10.5,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":31.25,"rank":12,"comparisonModelCount":17}]},{"modelId":"gemini-3-1-pro-preview","score":21.88,"testCount":2,"organizationCount":2,"agreement":{"minimum":18.75,"maximum":25,"spread":6.25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":25,"rank":13,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":18.75,"rank":14,"comparisonModelCount":17}]},{"modelId":"gemini-3-5-flash-lite","score":9.38,"testCount":2,"organizationCount":2,"agreement":{"minimum":0,"maximum":18.75,"spread":18.75},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":18.75,"rank":14,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":0,"rank":17,"comparisonModelCount":17}]},{"modelId":"gpt-5-4-mini","score":9.38,"testCount":2,"organizationCount":2,"agreement":{"minimum":6.25,"maximum":12.5,"spread":6.25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":6.25,"rank":16,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":12.5,"rank":15,"comparisonModelCount":17}]},{"modelId":"inkling","score":3.13,"testCount":2,"organizationCount":2,"agreement":{"minimum":0,"maximum":6.25,"spread":6.25},"tests":[{"familyId":"livebench-coding-2026-06-25","benchmark":"LiveBench : code","organization":"LiveBench","organizationId":"livebench","percentile":0,"rank":17,"comparisonModelCount":17},{"familyId":"vals-code-migration-v1-2026-09-03","benchmark":"Vals Code Migration : réécrire un programme","organization":"Vals AI","organizationId":"vals-ai","percentile":6.25,"rank":16,"comparisonModelCount":17}]}],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":2,"organizationCount":2,"referenceModelCount":17},"message":"Note Origin disponible pour 17 modèles sur 2 tests de 2 équipes indépendantes, édition origin-coding-2026-09-04-v1. Claude Fable 5.1 et Claude Fable 5 hors note : Politique de repli non documentée entre les évaluateurs.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},"aggregation":{"scope":"expanded","solidSourceCount":3,"solidSourceCoverage":[{"organizationId":"terminal-bench","organization":"Terminal-Bench","modelCount":13,"eligible":true,"reason":"13 modèles du panel, 5 requis ; compte vers la preuve solide."},{"organizationId":"livebench","organization":"LiveBench","modelCount":41,"eligible":true,"reason":"41 modèles du panel, 5 requis ; compte vers la preuve solide."},{"organizationId":"vals-ai","organization":"Vals AI","modelCount":41,"eligible":true,"reason":"41 modèles du panel, 5 requis ; compte vers la preuve solide."}],"sourceCount":3,"modelCount":41,"kendallW":0.8012,"uncertaintyLow":0.8012,"uncertaintyHigh":1,"ties":[{"level":"source","organization":"Terminal-Bench","familyId":"terminal-bench-v4-0","modelIds":["fable-5-1","opus-5"],"rank":1.5,"reason":"Les fourchettes publiées se recouvrent."},{"level":"source","organization":"Terminal-Bench","familyId":"terminal-bench-v4-0","modelIds":["fable-5","glm-5-3","sol"],"rank":4,"reason":"Les fourchettes publiées se recouvrent."},{"level":"source","organization":"Terminal-Bench","familyId":"terminal-bench-v4-0","modelIds":["claude-opus-4-8","terra","grok-4-6","gemini-3-8-flash","luna","claude-sonnet-5","grok-4-5","gemini-3-7-flash"],"rank":9.5,"reason":"Les fourchettes publiées se recouvrent."},{"level":"source","organization":"LiveBench","familyId":"livebench-coding-2026-06-25","modelIds":["kimi-k3","opus-5"],"rank":8.5,"reason":"Les scores publiés sont identiques."},{"level":"source","organization":"LiveBench","familyId":"livebench-coding-2026-06-25","modelIds":["glm-5-3","glm-5-3-flash"],"rank":13.5,"reason":"Les scores publiés sont identiques."},{"level":"source","organization":"LiveBench","familyId":"livebench-coding-2026-06-25","modelIds":["gemini-3-5-flash","qwen3-6-plus"],"rank":18.5,"reason":"Les scores publiés sont identiques."},{"level":"source","organization":"LiveBench","familyId":"livebench-coding-2026-06-25","modelIds":["gpt-5-4","muse-spark-1-2"],"rank":21.5,"reason":"Les scores publiés sont identiques."},{"level":"source","organization":"LiveBench","familyId":"livebench-coding-2026-06-25","modelIds":["deepseek-v4-pro-0813","muse-spark-1-1"],"rank":23.5,"reason":"Les scores publiés sont identiques."},{"level":"aggregate","organization":null,"familyId":null,"modelIds":["opus-5","sol"],"rank":3.5,"reason":"Même rang moyen après combinaison des sources."},{"level":"aggregate","organization":null,"familyId":null,"modelIds":["claude-opus-4-8","luna"],"rank":6.5,"reason":"Même rang moyen après combinaison des sources."},{"level":"aggregate","organization":null,"familyId":null,"modelIds":["gpt-5-4","kimi-k3"],"rank":19.5,"reason":"Même rang moyen après combinaison des sources."},{"level":"aggregate","organization":null,"familyId":null,"modelIds":["muse-spark-1-1","muse-spark-1-2"],"rank":26.5,"reason":"Même rang moyen après combinaison des sources."},{"level":"aggregate","organization":null,"familyId":null,"modelIds":["grok-4-3","nemotron-3-ultra"],"rank":40.5,"reason":"Même rang moyen après combinaison des sources."}],"excludedSources":[{"organization":"SWE-bench","sourceId":"swe-bench-verified-2026","familyId":"swe-bench-verified-mini-v2-2026-02","reason":"Origine d’exécution non vérifiée : résultat publié mais non compté, la soumission ne prouve pas le contrôle par l’équipe."},{"organization":"Artificial Analysis","sourceId":"aa-coding-agent-v1-4","familyId":"aa-coding-agent-v1-4","reason":"Dépend d’une autre source retenue, Terminal-Bench 4.0. Écartée pour éviter de compter deux fois la même famille de tâches."}],"sensitivity":"Sensibilité : Noyau strict, 2 organismes, 13 modèles. Accord des classements (W) : 0,82. Autre podium : Claude Fable 5.1 (1er), Claude Fable 5 (2e), GPT-5.6 Sol (3e). Écarts de podium : Claude Opus 5 : 3e ex aequo dans l’analyse affichée, 4e dans cette autre analyse ; GPT-5.6 Sol : 3e ex aequo dans l’analyse affichée, 3e dans cette autre analyse. Les deux analyses restent séparées, sans moyenne.","citable":"Méta-analyse par agrégation de rangs, 3 sources, 41 modèles, W = 0,8012."},"aggregationCoverage":{"solidSourceCount":3,"solidSourceCoverage":[{"organizationId":"terminal-bench","organization":"Terminal-Bench","modelCount":13,"eligible":true,"reason":"13 modèles du panel, 5 requis ; compte vers la preuve solide."},{"organizationId":"livebench","organization":"LiveBench","modelCount":41,"eligible":true,"reason":"41 modèles du panel, 5 requis ; compte vers la preuve solide."},{"organizationId":"vals-ai","organization":"Vals AI","modelCount":41,"eligible":true,"reason":"41 modèles du panel, 5 requis ; compte vers la preuve solide."}],"sourceCount":3,"candidateSourceCount":4,"modelCount":41,"panelModelCount":56,"message":"Agrégation calculée sur 3 sources et 41 modèles.","candidateSources":[{"organization":"Artificial Analysis","sourceId":"aa-coding-agent-v1-4","familyId":"aa-coding-agent-v1-4","independenceLevel":2,"status":"excluded","reason":"Dépend d’une autre source retenue, Terminal-Bench 4.0. Écartée pour éviter de compter deux fois la même famille de tâches."},{"organization":"Terminal-Bench","sourceId":"terminal-bench-v4-0","familyId":"terminal-bench-v4-0","independenceLevel":1,"status":"included","reason":null},{"organization":"SWE-bench","sourceId":"swe-bench-verified-2026","familyId":"swe-bench-verified-mini-v2-2026-02","independenceLevel":1,"status":"excluded","reason":"Origine d’exécution non vérifiée : résultat publié mais non compté, la soumission ne prouve pas le contrôle par l’équipe."},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-coding-2026-06-25","independenceLevel":1,"status":"included","reason":null},{"organization":"Vals AI","sourceId":"vals-code-migration-v1-2026-09-03","familyId":"vals-code-migration-v1-2026-09-03","independenceLevel":2,"status":"included","reason":null}]}},{"id":"legal","label":"Juridique","question":"Quel modèle pour préparer un travail juridique ?","verdict":"GPT-6 Astra arrive en tête avec « APEX-Agents Corporate Lawyer, moyenne des critères », mais Claude Fable 5.1 avec « APEX-Agents Corporate Lawyer, tâches sans erreur ». Les deux façons de compter restent visibles.","limitation":"Une seule équipe publie ces deux lectures. Aucune moyenne ne les réunit.","viewMode":"single-source","averageRank":null,"primaryFamilyId":"mercor-apex-agents-legal-mean-score","primaryFamilyLabel":"APEX-Agents Corporate Lawyer, moyenne des critères","rankLabel":"Rang sur APEX-Agents Corporate Lawyer, moyenne des critères","stars":2,"starsLabel":"Une équipe extérieure, confirmation manquante","isTopTie":false,"families":[{"id":"mercor-apex-agents-legal-mean-score","label":"APEX-Agents Corporate Lawyer, moyenne des critères","organization":"Mercor","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"corporate-lawyer","sourceType":2,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"astra-apex-legal-mean-score","label":"APEX-Agents Corporate Lawyer, moyenne des critères","display":"67,9 % des critères réussis","value":67.9,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":67.9},"modelId":"astra","modelName":"GPT-6 Astra","rank":1,"medal":"or"},{"observationId":"fable-5-1-apex-legal-mean-score","label":"APEX-Agents Corporate Lawyer, moyenne des critères","display":"64,8 % des critères réussis","value":64.8,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":64.8},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":2,"medal":"argent"},{"observationId":"sol-apex-legal-mean-score","label":"APEX-Agents Corporate Lawyer, moyenne des critères","display":"63,4 % des critères réussis","value":63.4,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":63.4},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":3,"medal":"bronze"}]},{"id":"mercor-apex-agents-legal-all-criteria","label":"APEX-Agents Corporate Lawyer, tâches sans erreur","organization":"Mercor","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"corporate-lawyer","sourceType":2,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"fable-5-1-apex-legal-all-criteria","label":"APEX-Agents Corporate Lawyer, tâches sans erreur","display":"41,9 % des tâches entièrement réussies","value":41.9,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Part des tâches dont tous les critères passent.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":41.9},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1,"medal":"or"},{"observationId":"astra-apex-legal-all-criteria","label":"APEX-Agents Corporate Lawyer, tâches sans erreur","display":"40,5 % des tâches entièrement réussies","value":40.5,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Part des tâches dont tous les critères passent.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":40.5},"modelId":"astra","modelName":"GPT-6 Astra","rank":2,"medal":"argent"},{"observationId":"sol-apex-legal-all-criteria","label":"APEX-Agents Corporate Lawyer, tâches sans erreur","display":"35,6 % des tâches entièrement réussies","value":35.6,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Part des tâches dont tous les critères passent.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":35.6},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":3,"medal":"bronze"}]}],"rows":[{"modelId":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":1,"averageRank":null,"normalizedScore":null,"rankLabel":"1er","medal":"or","manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[{"observationId":"astra-apex-legal-mean-score","label":"APEX-Agents Corporate Lawyer, moyenne des critères","display":"67,9 % des critères réussis","value":67.9,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":67.9},"modelId":"astra","modelName":"GPT-6 Astra","rank":1,"medal":"or"}],"mercor-apex-agents-legal-all-criteria":[{"observationId":"astra-apex-legal-all-criteria","label":"APEX-Agents Corporate Lawyer, tâches sans erreur","display":"40,5 % des tâches entièrement réussies","value":40.5,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Part des tâches dont tous les critères passent.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":40.5},"modelId":"astra","modelName":"GPT-6 Astra","rank":2,"medal":"argent"}]}},{"modelId":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":2,"averageRank":null,"normalizedScore":null,"rankLabel":"2e","medal":"argent","manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[{"observationId":"fable-5-1-apex-legal-mean-score","label":"APEX-Agents Corporate Lawyer, moyenne des critères","display":"64,8 % des critères réussis","value":64.8,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":64.8},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":2,"medal":"argent"}],"mercor-apex-agents-legal-all-criteria":[{"observationId":"fable-5-1-apex-legal-all-criteria","label":"APEX-Agents Corporate Lawyer, tâches sans erreur","display":"41,9 % des tâches entièrement réussies","value":41.9,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Part des tâches dont tous les critères passent.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":41.9},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1,"medal":"or"}]}},{"modelId":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":3,"averageRank":null,"normalizedScore":null,"rankLabel":"3e","medal":"bronze","manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[{"observationId":"sol-apex-legal-mean-score","label":"APEX-Agents Corporate Lawyer, moyenne des critères","display":"63,4 % des critères réussis","value":63.4,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":63.4},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":3,"medal":"bronze"}],"mercor-apex-agents-legal-all-criteria":[{"observationId":"sol-apex-legal-all-criteria","label":"APEX-Agents Corporate Lawyer, tâches sans erreur","display":"35,6 % des tâches entièrement réussies","value":35.6,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Part des tâches dont tous les critères passent.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":35.6},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":3,"medal":"bronze"}]}},{"modelId":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}},{"modelId":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-legal-mean-score":[],"mercor-apex-agents-legal-all-criteria":[]}}],"podiumModelIds":["astra","fable-5-1","sol"],"sortOrders":{"rank":["astra","fable-5-1","sol","fable-5","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"model":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"maker":["smaug-agentic","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","ling-3-0-flash-2607","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","nemotron-3-ultra","nemotron-lightning-3-5","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","inkling","inkling-small","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","mimo-v2-5","mimo-v2-5-pro","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash"],"date":["glm-5-1","mimo-v2-5-pro","mimo-v2-5","inkling-small","qwen3-7-plus","minimax-m2-7","claude-haiku-4-5","gemini-3-flash-preview","mistral-medium-3-5","gemini-3-1-flash-lite-preview","nemotron-lightning-3-5","grok-4-20-0309-reasoning","ling-3-0-flash-2607","astra","gemini-3-8-flash","muse-spark-1-3","fable-5-1","glm-5-3-flash","qwen3-8-flash-next","deepseek-v4-flash-vision-exp","qwen3-8-27b","glm-5-3","deepseek-v4-pro-0813","gemini-3-7-flash","grok-4-6","smaug-agentic","muse-spark-1-2","qwen3-8-max","deepseek-v4-flash-0731","opus-5","gemini-3-5-flash-lite","gemini-3-6-flash","kimi-k3","inkling","sol","terra","luna","muse-spark-1-1","grok-4-5","claude-sonnet-5","glm-5-2","kimi-k2-7-code","fable-5","qwen3-7-max","nemotron-3-ultra","minimax-m3","claude-opus-4-8","gemini-3-5-flash","grok-build-0-1","grok-4-3","deepseek-v4-flash","deepseek-v4-pro","gpt-5-5","qwen3-6-27b","kimi-k2-6","claude-opus-4-7","qwen3-6-plus","gpt-5-4-mini","gpt-5-4-nano","gpt-5-4","gemini-3-1-pro-preview","claude-sonnet-4-6","minimax-m2-5","glm-5","claude-opus-4-6","kimi-k2-5"],"teams":["fable-5-1","sol","astra","fable-5","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"score":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:mercor-apex-agents-legal-mean-score":["astra","fable-5-1","sol","fable-5","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:mercor-apex-agents-legal-all-criteria":["fable-5-1","astra","sol","fable-5","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"]},"contradictions":["GPT-6 Astra arrive en tête avec « APEX-Agents Corporate Lawyer, moyenne des critères », mais Claude Fable 5.1 avec « APEX-Agents Corporate Lawyer, tâches sans erreur ». Les deux façons de compter restent visibles."],"concordance":"Une seule équipe sur ce test : confirmation extérieure manquante.","normalizedScore":{"domain":"legal","available":false,"edition":{"editionId":"origin-legal-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[{"familyId":"mercor-apex-agents-legal-mean-score","sourceId":"mercor-apex-legal","benchmark":"APEX-Agents Corporate Lawyer, moyenne des critères","organization":"Mercor","organizationId":"mercor","modelCount":3,"reason":"Dépend d’une autre source retenue, APEX-Agents Corporate Lawyer, tâches sans erreur. Écartée pour éviter de compter deux fois la même famille de tâches."},{"familyId":"mercor-apex-agents-legal-all-criteria","sourceId":"mercor-apex-legal","benchmark":"APEX-Agents Corporate Lawyer, tâches sans erreur","organization":"Mercor","organizationId":"mercor","modelCount":3,"reason":"3 modèles mesurés, minimum pratique 15."}],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},"aggregation":null,"aggregationCoverage":{"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":1,"modelCount":0,"panelModelCount":3,"message":"Agrégation en attente de couverture, 0 modèles communs sur 3.","candidateSources":[{"organization":"Mercor","sourceId":"mercor-apex-legal","familyId":"mercor-apex-agents-legal-mean-score","independenceLevel":2,"status":"excluded","reason":"Dépend d’une autre source retenue, APEX-Agents Corporate Lawyer, tâches sans erreur. Écartée pour éviter de compter deux fois la même famille de tâches."},{"organization":"Mercor","sourceId":"mercor-apex-legal","familyId":"mercor-apex-agents-legal-all-criteria","independenceLevel":2,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."}]}},{"id":"finance","label":"Finance et comptabilité","question":"Quel modèle pour produire une analyse financière ?","verdict":"Claude Fable 5.1 arrive en tête sur APEX-Agents Investment Banking Analyst, moyenne des critères.","limitation":"Une seule équipe porte ce podium. Les autres tests de finance et comptabilité restent affichés séparément.","viewMode":"single-source","averageRank":null,"primaryFamilyId":"mercor-apex-agents-finance-mean-score","primaryFamilyLabel":"APEX-Agents Investment Banking Analyst, moyenne des critères","rankLabel":"Rang sur APEX-Agents Investment Banking Analyst, moyenne des critères","stars":2,"starsLabel":"Une équipe extérieure, confirmation manquante","isTopTie":false,"families":[{"id":"mercor-apex-agents-finance-mean-score","label":"APEX-Agents Investment Banking Analyst, moyenne des critères","organization":"Mercor","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"investment-banking","sourceType":2,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"fable-5-1-apex-finance-mean-score","label":"APEX-Agents Investment Banking Analyst, moyenne des critères","display":"55,7 % des critères réussis","value":55.7,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/investment-banking-analyst-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.","visual":{"kind":"bar","valuePercent":55.7},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1,"medal":"or"},{"observationId":"astra-apex-finance-mean-score","label":"APEX-Agents Investment Banking Analyst, moyenne des critères","display":"52,0 % des critères réussis","value":52,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/investment-banking-analyst-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.","visual":{"kind":"bar","valuePercent":52},"modelId":"astra","modelName":"GPT-6 Astra","rank":2,"medal":"argent"},{"observationId":"sol-apex-finance-mean-score","label":"APEX-Agents Investment Banking Analyst, moyenne des critères","display":"46,6 % des critères réussis","value":46.6,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/investment-banking-analyst-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.","visual":{"kind":"bar","valuePercent":46.6},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":3,"medal":"bronze"}]}],"rows":[{"modelId":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":2,"averageRank":null,"normalizedScore":null,"rankLabel":"2e","medal":"argent","manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[{"observationId":"astra-apex-finance-mean-score","label":"APEX-Agents Investment Banking Analyst, moyenne des critères","display":"52,0 % des critères réussis","value":52,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/investment-banking-analyst-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.","visual":{"kind":"bar","valuePercent":52},"modelId":"astra","modelName":"GPT-6 Astra","rank":2,"medal":"argent"}]}},{"modelId":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":1,"averageRank":null,"normalizedScore":null,"rankLabel":"1er","medal":"or","manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[{"observationId":"fable-5-1-apex-finance-mean-score","label":"APEX-Agents Investment Banking Analyst, moyenne des critères","display":"55,7 % des critères réussis","value":55.7,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/investment-banking-analyst-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.","visual":{"kind":"bar","valuePercent":55.7},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1,"medal":"or"}]}},{"modelId":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":3,"averageRank":null,"normalizedScore":null,"rankLabel":"3e","medal":"bronze","manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[{"observationId":"sol-apex-finance-mean-score","label":"APEX-Agents Investment Banking Analyst, moyenne des critères","display":"46,6 % des critères réussis","value":46.6,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/investment-banking-analyst-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.","visual":{"kind":"bar","valuePercent":46.6},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":3,"medal":"bronze"}]}},{"modelId":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}},{"modelId":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"mercor-apex-agents-finance-mean-score":[]}}],"podiumModelIds":["fable-5-1","astra","sol"],"sortOrders":{"rank":["fable-5-1","astra","sol","fable-5","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"model":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"maker":["smaug-agentic","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","ling-3-0-flash-2607","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","nemotron-3-ultra","nemotron-lightning-3-5","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","inkling","inkling-small","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","mimo-v2-5","mimo-v2-5-pro","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash"],"date":["glm-5-1","mimo-v2-5-pro","mimo-v2-5","inkling-small","qwen3-7-plus","minimax-m2-7","claude-haiku-4-5","gemini-3-flash-preview","mistral-medium-3-5","gemini-3-1-flash-lite-preview","nemotron-lightning-3-5","grok-4-20-0309-reasoning","ling-3-0-flash-2607","astra","gemini-3-8-flash","muse-spark-1-3","fable-5-1","glm-5-3-flash","qwen3-8-flash-next","deepseek-v4-flash-vision-exp","qwen3-8-27b","glm-5-3","deepseek-v4-pro-0813","gemini-3-7-flash","grok-4-6","smaug-agentic","muse-spark-1-2","qwen3-8-max","deepseek-v4-flash-0731","opus-5","gemini-3-5-flash-lite","gemini-3-6-flash","kimi-k3","inkling","sol","terra","luna","muse-spark-1-1","grok-4-5","claude-sonnet-5","glm-5-2","kimi-k2-7-code","fable-5","qwen3-7-max","nemotron-3-ultra","minimax-m3","claude-opus-4-8","gemini-3-5-flash","grok-build-0-1","grok-4-3","deepseek-v4-flash","deepseek-v4-pro","gpt-5-5","qwen3-6-27b","kimi-k2-6","claude-opus-4-7","qwen3-6-plus","gpt-5-4-mini","gpt-5-4-nano","gpt-5-4","gemini-3-1-pro-preview","claude-sonnet-4-6","minimax-m2-5","glm-5","claude-opus-4-6","kimi-k2-5"],"teams":["fable-5-1","sol","astra","fable-5","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"score":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:mercor-apex-agents-finance-mean-score":["fable-5-1","astra","sol","fable-5","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"]},"contradictions":[],"concordance":"Une seule équipe sur ce test : confirmation extérieure manquante.","normalizedScore":{"domain":"finance","available":false,"edition":{"editionId":"origin-finance-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[{"familyId":"mercor-apex-agents-finance-mean-score","sourceId":"mercor-apex-finance","benchmark":"APEX-Agents Investment Banking Analyst, moyenne des critères","organization":"Mercor","organizationId":"mercor","modelCount":3,"reason":"3 modèles mesurés, minimum pratique 15."}],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},"aggregation":null,"aggregationCoverage":{"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":1,"modelCount":0,"panelModelCount":3,"message":"Agrégation en attente de couverture, 0 modèles communs sur 3.","candidateSources":[{"organization":"Mercor","sourceId":"mercor-apex-finance","familyId":"mercor-apex-agents-finance-mean-score","independenceLevel":2,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."}]}},{"id":"healthcare","label":"Santé","question":"Quel modèle pour répondre à une question médicale ?","verdict":"Des scores existent, mais ils viennent du fabricant et ne constituent pas un classement.","limitation":"Les nombres restent visibles, sans rang ni médaille, jusqu’à une mesure extérieure.","viewMode":"single-source","averageRank":null,"primaryFamilyId":"openai-healthbench-professional","primaryFamilyLabel":"HealthBench Professional","rankLabel":"Rang sur HealthBench Professional","stars":0,"starsLabel":"Chiffres du fabricant seulement","isTopTie":false,"families":[{"id":"openai-healthbench-professional","label":"HealthBench Professional","organization":"OpenAI","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"clinical-response","sourceType":3,"isCountable":false,"isManufacturer":true,"measurements":[{"observationId":"astra-openai-healthbench-professional","label":"HealthBench Professional","display":"63,4 %","value":63.4,"unit":"percent","dispersion":null,"sourceUrl":"https://deploymentsafety.openai.com/gpt-6-astra/vision","sourceAccessedAt":"2026-09-04","organization":"OpenAI","sourceLabel":"Chiffre du fabricant","isManufacturer":true,"protocol":"Réponses produites dans HealthBench Professional. Score corrigé pour réduire l’avantage des réponses longues.","limitation":"OpenAI publie ce résultat sur ses propres modèles. Sans test extérieur, il ne suffit pas pour choisir un modèle en santé.","visual":{"kind":"bar","valuePercent":63.4},"modelId":"astra","modelName":"GPT-6 Astra","rank":null,"medal":null},{"observationId":"sol-openai-healthbench-professional","label":"HealthBench Professional","display":"60,5 %","value":60.5,"unit":"percent","dispersion":null,"sourceUrl":"https://deploymentsafety.openai.com/gpt-6-astra/vision","sourceAccessedAt":"2026-09-04","organization":"OpenAI","sourceLabel":"Chiffre du fabricant","isManufacturer":true,"protocol":"Réponses produites dans HealthBench Professional. Score corrigé pour réduire l’avantage des réponses longues.","limitation":"OpenAI publie ce résultat sur ses propres modèles. Sans test extérieur, il ne suffit pas pour choisir un modèle en santé.","visual":{"kind":"bar","valuePercent":60.5},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":null,"medal":null}]}],"rows":[{"modelId":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","measured":true,"independentTeams":0,"stars":0,"starsLabel":"Seulement le fabricant","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Sans classement","medal":null,"manufacturerOnly":true,"cells":{"openai-healthbench-professional":[{"observationId":"astra-openai-healthbench-professional","label":"HealthBench Professional","display":"63,4 %","value":63.4,"unit":"percent","dispersion":null,"sourceUrl":"https://deploymentsafety.openai.com/gpt-6-astra/vision","sourceAccessedAt":"2026-09-04","organization":"OpenAI","sourceLabel":"Chiffre du fabricant","isManufacturer":true,"protocol":"Réponses produites dans HealthBench Professional. Score corrigé pour réduire l’avantage des réponses longues.","limitation":"OpenAI publie ce résultat sur ses propres modèles. Sans test extérieur, il ne suffit pas pour choisir un modèle en santé.","visual":{"kind":"bar","valuePercent":63.4},"modelId":"astra","modelName":"GPT-6 Astra","rank":null,"medal":null}]}},{"modelId":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":true,"independentTeams":0,"stars":0,"starsLabel":"Seulement le fabricant","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Sans classement","medal":null,"manufacturerOnly":true,"cells":{"openai-healthbench-professional":[{"observationId":"sol-openai-healthbench-professional","label":"HealthBench Professional","display":"60,5 %","value":60.5,"unit":"percent","dispersion":null,"sourceUrl":"https://deploymentsafety.openai.com/gpt-6-astra/vision","sourceAccessedAt":"2026-09-04","organization":"OpenAI","sourceLabel":"Chiffre du fabricant","isManufacturer":true,"protocol":"Réponses produites dans HealthBench Professional. Score corrigé pour réduire l’avantage des réponses longues.","limitation":"OpenAI publie ce résultat sur ses propres modèles. Sans test extérieur, il ne suffit pas pour choisir un modèle en santé.","visual":{"kind":"bar","valuePercent":60.5},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":null,"medal":null}]}},{"modelId":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}},{"modelId":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"openai-healthbench-professional":[]}}],"podiumModelIds":["sol","astra"],"sortOrders":{"rank":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"model":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"maker":["smaug-agentic","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","ling-3-0-flash-2607","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","nemotron-3-ultra","nemotron-lightning-3-5","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","inkling","inkling-small","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","mimo-v2-5","mimo-v2-5-pro","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash"],"date":["glm-5-1","mimo-v2-5-pro","mimo-v2-5","inkling-small","qwen3-7-plus","minimax-m2-7","claude-haiku-4-5","gemini-3-flash-preview","mistral-medium-3-5","gemini-3-1-flash-lite-preview","nemotron-lightning-3-5","grok-4-20-0309-reasoning","ling-3-0-flash-2607","astra","gemini-3-8-flash","muse-spark-1-3","fable-5-1","glm-5-3-flash","qwen3-8-flash-next","deepseek-v4-flash-vision-exp","qwen3-8-27b","glm-5-3","deepseek-v4-pro-0813","gemini-3-7-flash","grok-4-6","smaug-agentic","muse-spark-1-2","qwen3-8-max","deepseek-v4-flash-0731","opus-5","gemini-3-5-flash-lite","gemini-3-6-flash","kimi-k3","inkling","sol","terra","luna","muse-spark-1-1","grok-4-5","claude-sonnet-5","glm-5-2","kimi-k2-7-code","fable-5","qwen3-7-max","nemotron-3-ultra","minimax-m3","claude-opus-4-8","gemini-3-5-flash","grok-build-0-1","grok-4-3","deepseek-v4-flash","deepseek-v4-pro","gpt-5-5","qwen3-6-27b","kimi-k2-6","claude-opus-4-7","qwen3-6-plus","gpt-5-4-mini","gpt-5-4-nano","gpt-5-4","gemini-3-1-pro-preview","claude-sonnet-4-6","minimax-m2-5","glm-5","claude-opus-4-6","kimi-k2-5"],"teams":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"score":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:openai-healthbench-professional":["astra","sol","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"]},"contradictions":[],"concordance":"Une seule équipe sur ce test : confirmation extérieure manquante.","normalizedScore":{"domain":"healthcare","available":false,"edition":{"editionId":"origin-healthcare-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[{"familyId":"openai-healthbench-professional","sourceId":"openai-healthbench-professional","benchmark":"HealthBench Professional","organization":"OpenAI","organizationId":"openai","modelCount":2,"reason":"Source non indépendante, inactive ou ne mesurant pas le modèle seul."}],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},"aggregation":null,"aggregationCoverage":{"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0.","candidateSources":[{"organization":"OpenAI","sourceId":"openai-healthbench-professional","familyId":"openai-healthbench-professional","independenceLevel":3,"status":"excluded","reason":"Source non indépendante, inactive ou ne mesurant pas le modèle seul."}]}},{"id":"mathScience","label":"Maths et sciences","question":"Quel modèle pour résoudre un problème scientifique difficile ?","verdict":"Claude Fable 5.1 arrive en tête sur LiveBench : mathématiques.","limitation":"Une seule équipe porte ce podium. Les autres tests de maths et sciences restent affichés séparément.","viewMode":"single-source","averageRank":null,"primaryFamilyId":"livebench-mathematics-2026-06-25","primaryFamilyLabel":"LiveBench : mathématiques","rankLabel":"Rang sur LiveBench : mathématiques","stars":2,"starsLabel":"Une équipe extérieure, confirmation manquante","isTopTie":false,"families":[{"id":"epoch-frontiermath-erdos","label":"FrontierMath Erdős","organization":"Epoch AI","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"formal-research-math","sourceType":1,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"astra-frontiermath-erdos","label":"FrontierMath Erdős","display":"3 %","value":3,"unit":"percent","dispersion":null,"sourceUrl":"https://epoch.ai/latest/announcing-frontiermath-erdos","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Agent sans internet, budget de 300 $ et 72 heures par problème. Preuve ou réfutation acceptée par Lean, un vérificateur mathématique.","limitation":"Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.","visual":{"kind":"bar","valuePercent":3},"modelId":"astra","modelName":"GPT-6 Astra","rank":1,"medal":"or"},{"observationId":"fable-5-1-frontiermath-erdos","label":"FrontierMath Erdős","display":"0 %","value":0,"unit":"percent","dispersion":null,"sourceUrl":"https://epoch.ai/latest/announcing-frontiermath-erdos","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Agent sans internet, budget de 300 $ et 72 heures par problème. Preuve ou réfutation acceptée par Lean, un vérificateur mathématique.","limitation":"Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.","visual":{"kind":"bar","valuePercent":0},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":2.5,"medal":null},{"observationId":"sol-frontiermath-erdos","label":"FrontierMath Erdős","display":"0 %","value":0,"unit":"percent","dispersion":null,"sourceUrl":"https://epoch.ai/latest/announcing-frontiermath-erdos","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Agent sans internet, budget de 300 $ et 72 heures par problème. Preuve ou réfutation acceptée par Lean, un vérificateur mathématique.","limitation":"Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.","visual":{"kind":"bar","valuePercent":0},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":2.5,"medal":null}]},{"id":"livebench-mathematics-2026-06-25","label":"LiveBench : mathématiques","organization":"LiveBench","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus haut est meilleur","constructId":"mathematics","sourceType":1,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"fable-5-1-livebench-mathematics","label":"LiveBench : mathématiques","display":"97,0 %","value":97.0068,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":97.0068},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1,"medal":"or"},{"observationId":"sol-livebench-mathematics","label":"LiveBench : mathématiques","display":"96,2 %","value":96.1978,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":96.1978},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":2,"medal":"argent"},{"observationId":"fable-5-livebench-mathematics","label":"LiveBench : mathématiques","display":"96,0 %","value":95.9858,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":95.9858},"modelId":"fable-5","modelName":"Claude Fable 5","rank":3,"medal":"bronze"},{"observationId":"muse-spark-1-3-livebench-mathematics","label":"LiveBench : mathématiques","display":"96,0 %","value":95.95,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":95.95},"modelId":"muse-spark-1-3","modelName":"Muse Spark 1.3","rank":4,"medal":null},{"observationId":"gpt-5-5-livebench-mathematics","label":"LiveBench : mathématiques","display":"95,9 %","value":95.8573,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":95.8573},"modelId":"gpt-5-5","modelName":"GPT-5.5","rank":5,"medal":null},{"observationId":"opus-5-livebench-mathematics","label":"LiveBench : mathématiques","display":"95,7 %","value":95.731,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":95.731},"modelId":"opus-5","modelName":"Claude Opus 5","rank":6,"medal":null},{"observationId":"deepseek-v4-pro-0813-livebench-mathematics","label":"LiveBench : mathématiques","display":"95,1 %","value":95.0863,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":95.0863},"modelId":"deepseek-v4-pro-0813","modelName":"DeepSeek V4 Pro 0813","rank":7,"medal":null},{"observationId":"terra-livebench-mathematics","label":"LiveBench : mathématiques","display":"94,9 %","value":94.9083,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":94.9083},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":8,"medal":null},{"observationId":"claude-opus-4-8-livebench-mathematics","label":"LiveBench : mathématiques","display":"94,3 %","value":94.3165,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":94.3165},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":9,"medal":null},{"observationId":"gpt-5-4-livebench-mathematics","label":"LiveBench : mathématiques","display":"94,1 %","value":94.148,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":94.148},"modelId":"gpt-5-4","modelName":"GPT-5.4","rank":10,"medal":null},{"observationId":"gemini-3-7-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"93,5 %","value":93.468,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":93.468},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":11,"medal":null},{"observationId":"claude-sonnet-5-livebench-mathematics","label":"LiveBench : mathématiques","display":"92,9 %","value":92.9423,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":92.9423},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":12,"medal":null},{"observationId":"claude-opus-4-7-livebench-mathematics","label":"LiveBench : mathématiques","display":"92,9 %","value":92.8538,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":92.8538},"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","rank":13,"medal":null},{"observationId":"grok-4-6-livebench-mathematics","label":"LiveBench : mathématiques","display":"92,6 %","value":92.568,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":92.568},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":14,"medal":null},{"observationId":"gemini-3-8-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"91,6 %","value":91.5643,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.5643},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":15,"medal":null},{"observationId":"qwen3-8-max-livebench-mathematics","label":"LiveBench : mathématiques","display":"91,3 %","value":91.3123,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.3123},"modelId":"qwen3-8-max","modelName":"Qwen 3.8 Max","rank":16,"medal":null},{"observationId":"muse-spark-1-2-livebench-mathematics","label":"LiveBench : mathématiques","display":"91,2 %","value":91.2035,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.2035},"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","rank":17,"medal":null},{"observationId":"gemini-3-1-pro-preview-livebench-mathematics","label":"LiveBench : mathématiques","display":"91,0 %","value":91.045,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.045},"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","rank":18,"medal":null},{"observationId":"gpt-5-4-nano-livebench-mathematics","label":"LiveBench : mathématiques","display":"91,0 %","value":90.977,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.977},"modelId":"gpt-5-4-nano","modelName":"GPT-5.4 nano","rank":19,"medal":null},{"observationId":"grok-4-5-livebench-mathematics","label":"LiveBench : mathématiques","display":"90,8 %","value":90.8245,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.8245},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":20,"medal":null},{"observationId":"deepseek-v4-pro-livebench-mathematics","label":"LiveBench : mathématiques","display":"90,7 %","value":90.6755,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.6755},"modelId":"deepseek-v4-pro","modelName":"DeepSeek V4 Pro","rank":21,"medal":null},{"observationId":"glm-5-2-livebench-mathematics","label":"LiveBench : mathématiques","display":"89,8 %","value":89.7813,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.7813},"modelId":"glm-5-2","modelName":"GLM 5.2","rank":22,"medal":null},{"observationId":"claude-opus-4-6-livebench-mathematics","label":"LiveBench : mathématiques","display":"89,3 %","value":89.317,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.317},"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","rank":23,"medal":null},{"observationId":"nemotron-3-ultra-livebench-mathematics","label":"LiveBench : mathématiques","display":"88,7 %","value":88.6633,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.6633},"modelId":"nemotron-3-ultra","modelName":"Nemotron 3 Ultra 550B A55B","rank":24,"medal":null},{"observationId":"inkling-livebench-mathematics","label":"LiveBench : mathématiques","display":"88,4 %","value":88.3648,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.3648},"modelId":"inkling","modelName":"Inkling","rank":25,"medal":null},{"observationId":"gemini-3-5-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"88,2 %","value":88.2438,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.2438},"modelId":"gemini-3-5-flash","modelName":"Gemini 3.5 Flash","rank":26,"medal":null},{"observationId":"glm-5-3-livebench-mathematics","label":"LiveBench : mathématiques","display":"87,9 %","value":87.898,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.898},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":27,"medal":null},{"observationId":"deepseek-v4-flash-vision-exp-livebench-mathematics","label":"LiveBench : mathématiques","display":"87,8 %","value":87.8068,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.8068},"modelId":"deepseek-v4-flash-vision-exp","modelName":"DeepSeek V4 Flash Vision Exp","rank":28,"medal":null},{"observationId":"luna-livebench-mathematics","label":"LiveBench : mathématiques","display":"87,2 %","value":87.2008,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.2008},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":29,"medal":null},{"observationId":"muse-spark-1-1-livebench-mathematics","label":"LiveBench : mathématiques","display":"87,1 %","value":87.1448,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.1448},"modelId":"muse-spark-1-1","modelName":"Muse Spark 1.1","rank":30,"medal":null},{"observationId":"claude-sonnet-4-6-livebench-mathematics","label":"LiveBench : mathématiques","display":"87,0 %","value":86.994,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.994},"modelId":"claude-sonnet-4-6","modelName":"Claude Sonnet 4.6","rank":31,"medal":null},{"observationId":"deepseek-v4-flash-0731-livebench-mathematics","label":"LiveBench : mathématiques","display":"86,8 %","value":86.7898,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.7898},"modelId":"deepseek-v4-flash-0731","modelName":"DeepSeek V4 Flash 0731","rank":32,"medal":null},{"observationId":"gemini-3-6-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"86,4 %","value":86.4025,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.4025},"modelId":"gemini-3-6-flash","modelName":"Gemini 3.6 Flash","rank":33,"medal":null},{"observationId":"qwen3-8-27b-livebench-mathematics","label":"LiveBench : mathématiques","display":"86,2 %","value":86.2128,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.2128},"modelId":"qwen3-8-27b","modelName":"Qwen 3.8 27B","rank":34,"medal":null},{"observationId":"qwen3-8-flash-next-livebench-mathematics","label":"LiveBench : mathématiques","display":"85,8 %","value":85.821,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.821},"modelId":"qwen3-8-flash-next","modelName":"Qwen 3.8 Flash Next","rank":35,"medal":null},{"observationId":"qwen3-7-max-livebench-mathematics","label":"LiveBench : mathématiques","display":"85,2 %","value":85.2483,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.2483},"modelId":"qwen3-7-max","modelName":"Qwen 3.7 Max","rank":36,"medal":null},{"observationId":"kimi-k3-livebench-mathematics","label":"LiveBench : mathématiques","display":"84,4 %","value":84.4368,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.4368},"modelId":"kimi-k3","modelName":"Kimi K3","rank":37,"medal":null},{"observationId":"grok-4-3-livebench-mathematics","label":"LiveBench : mathématiques","display":"84,3 %","value":84.339,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.339},"modelId":"grok-4-3","modelName":"Grok 4.3","rank":38,"medal":null},{"observationId":"kimi-k2-6-livebench-mathematics","label":"LiveBench : mathématiques","display":"84,3 %","value":84.2763,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.2763},"modelId":"kimi-k2-6","modelName":"Kimi K2.6","rank":39,"medal":null},{"observationId":"smaug-agentic-livebench-mathematics","label":"LiveBench : mathématiques","display":"83,9 %","value":83.9195,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.9195},"modelId":"smaug-agentic","modelName":"Smaug-Agentic","rank":40,"medal":null},{"observationId":"qwen3-6-plus-livebench-mathematics","label":"LiveBench : mathématiques","display":"83,7 %","value":83.7248,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.7248},"modelId":"qwen3-6-plus","modelName":"Qwen 3.6 Plus","rank":41,"medal":null},{"observationId":"glm-5-3-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"81,2 %","value":81.2445,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.2445},"modelId":"glm-5-3-flash","modelName":"GLM 5.3 Flash","rank":42,"medal":null},{"observationId":"qwen3-6-27b-livebench-mathematics","label":"LiveBench : mathématiques","display":"79,9 %","value":79.8685,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.8685},"modelId":"qwen3-6-27b","modelName":"Qwen 3.6 27B","rank":43,"medal":null},{"observationId":"deepseek-v4-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"79,6 %","value":79.6475,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.6475},"modelId":"deepseek-v4-flash","modelName":"DeepSeek V4 Flash","rank":44,"medal":null},{"observationId":"kimi-k2-7-code-livebench-mathematics","label":"LiveBench : mathématiques","display":"79,6 %","value":79.6043,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.6043},"modelId":"kimi-k2-7-code","modelName":"Kimi K2.7 Code","rank":45,"medal":null},{"observationId":"gpt-5-4-mini-livebench-mathematics","label":"LiveBench : mathématiques","display":"78,5 %","value":78.462,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.462},"modelId":"gpt-5-4-mini","modelName":"GPT-5.4 mini","rank":46,"medal":null},{"observationId":"grok-build-0-1-livebench-mathematics","label":"LiveBench : mathématiques","display":"78,4 %","value":78.4288,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.4288},"modelId":"grok-build-0-1","modelName":"Grok Build 0.1","rank":47,"medal":null},{"observationId":"minimax-m3-livebench-mathematics","label":"LiveBench : mathématiques","display":"76,9 %","value":76.9475,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.9475},"modelId":"minimax-m3","modelName":"MiniMax M3","rank":48,"medal":null},{"observationId":"gemini-3-5-flash-lite-livebench-mathematics","label":"LiveBench : mathématiques","display":"73,7 %","value":73.7395,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.7395},"modelId":"gemini-3-5-flash-lite","modelName":"Gemini 3.5 Flash-Lite","rank":49,"medal":null}]}],"rows":[{"modelId":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[{"observationId":"astra-frontiermath-erdos","label":"FrontierMath Erdős","display":"3 %","value":3,"unit":"percent","dispersion":null,"sourceUrl":"https://epoch.ai/latest/announcing-frontiermath-erdos","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Agent sans internet, budget de 300 $ et 72 heures par problème. Preuve ou réfutation acceptée par Lean, un vérificateur mathématique.","limitation":"Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.","visual":{"kind":"bar","valuePercent":3},"modelId":"astra","modelName":"GPT-6 Astra","rank":1,"medal":"or"}],"livebench-mathematics-2026-06-25":[]}},{"modelId":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","measured":true,"independentTeams":2,"stars":2,"starsLabel":"Une équipe extérieure","rank":1,"averageRank":null,"normalizedScore":null,"rankLabel":"1er","medal":"or","manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[{"observationId":"fable-5-1-frontiermath-erdos","label":"FrontierMath Erdős","display":"0 %","value":0,"unit":"percent","dispersion":null,"sourceUrl":"https://epoch.ai/latest/announcing-frontiermath-erdos","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Agent sans internet, budget de 300 $ et 72 heures par problème. Preuve ou réfutation acceptée par Lean, un vérificateur mathématique.","limitation":"Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.","visual":{"kind":"bar","valuePercent":0},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":2.5,"medal":null}],"livebench-mathematics-2026-06-25":[{"observationId":"fable-5-1-livebench-mathematics","label":"LiveBench : mathématiques","display":"97,0 %","value":97.0068,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":97.0068},"modelId":"fable-5-1","modelName":"Claude Fable 5.1","rank":1,"medal":"or"}]}},{"modelId":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":3,"averageRank":null,"normalizedScore":null,"rankLabel":"3e","medal":"bronze","manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"fable-5-livebench-mathematics","label":"LiveBench : mathématiques","display":"96,0 %","value":95.9858,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":95.9858},"modelId":"fable-5","modelName":"Claude Fable 5","rank":3,"medal":"bronze"}]}},{"modelId":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":6,"averageRank":null,"normalizedScore":null,"rankLabel":"6e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"opus-5-livebench-mathematics","label":"LiveBench : mathématiques","display":"95,7 %","value":95.731,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":95.731},"modelId":"opus-5","modelName":"Claude Opus 5","rank":6,"medal":null}]}},{"modelId":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":true,"independentTeams":2,"stars":2,"starsLabel":"Une équipe extérieure","rank":2,"averageRank":null,"normalizedScore":null,"rankLabel":"2e","medal":"argent","manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[{"observationId":"sol-frontiermath-erdos","label":"FrontierMath Erdős","display":"0 %","value":0,"unit":"percent","dispersion":null,"sourceUrl":"https://epoch.ai/latest/announcing-frontiermath-erdos","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Agent sans internet, budget de 300 $ et 72 heures par problème. Preuve ou réfutation acceptée par Lean, un vérificateur mathématique.","limitation":"Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.","visual":{"kind":"bar","valuePercent":0},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":2.5,"medal":null}],"livebench-mathematics-2026-06-25":[{"observationId":"sol-livebench-mathematics","label":"LiveBench : mathématiques","display":"96,2 %","value":96.1978,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":96.1978},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":2,"medal":"argent"}]}},{"modelId":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[]}},{"modelId":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":23,"averageRank":null,"normalizedScore":null,"rankLabel":"23e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"claude-opus-4-6-livebench-mathematics","label":"LiveBench : mathématiques","display":"89,3 %","value":89.317,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.317},"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","rank":23,"medal":null}]}},{"modelId":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[]}},{"modelId":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[]}},{"modelId":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":13,"averageRank":null,"normalizedScore":null,"rankLabel":"13e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"claude-opus-4-7-livebench-mathematics","label":"LiveBench : mathématiques","display":"92,9 %","value":92.8538,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":92.8538},"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","rank":13,"medal":null}]}},{"modelId":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":31,"averageRank":null,"normalizedScore":null,"rankLabel":"31e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"claude-sonnet-4-6-livebench-mathematics","label":"LiveBench : mathématiques","display":"87,0 %","value":86.994,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.994},"modelId":"claude-sonnet-4-6","modelName":"Claude Sonnet 4.6","rank":31,"medal":null}]}},{"modelId":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":12,"averageRank":null,"normalizedScore":null,"rankLabel":"12e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"claude-sonnet-5-livebench-mathematics","label":"LiveBench : mathématiques","display":"92,9 %","value":92.9423,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":92.9423},"modelId":"claude-sonnet-5","modelName":"Claude Sonnet 5","rank":12,"medal":null}]}},{"modelId":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":44,"averageRank":null,"normalizedScore":null,"rankLabel":"44e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"deepseek-v4-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"79,6 %","value":79.6475,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.6475},"modelId":"deepseek-v4-flash","modelName":"DeepSeek V4 Flash","rank":44,"medal":null}]}},{"modelId":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":21,"averageRank":null,"normalizedScore":null,"rankLabel":"21e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"deepseek-v4-pro-livebench-mathematics","label":"LiveBench : mathématiques","display":"90,7 %","value":90.6755,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.6755},"modelId":"deepseek-v4-pro","modelName":"DeepSeek V4 Pro","rank":21,"medal":null}]}},{"modelId":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":18,"averageRank":null,"normalizedScore":null,"rankLabel":"18e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"gemini-3-1-pro-preview-livebench-mathematics","label":"LiveBench : mathématiques","display":"91,0 %","value":91.045,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.045},"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","rank":18,"medal":null}]}},{"modelId":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":26,"averageRank":null,"normalizedScore":null,"rankLabel":"26e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"gemini-3-5-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"88,2 %","value":88.2438,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.2438},"modelId":"gemini-3-5-flash","modelName":"Gemini 3.5 Flash","rank":26,"medal":null}]}},{"modelId":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":22,"averageRank":null,"normalizedScore":null,"rankLabel":"22e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"glm-5-2-livebench-mathematics","label":"LiveBench : mathématiques","display":"89,8 %","value":89.7813,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.7813},"modelId":"glm-5-2","modelName":"GLM 5.2","rank":22,"medal":null}]}},{"modelId":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":46,"averageRank":null,"normalizedScore":null,"rankLabel":"46e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"gpt-5-4-mini-livebench-mathematics","label":"LiveBench : mathématiques","display":"78,5 %","value":78.462,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.462},"modelId":"gpt-5-4-mini","modelName":"GPT-5.4 mini","rank":46,"medal":null}]}},{"modelId":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":19,"averageRank":null,"normalizedScore":null,"rankLabel":"19e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"gpt-5-4-nano-livebench-mathematics","label":"LiveBench : mathématiques","display":"91,0 %","value":90.977,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.977},"modelId":"gpt-5-4-nano","modelName":"GPT-5.4 nano","rank":19,"medal":null}]}},{"modelId":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":10,"averageRank":null,"normalizedScore":null,"rankLabel":"10e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"gpt-5-4-livebench-mathematics","label":"LiveBench : mathématiques","display":"94,1 %","value":94.148,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":94.148},"modelId":"gpt-5-4","modelName":"GPT-5.4","rank":10,"medal":null}]}},{"modelId":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":5,"averageRank":null,"normalizedScore":null,"rankLabel":"5e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"gpt-5-5-livebench-mathematics","label":"LiveBench : mathématiques","display":"95,9 %","value":95.8573,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":95.8573},"modelId":"gpt-5-5","modelName":"GPT-5.5","rank":5,"medal":null}]}},{"modelId":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":38,"averageRank":null,"normalizedScore":null,"rankLabel":"38e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"grok-4-3-livebench-mathematics","label":"LiveBench : mathématiques","display":"84,3 %","value":84.339,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.339},"modelId":"grok-4-3","modelName":"Grok 4.3","rank":38,"medal":null}]}},{"modelId":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":20,"averageRank":null,"normalizedScore":null,"rankLabel":"20e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"grok-4-5-livebench-mathematics","label":"LiveBench : mathématiques","display":"90,8 %","value":90.8245,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.8245},"modelId":"grok-4-5","modelName":"Grok 4.5","rank":20,"medal":null}]}},{"modelId":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":47,"averageRank":null,"normalizedScore":null,"rankLabel":"47e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"grok-build-0-1-livebench-mathematics","label":"LiveBench : mathématiques","display":"78,4 %","value":78.4288,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.4288},"modelId":"grok-build-0-1","modelName":"Grok Build 0.1","rank":47,"medal":null}]}},{"modelId":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":39,"averageRank":null,"normalizedScore":null,"rankLabel":"39e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"kimi-k2-6-livebench-mathematics","label":"LiveBench : mathématiques","display":"84,3 %","value":84.2763,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.2763},"modelId":"kimi-k2-6","modelName":"Kimi K2.6","rank":39,"medal":null}]}},{"modelId":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":45,"averageRank":null,"normalizedScore":null,"rankLabel":"45e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"kimi-k2-7-code-livebench-mathematics","label":"LiveBench : mathématiques","display":"79,6 %","value":79.6043,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.6043},"modelId":"kimi-k2-7-code","modelName":"Kimi K2.7 Code","rank":45,"medal":null}]}},{"modelId":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":48,"averageRank":null,"normalizedScore":null,"rankLabel":"48e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"minimax-m3-livebench-mathematics","label":"LiveBench : mathématiques","display":"76,9 %","value":76.9475,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.9475},"modelId":"minimax-m3","modelName":"MiniMax M3","rank":48,"medal":null}]}},{"modelId":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":43,"averageRank":null,"normalizedScore":null,"rankLabel":"43e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"qwen3-6-27b-livebench-mathematics","label":"LiveBench : mathématiques","display":"79,9 %","value":79.8685,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.8685},"modelId":"qwen3-6-27b","modelName":"Qwen 3.6 27B","rank":43,"medal":null}]}},{"modelId":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":41,"averageRank":null,"normalizedScore":null,"rankLabel":"41e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"qwen3-6-plus-livebench-mathematics","label":"LiveBench : mathématiques","display":"83,7 %","value":83.7248,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.7248},"modelId":"qwen3-6-plus","modelName":"Qwen 3.6 Plus","rank":41,"medal":null}]}},{"modelId":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":36,"averageRank":null,"normalizedScore":null,"rankLabel":"36e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"qwen3-7-max-livebench-mathematics","label":"LiveBench : mathématiques","display":"85,2 %","value":85.2483,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.2483},"modelId":"qwen3-7-max","modelName":"Qwen 3.7 Max","rank":36,"medal":null}]}},{"modelId":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":8,"averageRank":null,"normalizedScore":null,"rankLabel":"8e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"terra-livebench-mathematics","label":"LiveBench : mathématiques","display":"94,9 %","value":94.9083,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":94.9083},"modelId":"terra","modelName":"GPT-5.6 Terra","rank":8,"medal":null}]}},{"modelId":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":29,"averageRank":null,"normalizedScore":null,"rankLabel":"29e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"luna-livebench-mathematics","label":"LiveBench : mathématiques","display":"87,2 %","value":87.2008,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.2008},"modelId":"luna","modelName":"GPT-5.6 Luna","rank":29,"medal":null}]}},{"modelId":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":30,"averageRank":null,"normalizedScore":null,"rankLabel":"30e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"muse-spark-1-1-livebench-mathematics","label":"LiveBench : mathématiques","display":"87,1 %","value":87.1448,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.1448},"modelId":"muse-spark-1-1","modelName":"Muse Spark 1.1","rank":30,"medal":null}]}},{"modelId":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":37,"averageRank":null,"normalizedScore":null,"rankLabel":"37e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"kimi-k3-livebench-mathematics","label":"LiveBench : mathématiques","display":"84,4 %","value":84.4368,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.4368},"modelId":"kimi-k3","modelName":"Kimi K3","rank":37,"medal":null}]}},{"modelId":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":25,"averageRank":null,"normalizedScore":null,"rankLabel":"25e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"inkling-livebench-mathematics","label":"LiveBench : mathématiques","display":"88,4 %","value":88.3648,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.3648},"modelId":"inkling","modelName":"Inkling","rank":25,"medal":null}]}},{"modelId":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":49,"averageRank":null,"normalizedScore":null,"rankLabel":"49e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"gemini-3-5-flash-lite-livebench-mathematics","label":"LiveBench : mathématiques","display":"73,7 %","value":73.7395,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.7395},"modelId":"gemini-3-5-flash-lite","modelName":"Gemini 3.5 Flash-Lite","rank":49,"medal":null}]}},{"modelId":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":33,"averageRank":null,"normalizedScore":null,"rankLabel":"33e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"gemini-3-6-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"86,4 %","value":86.4025,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.4025},"modelId":"gemini-3-6-flash","modelName":"Gemini 3.6 Flash","rank":33,"medal":null}]}},{"modelId":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":9,"averageRank":null,"normalizedScore":null,"rankLabel":"9e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"claude-opus-4-8-livebench-mathematics","label":"LiveBench : mathématiques","display":"94,3 %","value":94.3165,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":94.3165},"modelId":"claude-opus-4-8","modelName":"Claude Opus 4.8","rank":9,"medal":null}]}},{"modelId":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":32,"averageRank":null,"normalizedScore":null,"rankLabel":"32e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"deepseek-v4-flash-0731-livebench-mathematics","label":"LiveBench : mathématiques","display":"86,8 %","value":86.7898,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.7898},"modelId":"deepseek-v4-flash-0731","modelName":"DeepSeek V4 Flash 0731","rank":32,"medal":null}]}},{"modelId":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":16,"averageRank":null,"normalizedScore":null,"rankLabel":"16e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"qwen3-8-max-livebench-mathematics","label":"LiveBench : mathématiques","display":"91,3 %","value":91.3123,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.3123},"modelId":"qwen3-8-max","modelName":"Qwen 3.8 Max","rank":16,"medal":null}]}},{"modelId":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":17,"averageRank":null,"normalizedScore":null,"rankLabel":"17e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"muse-spark-1-2-livebench-mathematics","label":"LiveBench : mathématiques","display":"91,2 %","value":91.2035,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.2035},"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","rank":17,"medal":null}]}},{"modelId":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":40,"averageRank":null,"normalizedScore":null,"rankLabel":"40e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"smaug-agentic-livebench-mathematics","label":"LiveBench : mathématiques","display":"83,9 %","value":83.9195,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.9195},"modelId":"smaug-agentic","modelName":"Smaug-Agentic","rank":40,"medal":null}]}},{"modelId":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":7,"averageRank":null,"normalizedScore":null,"rankLabel":"7e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"deepseek-v4-pro-0813-livebench-mathematics","label":"LiveBench : mathématiques","display":"95,1 %","value":95.0863,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":95.0863},"modelId":"deepseek-v4-pro-0813","modelName":"DeepSeek V4 Pro 0813","rank":7,"medal":null}]}},{"modelId":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":14,"averageRank":null,"normalizedScore":null,"rankLabel":"14e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"grok-4-6-livebench-mathematics","label":"LiveBench : mathématiques","display":"92,6 %","value":92.568,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":92.568},"modelId":"grok-4-6","modelName":"Grok 4.6","rank":14,"medal":null}]}},{"modelId":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":11,"averageRank":null,"normalizedScore":null,"rankLabel":"11e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"gemini-3-7-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"93,5 %","value":93.468,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":93.468},"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","rank":11,"medal":null}]}},{"modelId":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":34,"averageRank":null,"normalizedScore":null,"rankLabel":"34e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"qwen3-8-27b-livebench-mathematics","label":"LiveBench : mathématiques","display":"86,2 %","value":86.2128,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.2128},"modelId":"qwen3-8-27b","modelName":"Qwen 3.8 27B","rank":34,"medal":null}]}},{"modelId":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":28,"averageRank":null,"normalizedScore":null,"rankLabel":"28e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"deepseek-v4-flash-vision-exp-livebench-mathematics","label":"LiveBench : mathématiques","display":"87,8 %","value":87.8068,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.8068},"modelId":"deepseek-v4-flash-vision-exp","modelName":"DeepSeek V4 Flash Vision Exp","rank":28,"medal":null}]}},{"modelId":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":27,"averageRank":null,"normalizedScore":null,"rankLabel":"27e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"glm-5-3-livebench-mathematics","label":"LiveBench : mathématiques","display":"87,9 %","value":87.898,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.898},"modelId":"glm-5-3","modelName":"GLM 5.3","rank":27,"medal":null}]}},{"modelId":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":42,"averageRank":null,"normalizedScore":null,"rankLabel":"42e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"glm-5-3-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"81,2 %","value":81.2445,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.2445},"modelId":"glm-5-3-flash","modelName":"GLM 5.3 Flash","rank":42,"medal":null}]}},{"modelId":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":35,"averageRank":null,"normalizedScore":null,"rankLabel":"35e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"qwen3-8-flash-next-livebench-mathematics","label":"LiveBench : mathématiques","display":"85,8 %","value":85.821,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.821},"modelId":"qwen3-8-flash-next","modelName":"Qwen 3.8 Flash Next","rank":35,"medal":null}]}},{"modelId":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":24,"averageRank":null,"normalizedScore":null,"rankLabel":"24e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"nemotron-3-ultra-livebench-mathematics","label":"LiveBench : mathématiques","display":"88,7 %","value":88.6633,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.6633},"modelId":"nemotron-3-ultra","modelName":"Nemotron 3 Ultra 550B A55B","rank":24,"medal":null}]}},{"modelId":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":15,"averageRank":null,"normalizedScore":null,"rankLabel":"15e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"gemini-3-8-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"91,6 %","value":91.5643,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.5643},"modelId":"gemini-3-8-flash","modelName":"Gemini 3.8 Flash","rank":15,"medal":null}]}},{"modelId":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":4,"averageRank":null,"normalizedScore":null,"rankLabel":"4e","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[{"observationId":"muse-spark-1-3-livebench-mathematics","label":"LiveBench : mathématiques","display":"96,0 %","value":95.95,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":95.95},"modelId":"muse-spark-1-3","modelName":"Muse Spark 1.3","rank":4,"medal":null}]}},{"modelId":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[]}},{"modelId":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[]}},{"modelId":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[]}},{"modelId":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[]}},{"modelId":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[]}},{"modelId":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[]}},{"modelId":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[]}},{"modelId":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[]}},{"modelId":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[]}},{"modelId":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[]}},{"modelId":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[]}},{"modelId":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[]}},{"modelId":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"epoch-frontiermath-erdos":[],"livebench-mathematics-2026-06-25":[]}}],"podiumModelIds":["fable-5-1","sol","fable-5"],"sortOrders":{"rank":["fable-5-1","sol","fable-5","muse-spark-1-3","gpt-5-5","opus-5","deepseek-v4-pro-0813","terra","claude-opus-4-8","gpt-5-4","gemini-3-7-flash","claude-sonnet-5","claude-opus-4-7","grok-4-6","gemini-3-8-flash","qwen3-8-max","muse-spark-1-2","gemini-3-1-pro-preview","gpt-5-4-nano","grok-4-5","deepseek-v4-pro","glm-5-2","claude-opus-4-6","nemotron-3-ultra","inkling","gemini-3-5-flash","glm-5-3","deepseek-v4-flash-vision-exp","luna","muse-spark-1-1","claude-sonnet-4-6","deepseek-v4-flash-0731","gemini-3-6-flash","qwen3-8-27b","qwen3-8-flash-next","qwen3-7-max","kimi-k3","grok-4-3","kimi-k2-6","smaug-agentic","qwen3-6-plus","glm-5-3-flash","qwen3-6-27b","deepseek-v4-flash","kimi-k2-7-code","gpt-5-4-mini","grok-build-0-1","minimax-m3","gemini-3-5-flash-lite","claude-haiku-4-5","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","glm-5","glm-5-1","astra","grok-4-20-0309-reasoning","inkling-small","kimi-k2-5","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","mistral-medium-3-5","nemotron-lightning-3-5","qwen3-7-plus"],"model":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"maker":["smaug-agentic","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","ling-3-0-flash-2607","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","nemotron-3-ultra","nemotron-lightning-3-5","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","inkling","inkling-small","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","mimo-v2-5","mimo-v2-5-pro","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash"],"date":["glm-5-1","mimo-v2-5-pro","mimo-v2-5","inkling-small","qwen3-7-plus","minimax-m2-7","claude-haiku-4-5","gemini-3-flash-preview","mistral-medium-3-5","gemini-3-1-flash-lite-preview","nemotron-lightning-3-5","grok-4-20-0309-reasoning","ling-3-0-flash-2607","astra","gemini-3-8-flash","muse-spark-1-3","fable-5-1","glm-5-3-flash","qwen3-8-flash-next","deepseek-v4-flash-vision-exp","qwen3-8-27b","glm-5-3","deepseek-v4-pro-0813","gemini-3-7-flash","grok-4-6","smaug-agentic","muse-spark-1-2","qwen3-8-max","deepseek-v4-flash-0731","opus-5","gemini-3-5-flash-lite","gemini-3-6-flash","kimi-k3","inkling","sol","terra","luna","muse-spark-1-1","grok-4-5","claude-sonnet-5","glm-5-2","kimi-k2-7-code","fable-5","qwen3-7-max","nemotron-3-ultra","minimax-m3","claude-opus-4-8","gemini-3-5-flash","grok-build-0-1","grok-4-3","deepseek-v4-flash","deepseek-v4-pro","gpt-5-5","qwen3-6-27b","kimi-k2-6","claude-opus-4-7","qwen3-6-plus","gpt-5-4-mini","gpt-5-4-nano","gpt-5-4","gemini-3-1-pro-preview","claude-sonnet-4-6","minimax-m2-5","glm-5","claude-opus-4-6","kimi-k2-5"],"teams":["fable-5-1","sol","fable-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","astra","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","kimi-k2-6","kimi-k2-7-code","kimi-k3","minimax-m3","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic","claude-haiku-4-5","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","glm-5","glm-5-1","grok-4-20-0309-reasoning","inkling-small","kimi-k2-5","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","mistral-medium-3-5","nemotron-lightning-3-5","qwen3-7-plus"],"score":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:epoch-frontiermath-erdos":["astra","fable-5-1","sol","fable-5","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:livebench-mathematics-2026-06-25":["fable-5-1","sol","fable-5","muse-spark-1-3","gpt-5-5","opus-5","deepseek-v4-pro-0813","terra","claude-opus-4-8","gpt-5-4","gemini-3-7-flash","claude-sonnet-5","claude-opus-4-7","grok-4-6","gemini-3-8-flash","qwen3-8-max","muse-spark-1-2","gemini-3-1-pro-preview","gpt-5-4-nano","grok-4-5","deepseek-v4-pro","glm-5-2","claude-opus-4-6","nemotron-3-ultra","inkling","gemini-3-5-flash","glm-5-3","deepseek-v4-flash-vision-exp","luna","muse-spark-1-1","claude-sonnet-4-6","deepseek-v4-flash-0731","gemini-3-6-flash","qwen3-8-27b","qwen3-8-flash-next","qwen3-7-max","kimi-k3","grok-4-3","kimi-k2-6","smaug-agentic","qwen3-6-plus","glm-5-3-flash","qwen3-6-27b","deepseek-v4-flash","kimi-k2-7-code","gpt-5-4-mini","grok-build-0-1","minimax-m3","gemini-3-5-flash-lite","claude-haiku-4-5","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","glm-5","glm-5-1","astra","grok-4-20-0309-reasoning","inkling-small","kimi-k2-5","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","mistral-medium-3-5","nemotron-lightning-3-5","qwen3-7-plus"]},"contradictions":[],"concordance":"Agrégation en attente de couverture, 2 modèles communs sur 49.","normalizedScore":{"domain":"mathScience","available":false,"edition":{"editionId":"origin-mathScience-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : couverture actuelle, 1 test au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[{"familyId":"epoch-frontiermath-erdos","sourceId":"epoch-frontiermath-erdos","benchmark":"FrontierMath Erdős","organization":"Epoch AI","organizationId":"epoch-ai","modelCount":3,"reason":"3 modèles mesurés, minimum pratique 15."},{"familyId":"livebench-mathematics-2026-06-25","sourceId":"livebench-2026-06-25","benchmark":"LiveBench : mathématiques","organization":"LiveBench","organizationId":"livebench","modelCount":49,"reason":"Hors socle : aucune édition Origin n’est constituée pour cet usage."}],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":1,"organizationCount":1,"referenceModelCount":0},"message":"Note Origin indisponible : couverture actuelle, 1 test au seuil pratique de 15 modèles et 1 équipe indépendante. Aucune référence commune figée.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},"aggregation":null,"aggregationCoverage":{"solidSourceCount":0,"solidSourceCoverage":[{"organizationId":"epoch-ai","organization":"Epoch AI","modelCount":2,"eligible":false,"reason":"2 modèles du panel, 5 requis ; contribution descriptive seulement."},{"organizationId":"livebench","organization":"LiveBench","modelCount":2,"eligible":false,"reason":"2 modèles du panel, 5 requis ; contribution descriptive seulement."}],"sourceCount":2,"candidateSourceCount":2,"modelCount":2,"panelModelCount":49,"message":"Agrégation en attente de couverture, 2 modèles communs sur 49.","candidateSources":[{"organization":"Epoch AI","sourceId":"epoch-frontiermath-erdos","familyId":"epoch-frontiermath-erdos","independenceLevel":1,"status":"included","reason":null},{"organization":"LiveBench","sourceId":"livebench-2026-06-25","familyId":"livebench-mathematics-2026-06-25","independenceLevel":1,"status":"included","reason":null}]}},{"id":"computerUse","label":"Usage d’ordinateur","question":"Quel modèle pour utiliser plusieurs logiciels ?","verdict":"Aucune équipe n’a encore publié de mesure comparable pour cet usage.","limitation":"Aucun score n’est estimé pour les modèles non mesurés.","viewMode":"empty","averageRank":null,"primaryFamilyId":null,"primaryFamilyLabel":null,"rankLabel":"Aucun rang","stars":0,"starsLabel":"Aucune mesure disponible","isTopTie":false,"families":[],"rows":[{"modelId":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}}],"podiumModelIds":[],"sortOrders":{"rank":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"model":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"maker":["smaug-agentic","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","ling-3-0-flash-2607","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","nemotron-3-ultra","nemotron-lightning-3-5","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","inkling","inkling-small","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","mimo-v2-5","mimo-v2-5-pro","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash"],"date":["glm-5-1","mimo-v2-5-pro","mimo-v2-5","inkling-small","qwen3-7-plus","minimax-m2-7","claude-haiku-4-5","gemini-3-flash-preview","mistral-medium-3-5","gemini-3-1-flash-lite-preview","nemotron-lightning-3-5","grok-4-20-0309-reasoning","ling-3-0-flash-2607","astra","gemini-3-8-flash","muse-spark-1-3","fable-5-1","glm-5-3-flash","qwen3-8-flash-next","deepseek-v4-flash-vision-exp","qwen3-8-27b","glm-5-3","deepseek-v4-pro-0813","gemini-3-7-flash","grok-4-6","smaug-agentic","muse-spark-1-2","qwen3-8-max","deepseek-v4-flash-0731","opus-5","gemini-3-5-flash-lite","gemini-3-6-flash","kimi-k3","inkling","sol","terra","luna","muse-spark-1-1","grok-4-5","claude-sonnet-5","glm-5-2","kimi-k2-7-code","fable-5","qwen3-7-max","nemotron-3-ultra","minimax-m3","claude-opus-4-8","gemini-3-5-flash","grok-build-0-1","grok-4-3","deepseek-v4-flash","deepseek-v4-pro","gpt-5-5","qwen3-6-27b","kimi-k2-6","claude-opus-4-7","qwen3-6-plus","gpt-5-4-mini","gpt-5-4-nano","gpt-5-4","gemini-3-1-pro-preview","claude-sonnet-4-6","minimax-m2-5","glm-5","claude-opus-4-6","kimi-k2-5"],"teams":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"score":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"]},"contradictions":[],"concordance":"Aucun test public dans le registre.","normalizedScore":{"domain":"computerUse","available":false,"edition":{"editionId":"origin-computerUse-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},"aggregation":null,"aggregationCoverage":{"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0.","candidateSources":[]}},{"id":"longContext","label":"Contexte long","question":"Quel modèle pour analyser beaucoup de documents ?","verdict":"Aucune équipe n’a encore publié de mesure comparable pour cet usage.","limitation":"Aucun score n’est estimé pour les modèles non mesurés.","viewMode":"empty","averageRank":null,"primaryFamilyId":null,"primaryFamilyLabel":null,"rankLabel":"Aucun rang","stars":0,"starsLabel":"Aucune mesure disponible","isTopTie":false,"families":[],"rows":[{"modelId":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}}],"podiumModelIds":[],"sortOrders":{"rank":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"model":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"maker":["smaug-agentic","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","ling-3-0-flash-2607","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","nemotron-3-ultra","nemotron-lightning-3-5","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","inkling","inkling-small","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","mimo-v2-5","mimo-v2-5-pro","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash"],"date":["glm-5-1","mimo-v2-5-pro","mimo-v2-5","inkling-small","qwen3-7-plus","minimax-m2-7","claude-haiku-4-5","gemini-3-flash-preview","mistral-medium-3-5","gemini-3-1-flash-lite-preview","nemotron-lightning-3-5","grok-4-20-0309-reasoning","ling-3-0-flash-2607","astra","gemini-3-8-flash","muse-spark-1-3","fable-5-1","glm-5-3-flash","qwen3-8-flash-next","deepseek-v4-flash-vision-exp","qwen3-8-27b","glm-5-3","deepseek-v4-pro-0813","gemini-3-7-flash","grok-4-6","smaug-agentic","muse-spark-1-2","qwen3-8-max","deepseek-v4-flash-0731","opus-5","gemini-3-5-flash-lite","gemini-3-6-flash","kimi-k3","inkling","sol","terra","luna","muse-spark-1-1","grok-4-5","claude-sonnet-5","glm-5-2","kimi-k2-7-code","fable-5","qwen3-7-max","nemotron-3-ultra","minimax-m3","claude-opus-4-8","gemini-3-5-flash","grok-build-0-1","grok-4-3","deepseek-v4-flash","deepseek-v4-pro","gpt-5-5","qwen3-6-27b","kimi-k2-6","claude-opus-4-7","qwen3-6-plus","gpt-5-4-mini","gpt-5-4-nano","gpt-5-4","gemini-3-1-pro-preview","claude-sonnet-4-6","minimax-m2-5","glm-5","claude-opus-4-6","kimi-k2-5"],"teams":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"score":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"]},"contradictions":[],"concordance":"Aucun test public dans le registre.","normalizedScore":{"domain":"longContext","available":false,"edition":{"editionId":"origin-longContext-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},"aggregation":null,"aggregationCoverage":{"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0.","candidateSources":[]}},{"id":"factuality","label":"Exactitude factuelle","question":"Quel modèle pour répondre sans inventer ?","verdict":"GPT-6 Astra arrive en tête sur AA-Omniscience, réponses inventées.","limitation":"Une seule équipe porte ce podium. Les autres tests de exactitude factuelle restent affichés séparément.","viewMode":"single-source","averageRank":null,"primaryFamilyId":"aa-omniscience-2026-09","primaryFamilyLabel":"AA-Omniscience, réponses inventées","rankLabel":"Rang sur AA-Omniscience, réponses inventées","stars":2,"starsLabel":"Une équipe extérieure, confirmation manquante","isTopTie":false,"families":[{"id":"aa-omniscience-2026-09","label":"AA-Omniscience, réponses inventées","organization":"Artificial Analysis","scaleLabel":"Échelle réelle de 0 à 100","betterLabel":"Plus bas est meilleur","constructId":"knowledge-abstention","sourceType":2,"isCountable":true,"isManufacturer":false,"measurements":[{"observationId":"astra-aa-omniscience-hallucination","label":"AA-Omniscience, réponses inventées","display":"51 % de réponses inventées","value":51,"unit":"percent","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Outils de l’Artificial Analysis Intelligence Index v4.1.1. Réponse incorrecte donnée au lieu d’une abstention.","limitation":"Le résultat dépend des questions choisies et d’une correction par un autre modèle d’IA. Il ne mesure pas toutes les formes d’erreur factuelle.","visual":{"kind":"bar","valuePercent":51},"modelId":"astra","modelName":"GPT-6 Astra","rank":1,"medal":"or"},{"observationId":"sol-aa-omniscience-hallucination","label":"AA-Omniscience, réponses inventées","display":"92 % de réponses inventées","value":92,"unit":"percent","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Outils de l’Artificial Analysis Intelligence Index v4.1.1. Réponse incorrecte donnée au lieu d’une abstention.","limitation":"Le résultat dépend des questions choisies et d’une correction par un autre modèle d’IA. Il ne mesure pas toutes les formes d’erreur factuelle.","visual":{"kind":"bar","valuePercent":92},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":2,"medal":"argent"}]}],"rows":[{"modelId":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":1,"averageRank":null,"normalizedScore":null,"rankLabel":"1er","medal":"or","manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[{"observationId":"astra-aa-omniscience-hallucination","label":"AA-Omniscience, réponses inventées","display":"51 % de réponses inventées","value":51,"unit":"percent","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Outils de l’Artificial Analysis Intelligence Index v4.1.1. Réponse incorrecte donnée au lieu d’une abstention.","limitation":"Le résultat dépend des questions choisies et d’une correction par un autre modèle d’IA. Il ne mesure pas toutes les formes d’erreur factuelle.","visual":{"kind":"bar","valuePercent":51},"modelId":"astra","modelName":"GPT-6 Astra","rank":1,"medal":"or"}]}},{"modelId":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":true,"independentTeams":1,"stars":2,"starsLabel":"Une équipe extérieure","rank":2,"averageRank":null,"normalizedScore":null,"rankLabel":"2e","medal":"argent","manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[{"observationId":"sol-aa-omniscience-hallucination","label":"AA-Omniscience, réponses inventées","display":"92 % de réponses inventées","value":92,"unit":"percent","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Outils de l’Artificial Analysis Intelligence Index v4.1.1. Réponse incorrecte donnée au lieu d’une abstention.","limitation":"Le résultat dépend des questions choisies et d’une correction par un autre modèle d’IA. Il ne mesure pas toutes les formes d’erreur factuelle.","visual":{"kind":"bar","valuePercent":92},"modelId":"sol","modelName":"GPT-5.6 Sol","rank":2,"medal":"argent"}]}},{"modelId":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}},{"modelId":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{"aa-omniscience-2026-09":[]}}],"podiumModelIds":["astra","sol"],"sortOrders":{"rank":["astra","sol","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"model":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"maker":["smaug-agentic","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","ling-3-0-flash-2607","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","nemotron-3-ultra","nemotron-lightning-3-5","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","inkling","inkling-small","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","mimo-v2-5","mimo-v2-5-pro","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash"],"date":["glm-5-1","mimo-v2-5-pro","mimo-v2-5","inkling-small","qwen3-7-plus","minimax-m2-7","claude-haiku-4-5","gemini-3-flash-preview","mistral-medium-3-5","gemini-3-1-flash-lite-preview","nemotron-lightning-3-5","grok-4-20-0309-reasoning","ling-3-0-flash-2607","astra","gemini-3-8-flash","muse-spark-1-3","fable-5-1","glm-5-3-flash","qwen3-8-flash-next","deepseek-v4-flash-vision-exp","qwen3-8-27b","glm-5-3","deepseek-v4-pro-0813","gemini-3-7-flash","grok-4-6","smaug-agentic","muse-spark-1-2","qwen3-8-max","deepseek-v4-flash-0731","opus-5","gemini-3-5-flash-lite","gemini-3-6-flash","kimi-k3","inkling","sol","terra","luna","muse-spark-1-1","grok-4-5","claude-sonnet-5","glm-5-2","kimi-k2-7-code","fable-5","qwen3-7-max","nemotron-3-ultra","minimax-m3","claude-opus-4-8","gemini-3-5-flash","grok-build-0-1","grok-4-3","deepseek-v4-flash","deepseek-v4-pro","gpt-5-5","qwen3-6-27b","kimi-k2-6","claude-opus-4-7","qwen3-6-plus","gpt-5-4-mini","gpt-5-4-nano","gpt-5-4","gemini-3-1-pro-preview","claude-sonnet-4-6","minimax-m2-5","glm-5","claude-opus-4-6","kimi-k2-5"],"teams":["sol","astra","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"score":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"family:aa-omniscience-2026-09":["astra","sol","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","terra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"]},"contradictions":[],"concordance":"Une seule équipe sur ce test : confirmation extérieure manquante.","normalizedScore":{"domain":"factuality","available":false,"edition":{"editionId":"origin-factuality-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[{"familyId":"aa-omniscience-2026-09","sourceId":"aa-omniscience-2026-09","benchmark":"AA-Omniscience, réponses inventées","organization":"Artificial Analysis","organizationId":"artificial-analysis","modelCount":2,"reason":"2 modèles mesurés, minimum pratique 15."}],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},"aggregation":null,"aggregationCoverage":{"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":1,"modelCount":0,"panelModelCount":2,"message":"Agrégation en attente de couverture, 0 modèles communs sur 2.","candidateSources":[{"organization":"Artificial Analysis","sourceId":"aa-omniscience-2026-09","familyId":"aa-omniscience-2026-09","independenceLevel":2,"status":"excluded","reason":"Moins de 2 modèles mesurés en commun avec une autre source du panel."}]}},{"id":"vision","label":"Vision","question":"Quel modèle pour comprendre des images et des documents ?","verdict":"Aucune équipe n’a encore publié de mesure comparable pour cet usage.","limitation":"Aucun score n’est estimé pour les modèles non mesurés.","viewMode":"empty","averageRank":null,"primaryFamilyId":null,"primaryFamilyLabel":null,"rankLabel":"Aucun rang","stars":0,"starsLabel":"Aucune mesure disponible","isTopTie":false,"families":[],"rows":[{"modelId":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}}],"podiumModelIds":[],"sortOrders":{"rank":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"model":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"maker":["smaug-agentic","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","ling-3-0-flash-2607","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","nemotron-3-ultra","nemotron-lightning-3-5","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","inkling","inkling-small","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","mimo-v2-5","mimo-v2-5-pro","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash"],"date":["glm-5-1","mimo-v2-5-pro","mimo-v2-5","inkling-small","qwen3-7-plus","minimax-m2-7","claude-haiku-4-5","gemini-3-flash-preview","mistral-medium-3-5","gemini-3-1-flash-lite-preview","nemotron-lightning-3-5","grok-4-20-0309-reasoning","ling-3-0-flash-2607","astra","gemini-3-8-flash","muse-spark-1-3","fable-5-1","glm-5-3-flash","qwen3-8-flash-next","deepseek-v4-flash-vision-exp","qwen3-8-27b","glm-5-3","deepseek-v4-pro-0813","gemini-3-7-flash","grok-4-6","smaug-agentic","muse-spark-1-2","qwen3-8-max","deepseek-v4-flash-0731","opus-5","gemini-3-5-flash-lite","gemini-3-6-flash","kimi-k3","inkling","sol","terra","luna","muse-spark-1-1","grok-4-5","claude-sonnet-5","glm-5-2","kimi-k2-7-code","fable-5","qwen3-7-max","nemotron-3-ultra","minimax-m3","claude-opus-4-8","gemini-3-5-flash","grok-build-0-1","grok-4-3","deepseek-v4-flash","deepseek-v4-pro","gpt-5-5","qwen3-6-27b","kimi-k2-6","claude-opus-4-7","qwen3-6-plus","gpt-5-4-mini","gpt-5-4-nano","gpt-5-4","gemini-3-1-pro-preview","claude-sonnet-4-6","minimax-m2-5","glm-5","claude-opus-4-6","kimi-k2-5"],"teams":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"score":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"]},"contradictions":[],"concordance":"Aucun test public dans le registre.","normalizedScore":{"domain":"vision","available":false,"edition":{"editionId":"origin-vision-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},"aggregation":null,"aggregationCoverage":{"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0.","candidateSources":[]}},{"id":"voice","label":"Voix","question":"Quel modèle pour une interaction vocale ?","verdict":"Aucune équipe n’a encore publié de mesure comparable pour cet usage.","limitation":"Aucun score n’est estimé pour les modèles non mesurés.","viewMode":"empty","averageRank":null,"primaryFamilyId":null,"primaryFamilyLabel":null,"rankLabel":"Aucun rang","stars":0,"starsLabel":"Aucune mesure disponible","isTopTie":false,"families":[],"rows":[{"modelId":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}}],"podiumModelIds":[],"sortOrders":{"rank":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"model":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"maker":["smaug-agentic","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","ling-3-0-flash-2607","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","nemotron-3-ultra","nemotron-lightning-3-5","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","inkling","inkling-small","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","mimo-v2-5","mimo-v2-5-pro","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash"],"date":["glm-5-1","mimo-v2-5-pro","mimo-v2-5","inkling-small","qwen3-7-plus","minimax-m2-7","claude-haiku-4-5","gemini-3-flash-preview","mistral-medium-3-5","gemini-3-1-flash-lite-preview","nemotron-lightning-3-5","grok-4-20-0309-reasoning","ling-3-0-flash-2607","astra","gemini-3-8-flash","muse-spark-1-3","fable-5-1","glm-5-3-flash","qwen3-8-flash-next","deepseek-v4-flash-vision-exp","qwen3-8-27b","glm-5-3","deepseek-v4-pro-0813","gemini-3-7-flash","grok-4-6","smaug-agentic","muse-spark-1-2","qwen3-8-max","deepseek-v4-flash-0731","opus-5","gemini-3-5-flash-lite","gemini-3-6-flash","kimi-k3","inkling","sol","terra","luna","muse-spark-1-1","grok-4-5","claude-sonnet-5","glm-5-2","kimi-k2-7-code","fable-5","qwen3-7-max","nemotron-3-ultra","minimax-m3","claude-opus-4-8","gemini-3-5-flash","grok-build-0-1","grok-4-3","deepseek-v4-flash","deepseek-v4-pro","gpt-5-5","qwen3-6-27b","kimi-k2-6","claude-opus-4-7","qwen3-6-plus","gpt-5-4-mini","gpt-5-4-nano","gpt-5-4","gemini-3-1-pro-preview","claude-sonnet-4-6","minimax-m2-5","glm-5","claude-opus-4-6","kimi-k2-5"],"teams":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"score":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"]},"contradictions":[],"concordance":"Aucun test public dans le registre.","normalizedScore":{"domain":"voice","available":false,"edition":{"editionId":"origin-voice-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},"aggregation":null,"aggregationCoverage":{"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0.","candidateSources":[]}},{"id":"education","label":"Éducation","question":"Quel modèle pour expliquer et enseigner ?","verdict":"Aucune équipe n’a encore publié de mesure comparable pour cet usage.","limitation":"Aucun score n’est estimé pour les modèles non mesurés.","viewMode":"empty","averageRank":null,"primaryFamilyId":null,"primaryFamilyLabel":null,"rankLabel":"Aucun rang","stars":0,"starsLabel":"Aucune mesure disponible","isTopTie":false,"families":[],"rows":[{"modelId":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}}],"podiumModelIds":[],"sortOrders":{"rank":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"model":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"maker":["smaug-agentic","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","ling-3-0-flash-2607","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","nemotron-3-ultra","nemotron-lightning-3-5","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","inkling","inkling-small","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","mimo-v2-5","mimo-v2-5-pro","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash"],"date":["glm-5-1","mimo-v2-5-pro","mimo-v2-5","inkling-small","qwen3-7-plus","minimax-m2-7","claude-haiku-4-5","gemini-3-flash-preview","mistral-medium-3-5","gemini-3-1-flash-lite-preview","nemotron-lightning-3-5","grok-4-20-0309-reasoning","ling-3-0-flash-2607","astra","gemini-3-8-flash","muse-spark-1-3","fable-5-1","glm-5-3-flash","qwen3-8-flash-next","deepseek-v4-flash-vision-exp","qwen3-8-27b","glm-5-3","deepseek-v4-pro-0813","gemini-3-7-flash","grok-4-6","smaug-agentic","muse-spark-1-2","qwen3-8-max","deepseek-v4-flash-0731","opus-5","gemini-3-5-flash-lite","gemini-3-6-flash","kimi-k3","inkling","sol","terra","luna","muse-spark-1-1","grok-4-5","claude-sonnet-5","glm-5-2","kimi-k2-7-code","fable-5","qwen3-7-max","nemotron-3-ultra","minimax-m3","claude-opus-4-8","gemini-3-5-flash","grok-build-0-1","grok-4-3","deepseek-v4-flash","deepseek-v4-pro","gpt-5-5","qwen3-6-27b","kimi-k2-6","claude-opus-4-7","qwen3-6-plus","gpt-5-4-mini","gpt-5-4-nano","gpt-5-4","gemini-3-1-pro-preview","claude-sonnet-4-6","minimax-m2-5","glm-5","claude-opus-4-6","kimi-k2-5"],"teams":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"score":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"]},"contradictions":[],"concordance":"Aucun test public dans le registre.","normalizedScore":{"domain":"education","available":false,"edition":{"editionId":"origin-education-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},"aggregation":null,"aggregationCoverage":{"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0.","candidateSources":[]}},{"id":"cybersecurity","label":"Cybersécurité","question":"Quel modèle pour chercher des failles en environnement contrôlé ?","verdict":"Aucune équipe n’a encore publié de mesure comparable pour cet usage.","limitation":"Aucun score n’est estimé pour les modèles non mesurés.","viewMode":"empty","averageRank":null,"primaryFamilyId":null,"primaryFamilyLabel":null,"rankLabel":"Aucun rang","stars":0,"starsLabel":"Aucune mesure disponible","isTopTie":false,"families":[],"rows":[{"modelId":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}}],"podiumModelIds":[],"sortOrders":{"rank":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"model":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"maker":["smaug-agentic","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","ling-3-0-flash-2607","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","nemotron-3-ultra","nemotron-lightning-3-5","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","inkling","inkling-small","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","mimo-v2-5","mimo-v2-5-pro","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash"],"date":["glm-5-1","mimo-v2-5-pro","mimo-v2-5","inkling-small","qwen3-7-plus","minimax-m2-7","claude-haiku-4-5","gemini-3-flash-preview","mistral-medium-3-5","gemini-3-1-flash-lite-preview","nemotron-lightning-3-5","grok-4-20-0309-reasoning","ling-3-0-flash-2607","astra","gemini-3-8-flash","muse-spark-1-3","fable-5-1","glm-5-3-flash","qwen3-8-flash-next","deepseek-v4-flash-vision-exp","qwen3-8-27b","glm-5-3","deepseek-v4-pro-0813","gemini-3-7-flash","grok-4-6","smaug-agentic","muse-spark-1-2","qwen3-8-max","deepseek-v4-flash-0731","opus-5","gemini-3-5-flash-lite","gemini-3-6-flash","kimi-k3","inkling","sol","terra","luna","muse-spark-1-1","grok-4-5","claude-sonnet-5","glm-5-2","kimi-k2-7-code","fable-5","qwen3-7-max","nemotron-3-ultra","minimax-m3","claude-opus-4-8","gemini-3-5-flash","grok-build-0-1","grok-4-3","deepseek-v4-flash","deepseek-v4-pro","gpt-5-5","qwen3-6-27b","kimi-k2-6","claude-opus-4-7","qwen3-6-plus","gpt-5-4-mini","gpt-5-4-nano","gpt-5-4","gemini-3-1-pro-preview","claude-sonnet-4-6","minimax-m2-5","glm-5","claude-opus-4-6","kimi-k2-5"],"teams":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"score":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"]},"contradictions":[],"concordance":"Aucun test public dans le registre.","normalizedScore":{"domain":"cybersecurity","available":false,"edition":{"editionId":"origin-cybersecurity-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},"aggregation":null,"aggregationCoverage":{"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0.","candidateSources":[]}},{"id":"efficiency","label":"Efficacité","question":"Quel modèle pour maîtriser le coût ?","verdict":"Aucune équipe n’a encore publié de mesure comparable pour cet usage.","limitation":"Aucun score n’est estimé pour les modèles non mesurés.","viewMode":"empty","averageRank":null,"primaryFamilyId":null,"primaryFamilyLabel":null,"rankLabel":"Aucun rang","stars":0,"starsLabel":"Aucune mesure disponible","isTopTie":false,"families":[],"rows":[{"modelId":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weights":"open","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weights":"closed","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}},{"modelId":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weights":"not-published","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","measured":false,"independentTeams":0,"stars":0,"starsLabel":"Aucune mesure","rank":null,"averageRank":null,"normalizedScore":null,"rankLabel":"Non classé sur ce test","medal":null,"manufacturerOnly":false,"cells":{}}],"podiumModelIds":[],"sortOrders":{"rank":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"model":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"maker":["smaug-agentic","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","ling-3-0-flash-2607","fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","nemotron-3-ultra","nemotron-lightning-3-5","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","inkling","inkling-small","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","mimo-v2-5","mimo-v2-5-pro","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash"],"date":["glm-5-1","mimo-v2-5-pro","mimo-v2-5","inkling-small","qwen3-7-plus","minimax-m2-7","claude-haiku-4-5","gemini-3-flash-preview","mistral-medium-3-5","gemini-3-1-flash-lite-preview","nemotron-lightning-3-5","grok-4-20-0309-reasoning","ling-3-0-flash-2607","astra","gemini-3-8-flash","muse-spark-1-3","fable-5-1","glm-5-3-flash","qwen3-8-flash-next","deepseek-v4-flash-vision-exp","qwen3-8-27b","glm-5-3","deepseek-v4-pro-0813","gemini-3-7-flash","grok-4-6","smaug-agentic","muse-spark-1-2","qwen3-8-max","deepseek-v4-flash-0731","opus-5","gemini-3-5-flash-lite","gemini-3-6-flash","kimi-k3","inkling","sol","terra","luna","muse-spark-1-1","grok-4-5","claude-sonnet-5","glm-5-2","kimi-k2-7-code","fable-5","qwen3-7-max","nemotron-3-ultra","minimax-m3","claude-opus-4-8","gemini-3-5-flash","grok-build-0-1","grok-4-3","deepseek-v4-flash","deepseek-v4-pro","gpt-5-5","qwen3-6-27b","kimi-k2-6","claude-opus-4-7","qwen3-6-plus","gpt-5-4-mini","gpt-5-4-nano","gpt-5-4","gemini-3-1-pro-preview","claude-sonnet-4-6","minimax-m2-5","glm-5","claude-opus-4-6","kimi-k2-5"],"teams":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"],"score":["fable-5","fable-5-1","claude-haiku-4-5","claude-opus-4-6","claude-opus-4-7","claude-opus-4-8","opus-5","claude-sonnet-4-6","claude-sonnet-5","deepseek-v4-flash","deepseek-v4-flash-0731","deepseek-v4-flash-vision-exp","deepseek-v4-pro","deepseek-v4-pro-0813","gemini-3-flash-preview","gemini-3-1-flash-lite-preview","gemini-3-1-pro-preview","gemini-3-5-flash","gemini-3-5-flash-lite","gemini-3-6-flash","gemini-3-7-flash","gemini-3-8-flash","glm-5","glm-5-1","glm-5-2","glm-5-3","glm-5-3-flash","gpt-5-4","gpt-5-4-mini","gpt-5-4-nano","gpt-5-5","luna","sol","terra","astra","grok-4-20-0309-reasoning","grok-4-3","grok-4-5","grok-4-6","grok-build-0-1","inkling","inkling-small","kimi-k2-5","kimi-k2-6","kimi-k2-7-code","kimi-k3","ling-3-0-flash-2607","mimo-v2-5","mimo-v2-5-pro","minimax-m2-5","minimax-m2-7","minimax-m3","mistral-medium-3-5","muse-spark-1-1","muse-spark-1-2","muse-spark-1-3","nemotron-3-ultra","nemotron-lightning-3-5","qwen3-6-27b","qwen3-6-plus","qwen3-7-max","qwen3-7-plus","qwen3-8-27b","qwen3-8-flash-next","qwen3-8-max","smaug-agentic"]},"contradictions":[],"concordance":"Aucun test public dans le registre.","normalizedScore":{"domain":"efficiency","available":false,"edition":{"editionId":"origin-efficiency-2026-09-non-constituee","cutoffDate":"2026-09-04","status":"not-constituted","reason":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","snapshotFingerprint":"score-v1-741638a568efd6f9"},"panelModelIds":[],"qualifiedTests":[],"excludedTests":[],"partialModels":[],"scores":[],"coverage":{"minimumModelsPerTest":15,"minimumTestsPerModel":2,"minimumOrganizations":2,"testsReachingRawCoverage":0,"organizationCount":0,"referenceModelCount":0},"message":"Note Origin indisponible : Aucun test n’atteint encore le seuil pratique de 15 modèles pour constituer une référence.","method":"Position relative de 0 à 100 sur une référence figée, avec les mêmes tests pour tous les modèles"},"aggregation":null,"aggregationCoverage":{"solidSourceCount":0,"solidSourceCoverage":[],"sourceCount":0,"candidateSourceCount":0,"modelCount":0,"panelModelCount":0,"message":"Agrégation en attente de couverture, 0 modèles communs sur 0.","candidateSources":[]}}],"matrix":[{"usageId":"general","label":"Raisonnement général","leader":"Claude Fable 5.1","stars":2,"starsLabel":"Une équipe extérieure, confirmation manquante","source":"LiveBench : raisonnement"},{"usageId":"agentic","label":"Missions longues","leader":"Claude Fable 5.1","stars":2,"starsLabel":"Une équipe extérieure, confirmation manquante","source":"LiveBench : code autonome"},{"usageId":"coding","label":"Développement logiciel","leader":"Claude Fable 5.1","stars":3,"starsLabel":"3 organismes couvrent au moins 5 modèles ; 3 requis pour une preuve solide","source":"3 sources indépendantes"},{"usageId":"legal","label":"Juridique","leader":"GPT-6 Astra","stars":2,"starsLabel":"Une équipe extérieure, confirmation manquante","source":"APEX-Agents Corporate Lawyer, moyenne des critères"},{"usageId":"finance","label":"Finance et comptabilité","leader":"Claude Fable 5.1","stars":2,"starsLabel":"Une équipe extérieure, confirmation manquante","source":"APEX-Agents Investment Banking Analyst, moyenne des critères"},{"usageId":"healthcare","label":"Santé","leader":"Chiffres fabricant seulement","stars":0,"starsLabel":"Chiffres du fabricant seulement","source":"HealthBench Professional"},{"usageId":"mathScience","label":"Maths et sciences","leader":"Claude Fable 5.1","stars":2,"starsLabel":"Une équipe extérieure, confirmation manquante","source":"LiveBench : mathématiques"},{"usageId":"computerUse","label":"Usage d’ordinateur","leader":"Personne n’a mesuré","stars":0,"starsLabel":"Aucune mesure disponible","source":"Aucun test public"},{"usageId":"longContext","label":"Contexte long","leader":"Personne n’a mesuré","stars":0,"starsLabel":"Aucune mesure disponible","source":"Aucun test public"},{"usageId":"factuality","label":"Exactitude factuelle","leader":"GPT-6 Astra","stars":2,"starsLabel":"Une équipe extérieure, confirmation manquante","source":"AA-Omniscience, réponses inventées"},{"usageId":"vision","label":"Vision","leader":"Personne n’a mesuré","stars":0,"starsLabel":"Aucune mesure disponible","source":"Aucun test public"},{"usageId":"voice","label":"Voix","leader":"Personne n’a mesuré","stars":0,"starsLabel":"Aucune mesure disponible","source":"Aucun test public"},{"usageId":"education","label":"Éducation","leader":"Personne n’a mesuré","stars":0,"starsLabel":"Aucune mesure disponible","source":"Aucun test public"},{"usageId":"cybersecurity","label":"Cybersécurité","leader":"Personne n’a mesuré","stars":0,"starsLabel":"Aucune mesure disponible","source":"Aucun test public"},{"usageId":"efficiency","label":"Efficacité","leader":"Personne n’a mesuré","stars":0,"starsLabel":"Aucune mesure disponible","source":"Aucun test public"}],"modelSheets":[{"modelId":"astra","name":"GPT-6 Astra","maker":"OpenAI","releaseDate":"2026-09-03","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/safety-overview-gpt-6-astra/","price":{"modelId":"astra","inputPerMillion":10,"outputPerMillion":50,"currency":"USD","source":{"url":"https://developers.openai.com/api/docs/models/gpt-6-astra","accessedAt":"2026-09-06","publisher":"OpenAI"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API OpenAI","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":{"threshold":272000,"input":20,"output":75},"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"astra","amount":44.364548,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"astra-aa-intelligence","label":"Artificial Analysis Intelligence Index v4.1.1","display":"61 points","value":61,"unit":"index","dispersion":"Marge annoncée à 95 % : moins de ±1 point","sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Outils et réglages propres à chacun des neuf tests. Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %.","limitation":"Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.","visual":{"kind":"none"}},{"usageLabel":"Développement logiciel","observationId":"astra-aa-coding","label":"Artificial Analysis Coding Agent Index v1.4","display":"67 points","value":67,"unit":"index","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent Codex. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.","limitation":"Le score mesure GPT-6 Astra avec un agent précis. Changer cet agent peut changer le résultat.","visual":{"kind":"none"}},{"usageLabel":"Raisonnement général","observationId":"astra-epoch-eci","label":"Epoch Capabilities Index","display":"169 points Epoch","value":169,"unit":"index","dispersion":"Fourchette probable à 90 % : 165 à 174","sourceUrl":"https://epoch.ai/models/gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Sources mélangées","isManufacturer":false,"protocol":"Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants. Calcul tenant compte du niveau de difficulté de chaque test.","limitation":"Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.","visual":{"kind":"none"}},{"usageLabel":"Missions longues","observationId":"astra-arc-agi-3-standard","label":"ARC-AGI-3, tâches partiellement cachées, configuration standard","display":"62,7 %","value":62.71,"unit":"percent","dispersion":null,"sourceUrl":"https://arcprize.org/results/openai-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"ARC Prize","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Interface minimale commune, notes visibles gérées par le modèle. Objectifs atteints dans des environnements inconnus.","limitation":"Mesure ciblée d’apprentissage de règles nouvelles. Elle ne mesure pas un pourcentage d’intelligence générale.","visual":{"kind":"bar","valuePercent":62.71}},{"usageLabel":"Missions longues","observationId":"astra-arc-agi-3-adapter","label":"ARC-AGI-3, tâches partiellement cachées, configuration fournisseur","display":"99,9 %","value":99.95,"unit":"percent","dispersion":null,"sourceUrl":"https://arcprize.org/results/openai-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"ARC Prize","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"État de raisonnement opaque conservé et contexte compacté par le fournisseur. Objectifs atteints dans des environnements inconnus.","limitation":"Même série de tâches que la configuration standard. Ce résultat ne constitue pas une seconde confirmation indépendante.","visual":{"kind":"bar","valuePercent":99.95}},{"usageLabel":"Missions longues","observationId":"astra-apex-agents","label":"APEX-Agents","display":"62,4 %","value":62.4,"unit":"percent","dispersion":"± 3,6 points","sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions utilisant plusieurs applications de travail. Part moyenne des critères réussis.","limitation":"Les tâches et critères viennent de professionnels, mais une partie de la correction repose sur un autre modèle d’IA.","visual":{"kind":"interval","valuePercent":62.4,"lowPercent":58.8,"highPercent":66,"spanPercent":7.200000000000003}},{"usageLabel":"Juridique","observationId":"astra-apex-legal-mean-score","label":"APEX-Agents Corporate Lawyer, moyenne des critères","display":"67,9 % des critères réussis","value":67.9,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":67.9}},{"usageLabel":"Juridique","observationId":"astra-apex-legal-all-criteria","label":"APEX-Agents Corporate Lawyer, tâches sans erreur","display":"40,5 % des tâches entièrement réussies","value":40.5,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Part des tâches dont tous les critères passent.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":40.5}},{"usageLabel":"Finance et comptabilité","observationId":"astra-apex-finance-mean-score","label":"APEX-Agents Investment Banking Analyst, moyenne des critères","display":"52,0 % des critères réussis","value":52,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/investment-banking-analyst-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.","visual":{"kind":"bar","valuePercent":52}},{"usageLabel":"Maths et sciences","observationId":"astra-frontiermath-erdos","label":"FrontierMath Erdős","display":"3 %","value":3,"unit":"percent","dispersion":null,"sourceUrl":"https://epoch.ai/latest/announcing-frontiermath-erdos","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Agent sans internet, budget de 300 $ et 72 heures par problème. Preuve ou réfutation acceptée par Lean, un vérificateur mathématique.","limitation":"Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.","visual":{"kind":"bar","valuePercent":3}},{"usageLabel":"Santé","observationId":"astra-openai-healthbench-professional","label":"HealthBench Professional","display":"63,4 %","value":63.4,"unit":"percent","dispersion":null,"sourceUrl":"https://deploymentsafety.openai.com/gpt-6-astra/vision","sourceAccessedAt":"2026-09-04","organization":"OpenAI","sourceLabel":"Chiffre du fabricant","isManufacturer":true,"protocol":"Réponses produites dans HealthBench Professional. Score corrigé pour réduire l’avantage des réponses longues.","limitation":"OpenAI publie ce résultat sur ses propres modèles. Sans test extérieur, il ne suffit pas pour choisir un modèle en santé.","visual":{"kind":"bar","valuePercent":63.4}},{"usageLabel":"Exactitude factuelle","observationId":"astra-aa-omniscience-hallucination","label":"AA-Omniscience, réponses inventées","display":"51 % de réponses inventées","value":51,"unit":"percent","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Outils de l’Artificial Analysis Intelligence Index v4.1.1. Réponse incorrecte donnée au lieu d’une abstention.","limitation":"Le résultat dépend des questions choisies et d’une correction par un autre modèle d’IA. Il ne mesure pas toutes les formes d’erreur factuelle.","visual":{"kind":"bar","valuePercent":51}},{"usageLabel":"Développement logiciel","observationId":"astra-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"67,74 %","value":67.74,"unit":"percent","dispersion":"Erreur standard publiée : 4,216 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-6-astra. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":67.74}}]},{"modelId":"fable-5-1","name":"Claude Fable 5.1","maker":"Anthropic","releaseDate":"2026-09-01","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/claude-fable-and-mythos-5-1","price":{"modelId":"fable-5-1","inputPerMillion":10,"outputPerMillion":50,"currency":"USD","source":{"url":"https://platform.claude.com/docs/en/about-claude/pricing","accessedAt":"2026-09-06","publisher":"Anthropic"},"limitation":"Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis.","service":"API Anthropic","contextCondition":"Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens.","longContext":null,"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"fable-5-1","amount":70.973455,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"fable-5-1-aa-intelligence","label":"Artificial Analysis Intelligence Index v4.1.1","display":"66 points","value":66,"unit":"index","dispersion":"Marge annoncée à 95 % : moins de ±1 point","sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Outils et réglages propres à chacun des neuf tests. Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %.","limitation":"Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.","visual":{"kind":"none"}},{"usageLabel":"Développement logiciel","observationId":"fable-5-1-aa-coding","label":"Artificial Analysis Coding Agent Index v1.4","display":"70 points","value":70,"unit":"index","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.","limitation":"Le score mesure Claude Fable 5.1 avec un agent précis. Changer cet agent peut changer le résultat.","visual":{"kind":"none"}},{"usageLabel":"Développement logiciel","observationId":"fable-5-1-terminal-bench-4","label":"Terminal-Bench 4.0","display":"57,88 %","value":57.88,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 54,12 à 61,64 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-02-anthropic-claude-fable-5-1-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.257. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5-1. Date de sortie déclarée par Terminal-Bench : 2026-09-01. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":57.88,"lowPercent":54.12,"highPercent":61.64,"spanPercent":7.520000000000003}},{"usageLabel":"Raisonnement général","observationId":"fable-5-1-epoch-eci","label":"Epoch Capabilities Index","display":"163 points Epoch","value":163,"unit":"index","dispersion":"Fourchette probable à 90 % : 160 à 166","sourceUrl":"https://epoch.ai/models/claude-fable-5-1","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Sources mélangées","isManufacturer":false,"protocol":"Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants. Calcul tenant compte du niveau de difficulté de chaque test.","limitation":"Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.","visual":{"kind":"none"}},{"usageLabel":"Missions longues","observationId":"fable-5-1-apex-agents","label":"APEX-Agents","display":"62,0 %","value":62,"unit":"percent","dispersion":"± 3,5 points","sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions utilisant plusieurs applications de travail. Part moyenne des critères réussis.","limitation":"Les tâches et critères viennent de professionnels, mais une partie de la correction repose sur un autre modèle d’IA.","visual":{"kind":"interval","valuePercent":62,"lowPercent":58.5,"highPercent":65.5,"spanPercent":7}},{"usageLabel":"Juridique","observationId":"fable-5-1-apex-legal-mean-score","label":"APEX-Agents Corporate Lawyer, moyenne des critères","display":"64,8 % des critères réussis","value":64.8,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":64.8}},{"usageLabel":"Juridique","observationId":"fable-5-1-apex-legal-all-criteria","label":"APEX-Agents Corporate Lawyer, tâches sans erreur","display":"41,9 % des tâches entièrement réussies","value":41.9,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Part des tâches dont tous les critères passent.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":41.9}},{"usageLabel":"Finance et comptabilité","observationId":"fable-5-1-apex-finance-mean-score","label":"APEX-Agents Investment Banking Analyst, moyenne des critères","display":"55,7 % des critères réussis","value":55.7,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/investment-banking-analyst-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.","visual":{"kind":"bar","valuePercent":55.7}},{"usageLabel":"Maths et sciences","observationId":"fable-5-1-frontiermath-erdos","label":"FrontierMath Erdős","display":"0 %","value":0,"unit":"percent","dispersion":null,"sourceUrl":"https://epoch.ai/latest/announcing-frontiermath-erdos","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Agent sans internet, budget de 300 $ et 72 heures par problème. Preuve ou réfutation acceptée par Lean, un vérificateur mathématique.","limitation":"Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.","visual":{"kind":"bar","valuePercent":0}},{"usageLabel":"Raisonnement général","observationId":"fable-5-1-livebench-reasoning","label":"LiveBench : raisonnement","display":"91,7 %","value":91.6923,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.6923}},{"usageLabel":"Développement logiciel","observationId":"fable-5-1-livebench-coding","label":"LiveBench : code","display":"86,4 %","value":86.375,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.375}},{"usageLabel":"Missions longues","observationId":"fable-5-1-livebench-agentic-coding","label":"LiveBench : code autonome","display":"66,1 %","value":66.0607,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":66.0607}},{"usageLabel":"Maths et sciences","observationId":"fable-5-1-livebench-mathematics","label":"LiveBench : mathématiques","display":"97,0 %","value":97.0068,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":97.0068}},{"usageLabel":"Raisonnement général","observationId":"fable-5-1-livebench-data-analysis","label":"LiveBench : analyse de données","display":"80,3 %","value":80.2757,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":80.2757}},{"usageLabel":"Raisonnement général","observationId":"fable-5-1-livebench-language","label":"LiveBench : langue","display":"89,5 %","value":89.501,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.501}},{"usageLabel":"Raisonnement général","observationId":"fable-5-1-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"73,0 %","value":72.9878,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.9878}},{"usageLabel":"Développement logiciel","observationId":"fable-5-1-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"54,607 %","value":54.607,"unit":"percent","dispersion":"Erreur standard publiée : 4,812 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":54.607}}]},{"modelId":"fable-5","name":"Claude Fable 5","maker":"Anthropic","releaseDate":"2026-06-09","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-fable-5-mythos-5","price":null,"measuredCost":{"modelId":"fable-5","amount":112.098109,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"fable-5-aa-coding","label":"Artificial Analysis Coding Agent Index v1.4","display":"67 points","value":67,"unit":"index","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.","limitation":"Le score mesure Claude Fable 5 avec un agent précis. Changer cet agent peut changer le résultat.","visual":{"kind":"none"}},{"usageLabel":"Développement logiciel","observationId":"fable-5-terminal-bench-4","label":"Terminal-Bench 4.0","display":"44,55 %","value":44.55,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 40,70 à 48,40 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-fable-5-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-fable-5. Date de sortie déclarée par Terminal-Bench : 2026-06-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":44.55,"lowPercent":40.7,"highPercent":48.4,"spanPercent":7.699999999999996}},{"usageLabel":"Raisonnement général","observationId":"fable-5-livebench-reasoning","label":"LiveBench : raisonnement","display":"89,7 %","value":89.6538,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.6538}},{"usageLabel":"Développement logiciel","observationId":"fable-5-livebench-coding","label":"LiveBench : code","display":"86,0 %","value":85.992,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.992}},{"usageLabel":"Missions longues","observationId":"fable-5-livebench-agentic-coding","label":"LiveBench : code autonome","display":"62,2 %","value":62.1717,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.1717}},{"usageLabel":"Maths et sciences","observationId":"fable-5-livebench-mathematics","label":"LiveBench : mathématiques","display":"96,0 %","value":95.9858,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":95.9858}},{"usageLabel":"Raisonnement général","observationId":"fable-5-livebench-data-analysis","label":"LiveBench : analyse de données","display":"80,5 %","value":80.5377,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":80.5377}},{"usageLabel":"Raisonnement général","observationId":"fable-5-livebench-language","label":"LiveBench : langue","display":"90,7 %","value":90.684,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.684}},{"usageLabel":"Raisonnement général","observationId":"fable-5-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"75,8 %","value":75.7708,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.7708}},{"usageLabel":"Développement logiciel","observationId":"fable-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"55,065 %","value":55.065,"unit":"percent","dispersion":"Erreur standard publiée : 4,605 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Politique de repli non documentée entre les évaluateurs. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":55.065}}]},{"modelId":"opus-5","name":"Claude Opus 5","maker":"Anthropic","releaseDate":"2026-07-24","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-5","price":{"modelId":"opus-5","inputPerMillion":5,"outputPerMillion":25,"currency":"USD","source":{"url":"https://platform.claude.com/docs/en/about-claude/pricing","accessedAt":"2026-09-06","publisher":"Anthropic"},"limitation":"Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis.","service":"API Anthropic","contextCondition":"Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens.","longContext":null,"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"opus-5","amount":60.509587,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"opus-5-aa-coding","label":"Artificial Analysis Coding Agent Index v1.4","display":"68 points","value":68,"unit":"index","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent Claude Code. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.","limitation":"Le score mesure Claude Opus 5 avec un agent précis. Changer cet agent peut changer le résultat.","visual":{"kind":"none"}},{"usageLabel":"Développement logiciel","observationId":"opus-5-terminal-bench-4","label":"Terminal-Bench 4.0","display":"51,82 %","value":51.82,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 48,43 à 55,21 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-opus-5-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-5. Date de sortie déclarée par Terminal-Bench : 2026-07-24. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":51.82,"lowPercent":48.43,"highPercent":55.21,"spanPercent":6.780000000000001}},{"usageLabel":"Raisonnement général","observationId":"opus-5-livebench-reasoning","label":"LiveBench : raisonnement","display":"91,2 %","value":91.2115,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.2115}},{"usageLabel":"Développement logiciel","observationId":"opus-5-livebench-coding","label":"LiveBench : code","display":"81,4 %","value":81.4455,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.4455}},{"usageLabel":"Missions longues","observationId":"opus-5-livebench-agentic-coding","label":"LiveBench : code autonome","display":"65,2 %","value":65.202,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.202}},{"usageLabel":"Maths et sciences","observationId":"opus-5-livebench-mathematics","label":"LiveBench : mathématiques","display":"95,7 %","value":95.731,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":95.731}},{"usageLabel":"Raisonnement général","observationId":"opus-5-livebench-data-analysis","label":"LiveBench : analyse de données","display":"74,6 %","value":74.5503,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.5503}},{"usageLabel":"Raisonnement général","observationId":"opus-5-livebench-language","label":"LiveBench : langue","display":"88,7 %","value":88.688,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.688}},{"usageLabel":"Raisonnement général","observationId":"opus-5-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"63,8 %","value":63.7665,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.7665}},{"usageLabel":"Développement logiciel","observationId":"opus-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"57,473 %","value":57.473,"unit":"percent","dispersion":"Erreur standard publiée : 4,371 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":57.473}}]},{"modelId":"sol","name":"GPT-5.6 Sol","maker":"OpenAI","releaseDate":"2026-07-09","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","price":{"modelId":"sol","inputPerMillion":4,"outputPerMillion":20,"currency":"USD","source":{"url":"https://developers.openai.com/api/docs/models/gpt-5.6-sol","accessedAt":"2026-09-06","publisher":"OpenAI"},"limitation":"Promotion annoncée au moins jusqu’au 21 novembre 2026 ; tarif ultérieur non publié. Hors outils et options de traitement facturés séparément.","service":"API OpenAI","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":{"threshold":272000,"input":8,"output":30},"promotion":{"until":"2026-11-21","after":null},"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"sol","amount":24.541448,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"sol-aa-intelligence","label":"Artificial Analysis Intelligence Index v4.1.1","display":"61 points","value":61,"unit":"index","dispersion":"Marge annoncée à 95 % : moins de ±1 point","sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Outils et réglages propres à chacun des neuf tests. Moyenne pondérée : missions autonomes 34 %, logiciel 24 %, sciences 24 %, général 18 %.","limitation":"Cet indice combine plusieurs tests, dont certains sont aussi publiés séparément. Il ne compte donc que comme une seule preuve.","visual":{"kind":"none"}},{"usageLabel":"Développement logiciel","observationId":"sol-aa-coding","label":"Artificial Analysis Coding Agent Index v1.4","display":"65 points","value":65,"unit":"index","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent Codex. Moyenne de trois séries de tâches, chaque tâche étant réussie ou échouée.","limitation":"Le score mesure GPT-5.6 Sol avec un agent précis. Changer cet agent peut changer le résultat.","visual":{"kind":"none"}},{"usageLabel":"Développement logiciel","observationId":"sol-terminal-bench-4","label":"Terminal-Bench 4.0","display":"37,27 %","value":37.27,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 33,49 à 41,05 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-sol-max-codex.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-sol. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":37.27,"lowPercent":33.49,"highPercent":41.05,"spanPercent":7.559999999999995}},{"usageLabel":"Raisonnement général","observationId":"sol-epoch-eci","label":"Epoch Capabilities Index","display":"162 points Epoch","value":162,"unit":"index","dispersion":"Fourchette probable à 90 % : 160 à 165","sourceUrl":"https://epoch.ai/models/gpt-5-6-sol","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Sources mélangées","isManufacturer":false,"protocol":"Regroupement de résultats venant d’Epoch, d’autres équipes et des fabricants. Calcul tenant compte du niveau de difficulté de chaque test.","limitation":"Cette synthèse ne vaut pas cinquante études indépendantes. Certains chiffres viennent des fabricants et le meilleur réglage est retenu.","visual":{"kind":"none"}},{"usageLabel":"Juridique","observationId":"sol-apex-legal-mean-score","label":"APEX-Agents Corporate Lawyer, moyenne des critères","display":"63,4 % des critères réussis","value":63.4,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":63.4}},{"usageLabel":"Juridique","observationId":"sol-apex-legal-all-criteria","label":"APEX-Agents Corporate Lawyer, tâches sans erreur","display":"35,6 % des tâches entièrement réussies","value":35.6,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/corporate-lawyer-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Part des tâches dont tous les critères passent.","limitation":"Les deux façons de compter portent sur les mêmes tâches et inversent la première place. Elles restent une seule preuve extérieure.","visual":{"kind":"bar","valuePercent":35.6}},{"usageLabel":"Finance et comptabilité","observationId":"sol-apex-finance-mean-score","label":"APEX-Agents Investment Banking Analyst, moyenne des critères","display":"46,6 % des critères réussis","value":46.6,"unit":"percent","dispersion":null,"sourceUrl":"https://www.mercor.com/apex/apex-agents-leaderboard/investment-banking-analyst-agent/","sourceAccessedAt":"2026-09-04","organization":"Mercor","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Agent en boucle d’actions avec outils et documents professionnels. Moyenne des critères réussis.","limitation":"Un seul test extérieur est publié pour ce domaine. Origin affiche ici la moyenne des critères réussis.","visual":{"kind":"bar","valuePercent":46.6}},{"usageLabel":"Maths et sciences","observationId":"sol-frontiermath-erdos","label":"FrontierMath Erdős","display":"0 %","value":0,"unit":"percent","dispersion":null,"sourceUrl":"https://epoch.ai/latest/announcing-frontiermath-erdos","sourceAccessedAt":"2026-09-04","organization":"Epoch AI","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Agent sans internet, budget de 300 $ et 72 heures par problème. Preuve ou réfutation acceptée par Lean, un vérificateur mathématique.","limitation":"Une seule tentative par problème et très peu de succès. Le résultat ne représente pas toutes les mathématiques.","visual":{"kind":"bar","valuePercent":0}},{"usageLabel":"Santé","observationId":"sol-openai-healthbench-professional","label":"HealthBench Professional","display":"60,5 %","value":60.5,"unit":"percent","dispersion":null,"sourceUrl":"https://deploymentsafety.openai.com/gpt-6-astra/vision","sourceAccessedAt":"2026-09-04","organization":"OpenAI","sourceLabel":"Chiffre du fabricant","isManufacturer":true,"protocol":"Réponses produites dans HealthBench Professional. Score corrigé pour réduire l’avantage des réponses longues.","limitation":"OpenAI publie ce résultat sur ses propres modèles. Sans test extérieur, il ne suffit pas pour choisir un modèle en santé.","visual":{"kind":"bar","valuePercent":60.5}},{"usageLabel":"Exactitude factuelle","observationId":"sol-aa-omniscience-hallucination","label":"AA-Omniscience, réponses inventées","display":"92 % de réponses inventées","value":92,"unit":"percent","dispersion":null,"sourceUrl":"https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra","sourceAccessedAt":"2026-09-04","organization":"Artificial Analysis","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Outils de l’Artificial Analysis Intelligence Index v4.1.1. Réponse incorrecte donnée au lieu d’une abstention.","limitation":"Le résultat dépend des questions choisies et d’une correction par un autre modèle d’IA. Il ne mesure pas toutes les formes d’erreur factuelle.","visual":{"kind":"bar","valuePercent":92}},{"usageLabel":"Raisonnement général","observationId":"sol-livebench-reasoning","label":"LiveBench : raisonnement","display":"91,7 %","value":91.6538,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.6538}},{"usageLabel":"Développement logiciel","observationId":"sol-livebench-coding","label":"LiveBench : code","display":"83,9 %","value":83.941,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.941}},{"usageLabel":"Missions longues","observationId":"sol-livebench-agentic-coding","label":"LiveBench : code autonome","display":"56,2 %","value":56.212,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":56.212}},{"usageLabel":"Maths et sciences","observationId":"sol-livebench-mathematics","label":"LiveBench : mathématiques","display":"96,2 %","value":96.1978,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":96.1978}},{"usageLabel":"Raisonnement général","observationId":"sol-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,8 %","value":79.8407,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.8407}},{"usageLabel":"Raisonnement général","observationId":"sol-livebench-language","label":"LiveBench : langue","display":"87,7 %","value":87.6837,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.6837}},{"usageLabel":"Raisonnement général","observationId":"sol-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,8 %","value":71.846,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.846}},{"usageLabel":"Développement logiciel","observationId":"sol-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"52,916 %","value":52.916,"unit":"percent","dispersion":"Erreur standard publiée : 4,353 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":52.916}}]},{"modelId":"minimax-m2-5","name":"MiniMax M2.5","maker":"MiniMax","releaseDate":"2026-02-12","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.minimax.io/models/text","price":null,"measuredCost":null,"results":[{"usageLabel":"Développement logiciel","observationId":"minimax-m2-5-swe-bench-verified","label":"SWE-bench Verified","display":"75,8 %","value":75.8,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_minimax-2-5-high/metadata.yaml","sourceAccessedAt":"2026-09-04","organization":"SWE-bench","sourceLabel":"Origine d’exécution non vérifiée","isManufacturer":false,"protocol":"mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.","limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 379 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"bar","valuePercent":75.8}}]},{"modelId":"claude-opus-4-6","name":"Claude Opus 4.6","maker":"Anthropic","releaseDate":"2026-02-05","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-6","price":null,"measuredCost":null,"results":[{"usageLabel":"Développement logiciel","observationId":"claude-opus-4-6-swe-bench-verified","label":"SWE-bench Verified","display":"75,6 %","value":75.6,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_claude-4-6-opus/metadata.yaml","sourceAccessedAt":"2026-09-04","organization":"SWE-bench","sourceLabel":"Origine d’exécution non vérifiée","isManufacturer":false,"protocol":"mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.","limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 378 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Valeur révisée de 75,4 à 75,6 % le 18 février 2026 : https://github.com/SWE-bench/experiments/commit/36905bfeb728dadd82a75bb169ed612aac634551. Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"bar","valuePercent":75.6}},{"usageLabel":"Raisonnement général","observationId":"claude-opus-4-6-livebench-reasoning","label":"LiveBench : raisonnement","display":"88,7 %","value":88.673,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.673}},{"usageLabel":"Développement logiciel","observationId":"claude-opus-4-6-livebench-coding","label":"LiveBench : code","display":"78,2 %","value":78.1845,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.1845}},{"usageLabel":"Missions longues","observationId":"claude-opus-4-6-livebench-agentic-coding","label":"LiveBench : code autonome","display":"49,0 %","value":48.9897,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":48.9897}},{"usageLabel":"Maths et sciences","observationId":"claude-opus-4-6-livebench-mathematics","label":"LiveBench : mathématiques","display":"89,3 %","value":89.317,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.317}},{"usageLabel":"Raisonnement général","observationId":"claude-opus-4-6-livebench-data-analysis","label":"LiveBench : analyse de données","display":"69,9 %","value":69.893,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.893}},{"usageLabel":"Raisonnement général","observationId":"claude-opus-4-6-livebench-language","label":"LiveBench : langue","display":"83,3 %","value":83.2697,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.2697}},{"usageLabel":"Raisonnement général","observationId":"claude-opus-4-6-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"63,3 %","value":63.3125,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.3125}}]},{"modelId":"glm-5","name":"GLM 5","maker":"Z.ai","releaseDate":"2026-02-12","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5","price":null,"measuredCost":null,"results":[{"usageLabel":"Développement logiciel","observationId":"glm-5-swe-bench-verified","label":"SWE-bench Verified","display":"72,8 %","value":72.8,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_glm-5-high/metadata.yaml","sourceAccessedAt":"2026-09-04","organization":"SWE-bench","sourceLabel":"Origine d’exécution non vérifiée","isManufacturer":false,"protocol":"mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.","limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 364 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"bar","valuePercent":72.8}}]},{"modelId":"kimi-k2-5","name":"Kimi K2.5","maker":"Moonshot AI","releaseDate":"2026-01-27","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://www.kimi.com/en/blog/kimi-k2-5","price":null,"measuredCost":{"modelId":"kimi-k2-5","amount":0.926909,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"kimi-k2-5-swe-bench-verified","label":"SWE-bench Verified","display":"70,8 %","value":70.8,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/SWE-bench/experiments/blob/40f164d5b8f1d249bf95a6df8b74b577fd8e519d/evaluation/verified/20260217_mini-v2.0.0_kimi-k2-5-high/metadata.yaml","sourceAccessedAt":"2026-09-04","organization":"SWE-bench","sourceLabel":"Origine d’exécution non vérifiée","isManufacturer":false,"protocol":"mini-SWE-agent 2.0.0. Part des 500 problèmes de dépôt résolus.","limitation":"Le jeu de problèmes est public et la mesure repose sur une tentative. Le dépôt détaille 354 réussites sur 500. Date d’exécution non publiée. Première publication le 17 février 2026, PR 413 fusionnée à 17:24 UTC (https://github.com/SWE-bench/experiments/pull/413). Le 1er septembre 2026 correspond à une migration de chemin, pas à la première publication. Origine non vérifiée : exécution soumise par un membre de l’organisation, non marquée comme contrôlée par l’équipe selon sa propre légende. Une publication par un mainteneur ne prouve pas qui a exécuté le test. 4 sur 13 résultats de la cohorte mini-SWE-agent 2.0.0 de février 2026 sont affichés. Neuf autres résultats restent hors de ce lot de collecte, sans exclusion fondée sur leur année de sortie. Contexte distinct : 47 résultats Bash Only et 180 Verified sur https://www.swebench.com/, consulté le 2026-09-04. Ces nombres ne décrivent pas une couverture complète par Origin. Relation commerciale : aucun contrat commercial décrit par la source. Open Philanthropy : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. AWS : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Modal : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Andreessen Horowitz : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. OpenAI : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Anthropic : soutien déclaré, https://www.swebench.com/, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"bar","valuePercent":70.8}},{"usageLabel":"Développement logiciel","observationId":"kimi-k2-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"6,962 %","value":6.962,"unit":"percent","dispersion":"Erreur standard publiée : 1,29 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/moonshotai/kimi-k2.5-0127/endpoints. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":6.962}}]},{"modelId":"claude-opus-4-7","name":"Claude Opus 4.7","maker":"Anthropic","releaseDate":"2026-04-16","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-7","price":null,"measuredCost":{"modelId":"claude-opus-4-7","amount":36.387681,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"claude-opus-4-7-livebench-reasoning","label":"LiveBench : raisonnement","display":"87,2 %","value":87.1923,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.1923}},{"usageLabel":"Développement logiciel","observationId":"claude-opus-4-7-livebench-coding","label":"LiveBench : code","display":"82,1 %","value":82.088,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.088}},{"usageLabel":"Missions longues","observationId":"claude-opus-4-7-livebench-agentic-coding","label":"LiveBench : code autonome","display":"50,7 %","value":50.6563,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":50.6563}},{"usageLabel":"Maths et sciences","observationId":"claude-opus-4-7-livebench-mathematics","label":"LiveBench : mathématiques","display":"92,9 %","value":92.8538,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":92.8538}},{"usageLabel":"Raisonnement général","observationId":"claude-opus-4-7-livebench-data-analysis","label":"LiveBench : analyse de données","display":"78,3 %","value":78.2637,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.2637}},{"usageLabel":"Raisonnement général","observationId":"claude-opus-4-7-livebench-language","label":"LiveBench : langue","display":"77,9 %","value":77.914,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.914}},{"usageLabel":"Raisonnement général","observationId":"claude-opus-4-7-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"66,7 %","value":66.7375,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":66.7375}},{"usageLabel":"Développement logiciel","observationId":"claude-opus-4-7-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"43,878 %","value":43.878,"unit":"percent","dispersion":"Erreur standard publiée : 4,22 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":43.878}}]},{"modelId":"claude-sonnet-4-6","name":"Claude Sonnet 4.6","maker":"Anthropic","releaseDate":"2026-02-17","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-4-6","price":null,"measuredCost":{"modelId":"claude-sonnet-4-6","amount":38.507642,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"claude-sonnet-4-6-livebench-reasoning","label":"LiveBench : raisonnement","display":"84,8 %","value":84.7693,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.7693}},{"usageLabel":"Développement logiciel","observationId":"claude-sonnet-4-6-livebench-coding","label":"LiveBench : code","display":"79,3 %","value":79.2715,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.2715}},{"usageLabel":"Missions longues","observationId":"claude-sonnet-4-6-livebench-agentic-coding","label":"LiveBench : code autonome","display":"42,6 %","value":42.626,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":42.626}},{"usageLabel":"Maths et sciences","observationId":"claude-sonnet-4-6-livebench-mathematics","label":"LiveBench : mathématiques","display":"87,0 %","value":86.994,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.994}},{"usageLabel":"Raisonnement général","observationId":"claude-sonnet-4-6-livebench-data-analysis","label":"LiveBench : analyse de données","display":"77,9 %","value":77.946,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.946}},{"usageLabel":"Raisonnement général","observationId":"claude-sonnet-4-6-livebench-language","label":"LiveBench : langue","display":"76,1 %","value":76.1027,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.1027}},{"usageLabel":"Raisonnement général","observationId":"claude-sonnet-4-6-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"63,2 %","value":63.2208,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.2208}},{"usageLabel":"Développement logiciel","observationId":"claude-sonnet-4-6-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"39,892 %","value":39.892,"unit":"percent","dispersion":"Erreur standard publiée : 4,138 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":39.892}}]},{"modelId":"claude-sonnet-5","name":"Claude Sonnet 5","maker":"Anthropic","releaseDate":"2026-06-30","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-sonnet-5","price":null,"measuredCost":{"modelId":"claude-sonnet-5","amount":52.965657,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"claude-sonnet-5-terminal-bench-4","label":"Terminal-Bench 4.0","display":"12,42 %","value":12.42,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 9,36 à 15,48 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-sonnet-5-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-sonnet-5. Date de sortie déclarée par Terminal-Bench : 2026-06-30. Efforts différents : max chez Terminal-Bench, xhigh chez LiveBench. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":12.42,"lowPercent":9.36,"highPercent":15.48,"spanPercent":6.120000000000001}},{"usageLabel":"Raisonnement général","observationId":"claude-sonnet-5-livebench-reasoning","label":"LiveBench : raisonnement","display":"88,7 %","value":88.6923,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.6923}},{"usageLabel":"Développement logiciel","observationId":"claude-sonnet-5-livebench-coding","label":"LiveBench : code","display":"80,7 %","value":80.68,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":80.68}},{"usageLabel":"Missions longues","observationId":"claude-sonnet-5-livebench-agentic-coding","label":"LiveBench : code autonome","display":"59,4 %","value":59.394,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":59.394}},{"usageLabel":"Maths et sciences","observationId":"claude-sonnet-5-livebench-mathematics","label":"LiveBench : mathématiques","display":"92,9 %","value":92.9423,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":92.9423}},{"usageLabel":"Raisonnement général","observationId":"claude-sonnet-5-livebench-data-analysis","label":"LiveBench : analyse de données","display":"71,7 %","value":71.7407,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.7407}},{"usageLabel":"Raisonnement général","observationId":"claude-sonnet-5-livebench-language","label":"LiveBench : langue","display":"75,0 %","value":74.9703,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.9703}},{"usageLabel":"Raisonnement général","observationId":"claude-sonnet-5-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"63,9 %","value":63.8585,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.8585}},{"usageLabel":"Développement logiciel","observationId":"claude-sonnet-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"44,392 %","value":44.392,"unit":"percent","dispersion":"Erreur standard publiée : 4,246 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":44.392}}]},{"modelId":"deepseek-v4-flash","name":"DeepSeek V4 Flash","maker":"DeepSeek","releaseDate":"2026-04-24","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash","price":null,"measuredCost":null,"results":[{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"70,6 %","value":70.5818,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.5818}},{"usageLabel":"Développement logiciel","observationId":"deepseek-v4-flash-livebench-coding","label":"LiveBench : code","display":"69,2 %","value":69.228,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.228}},{"usageLabel":"Missions longues","observationId":"deepseek-v4-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"37,6 %","value":37.626,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":37.626}},{"usageLabel":"Maths et sciences","observationId":"deepseek-v4-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"79,6 %","value":79.6475,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.6475}},{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"68,0 %","value":68.023,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":68.023}},{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-flash-livebench-language","label":"LiveBench : langue","display":"70,1 %","value":70.124,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.124}},{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"63,1 %","value":63.1375,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.1375}}]},{"modelId":"deepseek-v4-pro","name":"DeepSeek V4 Pro","maker":"DeepSeek","releaseDate":"2026-04-24","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro","price":null,"measuredCost":{"modelId":"deepseek-v4-pro","amount":1.071016,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-pro-livebench-reasoning","label":"LiveBench : raisonnement","display":"82,7 %","value":82.6923,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.6923}},{"usageLabel":"Développement logiciel","observationId":"deepseek-v4-pro-livebench-coding","label":"LiveBench : code","display":"70,0 %","value":69.994,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.994}},{"usageLabel":"Missions longues","observationId":"deepseek-v4-pro-livebench-agentic-coding","label":"LiveBench : code autonome","display":"42,6 %","value":42.626,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":42.626}},{"usageLabel":"Maths et sciences","observationId":"deepseek-v4-pro-livebench-mathematics","label":"LiveBench : mathématiques","display":"90,7 %","value":90.6755,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.6755}},{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-pro-livebench-data-analysis","label":"LiveBench : analyse de données","display":"74,5 %","value":74.5377,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.5377}},{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-pro-livebench-language","label":"LiveBench : langue","display":"78,1 %","value":78.1303,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.1303}},{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-pro-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"62,4 %","value":62.35,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.35}},{"usageLabel":"Développement logiciel","observationId":"deepseek-v4-pro-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"26,201 %","value":26.201,"unit":"percent","dispersion":"Erreur standard publiée : 4,037 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-pro-20260423/endpoints. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":26.201}}]},{"modelId":"gemini-3-1-pro-preview","name":"Gemini 3.1 Pro Preview","maker":"Google","releaseDate":"2026-02-19","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","price":{"modelId":"gemini-3-1-pro-preview","inputPerMillion":2,"outputPerMillion":12,"currency":"USD","source":{"url":"https://ai.google.dev/gemini-api/docs/pricing","accessedAt":"2026-09-06","publisher":"Google"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API Google","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":{"threshold":200000,"input":4,"output":18},"promotion":null,"reasoningBilling":"Les tokens de réflexion sont inclus dans les tokens facturés en sortie.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"gemini-3-1-pro-preview","amount":1.614622,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"gemini-3-1-pro-preview-livebench-reasoning","label":"LiveBench : raisonnement","display":"84,0 %","value":84.0048,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.0048}},{"usageLabel":"Développement logiciel","observationId":"gemini-3-1-pro-preview-livebench-coding","label":"LiveBench : code","display":"76,5 %","value":76.4545,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.4545}},{"usageLabel":"Missions longues","observationId":"gemini-3-1-pro-preview-livebench-agentic-coding","label":"LiveBench : code autonome","display":"44,1 %","value":44.1413,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":44.1413}},{"usageLabel":"Maths et sciences","observationId":"gemini-3-1-pro-preview-livebench-mathematics","label":"LiveBench : mathématiques","display":"91,0 %","value":91.045,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.045}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-1-pro-preview-livebench-data-analysis","label":"LiveBench : analyse de données","display":"78,5 %","value":78.5413,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.5413}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-1-pro-preview-livebench-language","label":"LiveBench : langue","display":"85,4 %","value":85.376,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.376}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-1-pro-preview-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"79,1 %","value":79.1,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.1}},{"usageLabel":"Développement logiciel","observationId":"gemini-3-1-pro-preview-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"17,313 %","value":17.313,"unit":"percent","dispersion":"Erreur standard publiée : 3,933 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":17.313}}]},{"modelId":"gemini-3-5-flash","name":"Gemini 3.5 Flash","maker":"Google","releaseDate":"2026-05-19","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","price":{"modelId":"gemini-3-5-flash","inputPerMillion":1.5,"outputPerMillion":9,"currency":"USD","source":{"url":"https://ai.google.dev/gemini-api/docs/pricing","accessedAt":"2026-09-06","publisher":"Google"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API Google","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":null,"promotion":null,"reasoningBilling":"Les tokens de réflexion sont inclus dans les tokens facturés en sortie.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"gemini-3-5-flash","amount":5.725122,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"gemini-3-5-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"82,0 %","value":82.0048,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.0048}},{"usageLabel":"Développement logiciel","observationId":"gemini-3-5-flash-livebench-coding","label":"LiveBench : code","display":"78,2 %","value":78.1845,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.1845}},{"usageLabel":"Missions longues","observationId":"gemini-3-5-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"49,0 %","value":48.9897,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":48.9897}},{"usageLabel":"Maths et sciences","observationId":"gemini-3-5-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"88,2 %","value":88.2438,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.2438}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-5-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"64,9 %","value":64.8573,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.8573}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-5-flash-livebench-language","label":"LiveBench : langue","display":"84,6 %","value":84.5843,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.5843}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-5-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"75,6 %","value":75.6,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.6}},{"usageLabel":"Développement logiciel","observationId":"gemini-3-5-flash-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"26,745 %","value":26.745,"unit":"percent","dispersion":"Erreur standard publiée : 4,104 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":26.745}}]},{"modelId":"glm-5-2","name":"GLM 5.2","maker":"Z.ai","releaseDate":"2026-06-17","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.2","price":null,"measuredCost":{"modelId":"glm-5-2","amount":12.635818,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"glm-5-2-livebench-reasoning","label":"LiveBench : raisonnement","display":"78,6 %","value":78.625,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.625}},{"usageLabel":"Développement logiciel","observationId":"glm-5-2-livebench-coding","label":"LiveBench : code","display":"79,7 %","value":79.654,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.654}},{"usageLabel":"Missions longues","observationId":"glm-5-2-livebench-agentic-coding","label":"LiveBench : code autonome","display":"51,8 %","value":51.7677,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":51.7677}},{"usageLabel":"Maths et sciences","observationId":"glm-5-2-livebench-mathematics","label":"LiveBench : mathématiques","display":"89,8 %","value":89.7813,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.7813}},{"usageLabel":"Raisonnement général","observationId":"glm-5-2-livebench-data-analysis","label":"LiveBench : analyse de données","display":"73,7 %","value":73.7397,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.7397}},{"usageLabel":"Raisonnement général","observationId":"glm-5-2-livebench-language","label":"LiveBench : langue","display":"76,2 %","value":76.2417,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.2417}},{"usageLabel":"Raisonnement général","observationId":"glm-5-2-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"62,3 %","value":62.2918,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.2918}},{"usageLabel":"Développement logiciel","observationId":"glm-5-2-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"37,87 %","value":37.87,"unit":"percent","dispersion":"Erreur standard publiée : 4,143 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.2. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":37.87}}]},{"modelId":"gpt-5-4-mini","name":"GPT-5.4 mini","maker":"OpenAI","releaseDate":"2026-03-17","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","price":{"modelId":"gpt-5-4-mini","inputPerMillion":0.75,"outputPerMillion":4.5,"currency":"USD","source":{"url":"https://developers.openai.com/api/docs/models/gpt-5.4-mini","accessedAt":"2026-09-06","publisher":"OpenAI"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API OpenAI","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":null,"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"gpt-5-4-mini","amount":1.953198,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"gpt-5-4-mini-livebench-reasoning","label":"LiveBench : raisonnement","display":"71,3 %","value":71.3238,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.3238}},{"usageLabel":"Développement logiciel","observationId":"gpt-5-4-mini-livebench-coding","label":"LiveBench : code","display":"71,6 %","value":71.624,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.624}},{"usageLabel":"Missions longues","observationId":"gpt-5-4-mini-livebench-agentic-coding","label":"LiveBench : code autonome","display":"41,7 %","value":41.6667,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":41.6667}},{"usageLabel":"Maths et sciences","observationId":"gpt-5-4-mini-livebench-mathematics","label":"LiveBench : mathématiques","display":"78,5 %","value":78.462,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.462}},{"usageLabel":"Raisonnement général","observationId":"gpt-5-4-mini-livebench-data-analysis","label":"LiveBench : analyse de données","display":"70,8 %","value":70.7857,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.7857}},{"usageLabel":"Raisonnement général","observationId":"gpt-5-4-mini-livebench-language","label":"LiveBench : langue","display":"71,0 %","value":70.9517,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.9517}},{"usageLabel":"Raisonnement général","observationId":"gpt-5-4-mini-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"59,8 %","value":59.804,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":59.804}},{"usageLabel":"Développement logiciel","observationId":"gpt-5-4-mini-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"12,936 %","value":12.936,"unit":"percent","dispersion":"Erreur standard publiée : 3,641 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-mini. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":12.936}}]},{"modelId":"gpt-5-4-nano","name":"GPT-5.4 nano","maker":"OpenAI","releaseDate":"2026-03-17","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4-mini-and-nano/","price":null,"measuredCost":{"modelId":"gpt-5-4-nano","amount":0.416225,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"gpt-5-4-nano-livebench-reasoning","label":"LiveBench : raisonnement","display":"81,1 %","value":81.097,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.097}},{"usageLabel":"Développement logiciel","observationId":"gpt-5-4-nano-livebench-coding","label":"LiveBench : code","display":"70,8 %","value":70.8385,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.8385}},{"usageLabel":"Missions longues","observationId":"gpt-5-4-nano-livebench-agentic-coding","label":"LiveBench : code autonome","display":"46,8 %","value":46.7677,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":46.7677}},{"usageLabel":"Maths et sciences","observationId":"gpt-5-4-nano-livebench-mathematics","label":"LiveBench : mathématiques","display":"91,0 %","value":90.977,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.977}},{"usageLabel":"Raisonnement général","observationId":"gpt-5-4-nano-livebench-data-analysis","label":"LiveBench : analyse de données","display":"67,6 %","value":67.6427,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":67.6427}},{"usageLabel":"Raisonnement général","observationId":"gpt-5-4-nano-livebench-language","label":"LiveBench : langue","display":"62,5 %","value":62.507,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.507}},{"usageLabel":"Raisonnement général","observationId":"gpt-5-4-nano-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"67,2 %","value":67.2048,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":67.2048}},{"usageLabel":"Développement logiciel","observationId":"gpt-5-4-nano-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"14,467 %","value":14.467,"unit":"percent","dispersion":"Erreur standard publiée : 4,025 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Efforts différents entre Vals et LiveBench. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4-nano. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":14.467}}]},{"modelId":"gpt-5-4","name":"GPT-5.4","maker":"OpenAI","releaseDate":"2026-03-05","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/introducing-gpt-5-4/","price":{"modelId":"gpt-5-4","inputPerMillion":2.5,"outputPerMillion":15,"currency":"USD","source":{"url":"https://developers.openai.com/api/docs/models/gpt-5.4","accessedAt":"2026-09-06","publisher":"OpenAI"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API OpenAI","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":{"threshold":272000,"input":5,"output":22.5},"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"gpt-5-4","amount":7.756561,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"gpt-5-4-livebench-reasoning","label":"LiveBench : raisonnement","display":"88,1 %","value":88.1155,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.1155}},{"usageLabel":"Développement logiciel","observationId":"gpt-5-4-livebench-coding","label":"LiveBench : code","display":"77,5 %","value":77.5415,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.5415}},{"usageLabel":"Missions longues","observationId":"gpt-5-4-livebench-agentic-coding","label":"LiveBench : code autonome","display":"53,8 %","value":53.8383,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":53.8383}},{"usageLabel":"Maths et sciences","observationId":"gpt-5-4-livebench-mathematics","label":"LiveBench : mathématiques","display":"94,1 %","value":94.148,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":94.148}},{"usageLabel":"Raisonnement général","observationId":"gpt-5-4-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,3 %","value":79.3133,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.3133}},{"usageLabel":"Raisonnement général","observationId":"gpt-5-4-livebench-language","label":"LiveBench : langue","display":"82,6 %","value":82.6337,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.6337}},{"usageLabel":"Raisonnement général","observationId":"gpt-5-4-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"70,2 %","value":70.2168,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.2168}},{"usageLabel":"Développement logiciel","observationId":"gpt-5-4-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"34,984 %","value":34.984,"unit":"percent","dispersion":"Erreur standard publiée : 4,113 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.4. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":34.984}}]},{"modelId":"gpt-5-5","name":"GPT-5.5","maker":"OpenAI","releaseDate":"2026-04-23","weightsLabel":"Poids fermés","weightsSourceUrl":"https://platform.openai.com/docs/models/gpt-5.5","price":{"modelId":"gpt-5-5","inputPerMillion":5,"outputPerMillion":30,"currency":"USD","source":{"url":"https://developers.openai.com/api/docs/models/gpt-5.5","accessedAt":"2026-09-06","publisher":"OpenAI"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API OpenAI","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":{"threshold":272000,"input":10,"output":45},"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"gpt-5-5","amount":6.442253,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"gpt-5-5-livebench-reasoning","label":"LiveBench : raisonnement","display":"89,7 %","value":89.6538,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.6538}},{"usageLabel":"Développement logiciel","observationId":"gpt-5-5-livebench-coding","label":"LiveBench : code","display":"82,1 %","value":82.1495,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.1495}},{"usageLabel":"Missions longues","observationId":"gpt-5-5-livebench-agentic-coding","label":"LiveBench : code autonome","display":"54,0 %","value":53.9897,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":53.9897}},{"usageLabel":"Maths et sciences","observationId":"gpt-5-5-livebench-mathematics","label":"LiveBench : mathématiques","display":"95,9 %","value":95.8573,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":95.8573}},{"usageLabel":"Raisonnement général","observationId":"gpt-5-5-livebench-data-analysis","label":"LiveBench : analyse de données","display":"81,6 %","value":81.5757,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.5757}},{"usageLabel":"Raisonnement général","observationId":"gpt-5-5-livebench-language","label":"LiveBench : langue","display":"87,4 %","value":87.363,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.363}},{"usageLabel":"Raisonnement général","observationId":"gpt-5-5-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"70,7 %","value":70.7293,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.7293}},{"usageLabel":"Développement logiciel","observationId":"gpt-5-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"45,161 %","value":45.161,"unit":"percent","dispersion":"Erreur standard publiée : 4,164 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models/gpt-5.5. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":45.161}}]},{"modelId":"grok-4-3","name":"Grok 4.3","maker":"xAI","releaseDate":"2026-05-15","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/migration/may-15-retirement","price":null,"measuredCost":{"modelId":"grok-4-3","amount":0.416921,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"grok-4-3-livebench-reasoning","label":"LiveBench : raisonnement","display":"70,8 %","value":70.822,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.822}},{"usageLabel":"Développement logiciel","observationId":"grok-4-3-livebench-coding","label":"LiveBench : code","display":"69,9 %","value":69.9325,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.9325}},{"usageLabel":"Missions longues","observationId":"grok-4-3-livebench-agentic-coding","label":"LiveBench : code autonome","display":"18,5 %","value":18.5353,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":18.5353}},{"usageLabel":"Maths et sciences","observationId":"grok-4-3-livebench-mathematics","label":"LiveBench : mathématiques","display":"84,3 %","value":84.339,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.339}},{"usageLabel":"Raisonnement général","observationId":"grok-4-3-livebench-data-analysis","label":"LiveBench : analyse de données","display":"55,8 %","value":55.7727,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":55.7727}},{"usageLabel":"Raisonnement général","observationId":"grok-4-3-livebench-language","label":"LiveBench : langue","display":"73,6 %","value":73.58,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.58}},{"usageLabel":"Raisonnement général","observationId":"grok-4-3-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"62,8 %","value":62.75,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.75}},{"usageLabel":"Développement logiciel","observationId":"grok-4-3-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"6,795 %","value":6.795,"unit":"percent","dispersion":"Erreur standard publiée : 1,195 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.3. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":6.795}}]},{"modelId":"grok-4-5","name":"Grok 4.5","maker":"xAI","releaseDate":"2026-07-08","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","price":null,"measuredCost":{"modelId":"grok-4-5","amount":3.369806,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"grok-4-5-terminal-bench-4","label":"Terminal-Bench 4.0","display":"12,42 %","value":12.42,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 9,80 à 15,04 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-xai-grok-4-5-none-grok-build.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Grok Build 1.0.5. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.5. Date de sortie déclarée par Terminal-Bench : 2026-07-16. Écart conservé avec la date du catalogue Origin : 2026-07-08. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":12.42,"lowPercent":9.8,"highPercent":15.04,"spanPercent":5.239999999999998}},{"usageLabel":"Raisonnement général","observationId":"grok-4-5-livebench-reasoning","label":"LiveBench : raisonnement","display":"87,2 %","value":87.173,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.173}},{"usageLabel":"Développement logiciel","observationId":"grok-4-5-livebench-coding","label":"LiveBench : code","display":"68,6 %","value":68.5855,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":68.5855}},{"usageLabel":"Missions longues","observationId":"grok-4-5-livebench-agentic-coding","label":"LiveBench : code autonome","display":"56,5 %","value":56.4647,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":56.4647}},{"usageLabel":"Maths et sciences","observationId":"grok-4-5-livebench-mathematics","label":"LiveBench : mathématiques","display":"90,8 %","value":90.8245,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.8245}},{"usageLabel":"Raisonnement général","observationId":"grok-4-5-livebench-data-analysis","label":"LiveBench : analyse de données","display":"73,0 %","value":73.0377,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.0377}},{"usageLabel":"Raisonnement général","observationId":"grok-4-5-livebench-language","label":"LiveBench : langue","display":"82,8 %","value":82.7953,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.7953}},{"usageLabel":"Raisonnement général","observationId":"grok-4-5-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,5 %","value":71.5293,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.5293}},{"usageLabel":"Développement logiciel","observationId":"grok-4-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"36,596 %","value":36.596,"unit":"percent","dispersion":"Erreur standard publiée : 4,141 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.5. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":36.596}}]},{"modelId":"grok-build-0-1","name":"Grok Build 0.1","maker":"xAI","releaseDate":"2026-05-19","weightsLabel":"Poids fermés","weightsSourceUrl":"https://docs.x.ai/developers/release-notes","price":null,"measuredCost":null,"results":[{"usageLabel":"Raisonnement général","observationId":"grok-build-0-1-livebench-reasoning","label":"LiveBench : raisonnement","display":"76,4 %","value":76.3703,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.3703}},{"usageLabel":"Développement logiciel","observationId":"grok-build-0-1-livebench-coding","label":"LiveBench : code","display":"65,4 %","value":65.3855,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.3855}},{"usageLabel":"Missions longues","observationId":"grok-build-0-1-livebench-agentic-coding","label":"LiveBench : code autonome","display":"45,8 %","value":45.808,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":45.808}},{"usageLabel":"Maths et sciences","observationId":"grok-build-0-1-livebench-mathematics","label":"LiveBench : mathématiques","display":"78,4 %","value":78.4288,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.4288}},{"usageLabel":"Raisonnement général","observationId":"grok-build-0-1-livebench-data-analysis","label":"LiveBench : analyse de données","display":"70,8 %","value":70.794,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.794}},{"usageLabel":"Raisonnement général","observationId":"grok-build-0-1-livebench-language","label":"LiveBench : langue","display":"72,5 %","value":72.46,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.46}},{"usageLabel":"Raisonnement général","observationId":"grok-build-0-1-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"65,2 %","value":65.2208,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.2208}}]},{"modelId":"kimi-k2-6","name":"Kimi K2.6","maker":"Moonshot AI","releaseDate":"2026-04-20","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.6","price":null,"measuredCost":{"modelId":"kimi-k2-6","amount":5.112053,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"kimi-k2-6-livebench-reasoning","label":"LiveBench : raisonnement","display":"79,4 %","value":79.375,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.375}},{"usageLabel":"Développement logiciel","observationId":"kimi-k2-6-livebench-coding","label":"LiveBench : code","display":"78,6 %","value":78.567,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.567}},{"usageLabel":"Missions longues","observationId":"kimi-k2-6-livebench-agentic-coding","label":"LiveBench : code autonome","display":"46,9 %","value":46.9193,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":46.9193}},{"usageLabel":"Maths et sciences","observationId":"kimi-k2-6-livebench-mathematics","label":"LiveBench : mathématiques","display":"84,3 %","value":84.2763,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.2763}},{"usageLabel":"Raisonnement général","observationId":"kimi-k2-6-livebench-data-analysis","label":"LiveBench : analyse de données","display":"65,1 %","value":65.1343,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.1343}},{"usageLabel":"Raisonnement général","observationId":"kimi-k2-6-livebench-language","label":"LiveBench : langue","display":"75,1 %","value":75.1413,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.1413}},{"usageLabel":"Raisonnement général","observationId":"kimi-k2-6-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"64,4 %","value":64.3583,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.3583}},{"usageLabel":"Développement logiciel","observationId":"kimi-k2-6-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"27,768 %","value":27.768,"unit":"percent","dispersion":"Erreur standard publiée : 4,144 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":27.768}}]},{"modelId":"kimi-k2-7-code","name":"Kimi K2.7 Code","maker":"Moonshot AI","releaseDate":"2026-06-12","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","price":null,"measuredCost":{"modelId":"kimi-k2-7-code","amount":5.040913,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"kimi-k2-7-code-livebench-reasoning","label":"LiveBench : raisonnement","display":"82,8 %","value":82.8078,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.8078}},{"usageLabel":"Développement logiciel","observationId":"kimi-k2-7-code-livebench-coding","label":"LiveBench : code","display":"74,0 %","value":73.959,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.959}},{"usageLabel":"Missions longues","observationId":"kimi-k2-7-code-livebench-agentic-coding","label":"LiveBench : code autonome","display":"45,7 %","value":45.6563,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":45.6563}},{"usageLabel":"Maths et sciences","observationId":"kimi-k2-7-code-livebench-mathematics","label":"LiveBench : mathématiques","display":"79,6 %","value":79.6043,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.6043}},{"usageLabel":"Raisonnement général","observationId":"kimi-k2-7-code-livebench-data-analysis","label":"LiveBench : analyse de données","display":"62,7 %","value":62.6573,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.6573}},{"usageLabel":"Raisonnement général","observationId":"kimi-k2-7-code-livebench-language","label":"LiveBench : langue","display":"77,9 %","value":77.9057,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.9057}},{"usageLabel":"Raisonnement général","observationId":"kimi-k2-7-code-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"56,3 %","value":56.2918,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":56.2918}},{"usageLabel":"Développement logiciel","observationId":"kimi-k2-7-code-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"25,392 %","value":25.392,"unit":"percent","dispersion":"Erreur standard publiée : 4,161 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":25.392}}]},{"modelId":"minimax-m3","name":"MiniMax M3","maker":"MiniMax","releaseDate":"2026-06-01","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.minimax.io/blog/minimax-m3","price":null,"measuredCost":{"modelId":"minimax-m3","amount":7.072659,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"minimax-m3-livebench-reasoning","label":"LiveBench : raisonnement","display":"74,5 %","value":74.4808,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.4808}},{"usageLabel":"Développement logiciel","observationId":"minimax-m3-livebench-coding","label":"LiveBench : code","display":"68,2 %","value":68.2025,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":68.2025}},{"usageLabel":"Missions longues","observationId":"minimax-m3-livebench-agentic-coding","label":"LiveBench : code autonome","display":"40,7 %","value":40.6563,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":40.6563}},{"usageLabel":"Maths et sciences","observationId":"minimax-m3-livebench-mathematics","label":"LiveBench : mathématiques","display":"76,9 %","value":76.9475,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.9475}},{"usageLabel":"Raisonnement général","observationId":"minimax-m3-livebench-data-analysis","label":"LiveBench : analyse de données","display":"76,2 %","value":76.1663,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.1663}},{"usageLabel":"Raisonnement général","observationId":"minimax-m3-livebench-language","label":"LiveBench : langue","display":"76,8 %","value":76.8357,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.8357}},{"usageLabel":"Raisonnement général","observationId":"minimax-m3-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"57,5 %","value":57.5083,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":57.5083}},{"usageLabel":"Développement logiciel","observationId":"minimax-m3-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"19,925 %","value":19.925,"unit":"percent","dispersion":"Erreur standard publiée : 3,944 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":19.925}}]},{"modelId":"qwen3-6-27b","name":"Qwen 3.6 27B","maker":"Alibaba","releaseDate":"2026-04-21","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.6-27B","price":null,"measuredCost":null,"results":[{"usageLabel":"Raisonnement général","observationId":"qwen3-6-27b-livebench-reasoning","label":"LiveBench : raisonnement","display":"70,3 %","value":70.2838,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.2838}},{"usageLabel":"Développement logiciel","observationId":"qwen3-6-27b-livebench-coding","label":"LiveBench : code","display":"71,8 %","value":71.785,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.785}},{"usageLabel":"Missions longues","observationId":"qwen3-6-27b-livebench-agentic-coding","label":"LiveBench : code autonome","display":"39,3 %","value":39.2927,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":39.2927}},{"usageLabel":"Maths et sciences","observationId":"qwen3-6-27b-livebench-mathematics","label":"LiveBench : mathématiques","display":"79,9 %","value":79.8685,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.8685}},{"usageLabel":"Raisonnement général","observationId":"qwen3-6-27b-livebench-data-analysis","label":"LiveBench : analyse de données","display":"70,4 %","value":70.4267,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.4267}},{"usageLabel":"Raisonnement général","observationId":"qwen3-6-27b-livebench-language","label":"LiveBench : langue","display":"63,3 %","value":63.3043,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":63.3043}},{"usageLabel":"Raisonnement général","observationId":"qwen3-6-27b-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"53,2 %","value":53.229,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":53.229}}]},{"modelId":"qwen3-6-plus","name":"Qwen 3.6 Plus","maker":"Alibaba","releaseDate":"2026-04-02","weightsLabel":"Poids fermés","weightsSourceUrl":"https://qwen.ai/blog?id=qwen3.6/","price":null,"measuredCost":{"modelId":"qwen3-6-plus","amount":4.781669,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"qwen3-6-plus-livebench-reasoning","label":"LiveBench : raisonnement","display":"75,8 %","value":75.827,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.827}},{"usageLabel":"Développement logiciel","observationId":"qwen3-6-plus-livebench-coding","label":"LiveBench : code","display":"78,2 %","value":78.1845,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.1845}},{"usageLabel":"Missions longues","observationId":"qwen3-6-plus-livebench-agentic-coding","label":"LiveBench : code autonome","display":"41,4 %","value":41.3637,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":41.3637}},{"usageLabel":"Maths et sciences","observationId":"qwen3-6-plus-livebench-mathematics","label":"LiveBench : mathématiques","display":"83,7 %","value":83.7248,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.7248}},{"usageLabel":"Raisonnement général","observationId":"qwen3-6-plus-livebench-data-analysis","label":"LiveBench : analyse de données","display":"69,9 %","value":69.9117,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.9117}},{"usageLabel":"Raisonnement général","observationId":"qwen3-6-plus-livebench-language","label":"LiveBench : langue","display":"75,0 %","value":74.9893,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.9893}},{"usageLabel":"Raisonnement général","observationId":"qwen3-6-plus-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"58,3 %","value":58.342,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":58.342}},{"usageLabel":"Développement logiciel","observationId":"qwen3-6-plus-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"11,102 %","value":11.102,"unit":"percent","dispersion":"Erreur standard publiée : 1,312 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":11.102}}]},{"modelId":"qwen3-7-max","name":"Qwen 3.7 Max","maker":"Alibaba","releaseDate":"2026-06-08","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/qwen3-7-max","price":null,"measuredCost":{"modelId":"qwen3-7-max","amount":1.932899,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"qwen3-7-max-livebench-reasoning","label":"LiveBench : raisonnement","display":"83,3 %","value":83.3365,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.3365}},{"usageLabel":"Développement logiciel","observationId":"qwen3-7-max-livebench-coding","label":"LiveBench : code","display":"74,2 %","value":74.219,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.219}},{"usageLabel":"Missions longues","observationId":"qwen3-7-max-livebench-agentic-coding","label":"LiveBench : code autonome","display":"43,6 %","value":43.586,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":43.586}},{"usageLabel":"Maths et sciences","observationId":"qwen3-7-max-livebench-mathematics","label":"LiveBench : mathématiques","display":"85,2 %","value":85.2483,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.2483}},{"usageLabel":"Raisonnement général","observationId":"qwen3-7-max-livebench-data-analysis","label":"LiveBench : analyse de données","display":"71,8 %","value":71.786,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.786}},{"usageLabel":"Raisonnement général","observationId":"qwen3-7-max-livebench-language","label":"LiveBench : langue","display":"79,7 %","value":79.739,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.739}},{"usageLabel":"Raisonnement général","observationId":"qwen3-7-max-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"74,0 %","value":74.0415,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.0415}},{"usageLabel":"Développement logiciel","observationId":"qwen3-7-max-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"13,069 %","value":13.069,"unit":"percent","dispersion":"Erreur standard publiée : 2,858 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":13.069}}]},{"modelId":"terra","name":"GPT-5.6 Terra","maker":"OpenAI","releaseDate":"2026-07-09","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","price":{"modelId":"terra","inputPerMillion":2,"outputPerMillion":12,"currency":"USD","source":{"url":"https://developers.openai.com/api/docs/models/gpt-5.6-terra","accessedAt":"2026-09-06","publisher":"OpenAI"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API OpenAI","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":{"threshold":272000,"input":4,"output":18},"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"terra","amount":8.127254,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"terra-terminal-bench-4","label":"Terminal-Bench 4.0","display":"21,52 %","value":21.52,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 18,27 à 24,77 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-terra-max-codex.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-terra. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":21.52,"lowPercent":18.27,"highPercent":24.77,"spanPercent":6.5}},{"usageLabel":"Raisonnement général","observationId":"terra-livebench-reasoning","label":"LiveBench : raisonnement","display":"90,6 %","value":90.6345,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.6345}},{"usageLabel":"Développement logiciel","observationId":"terra-livebench-coding","label":"LiveBench : code","display":"78,2 %","value":78.2455,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.2455}},{"usageLabel":"Missions longues","observationId":"terra-livebench-agentic-coding","label":"LiveBench : code autonome","display":"54,9 %","value":54.9497,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":54.9497}},{"usageLabel":"Maths et sciences","observationId":"terra-livebench-mathematics","label":"LiveBench : mathématiques","display":"94,9 %","value":94.9083,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":94.9083}},{"usageLabel":"Raisonnement général","observationId":"terra-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,3 %","value":79.3067,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.3067}},{"usageLabel":"Raisonnement général","observationId":"terra-livebench-language","label":"LiveBench : langue","display":"82,9 %","value":82.8927,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.8927}},{"usageLabel":"Raisonnement général","observationId":"terra-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"64,6 %","value":64.6165,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.6165}},{"usageLabel":"Développement logiciel","observationId":"terra-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"47,804 %","value":47.804,"unit":"percent","dispersion":"Erreur standard publiée : 4,28 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":47.804}}]},{"modelId":"luna","name":"GPT-5.6 Luna","maker":"OpenAI","releaseDate":"2026-07-09","weightsLabel":"Poids fermés","weightsSourceUrl":"https://openai.com/index/gpt-5-6/","price":{"modelId":"luna","inputPerMillion":0.2,"outputPerMillion":1.2,"currency":"USD","source":{"url":"https://developers.openai.com/api/docs/models/gpt-5.6-luna","accessedAt":"2026-09-06","publisher":"OpenAI"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API OpenAI","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":{"threshold":272000,"input":0.4,"output":1.8},"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"luna","amount":1.882918,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"luna-terminal-bench-4","label":"Terminal-Bench 4.0","display":"17,27 %","value":17.27,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 14,42 à 20,12 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-openai-gpt-5-6-luna-max-codex.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Codex 0.149.1. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : openai/gpt-5.6-luna. Date de sortie déclarée par Terminal-Bench : 2026-06-26. Écart conservé avec la date du catalogue Origin : 2026-07-09. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":17.27,"lowPercent":14.42,"highPercent":20.12,"spanPercent":5.700000000000001}},{"usageLabel":"Raisonnement général","observationId":"luna-livebench-reasoning","label":"LiveBench : raisonnement","display":"85,6 %","value":85.6443,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.6443}},{"usageLabel":"Développement logiciel","observationId":"luna-livebench-coding","label":"LiveBench : code","display":"82,9 %","value":82.915,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.915}},{"usageLabel":"Missions longues","observationId":"luna-livebench-agentic-coding","label":"LiveBench : code autonome","display":"48,4 %","value":48.4343,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":48.4343}},{"usageLabel":"Maths et sciences","observationId":"luna-livebench-mathematics","label":"LiveBench : mathématiques","display":"87,2 %","value":87.2008,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.2008}},{"usageLabel":"Raisonnement général","observationId":"luna-livebench-data-analysis","label":"LiveBench : analyse de données","display":"78,0 %","value":78.0333,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.0333}},{"usageLabel":"Raisonnement général","observationId":"luna-livebench-language","label":"LiveBench : langue","display":"72,6 %","value":72.567,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.567}},{"usageLabel":"Raisonnement général","observationId":"luna-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"60,1 %","value":60.121,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":60.121}},{"usageLabel":"Développement logiciel","observationId":"luna-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"44,55 %","value":44.55,"unit":"percent","dispersion":"Erreur standard publiée : 4,244 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://developers.openai.com/api/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":44.55}}]},{"modelId":"muse-spark-1-1","name":"Muse Spark 1.1","maker":"Meta","releaseDate":"2026-07-09","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-meta-model-api","price":{"modelId":"muse-spark-1-1","inputPerMillion":1.25,"outputPerMillion":4.25,"currency":"USD","source":{"url":"https://openrouter.ai/meta/muse-spark-1.1","accessedAt":"2026-09-06","publisher":"OpenRouter"},"limitation":"Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici.","service":"OpenRouter","contextCondition":"Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée.","longContext":null,"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"muse-spark-1-1","amount":4.560329,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"muse-spark-1-1-livebench-reasoning","label":"LiveBench : raisonnement","display":"87,7 %","value":87.7308,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.7308}},{"usageLabel":"Développement logiciel","observationId":"muse-spark-1-1-livebench-coding","label":"LiveBench : code","display":"77,2 %","value":77.1585,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.1585}},{"usageLabel":"Missions longues","observationId":"muse-spark-1-1-livebench-agentic-coding","label":"LiveBench : code autonome","display":"58,5 %","value":58.5353,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":58.5353}},{"usageLabel":"Maths et sciences","observationId":"muse-spark-1-1-livebench-mathematics","label":"LiveBench : mathématiques","display":"87,1 %","value":87.1448,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.1448}},{"usageLabel":"Raisonnement général","observationId":"muse-spark-1-1-livebench-data-analysis","label":"LiveBench : analyse de données","display":"72,5 %","value":72.548,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.548}},{"usageLabel":"Raisonnement général","observationId":"muse-spark-1-1-livebench-language","label":"LiveBench : langue","display":"74,3 %","value":74.342,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.342}},{"usageLabel":"Raisonnement général","observationId":"muse-spark-1-1-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"69,6 %","value":69.6375,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.6375}},{"usageLabel":"Développement logiciel","observationId":"muse-spark-1-1-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"31,115 %","value":31.115,"unit":"percent","dispersion":"Erreur standard publiée : 4,068 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.1. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":31.115}}]},{"modelId":"kimi-k3","name":"Kimi K3","maker":"Moonshot AI","releaseDate":"2026-07-16","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/moonshotai/Kimi-K3","price":null,"measuredCost":{"modelId":"kimi-k3","amount":13.871104,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"kimi-k3-livebench-reasoning","label":"LiveBench : raisonnement","display":"90,7 %","value":90.673,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.673}},{"usageLabel":"Développement logiciel","observationId":"kimi-k3-livebench-coding","label":"LiveBench : code","display":"81,4 %","value":81.4455,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.4455}},{"usageLabel":"Missions longues","observationId":"kimi-k3-livebench-agentic-coding","label":"LiveBench : code autonome","display":"62,2 %","value":62.1717,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.1717}},{"usageLabel":"Maths et sciences","observationId":"kimi-k3-livebench-mathematics","label":"LiveBench : mathématiques","display":"84,4 %","value":84.4368,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.4368}},{"usageLabel":"Raisonnement général","observationId":"kimi-k3-livebench-data-analysis","label":"LiveBench : analyse de données","display":"78,7 %","value":78.7337,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.7337}},{"usageLabel":"Raisonnement général","observationId":"kimi-k3-livebench-language","label":"LiveBench : langue","display":"85,5 %","value":85.528,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.528}},{"usageLabel":"Raisonnement général","observationId":"kimi-k3-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,4 %","value":71.3628,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.3628}},{"usageLabel":"Développement logiciel","observationId":"kimi-k3-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"16,099 %","value":16.099,"unit":"percent","dispersion":"Erreur standard publiée : 4,101 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.kimi.ai/docs/models. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":16.099}}]},{"modelId":"inkling","name":"Inkling","maker":"Thinking Machines Lab","releaseDate":"2026-07-15","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/thinkingmachines/Inkling","price":null,"measuredCost":{"modelId":"inkling","amount":3.006967,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"inkling-livebench-reasoning","label":"LiveBench : raisonnement","display":"78,3 %","value":78.3463,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.3463}},{"usageLabel":"Développement logiciel","observationId":"inkling-livebench-coding","label":"LiveBench : code","display":"71,0 %","value":71.0195,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.0195}},{"usageLabel":"Missions longues","observationId":"inkling-livebench-agentic-coding","label":"LiveBench : code autonome","display":"49,4 %","value":49.394,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":49.394}},{"usageLabel":"Maths et sciences","observationId":"inkling-livebench-mathematics","label":"LiveBench : mathématiques","display":"88,4 %","value":88.3648,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.3648}},{"usageLabel":"Raisonnement général","observationId":"inkling-livebench-data-analysis","label":"LiveBench : analyse de données","display":"72,8 %","value":72.778,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.778}},{"usageLabel":"Raisonnement général","observationId":"inkling-livebench-language","label":"LiveBench : langue","display":"73,5 %","value":73.4587,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.4587}},{"usageLabel":"Raisonnement général","observationId":"inkling-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"70,1 %","value":70.0958,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.0958}},{"usageLabel":"Développement logiciel","observationId":"inkling-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"11,79 %","value":11.79,"unit":"percent","dispersion":"Erreur standard publiée : 3,396 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":11.79}}]},{"modelId":"gemini-3-5-flash-lite","name":"Gemini 3.5 Flash-Lite","maker":"Google","releaseDate":"2026-07-21","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","price":{"modelId":"gemini-3-5-flash-lite","inputPerMillion":0.3,"outputPerMillion":2.5,"currency":"USD","source":{"url":"https://ai.google.dev/gemini-api/docs/pricing","accessedAt":"2026-09-06","publisher":"Google"},"limitation":"Tarif par token, hors appels d’outils facturés séparément. Le montant réel dépend des tokens consommés.","service":"API Google","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":null,"promotion":null,"reasoningBilling":"Les tokens de réflexion sont inclus dans les tokens facturés en sortie.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"gemini-3-5-flash-lite","amount":0.525186,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"gemini-3-5-flash-lite-livebench-reasoning","label":"LiveBench : raisonnement","display":"60,2 %","value":60.1875,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":60.1875}},{"usageLabel":"Développement logiciel","observationId":"gemini-3-5-flash-lite-livebench-coding","label":"LiveBench : code","display":"76,1 %","value":76.0715,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.0715}},{"usageLabel":"Missions longues","observationId":"gemini-3-5-flash-lite-livebench-agentic-coding","label":"LiveBench : code autonome","display":"45,3 %","value":45.2527,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":45.2527}},{"usageLabel":"Maths et sciences","observationId":"gemini-3-5-flash-lite-livebench-mathematics","label":"LiveBench : mathématiques","display":"73,7 %","value":73.7395,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.7395}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-5-flash-lite-livebench-data-analysis","label":"LiveBench : analyse de données","display":"53,2 %","value":53.2497,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":53.2497}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-5-flash-lite-livebench-language","label":"LiveBench : langue","display":"71,8 %","value":71.8203,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.8203}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-5-flash-lite-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"67,2 %","value":67.2378,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":67.2378}},{"usageLabel":"Développement logiciel","observationId":"gemini-3-5-flash-lite-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"6,148 %","value":6.148,"unit":"percent","dispersion":"Erreur standard publiée : 1,708 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":6.148}}]},{"modelId":"gemini-3-6-flash","name":"Gemini 3.6 Flash","maker":"Google","releaseDate":"2026-07-21","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","price":{"modelId":"gemini-3-6-flash","inputPerMillion":0.75,"outputPerMillion":3.75,"currency":"USD","source":{"url":"https://ai.google.dev/gemini-api/docs/pricing","accessedAt":"2026-09-06","publisher":"Google"},"limitation":"Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément.","service":"API Google","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":null,"promotion":{"until":"2026-12-31","after":{"input":1.5,"output":7.5}},"reasoningBilling":"Les tokens de réflexion sont inclus dans les tokens facturés en sortie.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"gemini-3-6-flash","amount":8.930416,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"gemini-3-6-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"85,1 %","value":85.149,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.149}},{"usageLabel":"Développement logiciel","observationId":"gemini-3-6-flash-livebench-coding","label":"LiveBench : code","display":"77,9 %","value":77.863,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.863}},{"usageLabel":"Missions longues","observationId":"gemini-3-6-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"43,4 %","value":43.4343,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":43.4343}},{"usageLabel":"Maths et sciences","observationId":"gemini-3-6-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"86,4 %","value":86.4025,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.4025}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-6-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"63,0 %","value":62.9993,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":62.9993}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-6-flash-livebench-language","label":"LiveBench : langue","display":"83,9 %","value":83.8977,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.8977}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-6-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"75,4 %","value":75.3668,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.3668}},{"usageLabel":"Développement logiciel","observationId":"gemini-3-6-flash-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"30,928 %","value":30.928,"unit":"percent","dispersion":"Erreur standard publiée : 4,068 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":30.928}}]},{"modelId":"claude-opus-4-8","name":"Claude Opus 4.8","maker":"Anthropic","releaseDate":"2026-05-28","weightsLabel":"Poids fermés","weightsSourceUrl":"https://www.anthropic.com/news/claude-opus-4-8","price":{"modelId":"claude-opus-4-8","inputPerMillion":5,"outputPerMillion":25,"currency":"USD","source":{"url":"https://platform.claude.com/docs/en/about-claude/pricing","accessedAt":"2026-09-06","publisher":"Anthropic"},"limitation":"Hors outils et options de résidence des données. Les tokens internes de raisonnement sont facturés même si leur affichage est omis.","service":"API Anthropic","contextCondition":"Tarif standard de l’API Claude globale, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens. Pas de surcharge de contexte long jusqu’à 1 million de tokens.","longContext":null,"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"claude-opus-4-8","amount":30.514184,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"claude-opus-4-8-terminal-bench-4","label":"Terminal-Bench 4.0","display":"23,64 %","value":23.64,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 20,08 à 27,20 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-claude-opus-4-8-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.231. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/claude-opus-4-8. Date de sortie déclarée par Terminal-Bench : 2026-05-28. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":23.64,"lowPercent":20.08,"highPercent":27.2,"spanPercent":7.120000000000001}},{"usageLabel":"Raisonnement général","observationId":"claude-opus-4-8-livebench-reasoning","label":"LiveBench : raisonnement","display":"89,2 %","value":89.1923,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.1923}},{"usageLabel":"Développement logiciel","observationId":"claude-opus-4-8-livebench-coding","label":"LiveBench : code","display":"81,8 %","value":81.828,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.828}},{"usageLabel":"Missions longues","observationId":"claude-opus-4-8-livebench-agentic-coding","label":"LiveBench : code autonome","display":"50,5 %","value":50.505,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":50.505}},{"usageLabel":"Maths et sciences","observationId":"claude-opus-4-8-livebench-mathematics","label":"LiveBench : mathématiques","display":"94,3 %","value":94.3165,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":94.3165}},{"usageLabel":"Raisonnement général","observationId":"claude-opus-4-8-livebench-data-analysis","label":"LiveBench : analyse de données","display":"66,0 %","value":66.0333,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":66.0333}},{"usageLabel":"Raisonnement général","observationId":"claude-opus-4-8-livebench-language","label":"LiveBench : langue","display":"79,7 %","value":79.6593,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.6593}},{"usageLabel":"Raisonnement général","observationId":"claude-opus-4-8-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"72,0 %","value":72.0335,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.0335}},{"usageLabel":"Développement logiciel","observationId":"claude-opus-4-8-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"47,25 %","value":47.25,"unit":"percent","dispersion":"Erreur standard publiée : 4,176 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":47.25}}]},{"modelId":"deepseek-v4-flash-0731","name":"DeepSeek V4 Flash 0731","maker":"DeepSeek","releaseDate":"2026-07-31","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","price":null,"measuredCost":{"modelId":"deepseek-v4-flash-0731","amount":3.605899,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-flash-0731-livebench-reasoning","label":"LiveBench : raisonnement","display":"86,6 %","value":86.6345,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.6345}},{"usageLabel":"Développement logiciel","observationId":"deepseek-v4-flash-0731-livebench-coding","label":"LiveBench : code","display":"75,0 %","value":74.9845,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.9845}},{"usageLabel":"Missions longues","observationId":"deepseek-v4-flash-0731-livebench-agentic-coding","label":"LiveBench : code autonome","display":"46,8 %","value":46.7677,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":46.7677}},{"usageLabel":"Maths et sciences","observationId":"deepseek-v4-flash-0731-livebench-mathematics","label":"LiveBench : mathématiques","display":"86,8 %","value":86.7898,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.7898}},{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-flash-0731-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,3 %","value":79.3273,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.3273}},{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-flash-0731-livebench-language","label":"LiveBench : langue","display":"79,2 %","value":79.175,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.175}},{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-flash-0731-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"65,5 %","value":65.5168,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.5168}},{"usageLabel":"Développement logiciel","observationId":"deepseek-v4-flash-0731-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"38,631 %","value":38.631,"unit":"percent","dispersion":"Erreur standard publiée : 4,382 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":38.631}}]},{"modelId":"qwen3-8-max","name":"Qwen 3.8 Max","maker":"Alibaba","releaseDate":"2026-08-02","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","price":null,"measuredCost":{"modelId":"qwen3-8-max","amount":10.53816,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"qwen3-8-max-livebench-reasoning","label":"LiveBench : raisonnement","display":"88,2 %","value":88.2115,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.2115}},{"usageLabel":"Développement logiciel","observationId":"qwen3-8-max-livebench-coding","label":"LiveBench : code","display":"72,9 %","value":72.872,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.872}},{"usageLabel":"Missions longues","observationId":"qwen3-8-max-livebench-agentic-coding","label":"LiveBench : code autonome","display":"64,6 %","value":64.6467,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.6467}},{"usageLabel":"Maths et sciences","observationId":"qwen3-8-max-livebench-mathematics","label":"LiveBench : mathématiques","display":"91,3 %","value":91.3123,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.3123}},{"usageLabel":"Raisonnement général","observationId":"qwen3-8-max-livebench-data-analysis","label":"LiveBench : analyse de données","display":"78,4 %","value":78.413,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.413}},{"usageLabel":"Raisonnement général","observationId":"qwen3-8-max-livebench-language","label":"LiveBench : langue","display":"79,7 %","value":79.6873,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.6873}},{"usageLabel":"Raisonnement général","observationId":"qwen3-8-max-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"74,1 %","value":74.0835,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.0835}},{"usageLabel":"Développement logiciel","observationId":"qwen3-8-max-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"23,958 %","value":23.958,"unit":"percent","dispersion":"Erreur standard publiée : 4,309 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":23.958}}]},{"modelId":"muse-spark-1-2","name":"Muse Spark 1.2","maker":"Meta","releaseDate":"2026-08-05","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","price":{"modelId":"muse-spark-1-2","inputPerMillion":1.25,"outputPerMillion":4.25,"currency":"USD","source":{"url":"https://openrouter.ai/meta/muse-spark-1.2","accessedAt":"2026-09-06","publisher":"OpenRouter"},"limitation":"Prix OpenRouter, pas un tarif direct Meta. Hors cache, recherche web et éventuels frais de plateforme ou de paiement ; ces derniers ne sont pas chiffrés ici.","service":"OpenRouter","contextCondition":"Prix OpenRouter en entrée et sortie, sans cache ni lot, prompts jusqu’à 200 000 tokens. Aucun palier de contexte long indiqué sur la fiche consultée.","longContext":null,"promotion":null,"reasoningBilling":"Les tokens de raisonnement sont facturés au tarif de sortie, y compris lorsqu’ils ne sont pas visibles.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"muse-spark-1-2","amount":3.784593,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"muse-spark-1-2-livebench-reasoning","label":"LiveBench : raisonnement","display":"90,0 %","value":90.0048,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.0048}},{"usageLabel":"Développement logiciel","observationId":"muse-spark-1-2-livebench-coding","label":"LiveBench : code","display":"77,5 %","value":77.5415,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.5415}},{"usageLabel":"Missions longues","observationId":"muse-spark-1-2-livebench-agentic-coding","label":"LiveBench : code autonome","display":"57,6 %","value":57.5757,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":57.5757}},{"usageLabel":"Maths et sciences","observationId":"muse-spark-1-2-livebench-mathematics","label":"LiveBench : mathématiques","display":"91,2 %","value":91.2035,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.2035}},{"usageLabel":"Raisonnement général","observationId":"muse-spark-1-2-livebench-data-analysis","label":"LiveBench : analyse de données","display":"76,5 %","value":76.4583,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.4583}},{"usageLabel":"Raisonnement général","observationId":"muse-spark-1-2-livebench-language","label":"LiveBench : langue","display":"78,6 %","value":78.5747,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.5747}},{"usageLabel":"Raisonnement général","observationId":"muse-spark-1-2-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"74,3 %","value":74.325,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.325}},{"usageLabel":"Développement logiciel","observationId":"muse-spark-1-2-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"29,954 %","value":29.954,"unit":"percent","dispersion":"Erreur standard publiée : 4,023 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/meta/muse-spark-1.2. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":29.954}}]},{"modelId":"smaug-agentic","name":"Smaug-Agentic","maker":"Abacus.AI","releaseDate":"2026-08-10","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/abacusai/Smaug-Agentic","price":null,"measuredCost":null,"results":[{"usageLabel":"Raisonnement général","observationId":"smaug-agentic-livebench-reasoning","label":"LiveBench : raisonnement","display":"90,3 %","value":90.274,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.274}},{"usageLabel":"Développement logiciel","observationId":"smaug-agentic-livebench-coding","label":"LiveBench : code","display":"82,5 %","value":82.471,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.471}},{"usageLabel":"Missions longues","observationId":"smaug-agentic-livebench-agentic-coding","label":"LiveBench : code autonome","display":"64,6 %","value":64.6467,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.6467}},{"usageLabel":"Maths et sciences","observationId":"smaug-agentic-livebench-mathematics","label":"LiveBench : mathématiques","display":"83,9 %","value":83.9195,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.9195}},{"usageLabel":"Raisonnement général","observationId":"smaug-agentic-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,9 %","value":79.8983,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.8983}},{"usageLabel":"Raisonnement général","observationId":"smaug-agentic-livebench-language","label":"LiveBench : langue","display":"84,4 %","value":84.3567,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":84.3567}},{"usageLabel":"Raisonnement général","observationId":"smaug-agentic-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,0 %","value":70.9918,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.9918}}]},{"modelId":"deepseek-v4-pro-0813","name":"DeepSeek V4 Pro 0813","maker":"DeepSeek","releaseDate":"2026-08-13","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","price":null,"measuredCost":{"modelId":"deepseek-v4-pro-0813","amount":18.581309,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-pro-0813-livebench-reasoning","label":"LiveBench : raisonnement","display":"85,8 %","value":85.8413,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.8413}},{"usageLabel":"Développement logiciel","observationId":"deepseek-v4-pro-0813-livebench-coding","label":"LiveBench : code","display":"77,2 %","value":77.1585,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.1585}},{"usageLabel":"Missions longues","observationId":"deepseek-v4-pro-0813-livebench-agentic-coding","label":"LiveBench : code autonome","display":"54,9 %","value":54.9497,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":54.9497}},{"usageLabel":"Maths et sciences","observationId":"deepseek-v4-pro-0813-livebench-mathematics","label":"LiveBench : mathématiques","display":"95,1 %","value":95.0863,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":95.0863}},{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-pro-0813-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,2 %","value":79.2433,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.2433}},{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-pro-0813-livebench-language","label":"LiveBench : langue","display":"82,1 %","value":82.074,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.074}},{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-pro-0813-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"67,7 %","value":67.7,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":67.7}},{"usageLabel":"Développement logiciel","observationId":"deepseek-v4-pro-0813-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"41,54 %","value":41.54,"unit":"percent","dispersion":"Erreur standard publiée : 4,301 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://api-docs.deepseek.com/quick_start/pricing/. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":41.54}}]},{"modelId":"grok-4-6","name":"Grok 4.6","maker":"xAI","releaseDate":"2026-08-12","weightsLabel":"Poids fermés","weightsSourceUrl":"https://x.ai/news/grok-4-6","price":null,"measuredCost":{"modelId":"grok-4-6","amount":14.575491,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"grok-4-6-terminal-bench-4","label":"Terminal-Bench 4.0","display":"20,30 %","value":20.3,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 17,21 à 23,39 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-xai-grok-4-6-none-grok-build.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Grok Build 1.0.5. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : xai/grok-4.6. Date de sortie déclarée par Terminal-Bench : 2026-08-12. Réglage Terminal-Bench non publié ; none ne signifie pas raisonnement désactivé. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":20.3,"lowPercent":17.21,"highPercent":23.39,"spanPercent":6.18}},{"usageLabel":"Raisonnement général","observationId":"grok-4-6-livebench-reasoning","label":"LiveBench : raisonnement","display":"90,5 %","value":90.5095,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":90.5095}},{"usageLabel":"Développement logiciel","observationId":"grok-4-6-livebench-coding","label":"LiveBench : code","display":"76,8 %","value":76.776,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.776}},{"usageLabel":"Missions longues","observationId":"grok-4-6-livebench-agentic-coding","label":"LiveBench : code autonome","display":"57,0 %","value":57.02,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":57.02}},{"usageLabel":"Maths et sciences","observationId":"grok-4-6-livebench-mathematics","label":"LiveBench : mathématiques","display":"92,6 %","value":92.568,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":92.568}},{"usageLabel":"Raisonnement général","observationId":"grok-4-6-livebench-data-analysis","label":"LiveBench : analyse de données","display":"73,9 %","value":73.857,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.857}},{"usageLabel":"Raisonnement général","observationId":"grok-4-6-livebench-language","label":"LiveBench : langue","display":"83,7 %","value":83.697,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":83.697}},{"usageLabel":"Raisonnement général","observationId":"grok-4-6-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,9 %","value":71.8665,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":71.8665}},{"usageLabel":"Développement logiciel","observationId":"grok-4-6-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"44,572 %","value":44.572,"unit":"percent","dispersion":"Erreur standard publiée : 4,479 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.6. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":44.572}}]},{"modelId":"gemini-3-7-flash","name":"Gemini 3.7 Flash","maker":"Google","releaseDate":"2026-08-13","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","price":{"modelId":"gemini-3-7-flash","inputPerMillion":0.75,"outputPerMillion":3.75,"currency":"USD","source":{"url":"https://ai.google.dev/gemini-api/docs/pricing","accessedAt":"2026-09-06","publisher":"Google"},"limitation":"Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément.","service":"API Google","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":null,"promotion":{"until":"2026-12-31","after":{"input":1.5,"output":7.5}},"reasoningBilling":"Les tokens de réflexion sont inclus dans les tokens facturés en sortie.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"gemini-3-7-flash","amount":21.464006,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"gemini-3-7-flash-terminal-bench-4","label":"Terminal-Bench 4.0","display":"11,21 %","value":11.21,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 8,76 à 13,66 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-02-gemini-gemini-3-7-flash-high-mini-swe-agent.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"mini-SWE-agent 2.4.6. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.7-flash. Date de sortie déclarée par Terminal-Bench : 2026-08-13. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":11.21,"lowPercent":8.76,"highPercent":13.66,"spanPercent":4.9}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-7-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"87,8 %","value":87.798,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.798}},{"usageLabel":"Développement logiciel","observationId":"gemini-3-7-flash-livebench-coding","label":"LiveBench : code","display":"78,9 %","value":78.8885,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.8885}},{"usageLabel":"Missions longues","observationId":"gemini-3-7-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"58,3 %","value":58.283,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":58.283}},{"usageLabel":"Maths et sciences","observationId":"gemini-3-7-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"93,5 %","value":93.468,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":93.468}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-7-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"68,0 %","value":67.9643,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":67.9643}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-7-flash-livebench-language","label":"LiveBench : langue","display":"85,5 %","value":85.455,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.455}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-7-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"79,9 %","value":79.9253,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.9253}},{"usageLabel":"Développement logiciel","observationId":"gemini-3-7-flash-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"34,8 %","value":34.8,"unit":"percent","dispersion":"Erreur standard publiée : 4,225 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":34.8}}]},{"modelId":"qwen3-8-27b","name":"Qwen 3.8 27B","maker":"Alibaba","releaseDate":"2026-08-14","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-27B","price":null,"measuredCost":{"modelId":"qwen3-8-27b","amount":21.677954,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"qwen3-8-27b-livebench-reasoning","label":"LiveBench : raisonnement","display":"80,0 %","value":80.0288,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":80.0288}},{"usageLabel":"Développement logiciel","observationId":"qwen3-8-27b-livebench-coding","label":"LiveBench : code","display":"75,7 %","value":75.689,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":75.689}},{"usageLabel":"Missions longues","observationId":"qwen3-8-27b-livebench-agentic-coding","label":"LiveBench : code autonome","display":"61,4 %","value":61.3637,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":61.3637}},{"usageLabel":"Maths et sciences","observationId":"qwen3-8-27b-livebench-mathematics","label":"LiveBench : mathématiques","display":"86,2 %","value":86.2128,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":86.2128}},{"usageLabel":"Raisonnement général","observationId":"qwen3-8-27b-livebench-data-analysis","label":"LiveBench : analyse de données","display":"76,6 %","value":76.5857,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.5857}},{"usageLabel":"Raisonnement général","observationId":"qwen3-8-27b-livebench-language","label":"LiveBench : langue","display":"74,3 %","value":74.3457,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.3457}},{"usageLabel":"Raisonnement général","observationId":"qwen3-8-27b-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"72,7 %","value":72.6583,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.6583}},{"usageLabel":"Développement logiciel","observationId":"qwen3-8-27b-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"14,157 %","value":14.157,"unit":"percent","dispersion":"Erreur standard publiée : 4,189 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/qwen/qwen3.8-27b-20260814/endpoints. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":14.157}}]},{"modelId":"deepseek-v4-flash-vision-exp","name":"DeepSeek V4 Flash Vision Exp","maker":"DeepSeek","releaseDate":"2026-08-21","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","price":null,"measuredCost":null,"results":[{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-flash-vision-exp-livebench-reasoning","label":"LiveBench : raisonnement","display":"85,4 %","value":85.399,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.399}},{"usageLabel":"Développement logiciel","observationId":"deepseek-v4-flash-vision-exp-livebench-coding","label":"LiveBench : code","display":"68,2 %","value":68.2025,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":68.2025}},{"usageLabel":"Missions longues","observationId":"deepseek-v4-flash-vision-exp-livebench-agentic-coding","label":"LiveBench : code autonome","display":"65,1 %","value":65.101,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":65.101}},{"usageLabel":"Maths et sciences","observationId":"deepseek-v4-flash-vision-exp-livebench-mathematics","label":"LiveBench : mathématiques","display":"87,8 %","value":87.8068,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.8068}},{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-flash-vision-exp-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,5 %","value":79.4767,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.4767}},{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-flash-vision-exp-livebench-language","label":"LiveBench : langue","display":"80,4 %","value":80.3597,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":80.3597}},{"usageLabel":"Raisonnement général","observationId":"deepseek-v4-flash-vision-exp-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"71,0 %","value":70.9582,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.9582}}]},{"modelId":"glm-5-3","name":"GLM 5.3","maker":"Z.ai","releaseDate":"2026-08-14","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3","price":null,"measuredCost":{"modelId":"glm-5-3","amount":24.909755,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"glm-5-3-terminal-bench-4","label":"Terminal-Bench 4.0","display":"41,82 %","value":41.82,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 38,59 à 45,05 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-08-26-anthropic-glm-5-3-max-claude-code.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Claude Code 2.1.207. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : anthropic/glm-5.3. Date de sortie déclarée par Terminal-Bench : 2026-08-14. Fabricant Z.ai ; préfixe source anthropic/, fournisseur du point d’accès non publié. Effort max chez Terminal-Bench ; effort LiveBench non publié. Aucune équivalence supposée. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":41.82,"lowPercent":38.59,"highPercent":45.05,"spanPercent":6.459999999999994}},{"usageLabel":"Raisonnement général","observationId":"glm-5-3-livebench-reasoning","label":"LiveBench : raisonnement","display":"85,8 %","value":85.803,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.803}},{"usageLabel":"Développement logiciel","observationId":"glm-5-3-livebench-coding","label":"LiveBench : code","display":"79,0 %","value":78.95,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.95}},{"usageLabel":"Missions longues","observationId":"glm-5-3-livebench-agentic-coding","label":"LiveBench : code autonome","display":"60,9 %","value":60.909,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":60.909}},{"usageLabel":"Maths et sciences","observationId":"glm-5-3-livebench-mathematics","label":"LiveBench : mathématiques","display":"87,9 %","value":87.898,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.898}},{"usageLabel":"Raisonnement général","observationId":"glm-5-3-livebench-data-analysis","label":"LiveBench : analyse de données","display":"70,2 %","value":70.2443,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.2443}},{"usageLabel":"Raisonnement général","observationId":"glm-5-3-livebench-language","label":"LiveBench : langue","display":"79,9 %","value":79.8563,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.8563}},{"usageLabel":"Raisonnement général","observationId":"glm-5-3-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"69,3 %","value":69.304,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":69.304}},{"usageLabel":"Développement logiciel","observationId":"glm-5-3-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"44,222 %","value":44.222,"unit":"percent","dispersion":"Erreur standard publiée : 4,289 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.3. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":44.222}}]},{"modelId":"glm-5-3-flash","name":"GLM 5.3 Flash","maker":"Z.ai","releaseDate":"2026-08-26","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/zai-org/GLM-5.3-Flash","price":null,"measuredCost":{"modelId":"glm-5-3-flash","amount":3.128822,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Raisonnement général","observationId":"glm-5-3-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"77,6 %","value":77.6443,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.6443}},{"usageLabel":"Développement logiciel","observationId":"glm-5-3-flash-livebench-coding","label":"LiveBench : code","display":"79,0 %","value":78.95,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.95}},{"usageLabel":"Missions longues","observationId":"glm-5-3-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"56,8 %","value":56.7677,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":56.7677}},{"usageLabel":"Maths et sciences","observationId":"glm-5-3-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"81,2 %","value":81.2445,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.2445}},{"usageLabel":"Raisonnement général","observationId":"glm-5-3-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"76,4 %","value":76.401,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":76.401}},{"usageLabel":"Raisonnement général","observationId":"glm-5-3-flash-livebench-language","label":"LiveBench : langue","display":"77,3 %","value":77.3073,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.3073}},{"usageLabel":"Raisonnement général","observationId":"glm-5-3-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"52,8 %","value":52.8208,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":52.8208}},{"usageLabel":"Développement logiciel","observationId":"glm-5-3-flash-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"20,515 %","value":20.515,"unit":"percent","dispersion":"Erreur standard publiée : 4,207 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/vlm/glm-5.3-flash. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":20.515}}]},{"modelId":"qwen3-8-flash-next","name":"Qwen 3.8 Flash Next","maker":"Alibaba","releaseDate":"2026-08-26","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/Qwen/Qwen3.8-Flash-Next","price":null,"measuredCost":null,"results":[{"usageLabel":"Raisonnement général","observationId":"qwen3-8-flash-next-livebench-reasoning","label":"LiveBench : raisonnement","display":"87,4 %","value":87.3798,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.3798}},{"usageLabel":"Développement logiciel","observationId":"qwen3-8-flash-next-livebench-coding","label":"LiveBench : code","display":"72,6 %","value":72.5505,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.5505}},{"usageLabel":"Missions longues","observationId":"qwen3-8-flash-next-livebench-agentic-coding","label":"LiveBench : code autonome","display":"61,6 %","value":61.6163,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":61.6163}},{"usageLabel":"Maths et sciences","observationId":"qwen3-8-flash-next-livebench-mathematics","label":"LiveBench : mathématiques","display":"85,8 %","value":85.821,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":85.821}},{"usageLabel":"Raisonnement général","observationId":"qwen3-8-flash-next-livebench-data-analysis","label":"LiveBench : analyse de données","display":"74,2 %","value":74.24,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.24}},{"usageLabel":"Raisonnement général","observationId":"qwen3-8-flash-next-livebench-language","label":"LiveBench : langue","display":"74,6 %","value":74.643,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.643}},{"usageLabel":"Raisonnement général","observationId":"qwen3-8-flash-next-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"77,1 %","value":77.1085,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":77.1085}}]},{"modelId":"nemotron-3-ultra","name":"Nemotron 3 Ultra 550B A55B","maker":"NVIDIA","releaseDate":"2026-06-04","weightsLabel":"Poids ouverts","weightsSourceUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4","price":null,"measuredCost":null,"results":[{"usageLabel":"Raisonnement général","observationId":"nemotron-3-ultra-livebench-reasoning","label":"LiveBench : raisonnement","display":"74,7 %","value":74.697,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":74.697}},{"usageLabel":"Développement logiciel","observationId":"nemotron-3-ultra-livebench-coding","label":"LiveBench : code","display":"70,7 %","value":70.698,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.698}},{"usageLabel":"Missions longues","observationId":"nemotron-3-ultra-livebench-agentic-coding","label":"LiveBench : code autonome","display":"38,7 %","value":38.7373,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":38.7373}},{"usageLabel":"Maths et sciences","observationId":"nemotron-3-ultra-livebench-mathematics","label":"LiveBench : mathématiques","display":"88,7 %","value":88.6633,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":88.6633}},{"usageLabel":"Raisonnement général","observationId":"nemotron-3-ultra-livebench-data-analysis","label":"LiveBench : analyse de données","display":"54,5 %","value":54.4567,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":54.4567}},{"usageLabel":"Raisonnement général","observationId":"nemotron-3-ultra-livebench-language","label":"LiveBench : langue","display":"70,8 %","value":70.8113,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":70.8113}},{"usageLabel":"Raisonnement général","observationId":"nemotron-3-ultra-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"73,4 %","value":73.4455,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":73.4455}},{"usageLabel":"Développement logiciel","observationId":"nemotron-3-ultra-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"4,905 %","value":4.905,"unit":"percent","dispersion":"Erreur standard publiée : 1,589 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Effort non publié dans au moins une des deux évaluations ; aucun défaut supposé. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://build.nvidia.com/nvidia/nemotron-3-ultra-550b-a55b. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":4.905}}]},{"modelId":"gemini-3-8-flash","name":"Gemini 3.8 Flash","maker":"Google","releaseDate":"2026-09-02","weightsLabel":"Poids fermés","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","price":{"modelId":"gemini-3-8-flash","inputPerMillion":0.75,"outputPerMillion":3.75,"currency":"USD","source":{"url":"https://ai.google.dev/gemini-api/docs/pricing","accessedAt":"2026-09-06","publisher":"Google"},"limitation":"Promotion jusqu’au 31 décembre 2026 ; tarif annoncé au 1er janvier 2027 : 1,50 USD en entrée et 7,50 USD en sortie par million de tokens. Hors outils facturés séparément.","service":"API Google","contextCondition":"Tarif standard, sans cache, ni lot, ni mode rapide, prompts jusqu’à 200 000 tokens.","longContext":null,"promotion":{"until":"2026-12-31","after":{"input":1.5,"output":7.5}},"reasoningBilling":"Les tokens de réflexion sont inclus dans les tokens facturés en sortie.","checkedAt":"2026-09-06","nextReviewDue":"2026-09-13"},"measuredCost":{"modelId":"gemini-3-8-flash","amount":18.491664,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"gemini-3-8-flash-terminal-bench-4","label":"Terminal-Bench 4.0","display":"19,09 %","value":19.09,"unit":"percent","dispersion":"IC à 95 % publié par la source, erreur standard par tâche : 15,73 à 22,45 %","sourceUrl":"https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/leaderboard/submissions/2026-09-01-gemini-gemini-3-8-flash-high-mini-swe-agent.json","sourceAccessedAt":"2026-09-05","organization":"Terminal-Bench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"mini-SWE-agent 2.4.6. Part des essais réussis sur 330, les erreurs comptent comme des échecs.","limitation":"Agents et versions différents selon les modèles. Cette famille recoupe une composante de l’indice Artificial Analysis. Publication : ajout au dépôt primaire, pas nécessairement première publication web. Date d’exécution non publiée. Identifiant source : gemini/gemini-3.8-flash. Date de sortie déclarée par Terminal-Bench : 2026-09-02. Exécutions réservées aux mainteneurs selon le guide primaire ; aucun contrat commercial décrit par la source. Relation commerciale : aucun contrat commercial décrit par la source. Harbor : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Laude Institute : hébergement, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Modal : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Anthropic : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. OpenAI : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Google : sponsor de calcul, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. ScaleAI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Snorkel Open Benchmarks : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Turing : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. gNucleus AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Boolean AI : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ellamind : partenaire de données, https://github.com/harbor-framework/terminal-bench/blob/83c7a6172d629c6575b785ab12c8db787bb2e323/README.md, consulté le 2026-09-05. Ces soutiens ne prouvent ni qui a exécuté la mesure, ni un biais ; ils ne changent aucun poids ni score.","visual":{"kind":"interval","valuePercent":19.09,"lowPercent":15.73,"highPercent":22.45,"spanPercent":6.719999999999999}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-8-flash-livebench-reasoning","label":"LiveBench : raisonnement","display":"89,3 %","value":89.2933,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.2933}},{"usageLabel":"Développement logiciel","observationId":"gemini-3-8-flash-livebench-coding","label":"LiveBench : code","display":"72,5 %","value":72.489,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":72.489}},{"usageLabel":"Missions longues","observationId":"gemini-3-8-flash-livebench-agentic-coding","label":"LiveBench : code autonome","display":"54,2 %","value":54.2423,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":54.2423}},{"usageLabel":"Maths et sciences","observationId":"gemini-3-8-flash-livebench-mathematics","label":"LiveBench : mathématiques","display":"91,6 %","value":91.5643,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":91.5643}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-8-flash-livebench-data-analysis","label":"LiveBench : analyse de données","display":"54,0 %","value":54.0057,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":54.0057}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-8-flash-livebench-language","label":"LiveBench : langue","display":"87,8 %","value":87.7927,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":87.7927}},{"usageLabel":"Raisonnement général","observationId":"gemini-3-8-flash-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"81,4 %","value":81.4125,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.4125}},{"usageLabel":"Développement logiciel","observationId":"gemini-3-8-flash-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"36,546 %","value":36.546,"unit":"percent","dispersion":"Erreur standard publiée : 4,184 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Version nominale et effort concordants ; identité exacte des serveurs historiques non démontrée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":36.546}}]},{"modelId":"muse-spark-1-3","name":"Muse Spark 1.3","maker":"Meta","releaseDate":"2026-09-02","weightsLabel":"Poids fermés","weightsSourceUrl":"https://research.meta.ai/blog/introducing-muse-spark-1-3","price":null,"measuredCost":null,"results":[{"usageLabel":"Raisonnement général","observationId":"muse-spark-1-3-livebench-reasoning","label":"LiveBench : raisonnement","display":"89,7 %","value":89.6538,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":89.6538}},{"usageLabel":"Développement logiciel","observationId":"muse-spark-1-3-livebench-coding","label":"LiveBench : code","display":"81,1 %","value":81.0625,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":81.0625}},{"usageLabel":"Missions longues","observationId":"muse-spark-1-3-livebench-agentic-coding","label":"LiveBench : code autonome","display":"64,1 %","value":64.091,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":64.091}},{"usageLabel":"Maths et sciences","observationId":"muse-spark-1-3-livebench-mathematics","label":"LiveBench : mathématiques","display":"96,0 %","value":95.95,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":95.95}},{"usageLabel":"Raisonnement général","observationId":"muse-spark-1-3-livebench-data-analysis","label":"LiveBench : analyse de données","display":"79,6 %","value":79.5653,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":79.5653}},{"usageLabel":"Raisonnement général","observationId":"muse-spark-1-3-livebench-language","label":"LiveBench : langue","display":"82,8 %","value":82.7937,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":82.7937}},{"usageLabel":"Raisonnement général","observationId":"muse-spark-1-3-livebench-instruction-following","label":"LiveBench : suivi des consignes","display":"78,0 %","value":78.0043,"unit":"percent","dispersion":null,"sourceUrl":"https://github.com/LiveBench/new-livebench/blob/62240f848c977d4202c1029191ac663498745f2f/public/table_2026_06_25.csv","sourceAccessedAt":"2026-09-04","organization":"LiveBench","sourceLabel":"Test extérieur","isManufacturer":false,"protocol":"Protocole commun LiveBench 2026-06-25. Moyenne arithmétique des sous-tests de la capacité, selon le code LiveBench.","limitation":"Une seule équipe publie ce résultat. Le score résume plusieurs sous-tests de la même capacité.","visual":{"kind":"bar","valuePercent":78.0043}}]},{"modelId":"glm-5-1","name":"GLM 5.1","maker":"Z.ai","releaseDate":"Date de sortie non publiée","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.z.ai/guides/llm/glm-5.1","price":null,"measuredCost":{"modelId":"glm-5-1","amount":5.701313,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"glm-5-1-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"25,768 %","value":25.768,"unit":"percent","dispersion":"Erreur standard publiée : 4,087 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.z.ai/guides/llm/glm-5.1. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":25.768}}]},{"modelId":"mimo-v2-5-pro","name":"MiMo V2.5 Pro","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","price":null,"measuredCost":{"modelId":"mimo-v2-5-pro","amount":0.2383,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"mimo-v2-5-pro-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"21,557 %","value":21.557,"unit":"percent","dispersion":"Erreur standard publiée : 4,127 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":21.557}}]},{"modelId":"mimo-v2-5","name":"MiMo V2.5","maker":"Xiaomi","releaseDate":"Date de sortie non publiée","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content","price":null,"measuredCost":{"modelId":"mimo-v2-5","amount":0.102802,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"mimo-v2-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"14,228 %","value":14.228,"unit":"percent","dispersion":"Erreur standard publiée : 3,687 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.xiaomimimo.com/docs/en-US/usage-guide/passing-back-reasoning_content. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":14.228}}]},{"modelId":"inkling-small","name":"Inkling Small","maker":"Thinking Machines Lab","releaseDate":"Date de sortie non publiée","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://tinker-docs.thinkingmachines.ai/tinker/models/","price":null,"measuredCost":{"modelId":"inkling-small","amount":0.596991,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"inkling-small-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"13,675 %","value":13.675,"unit":"percent","dispersion":"Erreur standard publiée : 3,81 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://tinker-docs.thinkingmachines.ai/tinker/models/. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":13.675}}]},{"modelId":"qwen3-7-plus","name":"Qwen 3.7 Plus","maker":"Alibaba","releaseDate":"Date de sortie non publiée","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://www.alibabacloud.com/help/en/model-studio/text-generation-model","price":null,"measuredCost":{"modelId":"qwen3-7-plus","amount":0.41923,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"qwen3-7-plus-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"12,856 %","value":12.856,"unit":"percent","dispersion":"Erreur standard publiée : 2,931 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://www.alibabacloud.com/help/en/model-studio/text-generation-model. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":12.856}}]},{"modelId":"minimax-m2-7","name":"MiniMax M2.7","maker":"MiniMax","releaseDate":"Date de sortie non publiée","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.minimax.io/docs/guides/models-intro","price":null,"measuredCost":{"modelId":"minimax-m2-7","amount":0.587624,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"minimax-m2-7-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"8,685 %","value":8.685,"unit":"percent","dispersion":"Erreur standard publiée : 1,786 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.minimax.io/docs/guides/models-intro. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":8.685}}]},{"modelId":"claude-haiku-4-5","name":"Claude Haiku 4.5","maker":"Anthropic","releaseDate":"Date de sortie non publiée","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://platform.claude.com/docs/en/about-claude/model-deprecations","price":null,"measuredCost":{"modelId":"claude-haiku-4-5","amount":0.981576,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"claude-haiku-4-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"7,551 %","value":7.551,"unit":"percent","dispersion":"Erreur standard publiée : 1,056 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://platform.claude.com/docs/en/about-claude/model-deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":7.551}}]},{"modelId":"gemini-3-flash-preview","name":"Gemini 3 Flash Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","price":null,"measuredCost":{"modelId":"gemini-3-flash-preview","amount":0.340087,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"gemini-3-flash-preview-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"6,391 %","value":6.391,"unit":"percent","dispersion":"Erreur standard publiée : 1,093 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":6.391}}]},{"modelId":"mistral-medium-3-5","name":"Mistral Medium 3.5","maker":"Mistral AI","releaseDate":"Date de sortie non publiée","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.mistral.ai/models/mistral-medium-3-5-26-04","price":null,"measuredCost":{"modelId":"mistral-medium-3-5","amount":18.623756,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"mistral-medium-3-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"5,127 %","value":5.127,"unit":"percent","dispersion":"Erreur standard publiée : 1,369 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.mistral.ai/models/mistral-medium-3-5-26-04. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":5.127}}]},{"modelId":"gemini-3-1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","maker":"Google","releaseDate":"Date de sortie non publiée","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://ai.google.dev/gemini-api/docs/deprecations","price":null,"measuredCost":{"modelId":"gemini-3-1-flash-lite-preview","amount":0.053028,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"gemini-3-1-flash-lite-preview-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"4,609 %","value":4.609,"unit":"percent","dispersion":"Erreur standard publiée : 1,069 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://ai.google.dev/gemini-api/docs/deprecations. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":4.609}}]},{"modelId":"nemotron-lightning-3-5","name":"Nemotron 3.5 Lightning","maker":"NVIDIA","releaseDate":"Date de sortie non publiée","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b","price":null,"measuredCost":{"modelId":"nemotron-lightning-3-5","amount":0.267017,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"nemotron-lightning-3-5-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"2,951 %","value":2.951,"unit":"percent","dispersion":"Erreur standard publiée : 0,951 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://fireworks.ai/models/fireworks/nemotron-lightning-3p5-30b-a3b. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":2.951}}]},{"modelId":"grok-4-20-0309-reasoning","name":"Grok 4.20 0309 Reasoning","maker":"xAI","releaseDate":"Date de sortie non publiée","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","price":null,"measuredCost":{"modelId":"grok-4-20-0309-reasoning","amount":0.289486,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"grok-4-20-0309-reasoning-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"0,314 %","value":0.314,"unit":"percent","dispersion":"Erreur standard publiée : 0,11 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Aucune mesure LiveBench code pour cette version dans le registre. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://docs.x.ai/developers/models/grok-4.20-0309-reasoning. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":0.314}}]},{"modelId":"ling-3-0-flash-2607","name":"Ling 3.0 Flash 2607, version non confirmée","maker":"Ant Group","releaseDate":"Date de sortie non publiée","weightsLabel":"Accès aux poids non renseigné","weightsSourceUrl":"https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints","price":null,"measuredCost":{"modelId":"ling-3-0-flash-2607","amount":0.060112,"currency":"USD","unit":"test","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","accessedAt":"2026-09-04","label":"coût par test mesuré par Vals, base de calcul non publiée"},"results":[{"usageLabel":"Développement logiciel","observationId":"ling-3-0-flash-2607-vals-code-migration","label":"Vals Code Migration : réécrire un programme","display":"0 %","value":0,"unit":"percent","dispersion":"Erreur standard publiée : 0 points. Pas un intervalle de confiance.","sourceUrl":"https://www.vals.ai/benchmarks/code-migration","sourceAccessedAt":"2026-09-04","organization":"Vals AI","sourceLabel":"Organisme commercial extérieur","isManufacturer":false,"protocol":"Environnement isolé hors ligne, code source et consignes fournis, livraison avec Dockerfile. Dispositif décrit par la méthode Vals consultée le 4 septembre 2026 ; champ harness non renseigné.. Part de tests de comportement cachés réussis ; moyenne des quatre langues cibles par dépôt CLI, puis moyenne des 40 dépôts. Contrôle anti-triche ; qualité du code hors score..","limitation":"Disponibilité de cette version non vérifiée ; mesure historique conservée. Vals est un évaluateur commercial. Dates des exécutions et nombre de répétitions non publiés. 120 migrations CLI ne sont pas 120 dépôts indépendants. Méthode : https://www.vals.ai/methodology. Disponibilité : https://openrouter.ai/api/v1/models/inclusionai/ling-3.0-flash-20260723/endpoints. Dossier complet : /benchmarks/vals-2026-09.json","visual":{"kind":"bar","valuePercent":0}}]}]}}