Benchmarks
Harvey LAB-AA sous le capot : pourquoi Kimi K3 y bat Claude Fable 5, et comment reproduire ce benchmark chez vous
Pierre Beunardeau · 2026-08-06
Sur Harvey LAB-AA, Kimi K3 boucle 26,7 % des 120 missions juridiques sans aucun critère manquant, contre 14,2 % pour Claude Fable 5, alors que leurs qualités moyennes ne diffèrent que d'1,1 point. Cet écart n'est ni un mystère ni un marketing : c'est la conséquence mécanique d'une notation binaire intégrale appliquée à des missions de 56 critères en médiane, et il disparaît presque quand on change de harnais d'évaluation.
Cet article démonte le benchmark pièce par pièce : architecture des tâches, double métrique, mathématique de la composition des erreurs, écarts entre les trois implémentations publiques, économie par mission résolue. Puis il donne la méthode complète pour construire votre propre évaluation d'agents juridiques, avec trois cas d'école et une checklist de protocole.

La réponse en 30 secondes
- Harvey LAB (Harvey, mai 2026) : 1 251 tâches, 24 domaines, plus de 75 000 critères écrits par des juristes ; Harvey LAB-AA (Artificial Analysis) en retient 120 missions ; cinq exemples sont présentés publiquement. Elles sont exécutées dans le framework open source Stirrup.
- Chaque mission est notée par des critères binaires : 23 au minimum, 56 en médiane, 194 au maximum par tâche (system card Anthropic). Une mission n'est résolue que si 100 % des critères passent.
- La composition des erreurs explique l'écart : sur 40 exigences, 94,64 % de réussite moyenne donne environ 11 % de chances de tout boucler, 93,56 % environ 7 %. À l'échelle d'un benchmark, 1,1 point devient 12,5 points.
- Le classement dépend du harnais : Kimi K3 mène chez Artificial Analysis (26,7 %), n'est que quatrième chez Vals AI (10,8 %, derrière Muse Spark 1.1 à 20,0 %), et Fable 5 détenait le record chez Harvey lui-même (13,3 %, juin 2026).
- Kimi K3 paie sa complétude en latence : environ 94 tours et 44 minutes par mission, contre 64 tours et 17 minutes pour Fable 5, pour un coût API inférieur (12,24 $ contre 18,94 $ par mission).
- Le coût par mission résolue renverse l'économie : environ 46 $ pour Kimi K3, 133 $ pour Fable 5, 7 $ pour Muse Spark 1.1. Ces écarts suggèrent de tester un routage multi-modèle.
- Un benchmark interne crédible tient en six briques : missions réelles, univers documentaire fermé, grilles binaires, harnais fixe, double juge calibré, double reporting.
Anatomie du benchmark
Le socle : LAB de Harvey. Publié le 6 mai 2026, le Legal Agent Benchmark contient 1 251 tâches dans 24 domaines de pratique (M&A, capital markets, contentieux, fiscalité, restructurations, travail, IP, fonds, réglementaire), évaluées par plus de 75 000 critères rédigés par des juristes (Harvey). Chaque tâche fournit un univers documentaire fermé : fichiers .docx, .xlsx, .eml, .pptx, mails, gabarits internes, pièces client, dont une partie sont des leurres. La consigne est rédigée comme une demande de travail d'associé à collaborateur, environ 50 mots, et stipule le livrable attendu et son format. La system card d'Anthropic documente les comptes de critères par tâche : minimum 23, médiane 56, maximum 194 ; 16 des 1 251 tâches ont été exclues pour défauts de données dans leurs propres runs (system card Claude Opus 4.8, consultée le 6 août 2026).
L'implémentation Artificial Analysis (LAB-AA). AA exécute 120 missions dans Stirrup, son framework agentique open source, dont cinq exemples sont accessibles au public : sandbox d'exécution de code, système de fichiers, pièces en lecture seule, pas d'accès Internet, 200 tours maximum, outil de vision pour les modèles compatibles, livrables en .docx, .xlsx ou .md. La règle de nommage est stricte : un livrable qui ne porte pas exactement le nom demandé est un livrable non produit. La notation est assurée par un juge LLM unique, critère par critère (Artificial Analysis).
L'implémentation Vals AI. Vals reprend le protocole de génération et de notation de Harvey dans son framework Valkyrie : six outils (Read File, Edit File, Write File, Glob, Bash, Grep), trois skills (docx, pptx, xlsx), Internet coupé, et deux juges, GPT 5.5 en raisonnement medium et Claude Sonnet 4.6, dont la moyenne des taux de réussite constitue le score final. Détail qui compte : Vals a corrigé en amont un bug de lecture des révisions Word qui rendait les critères de redline invisibles aux juges (Vals AI, correctif fusionné dans harveyai/harvey-labs#76).
Les deux métriques, et la mathématique qui les relie
Le criterion pass rate agrège tous les critères de toutes les missions : c'est une qualité moyenne. L'all-pass rate ne crédite une mission que si 100 % de ses critères passent : c'est une fiabilité de bout en bout.
Pourquoi 1,1 point d'écart sur la première devient 12,5 points sur la seconde ? Version simplifiée avec 40 exigences indépendantes par mission :
- 0,9464^40 ≈ 11 % de missions parfaites pour le profil Kimi K3 ;
- 0,9356^40 ≈ 7 % pour le profil Fable 5.
Les critères réels ne sont pas indépendants et les missions ne font pas toutes 56 critères, mais le mécanisme tient : sur une tâche composée, chaque critère est une multiplication de plus. La fiabilité de bout en bout croît ou s'effondre exponentiellement avec la qualité moyenne. C'est la même arithmétique qui régit les pipelines de données, et c'est pourquoi un agent « presque toujours bon » peut être inutilisable en production.

Conséquence pratique pour vos propres évaluations : ne reportez jamais le criterion pass rate seul. Un modèle à 93 % de critères peut être un excellent assistant de rédaction et un mauvais agent autonome.
Trois implémentations, trois podiums
| Implémentation | Harnais | Juges | Résultat clé | Source |
|---|---|---|---|---|
| Harvey LAB-AA | Stirrup, nommage strict, 200 tours | 1 juge LLM | Kimi K3 26,7 %, Fable 5 14,2 %, Grok 4.5 13,3 % | Artificial Analysis, 21/07/2026 |
| Vals AI | Valkyrie, 6 outils, 3 skills | 2 juges (GPT 5.5 + Sonnet 4.6), moyenne | Muse Spark 1.1 20,0 %, Grok 4.5 12,9 %, Fable 5 11,3 %, Kimi K3 10,8 % | Vals AI, 08/2026 |
| Harvey (interne) | Protocole Harvey | Protocole Harvey | Fable 5 13,3 %, record à date | Harvey, 09/06/2026 |

Le même modèle, Kimi K3, passe de 26,7 % à 10,8 % de missions résolues selon le harnais. Les variables qui bougent : outils exposés, stratégie de lecture des documents, gestion du contexte, règles de nommage, nombre et identité des juges, et même le fallback (chez Vals, Fable 5 a dégradé vers Opus 4.8 sur 4 tâches ; chez AA, sa configuration publiée est « Adaptive Reasoning, Max Effort, Opus 4.8 Fallback »).
Ce qu'un leaderboard agentique mesure est le couple modèle + harnais. Toute décision d'architecture fondée sur un seul classement est une décision fondée sur un harnais qui n'est pas le vôtre.
L'économie du benchmark
Coûts API publiés par Artificial Analysis pour les 120 missions, et coût brut par mission intégralement résolue (coût total divisé par les missions all-pass) :
| Modèle | Coût total (120 missions) | Missions résolues | Coût par mission résolue | Temps moyen | Tours moyens |
|---|---|---|---|---|---|
| Kimi K3 | 1 468,76 $ | ≈ 32 | ≈ 45,90 $ | ≈ 44,2 min | 94,15 |
| Claude Fable 5 | 2 272,81 $ | ≈ 17 | ≈ 133,69 $ | ≈ 17,4 min | 64,08 |
| Grok 4.5 | 124,76 $ | ≈ 16 | ≈ 7,80 $ | ≈ 14,4 min | 20,02 |
| Muse Spark 1.1 | 70,53 $ | ≈ 10 | ≈ 7,05 $ | ≈ 6,3 min | 23,79 |
| GLM-5.2 | 274,89 $ | ≈ 9 | ≈ 30,54 $ | ≈ 5,9 min | 60,35 |
Kimi K3 tarife à 3 $ / 15 $ par million de tokens (0,30 $ en cache), avec raisonnement permanent au niveau max ; sa vitesse observée est d'environ 39 tokens/s (Bleap, synthèse tarifaire du 21/07/2026). Son profil associe davantage de tours (94 en moyenne, 47 % de plus que Fable 5), plus de temps (2,5 fois plus) et un tarif par token inférieur ; le benchmark ne permet pas d'isoler la cause de son score.
Lecture architecturale : à 7-8 dollars par mission résolue, Grok 4.5 et Muse Spark 1.1 dominent le volume ; à 46-133 dollars, Kimi K3 et Fable 5 se justifient uniquement sur les dossiers où un critère manqué coûte plus cher que la différence. Un routeur à deux étages (modèle économique en premier passage, modèle de complétude sur les échecs ou les dossiers à enjeu) mérite d'être comparé à une stratégie mono-modèle sur vos propres dossiers.
Côté modèle : pourquoi Kimi K3 boucle plus de missions
Le benchmark ne prouve pas de causalité, mais quatre caractéristiques documentées de Kimi K3 (Moonshot, lancement du 16 juillet 2026, The GPU Trade, 19 juillet 2026) sont des explications plausibles :
- Capacité et sparsité : MoE de 2,8 trillions de paramètres, 104 milliards activés par token, 16 experts actifs sur 896.
- Contexte d'un million de tokens (1 048 576), qui réduit la compression prématurée des pièces dans une data room. Fable 5 annonce aussi 1M : la fenêtre ne suffit pas à expliquer l'écart.
- Architecture longue séquence : Kimi Delta Attention, Attention Residuals, Gated MLA, 93 couches ; Moonshot revendique 2,5 fois l'efficacité de scaling de K2, affirmation fournisseur non vérifiée indépendamment.
- Raisonnement forcé au niveau max : pas de variant non-réflexive, ce qui gonfle tours, tokens de sortie et latence, et probablement la complétude.
Contrepoint honnêteté, documenté dans la même synthèse : la précision de K3 progresse (46 % contre 33 % pour K2.6) mais son taux d'hallucination aussi (51 % contre 39 %) (Bleap, 21 juillet 2026). Pour un usage juridique, cela impose une couche de garde-fous que le modèle n'embarque pas nativement.
Méthode : construire votre évaluation interne en six étapes
Étape 1 : constituer le jeu de missions (1 journée)
Sélectionnez 20 à 30 missions réelles anonymisées, couvrant vos 3 à 5 types de dossiers dominants. Pour chacune, reconstituez un univers documentaire fermé : pièces utiles, pièces périphériques, et au moins deux leurres par mission (un contrat obsolète, un tableau d'une autre opération). C'est la présence de leurres qui sépare un test de lecture d'un test de travail.
Étape 2 : rédiger consignes et livrables (1 journée)
Consigne de 50 mots maximum, ton note d'associé, livrable nominal : nom de fichier exact, format, structure attendue. Exemple : « Produis coc-analysis-report.docx : rapport des clauses de changement de contrôle et de cession des contrats matériels de la cible, avec risques, recommandations et citations de sections. »
Étape 3 : écrire les grilles de critères (2 à 3 jours)
Visez 20 à 60 critères binaires par mission, écrits par un juriste, relus par un second. Un critère = une vérification pass/fail : clause X identifiée, section Y citée, distinction cession directe/indirecte faite, recommandation Z présente, fichier produit au bon nom. Interdisez-vous les critères « à moitié vrais » : découpez-les.

Étape 4 : figer le harnais (2 jours)
Un environnement, une liste d'outils, une limite de tours, des règles de nommage, et aucune modification en cours de campagne. Chaque changement de harnais invalide la comparaison avec la campagne précédente : versionnez-le comme du code, parce que c'en est.
Étape 5 : calibrer les juges (1 journée)
Deux juges LLM, moyenne des deux taux comme score, et surtout un étalonnage : faites noter 5 missions par un juriste senior, mesurez l'accord juge/humain critère par critère, et ne lancez la campagne que si l'accord dépasse un seuil que vous avez écrit à l'avance. Le bug des révisions Word trouvé par Vals AI montre qu'un juge mal alimenté note aveuglément : vérifiez ce que votre juge voit réellement des fichiers.
Étape 6 : présenter et rejouer les résultats (durée du jeu complet + 1 heure de synthèse)
Rapportez les deux métriques (all-pass, criterion pass rate), le coût par mission résolue, le temps et les tours. Rejouez le jeu complet à chaque nouvelle version de modèle, sans retoucher ni les missions ni les grilles : c'est la stabilité du jeu qui rend les séries temporelles exploitables.
Trois cas d'école
Les deux premiers cas reprennent des exemples documentés par les sources citées. Le troisième est un schéma type chiffré, pas un résultat client.
Cas 1 : la mission M&A Crestview. L'exemple public d'Artificial Analysis (Artificial Analysis, 21 juillet 2026) : acquisition fictive à 458 millions de dollars financée en actions, data room avec huit contrats matériels, un 10-K, un plan de rémunération différée et des pièces non pertinentes. La consigne tient en quelques lignes et exige coc-analysis-report.docx. Enseignement : la difficulté n'est pas le raisonnement juridique, c'est l'exhaustivité dans le bruit documentaire plus le respect strict du contrat de livraison. Un agent qui produit CoC_Analysis_Report_Final.docx a échoué.
Cas 2 : le bug des révisions Word (Vals AI). Les critères de redline exigeaient que le juge voie les insertions et suppressions dans les fichiers soumis ; la lecture standard des .docx les masquait, et les critères étaient notés sur une information invisible. Vals a corrigé le parseur et fusionné le correctif en amont (harveyai/harvey-labs#76). Enseignement : avant de conclure qu'un modèle échoue, auditez le chemin que ses livrables font jusqu'au juge. Cet exemple montre que certaines erreurs attribuées au modèle peuvent venir du harnais.
Cas 3 : le routage à deux étages. Hypothèse de production : 1 000 revues de contrats par mois. Stratégie mono-modèle Fable 5 au coût du benchmark : environ 19 000 dollars d'API. Stratégie routée : premier passage au profil Muse Spark 1.1 (0,59 $ par mission), second passage au profil Kimi K3 (12,24 $) sur les 30 % de dossiers signalés ou échoués : environ 4 300 dollars, sans conclusion sur la qualité finale, qui doit être mesurée sur les mêmes dossiers. Enseignement : le bon indicateur de décision n'est ni le leaderboard ni le prix token, c'est le coût par mission résolue sur votre distribution de dossiers.

Les erreurs fréquentes d'évaluation
Comparer des scores entre harnais. 26,7 % chez AA et 10,8 % chez Vals pour le même modèle : sans harnais identique, deux chiffres ne se comparent pas.
Reporter le criterion pass rate comme un taux de réussite. 94 % de critères peut signifier zéro mission parfaitement bouclée. Les deux métriques, toujours.
Faire confiance à un juge unique non calibré. Sans mesure d'accord avec un juriste sur un échantillon, vous ne savez pas ce que votre juge note. Deux juges minimum, un étalonnage humain, un seuil écrit.
Oublier que le modèle testé n'est peut-être pas celui que vous croyez. Fallbacks, configurations de raisonnement, versions d'API : consignez la configuration exacte de chaque run, comme le font AA (« Adaptive Reasoning, Max Effort, Opus 4.8 Fallback ») et Vals (4 tâches en fallback documentées).
Prendre le coût benchmark pour un coût production. Il exclut revue humaine, infrastructure, relances et conformité, qui dominent la facture réelle.
Contaminer le jeu de test. Le jeu évalué de LAB-AA est gardé privé précisément pour limiter la contamination. Vos missions internes doivent rester hors de tout corpus d'entraînement ou de fine-tuning.
Checklist avant de lancer votre benchmark interne

- 20 à 30 missions réelles anonymisées, avec au moins deux leurres documentaires chacune
- Consignes de 50 mots maximum, livrable nominal avec nom de fichier exact
- 20 à 60 critères binaires par mission, écrits et relus par deux juristes
- Harnais versionné : outils, limite de tours, règles de nommage figées
- Deux juges LLM, accord avec un juriste senior mesuré sur 5 missions, seuil écrit
- Chemin de lecture des livrables audité (révisions, tableaux, annexes visibles par le juge)
- Double reporting all-pass + criterion pass rate, coût par mission résolue, temps, tours
- Configuration exacte de chaque modèle consignée par run
- Jeu de test isolé de tout corpus d'entraînement
Conclusion
Harvey LAB-AA vaut moins pour son podium que pour sa méthode : des missions réelles, des critères binaires, une notation intégrale impitoyable. La leçon technique de l'été 2026 est double. D'un côté, sur cet instantané, Kimi K3 montre qu'un modèle open weight peut mener cette implémentation de l'évaluation. De l'autre, le même modèle perd 16 points en changeant de harnais : votre harnais est votre benchmark. Construisez le vôtre, calibrez vos juges, reportez l'all-pass, et laissez les classements publics faire ce qu'ils font le mieux : des signaux, pas des décisions.
FAQ
Pourquoi les trois implémentations de Harvey LAB donnent-elles des classements différents ?
Parce qu'un benchmark agentique est un système complet : harnais, outils, gestion du contexte, nommage des livrables, juges. Kimi K3 obtient 26,7 % chez Artificial Analysis (Stirrup, juge unique, nommage strict) et 10,8 % chez Vals AI (Valkyrie, deux juges). Le classement mesure le couple modèle + harnais, jamais le modèle seul.
Quelle est la différence entre criterion pass rate et all-pass rate ?
Le premier est la proportion de critères satisfaits, une qualité moyenne ; le second est la proportion de missions dont 100 % des critères passent, une fiabilité. Sur LAB-AA, Kimi K3 et Fable 5 sont à 1,1 point sur la qualité moyenne et à 12,5 points sur la fiabilité, parce que les erreurs se composent sur des dizaines de critères.
Comment sont notées les productions des agents ?
Par des grilles de critères binaires écrits par des juristes (23 à 194 par tâche, 56 en médiane), cochées par un juge LLM chez Artificial Analysis, par deux juges moyennés chez Vals AI. Une mission n'est résolue que si tous ses critères passent.
Le coût par mission du benchmark est-il représentatif d'un déploiement réel ?
Non : il ne mesure que les tokens API de l'évaluation (12,24 $ pour Kimi K3, 18,94 $ pour Fable 5 par mission). Il reste utile pour comparer les architectures : le coût par mission résolue varie de 7 $ (Muse Spark 1.1) à 133 $ (Fable 5), ce qui rend le routage à deux étages intéressant à évaluer.
Quels outils les agents utilisent-ils le plus dans ce benchmark ?
Dans les statistiques publiées par Vals AI : massivement Bash et Read File, régulièrement Write File, rarement Edit File, Glob et Grep (Grep étant peu adapté aux .docx/.pptx/.xlsx). Parmi les skills, docx domine devant xlsx et pptx.
Comment construire un benchmark juridique interne crédible ?
Six briques : 20 à 30 missions réelles anonymisées avec univers documentaire fermé et leurres, consignes courtes, grilles de 20 à 60 critères binaires, harnais versionné, deux juges calibrés sur un échantillon noté par un juriste, double reporting all-pass + criterion pass rate rejoué à chaque release.
Sources
- Artificial Analysis, Harvey LAB-AA Leaderboard, instantané du 21 juillet 2026. artificialanalysis.ai
- Harvey, Introducing Harvey's Legal Agent Benchmark, 6 mai 2026. harvey.ai
- Harvey, Anthropic Fable 5 Now Available, 9 juin 2026. harvey.ai
- Vals AI, Harvey's Legal Agent Benchmark, août 2026. vals.ai
- Anthropic, Claude Opus 4.8 System Card, section Legal Agent Benchmark, consultée le 6 août 2026. anthropic.com
- Bleap, Kimi K3 Review : tarifs, licence Modified MIT, hallucinations 51 %, vitesse 39 tokens/s, 21 juillet 2026. bleap.finance
- The GPU Trade, annonce Kimi K3 et architecture, 16 juillet 2026. thegputrade.com