Trois jours, trois éditeurs, trois philosophies de facturation : Google vend les tokens, ces unités de texte qui valent environ trois quarts d'un mot, au prix plancher de 0,75 dollar le million en entrée avec Gemini 3.8 Flash, Meta vend ceux de Muse Spark 1.3 à 0,10 dollar si vous acceptez que vos données entraînent ses modèles, et Anthropic n'a pas baissé le prix de Claude Fable 5.1 mais celui de sa mémoire, le cache. Le bon choix ne se lit pas sur la grille tarifaire : il se calcule au coût réel de votre workflow, à la valeur de vos données et à votre capacité à changer de fournisseur.
Les tokens sont devenus la monnaie de l'IA, et chaque éditeur vient d'en changer le cours à sa manière. Cet article vérifie les trois offres aux sources primaires, démonte ce que le prix affiché cache, puis livre une grille de décision et un cas appliqué. Pas de tableau de benchmarks, ces bancs d'essai qui comparent les modèles en laboratoire : ce qui nous intéresse ici est votre facture, pas leur classement.
« 3.8 Flash works harder. […] At times, the model might use more tokens to maximize performance, especially at higher effort levels. »
Google DeepMind, « Introducing Gemini 3.8 Flash and 3.8 Flash Cyber », 2 septembre 2026. En français : le modèle travaille plus, et peut consommer plus de tokens pour y arriver. L'aveu est rare et utile : un prix unitaire bas ne dit rien de la quantité achetée.

L'essentiel en six points
- Google a lancé Gemini 3.8 Flash le 2 septembre 2026 au même prix promo que le 3.7 : 0,75 dollar par million de tokens en entrée, 3,75 en sortie, jusqu'au 31 décembre 2026, puis 1,50 et 7,50 dollars au 1er janvier 2027, selon la page tarifaire officielle de l'API Gemini.
- Meta a lancé Muse Spark 1.3 le 2 septembre 2026 au prix inchangé de 1,25 et 4,25 dollars, avec une offre « Contributor » à 0,10 et 0,20 dollar si vous acceptez que vos requêtes et ses réponses servent à entraîner ses futurs modèles, selon sa page « Pricing and rate limits » ; The New Stack en donnait le contexte dès le 1er septembre.
- Anthropic n'a rien baissé le 1er septembre : Claude Fable 5.1 reste à 10 et 50 dollars le million de tokens, mais la lecture du cache passe à 0,25 dollar, 75 % de moins que Fable 5, avec une économie estimée par l'éditeur à 25 % sur une charge typique, selon la page officielle de Fable.
- Le prix unitaire n'est pas la facture. Google prévient que 3.8 Flash peut consommer plus de tokens pour maximiser la performance, Meta annonce environ 20 % d'appels d'outils et 25 % de tokens en moins par rapport à Muse Spark 1.2 dans ses comparaisons internes, et le cache d'Anthropic ne paie que si votre agent est bien construit.
- L'axe décisif pour une PME est souvent ailleurs : qui peut entraîner sur vos données, ce que la promo devient en janvier, et si vos workflows survivent à un changement de fournisseur.
- Les trois offres se combinent dans une même entreprise. La bonne question n'est pas « quel modèle » mais « quelle philosophie de facturation pour quel workflow ».
Trois offres, trois philosophies, vérifiées aux sources
Google : le prix plancher, en promotion jusqu'à fin 2026
Le billet officiel de Google DeepMind, daté du 2 septembre 2026, présente Gemini 3.8 Flash comme son modèle de labeur le plus intelligent, troisième version Flash en six semaines. Le prix reste calé sur celui du 3.7 : 0,75 dollar par million de tokens en entrée et 3,75 en sortie. La page Pricing de l'API Gemini, mise à jour le 2 septembre, précise le cadre : ce tarif est promotionnel jusqu'au 31 décembre 2026, puis passe à 1,50 et 7,50 dollars le 1er janvier 2027. Le cache y coûte 0,075 dollar le million relu.
Deux détails de la même page tarifaire méritent l'attention d'une PME. Le palier gratuit utilise vos contenus pour améliorer les produits Google ; le palier payant, non. Et, selon le billet de lancement, le modèle est disponible partout, API, AI Studio, Antigravity, Gemini Enterprise, abonnements Pro et Ultra, ce qui compte quand on veut tester avant d'engager. Enfin, le billet précise que 3.7 Flash « remains fully supported for efficiency-first workloads » : si votre contrainte est le coût unitaire et non la qualité, l'ancien reste au catalogue.
Meta : la remise payée en données
Le billet officiel de Meta Research, daté du 2 septembre 2026, annonce Muse Spark 1.3 dans Muse Code et l'API Meta Model, avec un mode de raisonnement maximal retardé le temps de tests de sécurité. Meta y revendique, dans les comparaisons de ses propres ingénieurs, environ 20 % d'appels d'outils et 25 % de tokens en moins que Muse Spark 1.2 pour un travail équivalent. Le tarif standard reste celui du 1.2 : 1,25 dollar en entrée, 4,25 en sortie.
Le vrai sujet est l'offre « Contributor ». Selon la page tarifaire de Meta, elle ramène le million de tokens à 0,10 dollar en entrée et 0,20 en sortie, contre 1,25 et 4,25 en standard : la remise se paie en données, car vos requêtes et les réponses du modèle servent alors à entraîner les futurs modèles de Meta, « in exchange for permission to use your prompts and completions to train future Meta models », écrit l'éditeur. L'écart est d'environ 12 fois en entrée et 21 fois en sortie, et Meta plafonne l'offre Contributor à 100 requêtes et 3 millions de tokens par minute, contre 3 000 requêtes et 4 millions de tokens en standard, selon sa page « Pricing and rate limits ». Des dirigeants d'ingénierie ont dit à The New Stack que ce troc était inenvisageable pour leur code propriétaire. C'est exactement la question qu'une PME doit se poser avant de regarder le prix.
Muse Code, l'agent de code de Meta, est sorti de bêta, annoncé le 31 août et rapporté le 1er septembre, avec des abonnements à 5, 15 et 50 dollars par mois, une messagerie entre sessions, un moteur qui coordonne plusieurs agents et un kit de développement en avant-première, toujours selon The New Stack. Le même article raconte un test, mené sur Muse Code alors motorisé par Muse Spark 1.2, qui vaut toutes les grilles tarifaires : sur trois tâches identiques, Muse Code a coûté beaucoup moins cher que Claude Code, mais a consommé nettement plus de tokens et produit un résultat plus faible sur un remaniement de code. Le prix était bas, le coût du travail utile, moins clair.
Anthropic : le prix stable, la mémoire bradée
Pas de baisse frontale chez Anthropic. La grille officielle, consultée le 3 septembre 2026, maintient Claude Fable 5.1 à 10 dollars le million de tokens en entrée et 50 en sortie, comme Fable 5. Ce qui change, c'est la lecture du cache : 0,25 dollar le million, contre 1 dollar pour Fable 5, soit 75 % de moins, avec une économie estimée par l'éditeur à 25 % sur les charges typiques et jusqu'à environ 45 % sur les charges très agentiques, ces workflows où le modèle enchaîne beaucoup d'étapes et d'outils, comme le précise la page Fable. Ce sont des estimations de l'éditeur, pas une garantie.
Le cache ne marche que si votre agent conserve un début de requête identique entre ses appels : mêmes outils, même consigne, mêmes documents, données variables à la fin. Nous l'avons démontré chiffres à l'appui dans notre analyse du cache de Fable 5.1 et de l'architecture d'agent qu'il exige, sans la répéter ici. Deux autres lignes de la même page comptent pour une PME : Fable impose par défaut une conservation des données de trente jours pour la surveillance de sécurité, et les requêtes signalées par les garde-fous cyber ou bio sont reroutées vers des modèles Opus, sans être facturées au tarif Fable.
Ce que le prix affiché ne dit jamais
Le prix se paie au token, mais le nombre de tokens n'est pas écrit dans la grille. Google le dit lui-même pour 3.8 Flash : sur les tâches complexes, le modèle « travaille plus », enchaîne des étapes de raisonnement supplémentaires et peut consommer davantage pour maximiser la performance, surtout aux niveaux d'effort élevés, comme le cite l'exergue du billet DeepMind. Meta promet l'inverse dans ses comparaisons internes, 20 % d'appels d'outils et 25 % de tokens en moins, mais ce sont des mesures de l'éditeur sur ses propres tâches, pas les vôtres, comme le précise le billet Meta Research.
Le test de The New Stack, mené sur Muse Spark 1.2, tranche le débat dans le bon sens : à tâche identique, le produit le moins cher au token a consommé plus de tokens et livré un résultat plus faible, laissant du code mort sur une tâche et un remaniement plus faible sur une autre, raconte l'enquête du 1er septembre. La conséquence méthodologique est simple : la seule unité qui compte est le coût par tâche terminée et validée, mesuré chez vous, sur vos dossiers. C'est la discipline que nous appliquons dans notre méthode pour choisir un modèle par workflow, qui part de la qualité et du coût par tâche plutôt que du tarif affiché.
Le cache ajoute une variable d'architecture : il ne réduit la facture que si votre agent garde un préfixe stable, et les estimations d'Anthropic, 25 % en typique, jusqu'à 45 % en très agentique, supposent des lectures réellement servies depuis le cache, comme l'écrit la page Fable. Un agent mal construit paiera le plein tarif avec le sentiment d'avoir « activé l'économie ».
L'axe données : ce que vous payez sans ligne de facture
La deuxième monnaie de cette semaine, c'est vos contenus. L'offre Contributor de Meta est explicite : prix cassé contre droit d'utiliser requêtes et réponses pour entraîner les futurs modèles de Meta, selon la page tarifaire de Meta. Google joue la même partition sur son palier gratuit, dont les contenus servent à améliorer ses produits, là où le palier payant les exclut, indique la page Pricing de l'API Gemini. Anthropic, de son côté, impose trente jours de conservation des données pour la surveillance de sécurité sur Fable, avec une option zéro rétention pour les clients éligibles, précise la page officielle.
Pour une PME française, le tri se fait en trois questions. Quelles données passent dans ce workflow : code propriétaire, données clients, données anonymisées ? Que dit le contrat de traitement des données du palier choisi, pas du produit en général ? Et qui, dans l'entreprise, a autorisé ce transfert ? Une offre Contributor sur des données clients ou un code qui fait votre avantage n'est pas une remise, c'est une cession. Sur des contenus publics ou anonymisés, elle peut être un excellent calcul.
Les réactions des développeurs à l'annonce illustrent les deux lectures possibles, sans constituer une preuve de qualité ou de conformité. Le 2 septembre 2026, l'utilisateur Hacker News jmward01 saluait une tarification qui dit explicitement « we train on this and value it this much », dans le fil de lancement. Le même jour, finnjohnsen2 résumait sa défiance ainsi : « one is cheap because it lets me “be the product” », dans le même débat. Le premier voit une transparence quantifiable, le second un problème de confiance. La page tarifaire établit la contrepartie ; ces témoignages montrent seulement comment elle est reçue.
L'axe accès : les capacités deviennent un produit à part
Troisième signal de la semaine : la capacité elle-même se vend désormais en gammes verrouillées. Google réserve Gemini 3.8 Flash Cyber, sa variante détection et correction de vulnérabilités, à des défenseurs de confiance via le programme Fairwind : autorités gouvernementales, opérateurs d'infrastructures critiques et mainteneurs de logiciels, avec des résultats revendiqués comme 2,6 fois plus de correctifs valides sur Chrome que les meilleurs modèles commerciaux plus gros, selon le billet DeepMind. Pour une PME, la leçon est indirecte mais réelle : le modèle que vous achetez par défaut n'est pas toujours le modèle dont on parle dans la presse.
Opinion de Pierre Beunardeau : un scénario pédagogique suffit à voir l'effet de ces trois logiques sur une trésorerie mensuelle. Prenez un flux répétitif de 200 dossiers par jour, chacun envoyant 30 000 tokens en entrée et recevant 2 000 tokens en sortie, avec un gabarit stable. Aux prix affichés le 3 septembre 2026 sur la page Pricing de Gemini, la page tarifaire de Meta et la grille Anthropic, la journée coûte environ 6,00 dollars avec Gemini 3.8 Flash, 9,20 dollars avec Muse Spark 1.3 standard, 0,68 dollar en Contributor, et 27,35 dollars avec Fable 5.1 si neuf appels sur dix relisent le gabarit depuis le cache, contre 80 dollars sans cache. Ce n'est ni une prévision ni une mesure : c'est l'arithmétique des grilles, qui montre que l'écart entre fournisseurs se joue moins sur le prix catalogue que sur la réutilisation, le plafond de débit et la clause sur les données.
En filigrane, la géographie rejoint la facture. Mistral a levé 830 millions de dollars de dette le 30 mars 2026 pour son centre de données de Bruyères-le-Châtel et ses 13 800 GPU, rapporte Boursorama : « hébergé en France » devient une option crédible dans un comparatif de coûts et de droit. Et Moonshot négocierait jusqu'à 30 % de partage de revenus avec Microsoft, Amazon et Google pour son modèle Kimi K3, selon Newsquawk au 26 août 2026, une négociation rapportée et non confirmée qui montre surtout que les poids ouverts, les paramètres téléchargeables d'un modèle qu'on peut héberger soi-même, se monétisent aussi par redevance. Meta a d'ailleurs mis la publication des poids ouverts de Muse Spark sur sa feuille de route, sans date, dans son billet du 2 septembre. Quand les poids ouverts arrivent, la question « qui héberge » devient un levier de coût et de réversibilité de plus.
La grille de décision Origin
Une comparaison tarifaire devient utile quand chaque exécution produit une ligne de comptabilité technique. Avant de tester un modèle, fixez le résultat attendu et les compteurs que vous conserverez.
| Champ du relevé | Gemini 3.8 Flash | Muse Spark 1.3 | Claude Fable 5.1 |
|---|---|---|---|
| Référence de prix | promotion puis tarif 2027 | standard ou Contributor | entrée, sortie et lecture de cache |
| Variable cachée | effort et jetons supplémentaires | droit d'entraînement et débit | stabilité du préfixe mémorisé |
| Preuve à collecter | jetons facturés par dossier clos | identifiant du palier appelé | lectures servies depuis le cache |
| Événement de révision | 1er janvier 2027 | changement de politique de données | modification des outils ou consignes |
| Critère de sortie | coût accepté au tarif normal | contenu devenu confidentiel | taux de cache insuffisant |
- ☐ Échantillonner vingt tâches comparables. Chaque dossier reçoit un identifiant, une difficulté et un résultat attendu avant l'appel.
- ☐ Relever les quatre compteurs bruts. Entrée, sortie, cache et nouvelles tentatives restent séparés ; une moyenne globale masque le moteur de la facture.
- ☐ Compter les reprises humaines. Une réponse rejetée, corrigée ou recommencée coûte du temps même si l'API l'affiche à quelques centimes.
- ☐ Étiqueter le palier juridique. Gratuit, payant, standard ou Contributor figure sur la ligne de mesure, avec la règle d'utilisation des contenus qui lui correspond.
- ☐ Projeter deux factures. L'une avec le prix du 3 septembre, l'autre avec les conditions déjà annoncées pour janvier ; une promotion ne devient jamais le budget permanent.
- ☐ Fixer un seuil de réexamen. Volume, taux de cache, nombre de reprises ou changement de sensibilité déclenchent une nouvelle comparaison, pas un renouvellement automatique.
Apport Origin : notre livrable n'est pas un classement de modèles, mais un registre de coût par dossier accepté. Une ligne associe le modèle exact, le palier, les jetons entrants et sortants, les lectures mémorisées, les nouvelles tentatives, le temps de reprise et le verdict final. Le registre permet d'expliquer pourquoi un modèle à 10 dollars peut revenir moins cher qu'un autre à 0,75 dollar, ou l'inverse, sans extrapoler un banc d'essai. Pour construire le préfixe stable dont dépend la mémoire Fable, renvoyez-vous à notre analyse dédiée du cache de Claude Fable 5.1. Pour arbitrer ensuite qualité, délai et autonomie, utilisez notre méthode de choix d'un modèle par workflow.
Réconcilier la facture avec les tâches réellement livrées
Le relevé technique et la facture fournisseur ne parlent pas spontanément la même langue. L'un connaît un dossier, une nouvelle tentative et un verdict ; l'autre additionne des unités d'entrée, de sortie et de cache. La réconciliation consiste à raccrocher chaque ligne facturée à un identifiant métier.
Conservez cinq étiquettes dans les métadonnées de chaque appel : job_id pour le dossier, model_id pour la version, pricing_tier pour le palier, attempt_no pour la tentative et accepted pour le verdict du relecteur. Ajoutez cached_input lorsque le fournisseur expose ce compteur. Une somme mensuelle peut alors être ventilée sans deviner pourquoi elle a monté.
Trois anomalies deviennent immédiatement visibles. Un dossier bon marché mais recommencé quatre fois signale un problème de qualité. Une série Fable sans lecture mémorisée révèle un préfixe instable. Une ligne Muse marquée Contributor sur un projet classé confidentiel déclenche une alerte contractuelle avant même la clôture comptable.
Le contrôle mensuel tient sur une page : rapprocher les unités de la facture, isoler les appels sans job_id, examiner les dossiers rejetés, puis signer le palier autorisé pour le mois suivant. Cette mécanique n'élit aucun vainqueur universel. Elle produit une décision auditable pour un usage nommé, et permet au responsable financier de discuter avec l'équipe technique sur les mêmes données.
Le dictionnaire du relevé mérite d'être figé lui aussi. input_tokens désigne ce qui entre, output_tokens ce qui sort, cache_read ce qui est relu à tarif réduit, cache_write ce qui est nouvellement mémorisé, tool_calls les actions externes et retry_count les reprises. Ajoutez la devise, la région de facturation, la remise négociée, les taxes, la date d'usage et le numéro de facture. Sans ce vocabulaire partagé, deux tableaux portant le même total peuvent raconter des consommations différentes.
Enfin, conservez le prix catalogue séparément du prix effectivement payé. Un avoir, un crédit promotionnel ou un engagement de volume réduit la facture du mois, mais ne décrit pas le coût futur du modèle. La colonne list_price garde la grille publique ; la colonne net_price garde le montant après réduction. Cette séparation rend le prochain appel d'offres comparable au précédent.
Archivez aussi le bordereau brut du fournisseur. Arrondis, fuseau horaire, conversion monétaire, minimum de facturation, abonnement prépayé et frais de dépassement peuvent expliquer un écart résiduel. Le rapprochement se clôt seulement quand le total ventilé rejoint la pièce comptable, centime après centime.
Cas appliqué : trois workflows d'une PME de services
Prenons un scénario de décision reproductible, sans prétendre qu'il décrit un client Origin. Une PME de services soumet vingt comptes rendus anonymisés aux trois modèles. Le résultat attendu est un résumé structuré comportant cinq rubriques, relu par la même personne. Le registre distingue chaque nouvelle tentative et refuse de compter comme « terminée » une réponse que le relecteur doit réécrire.
Gemini démarre avec son prix promotionnel, mais le tableur calcule immédiatement la colonne de janvier. Muse est testé en standard, car l'anonymisation ne suffit pas à autoriser une réutilisation contractuelle des contenus. Fable reçoit un préfixe identique contenant les règles et le plan des rubriques ; seules les notes variables arrivent à la fin, afin de mesurer de vraies lectures de cache.
Au vingtième dossier, l'équipe ne compare pas trois factures abstraites. Elle compare trois coûts complets : API, nouvelles tentatives et minutes de reprise. Elle conserve aussi les anomalies, par exemple un appel anormalement long ou un cache manqué après une modification de consigne. Le choix reste valable pour ce format précis, à ce volume précis, jusqu'au prochain événement de révision.
Ce que ce comparatif ne dit pas
- Les prix bougent. La promo Google expire le 31 décembre 2026, Meta peut revoir Contributor, et toute grille citée ici doit être relue au jour de votre décision. Nos chiffres sont vérifiés au 3 septembre 2026.
- Les économies annoncées sont des estimations d'éditeurs. Les baisses de consommation de Meta et les gains de cache d'Anthropic décrivent leurs charges de test, pas vos workflows ; seule une semaine de compteurs chez vous les confirme.
- Aucun classement de performance ici. Ce comparatif exclut volontairement les bancs d'essai : un score de laboratoire ne paie pas une facture, et notre précédent comparatif de benchmarks reste disponible pour cette lecture-là.
- Moonshot est une négociation rapportée. Le chiffre de 30 % vient d'une dépêche Newsquawk du 26 août 2026, non confirmée par les parties ; il illustre une tendance de monétisation, pas un contrat signé.
- Les conditions de Contributor se lisent avant tout achat. Contrat de traitement des données, périmètre d'entraînement, possibilité de retrait : trois documents, pas un prix.
FAQ
Le moins cher des trois est-il vraiment moins cher ?
Au token, oui : l'offre Contributor de Meta est la moins chère des trois grilles, à 0,10 et 0,20 dollar le million. À la tâche, rien ne le garantit : le test de The New Stack, mené sur Muse Spark 1.2, a mesuré plus de tokens consommés et un résultat plus faible sur un remaniement de code, et Google prévient que 3.8 Flash peut consommer davantage pour maximiser la performance. Le seul chiffre qui tranche est le coût par tâche validée, mesuré sur vos dossiers.
Puis-je utiliser l'offre Contributor de Meta avec des données clients ?
Techniquement oui, mais c'est une cession : vos requêtes et les réponses du modèle servent à entraîner les futurs modèles de Meta. Pour des données clients, du code propriétaire ou un secteur réglementé, c'est en pratique inacceptable sans analyse juridique, et plusieurs dirigeants d'ingénierie l'ont dit publiquement à The New Stack. Réservez ce palier à des contenus publics ou réellement anonymisés.
Le cache de Claude m'oblige-t-il à réécrire mon agent ?
Pas à réécrire, à structurer. Le cache ne paie que si votre agent envoie un début de requête identique à chaque appel : outils et consigne stables en tête, données variables à la fin. Si votre agent reconstruit son contexte dans un ordre changeant, la lecture à 0,25 dollar n'arrivera jamais et vous paierez l'entrée plein tarif. La mesure se fait sur les compteurs de l'API, pas sur une impression.
Que se passe-t-il le 1er janvier 2027 pour Gemini 3.8 Flash ?
Le prix promotionnel prend fin le 31 décembre 2026 : l'entrée passe de 0,75 à 1,50 dollar le million de tokens et la sortie de 3,75 à 7,50, selon la page tarifaire officielle de Google. Si votre calcul de rentabilité tient sur la promo, refaites-le au tarif standard avant d'engager un volume.
Sources
- Meta, « Pricing and rate limits », Meta Model API, consultée le 3 septembre 2026. Tarifs Standard et Contributor de Muse Spark 1.3, plafonds de requêtes et de tokens, contrepartie d'entraînement.
- Google DeepMind, « Introducing Gemini 3.8 Flash and 3.8 Flash Cyber », 2 septembre 2026, consulté le 3 septembre 2026. Annonce, philosophie « works harder », programme Fairwind.
- Google AI for Developers, « Gemini API Pricing », mise à jour le 2 septembre 2026, consultée le 3 septembre 2026. Tarifs promo, date de fin, tarifs 2027, paliers gratuit et payant.
- Meta Research, « Introducing Muse Spark 1.3 », 2 septembre 2026, consulté le 3 septembre 2026. Disponibilité, comparaisons internes, poids ouverts sur la feuille de route.
- The New Stack, « Meta's Claude Code rival exits beta with three new subscription tiers », 1er septembre 2026, consulté le 3 septembre 2026. Sortie de bêta de Muse Code, tarifs Standard et Contributor, abonnements, test comparatif.
- OrcaRouter, « Muse Spark 1.3 Contributor launches at $0.10/$0.20 », 2 septembre 2026, consulté le 3 septembre 2026. Écarts de prix et limites de débit de l'offre Contributor.
- Anthropic, « Claude Fable » et « Pricing », consultés le 3 septembre 2026. Tarifs Fable 5.1, lecture de cache, estimations d'économie, rétention des données.
- Boursorama, « Mistral lève 830 M$ pour renforcer son centre de données près de Paris », 30 mars 2026, consulté le 3 septembre 2026.
- Newsquawk, dépêche sur la négociation Moonshot, 26 août 2026, consultée le 3 septembre 2026. Négociation rapportée, non confirmée.
