Prenez une phrase, traduisez-la en anglais, envoyez les deux versions à une IA. La version française consommera plus de tokens, donc coûtera plus cher, et occupera davantage de place dans la mémoire de travail du modèle. À contenu identique. Ce n'est ni un bug ni une discrimination volontaire : c'est une conséquence directe de la façon dont ces systèmes découpent le texte. Voici l'explication, et ce que vous pouvez y faire.
C'est l'un des angles morts les plus concrets de l'IA pour les francophones. On parle beaucoup des biais culturels des modèles, moins de cette inégalité mécanique et chiffrable qui touche votre facture et les limites de vos conversations. Décortiquons-la.
Rappel : le token, l'unité qui compte
Une IA ne lit pas des mots, elle lit des tokens, ces fragments de texte qui sont son unité de base, comme nous l'avons expliqué dans notre article dédié. Tout est facturé au token, et la fenêtre de contexte, cette mémoire de travail dont nous parlions dans un autre article, se mesure également en tokens.
L'outil qui effectue ce découpage s'appelle le tokenizer. Et c'est lui qui est responsable de l'inégalité entre les langues.
Pourquoi le français est désavantagé
Un tokenizer n'est pas programmé à la main. Il est appris sur un corpus de textes, en identifiant les séquences de caractères les plus fréquentes pour leur attribuer un token unique. La logique est celle de la compression : ce qui revient souvent obtient un raccourci.
Or les corpus d'entraînement sont massivement dominés par l'anglais. Conséquence directe : les mots anglais courants ont chacun leur token dédié, tandis que les mots français sont plus souvent découpés en plusieurs morceaux. Le mot "the" est un token. Le mot "anticonstitutionnellement" en vaut évidemment plusieurs, mais même des mots français banals se retrouvent fragmentés.
Trois caractéristiques de notre langue aggravent la situation. Les accents d'abord : é, è, ç, ù sont moins fréquents dans les corpus, donc moins bien optimisés, et un mot accentué peut se découper là où son équivalent sans accent ne le serait pas. La morphologie riche ensuite : nos conjugaisons et nos accords multiplient les formes d'un même mot, ce qui dilue leur fréquence individuelle et réduit leurs chances d'obtenir un token propre. Enfin la longueur moyenne : le français est structurellement plus verbeux que l'anglais, avec des articles, des prépositions et des constructions plus longues pour dire la même chose.
En français, comptez environ un token pour 0,7 mot, là où l'anglais tourne plutôt autour d'un token pour 0,75 mot, avec des écarts qui varient selon les modèles et les tokenizers. À l'échelle d'une phrase, c'est négligeable. À l'échelle d'un livre entier passé à une IA, d'un agent qui tourne en boucle ou d'une facture mensuelle d'entreprise, l'écart devient une ligne budgétaire. Et il faut savoir qu'un changement de tokenizer entre deux versions d'un même modèle peut faire varier la consommation de manière notable, ce qui a surpris plus d'un développeur en découvrant sa facture.
Les trois conséquences concrètes
Vous payez plus cher. À contenu identique, un texte français coûte mécaniquement davantage qu'un texte anglais, en entrée comme en sortie. Pour un usage personnel, c'est indolore. Pour une entreprise qui traite des millions de documents, c'est un surcoût structurel lié à la langue de travail.
Votre fenêtre de contexte se remplit plus vite. C'est peut-être plus gênant que le prix. Si un modèle accepte un million de tokens, vous y ferez tenir moins de pages en français qu'en anglais. Sur une longue conversation ou un gros document, vous atteindrez la limite plus tôt, et le modèle perdra de vue le début de l'échange avant qu'un anglophone n'ait ce problème.
La qualité peut souffrir à la marge. Un mot découpé en quatre fragments est un peu plus difficile à traiter qu'un mot représenté par un token unique. Ce n'est pas dramatique sur les modèles récents, très solides en français, mais cela explique en partie pourquoi les performances restent souvent légèrement meilleures en anglais, notamment sur les tâches les plus techniques.
Ce que vous pouvez faire
Pour un usage courant, ne changez rien. Écrire en français dans votre langue de pensée produit de meilleures réponses que forcer un anglais approximatif. L'écart de coût ne justifie pas de dégrader votre demande.
Pour un usage intensif ou automatisé, mesurez. Si vous faites tourner un agent ou traitez de gros volumes, comparez le coût réel de vos tâches en français et en anglais sur vos cas précis. Sur certains traitements techniques, notamment le code où les mots-clés sont anglais de toute façon, passer les instructions système en anglais peut réduire la facture sans rien perdre en qualité. C'est le même réflexe de mesure que celui que nous recommandions à propos du coût caché des tokens de raisonnement.
Soignez la concision. Un prompt bavard coûte plus cher qu'un prompt précis, et le français invite naturellement à la circonvolution. Aller droit au but est doublement rentable ici.
Ce qu'il faut retenir
Il y a quelque chose de révélateur dans ce détail technique. Ces systèmes ont été construits sur un corpus dominé par l'anglais, et cette domination laisse des traces jusque dans la mécanique la plus élémentaire du découpage des mots. Ce n'est pas une intention malveillante, c'est une empreinte statistique, et elle a un coût mesurable pour tous ceux qui pensent dans une autre langue.
La bonne nouvelle est que l'écart se réduit. Les tokenizers récents sont mieux entraînés sur des corpus multilingues, et les modèles européens travaillent activement sur cette efficacité. Mais tant que l'anglais restera la langue par défaut des données d'entraînement, il restera la langue la moins chère à parler avec une machine. C'est une petite chose, et c'est en même temps un rappel utile : la neutralité technique n'existe pas, même dans un découpage de mots.