En juillet 2026, une IA a produit la preuve d'une conjecture mathématique restée ouverte depuis les années 1970. La même semaine, des modèles de pointe pouvaient encore se tromper sur une multiplication à plusieurs chiffres. Cette contradiction n'est pas une anomalie, elle découle directement de la façon dont ces systèmes sont construits. Et la comprendre change la manière de s'en servir.
Nous avons raconté dans un article récent comment une IA avait produit une démonstration mathématique qui avait résisté à des générations de chercheurs. Comment un système capable de cela peut-il échouer sur un calcul qu'un enfant de dix ans effectue sur un cahier ? Voici l'explication, en trois couches.
Première couche : elle ne calcule pas
Le point fondamental, déjà expliqué dans notre article sur les LLM : un modèle de langage prédit la suite de texte la plus probable. Il n'exécute pas d'opération arithmétique.
Quand vous lui demandez combien font 7 fois 8, il ne multiplie pas. Il génère le texte qui suit le plus plausiblement cette question, et comme "56" apparaît des millions de fois après cette formulation dans son corpus, il répond juste. Ce n'est pas du calcul, c'est de la reconnaissance de motif.
Cette distinction explique tout le reste. Sur les opérations courantes, largement présentes dans les textes d'entraînement, la reconnaissance de motif fonctionne parfaitement. Sur une multiplication de deux nombres à quatre chiffres tirés au hasard, il n'existe aucun motif mémorisé : cette opération précise n'a probablement jamais été écrite dans son corpus. Le modèle doit alors improviser, et il improvise mal.
Deuxième couche : les nombres sont mal découpés
Voici l'explication technique que peu de gens connaissent, et elle est élégante. Comme nous l'avons vu dans notre article sur le tokenizer, une IA ne lit pas des caractères mais des tokens, ces fragments appris selon leur fréquence.
Or les nombres subissent ce découpage comme le reste du texte. Un nombre comme 1 234 peut être découpé en deux ou trois fragments, selon des regroupements qui n'ont aucun rapport avec sa valeur mathématique. Le chiffre des unités, celui des dizaines, celui des centaines peuvent se retrouver mélangés dans des tokens différents.
Imaginez qu'on vous demande d'additionner deux nombres, mais qu'au lieu de voir leurs chiffres alignés, vous receviez des paquets arbitraires de symboles. Vous savez additionner, mais l'information vous arrive dans un format qui vous empêche de poser l'opération. C'est exactement la situation du modèle. L'arithmétique repose sur la position des chiffres, et le découpage en tokens détruit une partie de cette information positionnelle.
Voici le retournement contre-intuitif. Une démonstration mathématique est un enchaînement de raisonnements exprimés en langage : poser une hypothèse, appliquer un théorème, en déduire une conséquence. C'est du texte structuré, exactement ce que ces modèles manipulent le mieux. Une multiplication, elle, est une manipulation mécanique de positions de chiffres, ce qu'ils font le plus mal. Les mathématiques de haut niveau sont, du point de vue d'un modèle de langage, plus proches de la philosophie que du calcul mental.
Troisième couche : ce qui a changé
Les modèles récents se trompent beaucoup moins qu'il y a deux ans, pour trois raisons.
Le raisonnement explicite d'abord. Comme nous l'expliquions dans notre article dédié, un modèle qui décompose une opération étape par étape sur son brouillon interne, comme on pose une multiplication sur papier, réussit beaucoup mieux qu'un modèle qui tente de produire le résultat d'un seul coup. Il reconstruit ce que le découpage en tokens avait dispersé.
Les outils ensuite. La solution la plus fiable consiste à ne pas demander au modèle de calculer, mais de lui donner accès à une calculatrice ou à un interpréteur de code. Il écrit alors l'opération et laisse une machine déterministe l'exécuter. C'est exactement la logique de l'outil intermédiaire que nous décrivions à propos de l'IA en biologie : plutôt que de rendre le modèle meilleur, on lui donne le bon instrument.
L'entraînement ciblé enfin, avec des tokenizers qui traitent les chiffres plus proprement et des jeux de données spécifiquement conçus pour l'arithmétique.
Ce qu'il faut retenir
Cette bizarrerie est un excellent rappel de ce que sont réellement ces systèmes. Ils ne sont pas des cerveaux miniatures qui savent tout faire un peu. Ce sont des machines à manipuler le langage, extraordinairement douées pour tout ce qui s'exprime en mots et en raisonnements, et structurellement maladroites sur ce qui exige une manipulation mécanique précise de symboles positionnés.
Le réflexe pratique en découle : pour tout calcul qui compte, exigez que l'IA utilise un outil de calcul ou détaille ses étapes, et vérifiez le résultat. Non pas parce qu'elle est bête, mais parce que vous lui demandez précisément la chose pour laquelle elle est le moins bien conçue. C'est un peu comme demander à un excellent orateur de faire vos comptes de tête : il peut y arriver, mais ce n'est pas là que se trouve son talent.