Imaginez un amphithéâtre de mathématiques, le soir, quand tout le monde est parti. Au matin, les professeurs découvrent les tableaux noirs couverts de démonstrations. Pas une ou deux : des centaines. Personne ne sait encore lesquelles sont justes, lesquelles sont nouvelles, et lesquelles recopient sans le dire le travail de quelqu'un d'autre.
C'est à peu près la situation dans laquelle OpenAI vient de placer les mathématiciens du monde entier.
722 manuscrits, déposés d'un coup
OpenAI a publié cette semaine, sur la plateforme GitHub, un ensemble de 722 manuscrits mathématiques regroupés en 372 familles de résultats. Ils ont été produits par un modèle interne que l'entreprise n'a pas rendu public.
Les sujets couvrent l'algèbre, la théorie des nombres, l'informatique théorique, la logique et la topologie. Parmi les résultats mis en avant : la démonstration, dans certains cas, d'une formule liée à la conjecture de Birch et Swinnerton-Dyer, l'un des sept grands problèmes du millénaire, et un résultat sur les verres de spin, des matériaux dont le désordre intrigue les physiciens.
« Nous entrons dans une nouvelle ère de la découverte », a déclaré Sam Altman, le patron d'OpenAI.
Comment la machine a travaillé
Selon OpenAI, le modèle a reçu environ 4 000 problèmes. Pour la plupart des résultats publiés, il a suffi d'une seule demande, adressée à un seul agent, même si certains ont nécessité plusieurs essais. Chaque résultat a consommé en moyenne environ trois heures de calcul, l'équivalent du mode de réflexion de ChatGPT Pro.
Autrement dit, personne n'a guidé la machine pas à pas. On lui a donné l'énoncé, et elle a cherché seule : essayer une piste, l'abandonner, en tenter une autre, revenir en arrière. Exactement comme un chercheur qui passerait une nuit blanche devant son tableau, sauf qu'elle en a passé des milliers en parallèle.
Trois heures pour un résultat que des chercheurs n'avaient pas trouvé, c'est vertigineux. Mais il faut garder les proportions en tête : sur 4 000 problèmes tentés, 372 familles de résultats ont été retenues. La machine a aussi beaucoup échoué, et ces échecs ne sont pas dans la vitrine.
Le correcteur automatique des maths
Le vrai problème, avec 722 manuscrits, n'est pas de les écrire. C'est de les relire. Vérifier une seule démonstration difficile peut prendre des semaines à un spécialiste.
OpenAI s'appuie donc sur Lean, un logiciel de vérification de preuves. On peut le voir comme un correcteur d'orthographe, mais pour la logique : on traduit la démonstration dans son langage, et il vérifie, étape par étape, que chaque déduction découle bien de la précédente. Si une seule étape cloche, il refuse.
Beaucoup des démonstrations publiées ont été passées au crible de Lean. C'est un vrai gage de sérieux. Mais Lean vérifie qu'un raisonnement est correct, pas qu'il est nouveau, ni qu'il est important. Et toutes les preuves n'ont pas encore été relues par des experts humains.
En août, OpenAI avait déjà annoncé dix résultats obtenus par un modèle interne. Des mathématiciens avaient alors reproché à l'entreprise de présenter comme nouvelles des idées déjà publiées, sans citer correctement leurs auteurs. L'un d'eux, Stephen Miller, de l'université Yeshiva, avait parlé dans Scientific American de manquement à l'intégrité scientifique. OpenAI avait promis de corriger. La question de la juste attribution reste entière pour les 722 nouveaux manuscrits.
Pourquoi les mathématiciens sont partagés
Certains sont enthousiastes. Une machine capable de défricher des centaines de problèmes peut faire gagner des années à la recherche, et libérer les chercheurs pour les questions les plus profondes.
D'autres s'inquiètent. Selon le site spécialisé The Decoder, vingt-cinq lauréats de la médaille Fields, la plus haute distinction en mathématiques, ont signé une lettre ouverte dénonçant un profond décalage entre les objectifs de l'industrie de l'IA et ceux des mathématiques. Leur crainte : que la production en masse d'énoncés vrais finisse par prendre le pas sur la compréhension.
Le choix de publier directement sur GitHub, sans passer par les revues et leur relecture par les pairs, envoie aussi un message. Il dit, en substance, que le rythme habituel de la science est trop lent pour ce volume de résultats. Les revues, elles, n'ont pas changé de rythme.
Ce qu'on retient
Ce que montre cette publication, c'est moins une machine qui aurait « résolu les maths » qu'un changement d'équilibre. Produire un résultat devient rapide et bon marché. Le vérifier, le situer dans ce qui existe déjà, et comprendre ce qu'il veut dire, reste lent, et profondément humain.
Les tableaux noirs sont pleins. Reste à savoir qui aura le temps de les lire. Nous y consacrons notre réflexion de ce soir.