Un nouveau banc d'essai, publié en août 2026, pose une question difficile : à partir de la seule bibliographie d'un article scientifique, un modèle peut-il retrouver l'idée que cet article défendait ? Le protocole retire délibérément le texte complet, les informations sur les auteurs et tout signal postérieur à la publication. Autrement dit, il supprime tout ce que le modèle aurait pu mémoriser. Les scores rapportés tombent entre 3 et 15 %, et une organisation en plusieurs agents ne dépasse pas environ 42 %.
Nous avons souvent souligné qu'un bon score sur un test ne prouve pas grand-chose si le modèle a pu voir la réponse pendant son entraînement. Voici une tentative sérieuse de contourner ce problème, et le résultat est instructif.
Le problème que ce test résout
La difficulté centrale de l'évaluation des modèles est la contamination. Un modèle entraîné sur une immense partie du web a probablement lu les articles scientifiques sur lesquels on l'interroge, leurs résumés, leurs commentaires. Quand il produit la bonne réponse, on ne sait pas s'il raisonne ou s'il se souvient.
C'est la limite que nous soulignions dans notre article sur les benchmarks, et elle rend beaucoup de scores difficiles à interpréter.
Le protocole ici est élégant : en ne fournissant que la bibliographie, il donne au modèle exactement ce dont disposait le chercheur avant d'avoir son idée. Il ne teste plus la restitution, il teste la génération.
Ce que les résultats suggèrent
Des scores compris entre 3 et 15 % pour un modèle seul indiquent que retrouver une idée à partir de ses seuls prérequis reste très difficile. Le passage à environ 42 % avec une organisation en plusieurs agents confirme ce que nous avons observé ailleurs : faire travailler plusieurs instances en parallèle sur des angles différents améliore les résultats, comme dans la production de preuve mathématique.
Mais 42 % sur un problème dont la réponse existe et est vérifiable, cela reste un plafond. Les auteurs y voient un indice que les modèles actuels butent sur la génération d'hypothèses dès qu'on leur retire la possibilité de retrouver l'information.
Il faut se garder d'en tirer une conclusion générale du type l'IA ne peut pas avoir d'idées. Ce test mesure la capacité à reconstituer une idée précise déjà eue par quelqu'un, à partir de ses prémisses. Un modèle pourrait produire une hypothèse différente, originale et pertinente, et être noté zéro parce qu'elle ne correspond pas à celle de l'article. Autrement dit, le protocole mesure une convergence, pas une créativité. C'est une limite reconnue de ce type d'évaluation, et elle invite à la prudence dans l'interprétation.
Le lien avec ce que nous savons du fonctionnement
Ce résultat est cohérent avec le mécanisme que nous décrivons régulièrement. Un modèle produit la continuation la plus probable, comme nous l'expliquions dans notre article sur les LLM.
Or une idée scientifique nouvelle est, par définition, une continuation improbable. Elle rompt avec ce que le corpus contenait. Un système optimisé pour la plausibilité est structurellement mal placé pour produire ce qui n'était pas plausible avant qu'on l'ait pensé.
Cela n'interdit rien : l'improbable existe dans les distributions, et un modèle réglé pour explorer davantage, comme nous l'expliquions à propos de la température, produit des sorties plus inattendues. Mais l'inattendu utile et l'inattendu absurde se ressemblent beaucoup de l'intérieur du système. Trier les deux demande un jugement que le modèle n'a pas.
Ce qu'il faut retenir
Ce test apporte une pièce utile à un débat souvent mené à coups d'anecdotes. Il ne dit pas que les IA sont inutiles en science, ce que leur capacité à moderniser du code scientifique contredit largement.
Il suggère quelque chose de plus précis : ces systèmes sont extraordinairement puissants pour exploiter ce qui est déjà connu, et nettement plus faibles pour produire ce qui ne l'est pas. La distinction entre exploiter et découvrir, familière aux chercheurs, se retrouve ici mesurée.
Ce qui laisse à l'humain une place assez précise dans la chaîne : non pas celui qui calcule, ni celui qui compile, mais celui qui a l'intuition qu'il faut regarder ailleurs. C'est peu de chose, et c'est exactement ce qui fait une découverte.