Un rapport de terrain publié par OpenAI avec des partenaires académiques montre que des agents de codage peuvent reprendre et moderniser des logiciels scientifiques laissés à l'abandon, avec des gains de vitesse pouvant atteindre un facteur 60. La même étude formule un avertissement direct : ces systèmes sont éloquents, convaincants, et parfois catégoriquement faux. Les deux constats comptent autant l'un que l'autre.
Il existe dans la recherche scientifique un problème dont on parle peu : une quantité considérable de logiciels essentiels a été écrite il y a des années par des doctorants aujourd'hui partis, tourne sur des technologies obsolètes, et n'est plus maintenue par personne. Ce rapport décrit ce qui se passe quand on lance des agents IA sur ce chantier.
Le problème que ça résout
Une part importante de la science moderne dépend de code. Simulations, traitement de données d'observation, analyse statistique : ces outils sont souvent développés par des chercheurs qui ne sont pas des ingénieurs logiciels, pour répondre à un besoin précis, puis abandonnés quand leur auteur change de laboratoire.
Le résultat est un patrimoine considérable de logiciels qui fonctionnent mal, lentement, et que plus personne ne comprend. Les réécrire n'intéresse aucun financeur, parce que ce n'est pas une découverte. C'est une tâche ingrate, indispensable, et systématiquement reportée.
C'est exactement le genre de travail où un agent de codage excelle : bien délimité, techniquement exigeant, sans créativité scientifique requise. Les gains rapportés, jusqu'à soixante fois plus rapide sur certains traitements, changent concrètement ce qu'un laboratoire peut se permettre de calculer.
L'avertissement, et pourquoi il est central
La formule employée par les auteurs mérite d'être retenue : ces systèmes sont éloquents, convaincants, et confiants dans l'erreur. Ce n'est pas une réserve de politesse, c'est le coeur du problème.
Nous avons expliqué le mécanisme dans notre article sur la calibration : une IA produit une réponse fausse avec exactement le même aplomb qu'une réponse juste. Appliqué à du code scientifique, cela prend une dimension particulière.
Un code qui plante est un problème visible. Un code qui tourne parfaitement et produit un résultat légèrement faux est un problème invisible, et il peut se propager dans des publications, des jeux de données, et les travaux qui s'appuient dessus. L'accélération par soixante est inutile si elle produit des résultats erronés soixante fois plus vite.
Nous avions raconté dans un article sur VirBench comment un modèle interrogé trois fois sur la même question de biologie avait donné trois réponses différentes, dont aucune n'était la bonne. La solution n'avait pas consisté à prendre un modèle plus intelligent, mais à lui donner un outil déterministe. La leçon se répète ici : dans un contexte scientifique, la reproductibilité compte davantage que la performance.
Ce que ça implique pour la méthode scientifique
Cette tension pose une question qui dépasse l'informatique. La science repose sur la vérifiabilité : un résultat n'existe que si quelqu'un d'autre peut refaire le chemin. Or un code réécrit par un agent, plus rapide et plus propre, mais dont personne n'a relu chaque ligne, introduit une zone d'ombre au coeur du dispositif.
Le risque n'est pas théorique. Un chercheur qui obtient un résultat cohérent avec ses attentes, produit par un outil qui a l'air compétent, aura peu de raisons de creuser. C'est le biais que nous décrivions dans notre méthode de vérification : on contrôle beaucoup moins ce qui nous arrange.
Les pratiques qui répondent à cette difficulté existent, et elles ne sont pas nouvelles : conserver l'ancien code comme référence, comparer les sorties sur des cas connus, exiger que les résultats soient reproduits par un tiers. Ce qui change, c'est que ces précautions passent du statut de bonne pratique à celui de nécessité absolue.
Ce qu'il faut retenir
Ce rapport est intéressant précisément parce qu'il ne choisit pas son camp. Il documente un bénéfice réel et considérable, et il nomme le risque sans le minimiser. C'est rare dans un secteur où les publications d'entreprise soulignent rarement les limites de leurs produits.
La conclusion pratique vaut bien au-delà des laboratoires. Chaque fois qu'une IA vous fait gagner un facteur important sur une tâche, demandez-vous ce qui vérifie le résultat. Si la réponse est rien, parce que ça a l'air correct, vous n'avez pas gagné de temps : vous avez déplacé un risque vers un endroit où personne ne le regarde.