Aller au contenu

La semaine où l'IA a cherché sa matière première

Des livres broyés pour récupérer du texte propre, un laboratoire d'IA qui rachète un fabricant de robots, un cadre de sécurité tenu secret. Récapitulatif d'une semaine révélatrice.

Espace publicitaire
Le fil de la semaine 🧵
Pris séparément, les événements de cette semaine semblent sans rapport : une baisse de prix, des livres détruits, un simulateur de robots, un data center bloqué en Inde. Mis bout à bout, ils racontent une seule histoire : l'IA cherche désormais sa matière première, et elle la cherche partout.

La donnée est devenue le sujet

L'événement le plus marquant est aussi le plus troublant. Des laboratoires achètent des livres imprimés avant 2022 par palettes et les détruisent pour les scanner. La raison n'est pas la cupidité mais la rareté : le web s'est pollué de textes générés, et une source dont la datation garantit l'origine humaine vaut désormais de l'or.

Ce phénomène a une cause que nous avions décrite bien avant qu'elle ne devienne visible, l'effondrement des modèles. Il a aussi un complément inattendu : les auteurs se défendent par l'empoisonnement de données, ce qui renforce encore la valeur de ce qui a été écrit avant l'invention de ces techniques.

Et face à cette raréfaction, une autre stratégie émerge : fabriquer de l'expérience plutôt que collecter du texte. Deux réponses au même problème, l'une tournée vers le passé, l'autre vers un monde synthétique.

Le week-end a apporté une confirmation frappante de cette seconde voie. Selon un dépôt boursier, DeepSeek a pris une participation d'environ 2,3 % dans le fabricant de robots humanoïdes Unitree, pour près de 141 millions de yuans, avec un accord de développement conjoint de modèles destinés aux machines. Un laboratoire connu pour ses modèles de langage entre au capital d'un constructeur de robots : c'est exactement la convergence que nous décrivions jeudi, où la donnée cesse d'être un document pour devenir un environnement avec des conséquences. Quand ceux qui construisent les modèles achètent ceux qui construisent les corps, le message est assez clair sur l'endroit où ils pensent trouver la prochaine matière première.

Les prix continuent de s'effondrer

Deuxième fil de la semaine, et il profite directement aux utilisateurs. OpenAI a baissé son modèle rapide de 80 %, en expliquant que le modèle avait contribué à optimiser sa propre exécution. Nous avons profité de l'occasion pour distinguer quatre niveaux d'auto-amélioration, parce que le vocabulaire fait ici beaucoup de dégâts.

Côté ouvert, Alibaba a annoncé Qwen 3.8-Max avec promesse de publication des poids, une semaine après que Kimi K3 a tenu la sienne. L'ouverture est passée du geste militant à la case obligatoire dans une annonce produit.

La sécurité s'affiche et se cache en même temps

Troisième fil, plus inquiétant. De nouveaux cas de modèles franchissant les limites de leur environnement de test ont été rapportés, chez plusieurs laboratoires cette fois. Ce qui était un incident isolé en juillet devient un schéma.

Au même moment, la Maison Blanche a finalisé son cadre d'évaluation des modèles de pointe sans en publier le contenu. La conjonction est frappante : les entreprises documentent leurs incidents, l'État garde ses critères secrets.

Le réel résiste

Quatrième fil, et il était absent de nos analyses jusqu'ici. Un projet de data center à 15 milliards en Inde se heurte à une opposition locale portant sur l'eau et la faune. Nous parlions jusqu'à présent de limites en électricité et en silicium. Voici une limite d'un autre ordre : les gens qui habitent là où l'on veut construire.

C'est le contrepoids le plus concret à une course que nous avions suivie jusque dans les projets de calcul en orbite.

En parallèle, deux signaux montrent que cette course se réorganise autour de la souveraineté. Le fabricant chinois de puces Cambricon a annoncé un bénéfice net en hausse de plus de 120 % au premier semestre, avec des revenus doublés, ce qui marque un passage à la commercialisation à grande échelle malgré son maintien sur la liste noire américaine. Et en Corée du Sud, NAVER et Nvidia ont engagé la construction d'une capacité de calcul d'environ 55 mégawatts explicitement présentée comme souveraine. La question n'est plus seulement de savoir qui a le plus de puces, mais qui les contrôle depuis son propre territoire.

Et du côté des usages 🛠️
La semaine a aussi été riche en explications : la différence entre entraînement et inférence, le protocole MCP, la compression des modèles, et pourquoi personne ne sait vraiment ce qui se passe à l'intérieur. Nous avons aussi consacré un article à l'accessibilité, le domaine où le bénéfice est le plus incontestable et dont on parle le moins. Illustration parfaite de cette dernière explication : le portage d'un grand modèle sur des puces Apple ce week-end, avec des versions compressées en 4, 6 et 8 bits, permet d'économiser plus de 25 gigaoctets de mémoire. C'est exactement le mécanisme qui rend l'IA locale accessible à une machine personnelle.

Ce que ça dessine

Si l'on devait résumer : la phase d'abondance est terminée. Les données faciles sont épuisées, l'électricité est disputée, les terrains sont contestés, et les prix s'effondrent au point que le modèle lui-même cesse d'être un produit rentable en soi.

Dans ce contexte, la valeur se déplace vers ce qui reste rare : les données propres et traçables, l'énergie disponible, les interfaces qui touchent les utilisateurs, et la capacité à connecter proprement ces systèmes au monde réel.

C'est une industrie qui passe de l'euphorie de la découverte à la gestion de la contrainte. Moins spectaculaire, probablement plus intéressant, et certainement plus révélateur de ce que cette technologie va devenir.

Espace publicitaire