Aller au contenu

Thomson Reuters construit son propre modèle qui ne parle que de droit

Quarante millions investis, des décennies de jurisprudence en entraînement. Quand un éditeur cesse d'acheter de l'IA pour en fabriquer, le rapport de force change.

Espace publicitaire
L'essentiel en 30 secondes ⚡
Thomson Reuters a annoncé le 24 août son premier grand modèle de langage propriétaire, baptisé Thomson, entraîné à partir d'une base ouverte sur des décennies de contenus juridiques et fiscaux maison, avec un investissement rapporté d'environ 40 millions de dollars en calcul et en recrutement. Un éditeur de contenus cesse d'acheter de l'IA pour en fabriquer.

Nous avons couvert l'arrivée de l'IA dans les tribunaux et les avocats sanctionnés pour des jurisprudences inventées. Voici la réponse d'un acteur qui possède précisément ce qui manquait.

Ce qui rend ce mouvement intéressant

Le point n'est pas la performance annoncée, sur laquelle nous n'avons aucune mesure indépendante. C'est la logique stratégique.

Thomson Reuters possède quelque chose que les laboratoires généralistes n'ont pas : un corpus juridique et fiscal constitué sur des décennies, structuré, vérifié, avec des annotations professionnelles. Nous avons expliqué dans notre article sur les livres achetés et détruits que la donnée propre est devenue la ressource rare. Ici, elle existe déjà et appartient à quelqu'un.

Le calcul de l'entreprise est donc simple : plutôt que de licencier ce corpus à un laboratoire qui construira l'outil et captera la valeur, autant construire l'outil soi-même.

Le détail technique qui compte

Le modèle serait entraîné à partir d'une base ouverte plutôt que depuis zéro. C'est une information importante, et elle explique le montant.

Quarante millions de dollars ne permettent pas d'entraîner un modèle de fondation de premier plan : les ordres de grandeur sont bien supérieurs, comme nous l'avons décrit dans notre article sur les modèles de fondation. En revanche, partir d'un modèle ouvert de qualité et le spécialiser sur son propre corpus est parfaitement accessible à cette échelle.

C'est une conséquence directe de la banalisation des poids ouverts que nous documentons depuis des mois. Sans cet écosystème, ce projet n'existerait pas.

Ce que ça change sur le problème des jurisprudences inventées ⚖️
Un modèle généraliste produit une référence juridique plausible, avec le bon format et le bon ton, sans que rien ne garantisse son existence. C'est le mécanisme des hallucinations. Un modèle adossé à une base propriétaire peut, en principe, relier chaque affirmation à un document réel de cette base. Ce n'est pas une garantie absolue, mais la différence entre inventer une référence et pointer vers une entrée vérifiable est considérable dans ce métier.

Le mouvement de fond : les modèles verticaux

Cette annonce s'inscrit dans une tendance que nous voyons se dessiner et qui mérite d'être nommée.

Pendant trois ans, la stratégie dominante consistait à construire des modèles généralistes de plus en plus capables. Cette course arrive à un palier, avec des écarts qui se réduisent et des prix qui s'effondrent.

Dans ce contexte, la différenciation se déplace vers ce qu'un généraliste ne peut pas avoir : un corpus spécialisé, une connaissance métier, une base vérifiable. C'est exactement ce que nous relevions à propos de la valorisation du travail d'annotation experte : ce qui vaut cher, c'est la donnée que personne d'autre n'a.

Il faut s'attendre à voir ce mouvement se reproduire dans tous les secteurs disposant d'un patrimoine documentaire important : santé, ingénierie, finance, normalisation.

Les réserves

Aucune mesure indépendante. Les performances annoncées sont celles de l'entreprise. Pour un usage juridique, la question qui compte n'est pas un score mais le taux de références erronées en conditions réelles.

Un modèle spécialisé n'est pas un modèle infaillible. Il reste soumis aux limites que nous décrivons constamment, notamment l'absence de signal d'incertitude. Un modèle entraîné sur du droit américain interrogé sur du droit français produira une réponse assurée et fausse.

La question de l'enfermement. Un cabinet qui adopte un outil adossé au corpus d'un éditeur devient dépendant de cet éditeur pour son accès à l'information juridique. C'est une position que les professions concernées devraient examiner avant de s'y installer.

Ce qu'il faut retenir

Ce qui se joue ici dépasse un lancement de produit. C'est le moment où les détenteurs de données spécialisées cessent d'être des fournisseurs pour devenir des acteurs.

Cela pourrait rééquilibrer un rapport de force que nous avons souvent décrit comme défavorable aux producteurs de contenu, des éditeurs en procès contre Google aux médias privés de leur audience. Un éditeur qui construit son propre modèle n'a plus besoin de négocier une licence : il garde tout.

Reste que cette voie n'est ouverte qu'à ceux qui possèdent un corpus considérable et quarante millions de dollars. Pour les producteurs de contenu plus modestes, la question de la rémunération de leurs données reste entière.

Espace publicitaire