Imaginez un consultant compétent. Pour l'adapter à votre entreprise, vous avez deux options. Soit vous lui donnez accès à votre documentation et il la consulte quand il en a besoin : c'est le RAG. Soit vous le formez pendant des mois jusqu'à ce qu'il pense comme votre maison : c'est le fine-tuning. Ces deux approches ne résolvent pas le même problème, et les confondre est l'erreur la plus fréquente des projets d'IA en entreprise.
Nous avons expliqué séparément le RAG et le fine-tuning. Voici la question pratique : lequel choisir ?
Ce que chacun fait
Le RAG, pour génération augmentée par récupération, ne modifie pas le modèle. Au moment où vous posez une question, un système cherche dans vos documents les passages pertinents, les ajoute au contexte, et le modèle répond en s'appuyant dessus. Le mécanisme de recherche repose sur les embeddings.
Le fine-tuning modifie le modèle lui-même, en poursuivant son entraînement sur vos exemples. Le savoir n'est plus consulté, il est intégré dans les paramètres.
La question qui décide
Une seule question tranche dans la grande majorité des cas : voulez-vous que le modèle connaisse des faits, ou qu'il se comporte différemment ?
Si vous voulez qu'il réponde à partir de vos procédures internes, de votre catalogue produit, de votre base de connaissances : c'est du fait, donc du RAG.
Si vous voulez qu'il adopte un format de sortie très précis, un ton particulier, ou qu'il maîtrise une tâche répétitive avec une régularité parfaite : c'est du comportement, donc du fine-tuning.
L'erreur classique consiste à vouloir faire apprendre des connaissances par fine-tuning. C'est coûteux, cela fonctionne mal, et cela crée un problème majeur : le modèle mélange ce qu'il a appris avec ce qu'il savait déjà, sans pouvoir citer sa source.
La mise à jour immédiate : vous modifiez un document, la réponse change à la requête suivante. Avec un fine-tuning, il faut réentraîner.
La traçabilité : le système peut citer le passage utilisé, ce qui rend la réponse vérifiable.
Le contrôle d'accès : vous pouvez filtrer les documents selon les droits de l'utilisateur, impossible avec un modèle qui a tout absorbé.
Le coût : bien moins cher à mettre en place et à maintenir.
La réversibilité : retirer un document est instantané, désapprendre ne l'est pas.
Quand le fine-tuning se justifie vraiment
Trois situations, et elles sont plus rares qu'on ne le croit.
Un format de sortie strict et répétitif. Si vous devez produire des milliers de fois une structure très précise, un modèle affiné le fera plus fiablement et avec moins de tokens d'instruction.
Un domaine au vocabulaire très spécifique. Certains jargons techniques ou langues peu représentées bénéficient d'une adaptation en profondeur.
Une réduction de coût à grande échelle. Un petit modèle affiné peut égaler un gros modèle générique sur une tâche étroite, pour bien moins cher par requête. C'est l'argument le plus solide quand le volume est important.
La réponse pratique
Pour la quasi-totalité des projets d'entreprise : commencez par le RAG. Il est plus rapide à mettre en place, moins cher, plus facile à maintenir, et il répond au besoin réel dans la grande majorité des cas.
Et sachez que la qualité d'un RAG dépend bien davantage du découpage de vos documents et de la qualité de la recherche que du modèle utilisé. Les projets qui échouent échouent presque toujours là, pas sur le choix du modèle. Un excellent modèle qui reçoit les mauvais passages produit une excellente réponse à côté du sujet.