Aller au contenu

Qwen 3.8 en version 27 milliards : le modèle ouvert qui tient sur une carte et voit les images

Vision intégrée, 262 000 tokens de contexte, licence permissive. Ce n'est pas le plus gros modèle du mois, c'est peut-être le plus utile.

Espace publicitaire
L'essentiel en 30 secondes ⚡
Alibaba a publié une version 27 milliards de paramètres de Qwen 3.8 sous licence Apache 2.0, avec vision intégrée, un contexte natif de 262 000 tokens extensible à un million, et des résultats annoncés solides sur les tests de code. Cette taille tient sur une carte graphique de bonne facture. C'est le segment qui compte réellement pour la diffusion.

Nous avons couvert l'annonce du modèle Max à 2 400 milliards de paramètres. Voici la version qui concerne le plus de monde, et elle mérite plus d'attention que sa grande soeur.

Pourquoi 27 milliards est la bonne taille

Nous l'avons répété à propos de Kimi K3 et de ses 1,4 téraoctet : ouvert ne veut pas dire accessible. Un modèle librement téléchargeable qu'il faut servir sur des dizaines d'accélérateurs reste réservé aux institutions.

Vingt-sept milliards de paramètres, correctement compressés selon les techniques que nous avons décrites dans notre article sur la quantization, tiennent sur une carte graphique unique. C'est le seuil qui sépare l'expérimentation de l'usage réel pour une petite structure.

C'est le même segment que le modèle agentique publié par Meta, et cette convergence n'est pas un hasard : plusieurs laboratoires ont identifié la même cible.

Les caractéristiques qui comptent

La licence. Apache 2.0 est une licence permissive qui autorise l'usage commercial sans contrepartie. C'est un point important, tous les modèles présentés comme ouverts ne l'étant pas au même degré, comme nous l'expliquions dans notre article sur les poids ouverts.

La vision intégrée. Le modèle traite les images nativement, ce qui ouvre des usages concrets : lecture de documents scannés, analyse de captures d'écran, description de contenus. Disposer de cette capacité en local, sans envoyer d'images à un service tiers, a une vraie valeur pour tout ce qui touche à des documents sensibles.

Le contexte. Un contexte natif de 262 000 tokens permet de traiter des documents longs sans découpage compliqué.

La prudence habituelle 📊
Les scores annoncés sur les tests de code proviennent du laboratoire et n'ont pas été audités indépendamment au moment où nous écrivons. Par ailleurs, un modèle de cette taille ne se compare pas aux modèles de pointe sur le raisonnement complexe : il se compare à ce qu'on pouvait faire tourner localement il y a six mois. C'est à cette aune que le progrès est spectaculaire.

Ce que ça change concrètement

Trois usages deviennent réalistes pour une structure modeste.

Le traitement documentaire confidentiel. Analyser des contrats, des dossiers médicaux ou des documents internes sans qu'aucune donnée ne quitte vos machines.

L'automatisation à volume. Un traitement qui tourne en continu coûte cher en API et rien en local, hors électricité et matériel.

L'indépendance. Un modèle téléchargé ne prend pas sa retraite, comme nous le relevions dans notre article sur la dépréciation, et personne ne peut en modifier le tarif.

Ce qu'il faut retenir

La couverture médiatique se concentre naturellement sur les modèles les plus gros, parce que les chiffres sont impressionnants. Le mouvement qui compte pour la diffusion réelle se joue dans cette catégorie intermédiaire, où des capacités sérieuses deviennent accessibles à du matériel qu'on peut s'offrir.

Il y a un an, faire tourner localement un modèle capable de lire des images et de traiter un long document relevait du bricolage. C'est désormais une option raisonnable. Ce progrès-là ne fera aucun titre, et il change davantage de choses que le prochain modèle à trois mille milliards de paramètres.

Espace publicitaire