Z.ai a annoncé le 26 août GLM-5.3-Flash en confirmant qu'il s'agissait du modèle diffusé anonymement sous le nom d'Ox Alpha depuis le 20 août. Caractéristiques annoncées : architecture à mélange d'experts de 320 milliards de paramètres dont 18 actifs, contexte d'un million de tokens, multimodal nativement, publié sous licence MIT. Et un détail qui dépasse la technique : le laboratoire indique qu'il fonctionne entièrement sur des puces d'IA chinoises.
Nous avons suivi ce dossier depuis lundi en refusant de nommer un développeur avant qu'une source primaire ne le fasse. La source primaire a parlé, et la révélation vaut mieux que la spéculation.
Ce que les indices avaient bien vu
Rendons justice au travail de la communauté. Les analyses de tokenizer, les formats de messages d'erreur et la comptabilisation des tokens vidéo pointaient toutes vers la famille GLM. C'était correct.
Ce que ces indices ne pouvaient pas déterminer, c'était la version. Un tokenizer est généralement partagé par toute une famille de modèles : il identifie un laboratoire, pas un modèle précis. C'est pourquoi nous nous en tenions à une direction plutôt qu'à un nom.
Le nom, désormais confirmé, est GLM-5.3-Flash. Et il faut le distinguer de GLM-5.3, annoncé le 14 août, dont nous avons parlé pour ses capacités de détection de vulnérabilités : celui-là est un modèle textuel dont les poids étaient annoncés pour environ deux semaines après le lancement, le temps d'une évaluation de sécurité. Ce sont deux modèles différents.
Les caractéristiques annoncées
L'architecture. Un mélange d'experts d'environ 320 milliards de paramètres au total, dont environ 18 milliards actifs par token, avec 8 experts convoqués sur 288. C'est exactement le mécanisme que nous décrivions dans notre article sur le mélange d'experts, et il explique le nom : Flash désigne ici l'efficacité d'inférence, pas une petite taille.
Le contexte. Un million de tokens, avec des tests communautaires indiquant que la capacité tient effectivement au-delà de 900 000 tokens.
La multimodalité. Entrée texte, image et vidéo. Le laboratoire indique avoir entraîné le modèle à inspecter des interfaces rendues, des séquences de jeu et des sorties 3D, puis à corriger son travail à partir de ce retour visuel. C'est cohérent avec un usage agentique où le modèle vérifie ce qu'il a produit.
Le tarif. Environ 0,15 dollar par million de tokens en entrée et 0,50 en sortie, avec 0,03 pour l'entrée mise en cache.
Voici ce que personne n'avait anticipé. Le modèle sort sous licence MIT, l'une des plus permissives qui existent, avec des poids publiés. Nous avions posé comme hypothèse qu'une sortie furtive servait à préparer un lancement commercial fermé. C'est l'inverse : le laboratoire a utilisé l'anonymat pour tester, puis a tout ouvert. Cela contraste d'ailleurs avec Wan 3.0 d'Alibaba, préannoncé comme ouvert et finalement sorti fermé. Deux laboratoires chinois, deux trajectoires opposées.
Le point qui dépasse la technique
Le laboratoire précise que le modèle fonctionne entièrement sur des puces d'IA chinoises. Cette phrase mérite qu'on s'y arrête, parce qu'elle est probablement l'information la plus lourde de conséquences de toute l'affaire.
Nous documentons depuis des mois les contrôles à l'export destinés à limiter l'accès de la Chine aux accélérateurs de pointe, et nous avons couvert la montée des alternatives nationales. La démonstration est ici publique et vérifiable par l'usage : un modèle de 320 milliards de paramètres, servi à des dizaines de millions de requêtes quotidiennes, sur du matériel non américain.
Cela arrive au moment précis où Washington envisagerait de demander à des dizaines de pays de choisir leur camp technologique. Le message est difficile à manquer : la dépendance qu'on cherchait à créer est en train d'être contournée.
Une réserve d'usage s'impose : cette affirmation émane du laboratoire et n'est pas auditée. Elle est néanmoins cohérente avec les investissements chinois dans les accélérateurs nationaux que nous avons documentés.
La stratégie, relue à la lumière du résultat
Tout s'éclaire rétrospectivement. En six jours d'anonymat et de gratuité, le modèle a atteint environ 70 millions de requêtes quotidiennes et s'est installé dans les harnais d'agents que les développeurs utilisent quotidiennement.
Un lancement classique aurait produit un communiqué, un tableau de benchmarks, et une adoption progressive freinée par le scepticisme envers un laboratoire chinois. Ici, des milliers de développeurs ont jugé le modèle sur ses résultats avant de savoir d'où il venait.
C'est une démonstration remarquablement efficace de ce que nous écrivions lundi : la marque compte moins qu'on ne croit. Et cela règle la question à l'avance, puisque l'adoption a précédé la révélation.
Les points à vérifier
Deux réserves, parce que tout n'est pas cohérent à cette heure.
Une divergence sur les spécifications. Un classement indépendant référence à cette heure le modèle avec un contexte de 400 000 tokens et le décrit comme propriétaire, ce qui contredit l'annonce du laboratoire. Il s'agit probablement d'un décalage de mise à jour ou d'une mesure portant sur un point d'accès différent, mais la prudence s'impose sur les chiffres tant que cela n'est pas clarifié.
Les performances. Le laboratoire annonce des résultats en forte hausse sur ses tests internes et une position de premier plan sur un indice indépendant. Comme toujours, ces mesures dépendent du protocole utilisé, et les comparaisons entre laboratoires restent délicates.
Et les données envoyées pendant la préversion ?
La question reste entière et mérite d'être posée. Pendant six jours, des milliers de développeurs ont fait passer des dépôts de code entiers à travers un fournisseur anonyme dont la fiche indiquait que les requêtes sont conservées.
Savoir qui était derrière ne change rien à ce qui a été transmis. Cela permet simplement d'identifier à qui s'adresser, et sous quel droit. C'est mieux que rien, et c'est loin d'être une garantie.
Ce qu'il faut retenir
Ce dossier restera comme un cas d'école, et pour de meilleures raisons que celles qu'on croyait lundi.
Un laboratoire a testé son modèle en aveugle sur des usages réels, a laissé le produit se juger seul, puis a tout publié en licence permissive. Sur le plan méthodologique, c'est plus rigoureux que la plupart des lancements accompagnés de tableaux de benchmarks maison.
Et le message industriel est clair. Un modèle de premier plan, entraîné et servi sur du matériel national, publié gratuitement pour tous, adopté massivement avant même d'être nommé : c'est une réponse aux restrictions d'accès aux puces, et elle est plus éloquente que n'importe quelle déclaration diplomatique.