Aller au contenu

GLM-5.3 : un modèle ouvert a trouvé plus de mille failles réelles dans des logiciels très utilisés

GLM-5.3 devait être publié comme ses prédécesseurs. Z.ai a suspendu la diffusion après avoir mesuré ce qu'il savait faire en cybersécurité. C'est un précédent.

Espace publicitaire
Correction 📝
Une première version de cet article, publiée ce matin, décrivait GLM-5.3 comme un modèle dont les poids étaient déjà téléchargeables. C'était inexact, et c'est précisément l'inverse qui rend cette actualité intéressante. Z.ai a annoncé le modèle le 14 août mais a suspendu la publication des poids, en invoquant une évaluation de sécurité, avec une diffusion annoncée pour la fin du mois. Nous corrigeons et développons ci-dessous.
L'essentiel en 30 secondes ⚡
Le laboratoire chinois Z.ai a publié le 14 août GLM-5.3, un modèle qui atteint 84,5 % sur CyberGym, un test de découverte de vulnérabilités, devant les modèles fermés de pointe que le laboratoire cite en comparaison. Contrairement à toutes les versions précédentes de la famille GLM, les poids n'ont pas été diffusés le jour du lancement : Z.ai les retient le temps d'une évaluation de sécurité. C'est la décision qui compte, davantage que le score.

Nous avons posé le débat sur la publication des poids il y a quelques jours, en écrivant que la question ne se pose pas de la même manière selon la capacité du modèle. Voici le premier cas où un laboratoire réputé pour son ouverture applique lui-même cette distinction.

Ce que fait ce modèle

GLM-5.3 repose sur exactement la même base que son prédécesseur : une architecture à mélange d'experts d'environ 744 milliards de paramètres au total, dont une quarantaine actifs par token, avec une fenêtre d'un million de tokens.

Le point remarquable est là : aucune nouvelle architecture, aucun nouveau pré-entraînement. Tous les gains annoncés proviennent d'un travail d'après-entraînement massivement étendu, avec des environnements de tâches beaucoup plus nombreux et plus proches de conditions réelles, et davantage de calcul consacré à l'apprentissage par renforcement que nous décrivions dans un article dédié.

Les scores annoncés par le laboratoire, non audités indépendamment à ce jour, méritent d'être lus dans le détail plutôt que résumés.

Test GLM-5.3 Lecture
CyberGym (découverte de failles) 84,5 % Devant les modèles fermés cités par Z.ai
DeepSWE 1.1 (code agentique) 66,9 % (contre 46,2 avant) Progression très forte
ExploitBench (exploitation) 54,4 % (contre 24,4 avant) Double, et reste loin des leaders à 78 %
Code Bench interne 31,4 % Devant Opus 4.8 (29,5) mais derrière Fable 5 (39,5)

Le résumé honnête est plus étroit que les titres : GLM-5.3 est au niveau de la frontière sur la découverte de vulnérabilités et le travail agentique de longue haleine, et nettement en retrait sur la qualité de code brute et sur l'exploitation. Cette dernière distinction compte, et nous y revenons.

La décision qui fait de cette sortie un précédent

Toute la famille GLM s'est construite sur la publication des poids sous licence permissive. C'est ce qui lui a donné sa place dans l'écosystème, et nous l'avons couverte à ce titre depuis GLM-5.2.

Cette fois, le laboratoire a rompu avec cette pratique. Le modèle est accessible par API et par abonnement, mais les fichiers ne sont pas disponibles. Le motif invoqué est explicitement une évaluation de sécurité, et la publication est annoncée pour la fin du mois.

Autrement dit : un laboratoire chinois, dont l'ouverture est l'argument commercial central, applique de lui-même un seuil de capacité au-delà duquel il diffère la publication. C'est exactement la position que défendaient ceux qui plaidaient pour une ouverture conditionnée à la capacité, et que nous présentions comme la deuxième position du débat.

Pourquoi la distinction découverte / exploitation compte 🔍
Le modèle excelle à trouver des failles et reste en retrait pour les exploiter. Cette asymétrie n'est pas rassurante autant qu'on pourrait le croire. Trouver est la partie difficile et coûteuse ; écrire l'exploitation d'une faille identifiée est un travail plus mécanique, que d'autres outils savent faire. Un modèle qui identifie massivement des vulnérabilités fournit la matière première, même s'il ne fabrique pas l'arme finale.

L'asymétrie qui structure ce débat

Il faut redire pourquoi ce type de capacité inquiète, indépendamment des intentions.

Un défenseur doit corriger toutes les failles de son système. Un attaquant n'a besoin d'en exploiter qu'une. Un outil qui accélère la découverte des deux côtés n'avantage donc pas symétriquement : il avantage celui qui a le moins à faire.

C'est l'argument principal des partisans d'une publication conditionnée, et il est solide. L'argument inverse l'est aussi : retenir des poids en Occident n'empêche pas un modèle équivalent d'exister ailleurs, et prive la défense d'un outil que l'attaque finira par obtenir.

Ce qui change ici, c'est que la décision ne vient pas d'un régulateur occidental mais du laboratoire lui-même, ce qui affaiblit l'argument selon lequel ces retenues ne seraient qu'un protectionnisme déguisé.

Ce qu'il faut retenir

Trois points, dans l'ordre d'importance.

Le précédent. Pour la première fois, un laboratoire de la mouvance ouverte diffère volontairement une publication au motif d'une capacité offensive. Que la publication arrive finalement fin août ne change rien : le principe d'un seuil vient d'être appliqué en pratique.

La prudence sur le vocabulaire. Un modèle dont les poids sont promis n'est pas un modèle ouvert. Nous l'avions écrit à propos de Kimi K3, et nous nous sommes nous-mêmes trompés ce matin. La formulation exacte est : disponible par API, ouverture annoncée.

L'échéance. Si les poids sont publiés fin août comme annoncé, la capacité décrite ici devient effectivement irréversible. Ce sera le moment de reposer la question, avec cette fois un fait accompli plutôt qu'une hypothèse.

Espace publicitaire