Z.ai vient de dévoiler GLM-5.3, une nouvelle version de son modèle d’intelligence artificielle qui mise gros sur le développement logiciel autonome et la cybersécurité. L’entreprise chinoise, connue auparavant sous le nom de Zhipu AI, a annoncé son lancement le 14 août 2026.
Pour l’instant, GLM-5.3 est accessible via le GLM Coding Plan et l’environnement ZCode. Z.ai prévoit ensuite de publier les poids du modèle, environ deux semaines après son lancement.
Un nouveau modèle sans repartir de zéro
GLM-5.3 a une particularité assez intéressante : Z.ai n’a pas réentraîné entièrement son modèle de base. L’entreprise a conservé le modèle GLM-5.2 et ses 743 milliards de paramètres, puis a concentré ses efforts sur le post-entraînement. L’objectif était de rendre le modèle plus efficace face à des tâches de développement qui ne se règlent pas en quelques minutes. Les environnements d’apprentissage ont notamment été conçus pour reproduire des projets d’ingénierie complexes pouvant s’étaler sur plusieurs jours.
Les premiers résultats annoncés par Z.ai montrent un net écart avec GLM-5.2. Sur Terminal-Bench 3.0, le score passe de 4,6 à 28,3. Sur DeepSWE v1.1, il progresse de 46,2 à 66,9. AutomationBench affiche également une forte hausse, de 26,2 à 48,2.
Même constat sur le benchmark interne Z.ai Code Bench. Z.ai revendique environ 50 % de performances supplémentaires, tout en réduisant la quantité maximale de jetons de sortie : 75 000 contre 96 000 pour GLM-5.2.
La cybersécurité prend une place importante
GLM-5.3 ne s’arrête toutefois pas au code. Pendant son post-entraînement, le modèle a également été exposé à des données liées à l’analyse de vulnérabilités. Selon Z.ai, cette approche a fait émerger des capacités de cybersécurité plus poussées que prévu. Le modèle peut notamment aller au-delà de la simple détection d’une faille et construire une chaîne d’exploitation complète.
Les chiffres annoncés sont particulièrement élevés. Sur CyberGym, GLM-5.3 obtient un taux de réussite de 84,5 %, contre 77,2 % pour GLM-5.2. Sur ExploitBench, il atteint 54,4 %, alors que son prédécesseur plafonnait à 24,4 %.
Introducing GLM-5.3: Built to Code. Ready for Cyber Defense.
— Z.ai (@Zai_org) August 14, 2026
– Top-tier coding and agentic capabilities, achieved through post-training on the 743B base model
– A major leap in cybersecurity, setting a new standard among open models
Tech Blog: https://t.co/ekQkO83jCv pic.twitter.com/y3Y2AB0wxr
Z.ai indique également avoir travaillé avec des équipes de sécurité chinoises. Ces collaborations auraient permis d’identifier 2 436 vulnérabilités sur 269 projets. Parmi elles, 1 097 ont été classées comme critiques ou élevées. Le registre public de l’entreprise indique que 53 failles ont déjà été divulguées, tandis que 2 383 restent sous embargo. La plus ancienne vulnérabilité détectée remonterait à 1981, avec un âge moyen de 26,6 ans.
Une autre découverte fait parler d’elle : un représentant de Z.ai, Lou, affirme avoir identifié une vulnérabilité potentiellement sérieuse dans l’environnement Cursor. Cette information provient toutefois d’une publication sur X et n’a pas encore été confirmée officiellement par l’entreprise concernée.
Une API qui change et des tarifs qui grimpent
L’arrivée de GLM-5.3 implique aussi quelques changements pour les développeurs. Dans l’API, le mode de réflexion (« thinking ») ne peut désormais plus être désactivé. Il faut choisir un niveau d’effort parmi trois options : low, high ou max.
Les tarifs du Coding Plan commencent à 12,60 dollars par mois avec la formule Lite, qui comprend 10 000 crédits par semaine. L’offre Max monte à 117,60 dollars. Pour les équipes, les forfaits sont affichés à 88 et 188 dollars par utilisateur et par mois. Un système de quotas permet par ailleurs de bénéficier de 50 % de réduction pendant les périodes creuses.
Le prix n’est toutefois qu’une partie de l’équation. Il faut aussi regarder ce que le modèle offre pour ce coût. Dans un test indépendant consacré à la détection de failles IDOR, GLM-5.3 obtient un score F1 de 23,8 %, avec un coût de 0,15 dollar par vraie détection. Claude Opus 5 monte à 65,6 %, mais coûte 0,44 dollar par vrai positif. Claude Opus 4.8 affiche 23,6 %, pour 1,04 dollar.
Le résultat de GLM-5.3 est donc intéressant sur le rapport coût-performance, même si un détail mérite d’être surveillé : GLM-5.2 avait obtenu 26,8 % lors du même test. Les chercheurs doivent encore déterminer si cette différence vient simplement de la variabilité du benchmark.
- Partager l'article :
Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !


