Zhipu AI dévoile GLM-5.3-Flash : un modèle IA entraîné sur 100 000 puces chinoises qui fait trembler Nvidia
Zhipu AI vient de lever le voile sur GLM-5.3-Flash, son dernier modèle d’intelligence artificielle open-weight. Ce système, longtemps désigné sous le nom de code « Ox Alpha », a tourné entièrement sur un cluster de 100 000 puces chinoises. Son lancement discret a déjà battu des records mondiaux de trafic – et l’action de la société a bondi de 12 % en une seule séance.
- GLM-5.3-Flash a traité 62 000 milliards de tokens avant même son lancement officiel.
- Le modèle a fonctionné sur 100 000 puces domestiques chinoises, sans aucun GPU Nvidia.
- Son action cotée à Hong Kong a clôturé à HK$1 160, soit +12 % en une journée.
Un lancement furtif qui a fracassé les records
Avant son annonce officielle mercredi, GLM-5.3-Flash circulait sous le nom « Ox Alpha » sur deux plateformes mondiales : OpenRouter, un marché de modèles IA, et OpenCode, une plateforme d’agents codeurs. En une semaine de test discret, le modèle a traité 62 000 milliards de tokens – une unité de base du traitement du langage par les IA.
Sur OpenRouter seul, il a englouti plus de 11 000 milliards de tokens en trois jours. C’est le plus grand lancement de l’histoire de la plateforme. Le jeudi suivant la révélation, le modèle occupait la première place mondiale pour les tâches de codage. Il représentait 31 % du volume hebdomadaire total d’OpenRouter.
- 62 000 milliards de tokens traités avant le lancement officiel
- 100 000 puces chinoises mobilisées pour le cluster d’inférence
- 320 milliards de paramètres au total, 18 milliards activés par requête
- +12 % sur l’action Zhipu AI à Hong Kong en une seule séance
- Prix affiché à 1/40e du tarif d’Anthropic Opus 4.8 à niveau d’intelligence comparable
- Zhipu AI opère à l’international sous la marque Z.ai et collabore avec les principaux fabricants chinois de puces comme Huawei, Cambricon et Moore Threads.
- Washington restreint les exportations de GPU Nvidia vers la Chine, poussant les entreprises chinoises à développer des alternatives domestiques.
- Le secteur de l’IA open-source en Chine est en pleine ébullition : Alibaba a lancé Qwen3.8-Flash-Next le même jour que GLM-5.3-Flash.

La vraie rupture : tourner sans Nvidia sur des puces chinoises
Le véritable enjeu de ce lancement dépasse les benchmarks. Zhipu affirme avoir fait fonctionner GLM-5.3-Flash exclusivement sur des semi-conducteurs produits en Chine – sans mentionner de fournisseur précis. Deux acteurs domestiques, Cambricon et Moore Threads, ont tous deux annoncé une compatibilité « Day 0 » avec le modèle.
Les puces chinoises souffrent d’une mémoire et d’une bande passante inférieures aux GPU Nvidia haut de gamme. Pour compenser, Zhipu a conçu un moteur d’inférence spécialisé. Ce moteur divise les étapes de traitement en bassins de calcul gérés indépendamment. Résultat affiché : une performance multipliée par trois par rapport au niveau de départ. Zhipu affirme également avoir atteint une efficacité matérielle et un coût par token comparables aux accélérateurs Nvidia. Ces déclarations n’ont pas été vérifiées de manière indépendante.
Architecture : 320 milliards de paramètres, mais une légèreté assumée
GLM-5.3-Flash adopte une architecture à « mixture of experts » (MoE). Le principe est simple : le modèle dispose de 320 milliards de paramètres au total, mais n’en active que 18 milliards à chaque requête. Cela réduit la charge de calcul et abaisse les coûts.
C’est aussi le premier modèle de la série GLM-5 capable de traiter simultanément du texte et des images – ce qu’on appelle un modèle multimodal. La firme de benchmarking Artificial Analysis lui attribue un score de 57 sur son « Intelligence Index », le plaçant 10e mondial et 3e parmi les modèles open-weight, derrière Kimi K3 de Moonshot AI et Qwen3 d’Alibaba.
Une stratégie de prix agressive pour conquérir les développeurs internationaux
Zhipu mise sur une politique tarifaire offensive. GLM-5.3-Flash est proposé à un dixième du prix du GLM-5.3 standard. Pendant une promotion limitée, ce ratio tombe à un vingtième. La société revendique un coût 40 fois inférieur à celui d’Anthropic Opus 4.8 pour un niveau d’intelligence comparable.
Le modèle est disponible en open-weight – ses poids sont accessibles publiquement. Il est intégré à l’API de Zhipu, à la plateforme ZCode et au GLM Coding Plan. L’objectif est clair : attirer les développeurs du monde entier, y compris ceux qui travaillent actuellement avec des modèles occidentaux.
Des retours développeurs mitigés malgré l’engouement
Le succès de trafic ne s’est pas encore traduit en satisfaction unanime. Les premiers retours des développeurs sont contrastés. D’un côté, les utilisateurs saluent les capacités de débogage : le modèle a résolu 28 % des 175 problèmes du benchmark LiveCodeBench. De l’autre, certains signalent des hallucinations, des tâches abandonnées en cours d’exécution et une génération de texte lente.
Artificial Analysis confirme que la vitesse de sortie du modèle reste inférieure à la moyenne du secteur. Ces points de friction pourraient freiner l’adoption à grande échelle, malgré un positionnement tarifaire très compétitif.

La bataille de l’open-source chinois s’intensifie
Le lancement de GLM-5.3-Flash n’est pas isolé. Le même jour, Alibaba a publié Qwen3.8-Flash-Next, présenté comme un aperçu multimodal de la future série Qwen4. Ce modèle active 6 milliards de ses 125 milliards de paramètres, avec la même logique de réduction des coûts d’inférence.
La simultanéité de ces lancements semble indiquer une accélération délibérée dans l’écosystème open-source chinois. Chaque acteur cherche à s’imposer comme la référence internationale avant que les autres ne le fassent.
- GLM-5.3-Flash a battu les records de trafic d’OpenRouter avant même son lancement officiel.
- Le modèle fonctionne sur 100 000 puces chinoises, une réponse directe aux restrictions américaines sur Nvidia.
- Les performances annoncées face aux GPU Nvidia restent à vérifier de façon indépendante.
- La tarification agressive – jusqu’à 40 fois moins chère qu’Anthropic – cible les développeurs internationaux.
- La concurrence domestique entre Zhipu, Alibaba et Moonshot AI s’est brusquement accélérée.
Une démonstration qui va bien au-delà d’un simple modèle
GLM-5.3-Flash semble bien être autre chose qu’un simple lancement produit. C’est une démonstration publique que la Chine peut entraîner et déployer des modèles d’IA à grande échelle sur ses propres puces – et rester compétitive en termes de coûts et de performance. Dans un contexte où Washington cherche à couper Pékin des semi-conducteurs les plus avancés, cette démonstration technique prend une valeur stratégique évidente. Si Zhipu tient ses promesses de performance, d’autres acteurs chinois pourraient rapidement suivre la même voie.
Et vous, pensez-vous que les puces chinoises peuvent véritablement rivaliser avec Nvidia sur le long terme ? Partagez votre avis en commentaire.
Sources : South China Morning Post
