Zhipu AI dévoile GLM-5.3-Flash : un modèle IA entraîné sur 100 000 puces chinoises qui fait trembler Nvidia

Zhipu AI dévoile GLM-5.3-Flash : un modèle IA entraîné sur 100 000 puces chinoises qui fait trembler Nvidia

Zhipu AI vient de lever le voile sur GLM-5.3-Flash, son dernier modèle d’intelligence artificielle open-weight. Ce système, longtemps désigné sous le nom de code « Ox Alpha », a tourné entièrement sur un cluster de 100 000 puces chinoises. Son lancement discret a déjà battu des records mondiaux de trafic – et l’action de la société a bondi de 12 % en une seule séance.

En bref

  • GLM-5.3-Flash a traité 62 000 milliards de tokens avant même son lancement officiel.
  • Le modèle a fonctionné sur 100 000 puces domestiques chinoises, sans aucun GPU Nvidia.
  • Son action cotée à Hong Kong a clôturé à HK$1 160, soit +12 % en une journée.

Un lancement furtif qui a fracassé les records

Avant son annonce officielle mercredi, GLM-5.3-Flash circulait sous le nom « Ox Alpha » sur deux plateformes mondiales : OpenRouter, un marché de modèles IA, et OpenCode, une plateforme d’agents codeurs. En une semaine de test discret, le modèle a traité 62 000 milliards de tokens – une unité de base du traitement du langage par les IA.

Sur OpenRouter seul, il a englouti plus de 11 000 milliards de tokens en trois jours. C’est le plus grand lancement de l’histoire de la plateforme. Le jeudi suivant la révélation, le modèle occupait la première place mondiale pour les tâches de codage. Il représentait 31 % du volume hebdomadaire total d’OpenRouter.

Chiffres clés

  • 62 000 milliards de tokens traités avant le lancement officiel
  • 100 000 puces chinoises mobilisées pour le cluster d’inférence
  • 320 milliards de paramètres au total, 18 milliards activés par requête
  • +12 % sur l’action Zhipu AI à Hong Kong en une seule séance
  • Prix affiché à 1/40e du tarif d’Anthropic Opus 4.8 à niveau d’intelligence comparable
Contexte

  • Zhipu AI opère à l’international sous la marque Z.ai et collabore avec les principaux fabricants chinois de puces comme Huawei, Cambricon et Moore Threads.
  • Washington restreint les exportations de GPU Nvidia vers la Chine, poussant les entreprises chinoises à développer des alternatives domestiques.
  • Le secteur de l’IA open-source en Chine est en pleine ébullition : Alibaba a lancé Qwen3.8-Flash-Next le même jour que GLM-5.3-Flash.
Puce semi-conducteur chinoise en gros plan
Les puces chinoises de Cambricon et Moore Threads ont assuré une compatibilité immédiate avec GLM-5.3-Flash. (image générée avec IA Gemini)

La vraie rupture : tourner sans Nvidia sur des puces chinoises

Le véritable enjeu de ce lancement dépasse les benchmarks. Zhipu affirme avoir fait fonctionner GLM-5.3-Flash exclusivement sur des semi-conducteurs produits en Chine – sans mentionner de fournisseur précis. Deux acteurs domestiques, Cambricon et Moore Threads, ont tous deux annoncé une compatibilité « Day 0 » avec le modèle.

Les puces chinoises souffrent d’une mémoire et d’une bande passante inférieures aux GPU Nvidia haut de gamme. Pour compenser, Zhipu a conçu un moteur d’inférence spécialisé. Ce moteur divise les étapes de traitement en bassins de calcul gérés indépendamment. Résultat affiché : une performance multipliée par trois par rapport au niveau de départ. Zhipu affirme également avoir atteint une efficacité matérielle et un coût par token comparables aux accélérateurs Nvidia. Ces déclarations n’ont pas été vérifiées de manière indépendante.

Architecture : 320 milliards de paramètres, mais une légèreté assumée

GLM-5.3-Flash adopte une architecture à « mixture of experts » (MoE). Le principe est simple : le modèle dispose de 320 milliards de paramètres au total, mais n’en active que 18 milliards à chaque requête. Cela réduit la charge de calcul et abaisse les coûts.

C’est aussi le premier modèle de la série GLM-5 capable de traiter simultanément du texte et des images – ce qu’on appelle un modèle multimodal. La firme de benchmarking Artificial Analysis lui attribue un score de 57 sur son « Intelligence Index », le plaçant 10e mondial et 3e parmi les modèles open-weight, derrière Kimi K3 de Moonshot AI et Qwen3 d’Alibaba.

Une stratégie de prix agressive pour conquérir les développeurs internationaux

Zhipu mise sur une politique tarifaire offensive. GLM-5.3-Flash est proposé à un dixième du prix du GLM-5.3 standard. Pendant une promotion limitée, ce ratio tombe à un vingtième. La société revendique un coût 40 fois inférieur à celui d’Anthropic Opus 4.8 pour un niveau d’intelligence comparable.

Le modèle est disponible en open-weight – ses poids sont accessibles publiquement. Il est intégré à l’API de Zhipu, à la plateforme ZCode et au GLM Coding Plan. L’objectif est clair : attirer les développeurs du monde entier, y compris ceux qui travaillent actuellement avec des modèles occidentaux.

Des retours développeurs mitigés malgré l’engouement

Le succès de trafic ne s’est pas encore traduit en satisfaction unanime. Les premiers retours des développeurs sont contrastés. D’un côté, les utilisateurs saluent les capacités de débogage : le modèle a résolu 28 % des 175 problèmes du benchmark LiveCodeBench. De l’autre, certains signalent des hallucinations, des tâches abandonnées en cours d’exécution et une génération de texte lente.

Artificial Analysis confirme que la vitesse de sortie du modèle reste inférieure à la moyenne du secteur. Ces points de friction pourraient freiner l’adoption à grande échelle, malgré un positionnement tarifaire très compétitif.

Développeur analysant les performances du modèle GLM-5.3-Flash
Les premiers retours des développeurs sur GLM-5.3-Flash restent contrastés malgré un record de trafic mondial. (image générée avec IA Gemini)

La bataille de l’open-source chinois s’intensifie

Le lancement de GLM-5.3-Flash n’est pas isolé. Le même jour, Alibaba a publié Qwen3.8-Flash-Next, présenté comme un aperçu multimodal de la future série Qwen4. Ce modèle active 6 milliards de ses 125 milliards de paramètres, avec la même logique de réduction des coûts d’inférence.

La simultanéité de ces lancements semble indiquer une accélération délibérée dans l’écosystème open-source chinois. Chaque acteur cherche à s’imposer comme la référence internationale avant que les autres ne le fassent.

Ce qu’il faut retenir

  • GLM-5.3-Flash a battu les records de trafic d’OpenRouter avant même son lancement officiel.
  • Le modèle fonctionne sur 100 000 puces chinoises, une réponse directe aux restrictions américaines sur Nvidia.
  • Les performances annoncées face aux GPU Nvidia restent à vérifier de façon indépendante.
  • La tarification agressive – jusqu’à 40 fois moins chère qu’Anthropic – cible les développeurs internationaux.
  • La concurrence domestique entre Zhipu, Alibaba et Moonshot AI s’est brusquement accélérée.

Une démonstration qui va bien au-delà d’un simple modèle

GLM-5.3-Flash semble bien être autre chose qu’un simple lancement produit. C’est une démonstration publique que la Chine peut entraîner et déployer des modèles d’IA à grande échelle sur ses propres puces – et rester compétitive en termes de coûts et de performance. Dans un contexte où Washington cherche à couper Pékin des semi-conducteurs les plus avancés, cette démonstration technique prend une valeur stratégique évidente. Si Zhipu tient ses promesses de performance, d’autres acteurs chinois pourraient rapidement suivre la même voie.

Et vous, pensez-vous que les puces chinoises peuvent véritablement rivaliser avec Nvidia sur le long terme ? Partagez votre avis en commentaire.

Sources : South China Morning Post

(Les illustrations de cet article ont été générées avec Gemini)
Qu'est-ce que GLM-5.3-Flash de Zhipu AI ?
GLM-5.3-Flash est le dernier modèle d’intelligence artificielle open-weight de Zhipu AI, anciennement connu sous le nom de code « Ox Alpha ». Il dispose de 320 milliards de paramètres au total et en active 18 milliards par requête. Il est capable de traiter simultanément du texte et des images.
Pourquoi ce modèle IA tourne-t-il sur des puces chinoises plutôt que sur Nvidia ?
Les restrictions américaines à l’exportation limitent l’accès des entreprises chinoises aux GPU Nvidia les plus avancés. Zhipu AI a contourné cette contrainte en construisant un cluster de 100 000 puces domestiques et en développant un moteur d’inférence spécialisé pour compenser leurs limitations techniques.
Quelles sont les performances de GLM-5.3-Flash par rapport aux autres modèles ?
Selon Artificial Analysis, GLM-5.3-Flash obtient un score de 57 sur l’Intelligence Index, le classant 10e mondial et 3e parmi les modèles open-weight. Il dépasse 28 % des problèmes du benchmark LiveCodeBench, mais sa vitesse de génération reste inférieure à la moyenne du secteur.
Quel est le prix de GLM-5.3-Flash ?
Zhipu AI propose GLM-5.3-Flash à un dixième du prix de son modèle GLM-5.3 standard, et à un vingtième pendant une promotion limitée. La société affirme que le coût est environ 40 fois inférieur à celui d’Anthropic Opus 4.8 pour un niveau d’intelligence comparable.

Pierre Woo

Je m'appelle Pierre, diplômé d'un MBA en affaires internationales. Je suis passionné par la Chine. J'ai étudié et travaillé dans l'empire du milieu pendant plusieurs années. Cette expérience a non seulement approfondi ma compréhension de la Chine moderne, mais elle m'a aussi permis de saisir les nuances complexes de son économie en rapide évolution.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *