DeepSeek V4.1 Flash : plus rapide, moins cher et devant Kimi K3

DeepSeek V4.1 Flash : plus rapide, moins cher et devant Kimi K3

DeepSeek vient de lancer V4.1 Flash, un nouveau modèle d’IA qui dépasse son propre V4 Pro sur les benchmarks de codage et de cybersécurité. La société va même plus loin : elle redirige temporairement tous les utilisateurs de V4 Pro vers ce modèle moins cher, jugé supérieur. Ce mouvement révèle une tendance de fond dans l’IA chinoise – la course à l’efficacité maximale au coût minimal, comme réponse directe aux restrictions sur les puces américaines.

En bref

  • DeepSeek lance V4.1 Flash, basé sur une nouvelle architecture « Causal-Encoder-Decoder » et un design MoE.
  • Le modèle surpasse V4 Pro, Kimi K3 et GPT-5.6 Sol sur plusieurs benchmarks techniques.
  • Le coût d’inférence chute à 0,02 yuan par million de tokens en heures creuses.
  • DeepSeek redirige ses utilisateurs V4 Pro vers Flash, le temps que V4.1 Pro soit prêt.

Une architecture conçue pour faire plus avec moins

V4.1 Flash s’appuie sur 552 milliards de paramètres au total. Mais en pratique, il n’en utilise qu’une fraction. Son architecture Mixture-of-Experts – ou MoE – ne sollicite que 8 milliards de paramètres pour traiter une requête. Elle en active 16 milliards supplémentaires pour générer la réponse.

Dans un modèle traditionnel, chaque requête traverse l’ensemble du système. Ici, les tâches sont routées vers les sous-réseaux les plus adaptés. Résultat : une consommation de puces de calcul très inférieure pour des performances équivalentes ou supérieures.

C’est cette logique qui anime l’ensemble de la stratégie de DeepSeek. Avec les restrictions américaines sur l’export de puces Nvidia vers la Chine, les développeurs chinois n’ont pas d’autre choix que d’optimiser chaque couche de leurs modèles.

Chiffres clés

  • 552 milliards de paramètres au total, mais seulement 8 Mds activés en entrée et 16 Mds en sortie.
  • Score de 90,6 sur Terminal-Bench 2.1, contre 88,3 pour Kimi K3 et 88,8 pour GPT-5.6 Sol.
  • Score de 88,1 sur Cybergym (cybersécurité), contre 80 pour Kimi K3 et 84,5 pour GPT-5.6 Sol.
  • Mémoire KV réduite à 890 octets par token, contre 3 514 octets dans la version Flash précédente.
  • Tarif API à partir de 0,02 yuan par million de tokens en heures creuses.
Contexte

  • Les restrictions américaines sur l’export de puces limitent l’accès des entreprises chinoises aux GPU de pointe de Nvidia, ce qui pousse les développeurs à optimiser leurs architectures plutôt qu’à empiler les ressources matérielles.
  • Kimi K3, le modèle de Moonshot AI lancé récemment, est devenu une référence de comparaison pour les développeurs chinois malgré les contraintes liées aux puces.
  • DeepSeek avait précédemment lancé son équipe Harness pour développer des agents IA autonomes, dont Cui Tianyi est responsable.
Campus technologique chinois illuminé la nuit, symbole de la course à l'IA
Les développeurs chinois d’IA rivalisent d’innovations architecturales pour compenser les restrictions sur les puces. (image générée avec IA Gemini)

Des benchmarks qui placent Flash au-dessus du lot

Sur Terminal-Bench 2.1, un test centré sur les tâches réelles de calcul, V4.1 Flash obtient 90,6 points. C’est devant GPT-5.6 Sol d’OpenAI à 88,8 et Kimi K3 à 88,3. Le précédent V4 Pro de DeepSeek lui-même plafonnait à 87,9.

Sur Cybergym, le benchmark spécialisé en cybersécurité, l’écart est encore plus net. Flash marque 88,1 contre 83,3 pour V4 Pro, 80 pour Kimi K3, et 84,5 pour GPT-5.6 Sol. Ce n’est pas un résultat marginal – c’est un retournement de classement complet.

V4.1 Flash rivalise également avec Claude Opus 5 d’Anthropic sur le benchmark d’ingénierie logicielle DeepSWE v1.1. Il ne domine pas sur tous les tests, mais il s’impose sur les critères les plus concrets.

La mémoire, levier discret d’une compétitivité réelle

L’un des apports techniques les plus significatifs de V4.1 Flash est la réduction du cache KV. Ce cache – la mémoire temporaire qu’un modèle utilise pour suivre le fil d’une conversation – est l’un des principaux postes de coût en inférence.

DeepSeek l’a ramené à 890 octets par token. C’est une division par presque quatre comparé aux 3 514 octets du Flash précédent. Pour les applications d’agents IA qui enchaînent des milliers d’échanges, cela change directement l’équation économique.

Ce gain se traduit dans les tarifs : 0,02 yuan par million de tokens en cache en heures creuses. À titre de comparaison, DeepSeek V4 Pro était déjà 12 fois moins cher qu’OpenAI GPT-5.5 après une baisse de prix de 75 % – V4.1 Flash descend encore plus bas.

Un mouvement de prix qui dit tout

DeepSeek ne se contente pas d’annoncer un nouveau modèle. Elle redirige activement ses utilisateurs de V4 Pro vers Flash. La décision vient de Cui Tianyi, responsable de l’équipe Harness, qui a déclaré publiquement que vendre un modèle inférieur à un prix plus élevé serait « inapproprié ».

Ce choix est rare dans l’industrie. Habituellement, les entreprises conservent leurs anciens modèles à des prix plus bas pour segmenter leur offre. DeepSeek fait le contraire : elle substitue un modèle moins cher et plus performant à l’ancien, en attendant que V4.1 Pro soit disponible.

C’est un signal clair sur la trajectoire de prix de l’IA chinoise. Moins cher et plus capable sont présentés comme compatibles, pas comme un arbitrage.

La tendance Flash s’impose dans tout l’écosystème chinois

DeepSeek n’est pas seul sur cette voie. Le mois dernier, Z.ai a dévoilé son GLM-5.3-Flash avec 320 milliards de paramètres, mais seulement 18 milliards activés à la fois. Alibaba a suivi avec Qwen3.8-Flash-Next, qui n’active que 6 milliards de ses 125 milliards de paramètres.

La logique est identique partout : des modèles massivement paramétrisés en théorie, mais chirurgicalement frugaux en pratique. Ce n’est pas un hasard – c’est une réponse collective aux contraintes matérielles imposées de l’extérieur.

Pour les entreprises qui déploient des agents IA à grande échelle, cette tendance est directement pertinente. Les coûts d’inférence représentent souvent le principal frein à l’adoption des solutions IA en production.

Comparaison de benchmarks IA sur un écran de développeur
V4.1 Flash devance Kimi K3 et GPT-5.6 Sol sur les principaux benchmarks de codage et de cybersécurité. (image générée avec IA Gemini)

Ce que ce lancement révèle sur la guerre IA en Chine

V4.1 Flash n’est pas simplement un meilleur modèle. C’est le symptôme d’une compétition qui s’est déplacée du terrain de la puissance brute vers celui de l’efficacité systémique. Quand on ne peut pas acheter plus de puces, on optimise ce qu’on a.

Cette logique favorise structurellement les acteurs capables d’innovations architecturales profondes. DeepSeek, Moonshot AI, Z.ai et Alibaba montrent tous qu’ils ont intégré cette contrainte dans leur feuille de route.

Ce qu’il faut retenir

  • V4.1 Flash dépasse V4 Pro, Kimi K3 et GPT-5.6 Sol sur les benchmarks de codage et de cybersécurité.
  • La mémoire par token est réduite de 75 %, ce qui fait chuter les coûts d’inférence.
  • DeepSeek redirige les utilisateurs V4 Pro vers Flash, signalant une stratégie de prix offensive.
  • Z.ai et Alibaba ont lancé des modèles Flash similaires, confirmant une tendance sectorielle.
  • L’efficacité architecturale devient le principal avantage concurrentiel face aux restrictions sur les puces.

L’efficacité comme seule réponse viable aux restrictions de puces

La guerre de l’IA en Chine se joue désormais sur un terrain inattendu : l’art de faire beaucoup avec peu. Les restrictions américaines sur les semi-conducteurs ont involontairement créé une pression d’innovation qui pousse les développeurs chinois à repenser leurs architectures en profondeur. V4.1 Flash en est l’illustration la plus récente – et probablement pas la dernière.

Qu’est-ce qui vous semble le plus marquant dans cette évolution : la performance technique de V4.1 Flash, ou la stratégie de prix de DeepSeek ? Dites-le en commentaire.

Sources : South China Morning Post

(Les illustrations de cet article ont été générées avec Gemini)
Qu'est-ce que l'architecture Mixture-of-Experts (MoE) utilisée par DeepSeek V4.1 Flash ?
Dans un modèle MoE, l’ensemble des paramètres est divisé en sous-réseaux spécialisés. Chaque requête est dirigée uniquement vers les sous-réseaux les plus pertinents, sans activer tout le système. DeepSeek V4.1 Flash n’active ainsi que 8 milliards de paramètres en entrée et 16 milliards en sortie, sur un total de 552 milliards. Cela réduit considérablement la puissance de calcul nécessaire par requête.
Pourquoi DeepSeek a-t-il redirigé les utilisateurs de V4 Pro vers V4.1 Flash ?
DeepSeek a déclaré que V4.1 Flash surpasse V4 Pro sur tous les indicateurs mesurés. Maintenir V4 Pro à un tarif plus élevé alors qu’il est moins performant aurait été jugé injuste pour les utilisateurs. La société redirige donc temporairement toutes les requêtes V4 Pro vers Flash, en attendant la sortie du futur V4.1 Pro.
Comment V4.1 Flash se compare-t-il à Kimi K3 et à GPT-5.6 Sol ?
Sur Terminal-Bench 2.1, V4.1 Flash obtient 90,6 points contre 88,3 pour Kimi K3 et 88,8 pour GPT-5.6 Sol. Sur Cybergym, dédié à la cybersécurité, Flash marque 88,1 contre 80 pour Kimi K3 et 84,5 pour GPT-5.6 Sol. Il dépasse aussi son propre prédécesseur V4 Pro sur ces deux tests.
Pourquoi les modèles Flash sont-ils devenus si courants dans l'IA chinoise ?
Les restrictions américaines sur l’export de puces de calcul limitent l’accès des entreprises chinoises aux GPU haut de gamme. En réponse, les développeurs comme DeepSeek, Z.ai et Alibaba conçoivent des modèles qui activent une petite fraction de leurs paramètres à chaque requête. Cette approche permet d’obtenir des performances élevées avec des ressources matérielles réduites, et de proposer des tarifs très compétitifs.

Pierre Woo

Je m'appelle Pierre, diplômé d'un MBA en affaires internationales. Je suis passionné par la Chine. J'ai étudié et travaillé dans l'empire du milieu pendant plusieurs années. Cette expérience a non seulement approfondi ma compréhension de la Chine moderne, mais elle m'a aussi permis de saisir les nuances complexes de son économie en rapide évolution.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *