DeepSeek V4.1 Flash : plus rapide, moins cher et devant Kimi K3
DeepSeek vient de lancer V4.1 Flash, un nouveau modèle d’IA qui dépasse son propre V4 Pro sur les benchmarks de codage et de cybersécurité. La société va même plus loin : elle redirige temporairement tous les utilisateurs de V4 Pro vers ce modèle moins cher, jugé supérieur. Ce mouvement révèle une tendance de fond dans l’IA chinoise – la course à l’efficacité maximale au coût minimal, comme réponse directe aux restrictions sur les puces américaines.
- DeepSeek lance V4.1 Flash, basé sur une nouvelle architecture « Causal-Encoder-Decoder » et un design MoE.
- Le modèle surpasse V4 Pro, Kimi K3 et GPT-5.6 Sol sur plusieurs benchmarks techniques.
- Le coût d’inférence chute à 0,02 yuan par million de tokens en heures creuses.
- DeepSeek redirige ses utilisateurs V4 Pro vers Flash, le temps que V4.1 Pro soit prêt.
Une architecture conçue pour faire plus avec moins
V4.1 Flash s’appuie sur 552 milliards de paramètres au total. Mais en pratique, il n’en utilise qu’une fraction. Son architecture Mixture-of-Experts – ou MoE – ne sollicite que 8 milliards de paramètres pour traiter une requête. Elle en active 16 milliards supplémentaires pour générer la réponse.
Dans un modèle traditionnel, chaque requête traverse l’ensemble du système. Ici, les tâches sont routées vers les sous-réseaux les plus adaptés. Résultat : une consommation de puces de calcul très inférieure pour des performances équivalentes ou supérieures.
C’est cette logique qui anime l’ensemble de la stratégie de DeepSeek. Avec les restrictions américaines sur l’export de puces Nvidia vers la Chine, les développeurs chinois n’ont pas d’autre choix que d’optimiser chaque couche de leurs modèles.
- 552 milliards de paramètres au total, mais seulement 8 Mds activés en entrée et 16 Mds en sortie.
- Score de 90,6 sur Terminal-Bench 2.1, contre 88,3 pour Kimi K3 et 88,8 pour GPT-5.6 Sol.
- Score de 88,1 sur Cybergym (cybersécurité), contre 80 pour Kimi K3 et 84,5 pour GPT-5.6 Sol.
- Mémoire KV réduite à 890 octets par token, contre 3 514 octets dans la version Flash précédente.
- Tarif API à partir de 0,02 yuan par million de tokens en heures creuses.
- Les restrictions américaines sur l’export de puces limitent l’accès des entreprises chinoises aux GPU de pointe de Nvidia, ce qui pousse les développeurs à optimiser leurs architectures plutôt qu’à empiler les ressources matérielles.
- Kimi K3, le modèle de Moonshot AI lancé récemment, est devenu une référence de comparaison pour les développeurs chinois malgré les contraintes liées aux puces.
- DeepSeek avait précédemment lancé son équipe Harness pour développer des agents IA autonomes, dont Cui Tianyi est responsable.

Des benchmarks qui placent Flash au-dessus du lot
Sur Terminal-Bench 2.1, un test centré sur les tâches réelles de calcul, V4.1 Flash obtient 90,6 points. C’est devant GPT-5.6 Sol d’OpenAI à 88,8 et Kimi K3 à 88,3. Le précédent V4 Pro de DeepSeek lui-même plafonnait à 87,9.
Sur Cybergym, le benchmark spécialisé en cybersécurité, l’écart est encore plus net. Flash marque 88,1 contre 83,3 pour V4 Pro, 80 pour Kimi K3, et 84,5 pour GPT-5.6 Sol. Ce n’est pas un résultat marginal – c’est un retournement de classement complet.
V4.1 Flash rivalise également avec Claude Opus 5 d’Anthropic sur le benchmark d’ingénierie logicielle DeepSWE v1.1. Il ne domine pas sur tous les tests, mais il s’impose sur les critères les plus concrets.
La mémoire, levier discret d’une compétitivité réelle
L’un des apports techniques les plus significatifs de V4.1 Flash est la réduction du cache KV. Ce cache – la mémoire temporaire qu’un modèle utilise pour suivre le fil d’une conversation – est l’un des principaux postes de coût en inférence.
DeepSeek l’a ramené à 890 octets par token. C’est une division par presque quatre comparé aux 3 514 octets du Flash précédent. Pour les applications d’agents IA qui enchaînent des milliers d’échanges, cela change directement l’équation économique.
Ce gain se traduit dans les tarifs : 0,02 yuan par million de tokens en cache en heures creuses. À titre de comparaison, DeepSeek V4 Pro était déjà 12 fois moins cher qu’OpenAI GPT-5.5 après une baisse de prix de 75 % – V4.1 Flash descend encore plus bas.
Un mouvement de prix qui dit tout
DeepSeek ne se contente pas d’annoncer un nouveau modèle. Elle redirige activement ses utilisateurs de V4 Pro vers Flash. La décision vient de Cui Tianyi, responsable de l’équipe Harness, qui a déclaré publiquement que vendre un modèle inférieur à un prix plus élevé serait « inapproprié ».
Ce choix est rare dans l’industrie. Habituellement, les entreprises conservent leurs anciens modèles à des prix plus bas pour segmenter leur offre. DeepSeek fait le contraire : elle substitue un modèle moins cher et plus performant à l’ancien, en attendant que V4.1 Pro soit disponible.
C’est un signal clair sur la trajectoire de prix de l’IA chinoise. Moins cher et plus capable sont présentés comme compatibles, pas comme un arbitrage.
La tendance Flash s’impose dans tout l’écosystème chinois
DeepSeek n’est pas seul sur cette voie. Le mois dernier, Z.ai a dévoilé son GLM-5.3-Flash avec 320 milliards de paramètres, mais seulement 18 milliards activés à la fois. Alibaba a suivi avec Qwen3.8-Flash-Next, qui n’active que 6 milliards de ses 125 milliards de paramètres.
La logique est identique partout : des modèles massivement paramétrisés en théorie, mais chirurgicalement frugaux en pratique. Ce n’est pas un hasard – c’est une réponse collective aux contraintes matérielles imposées de l’extérieur.
Pour les entreprises qui déploient des agents IA à grande échelle, cette tendance est directement pertinente. Les coûts d’inférence représentent souvent le principal frein à l’adoption des solutions IA en production.

Ce que ce lancement révèle sur la guerre IA en Chine
V4.1 Flash n’est pas simplement un meilleur modèle. C’est le symptôme d’une compétition qui s’est déplacée du terrain de la puissance brute vers celui de l’efficacité systémique. Quand on ne peut pas acheter plus de puces, on optimise ce qu’on a.
Cette logique favorise structurellement les acteurs capables d’innovations architecturales profondes. DeepSeek, Moonshot AI, Z.ai et Alibaba montrent tous qu’ils ont intégré cette contrainte dans leur feuille de route.
- V4.1 Flash dépasse V4 Pro, Kimi K3 et GPT-5.6 Sol sur les benchmarks de codage et de cybersécurité.
- La mémoire par token est réduite de 75 %, ce qui fait chuter les coûts d’inférence.
- DeepSeek redirige les utilisateurs V4 Pro vers Flash, signalant une stratégie de prix offensive.
- Z.ai et Alibaba ont lancé des modèles Flash similaires, confirmant une tendance sectorielle.
- L’efficacité architecturale devient le principal avantage concurrentiel face aux restrictions sur les puces.
L’efficacité comme seule réponse viable aux restrictions de puces
La guerre de l’IA en Chine se joue désormais sur un terrain inattendu : l’art de faire beaucoup avec peu. Les restrictions américaines sur les semi-conducteurs ont involontairement créé une pression d’innovation qui pousse les développeurs chinois à repenser leurs architectures en profondeur. V4.1 Flash en est l’illustration la plus récente – et probablement pas la dernière.
Qu’est-ce qui vous semble le plus marquant dans cette évolution : la performance technique de V4.1 Flash, ou la stratégie de prix de DeepSeek ? Dites-le en commentaire.
Sources : South China Morning Post
