I. Aperçu de l'événement
Le 24 avril 2026, DeepSeek a officiellement publié la version de prévisualisation des grands modèles de la série V4, comprenant le modèle phare DeepSeek-V4-Pro (1,6 billion de paramètres totaux / 49 milliards de paramètres activés) et la version légère DeepSeek-V4-Flash (284 milliards de paramètres totaux / 13 milliards de paramètres activés). Les deux prennent nativement en charge une fenêtre de contexte d’un million de tokens et sont entièrement en open source sous licence MIT. La série V4 est devenue officiellement disponible le 20 juillet, et l’API de la version officielle V4-Flash-0731 a été lancée pour tests publics le 31 juillet.
Le même jour, DeepSeek a annoncé une réduction permanente de 75 % du prix de l’API V4-Pro. Dans les scénarios de cache hit, le prix d’entrée est tombé à 0,025 yuan par million de tokens, et le prix de sortie à 6 yuan par million de tokens — un nouveau prix plancher parmi les modèles de pointe mondiaux.
II. Percées technologiques : pas seulement une question de prix bas
La série V4 a introduit trois technologies fondamentales :
- Architecture d’attention hybride (CSA + HCA) : combine l’attention compressée parcimonieuse avec l’attention hautement compressée. Avec une fenêtre de contexte d’un million de tokens, le calcul d’inférence ne représente que 27 % de celui de V3.2, et le cache KV n’utilise que 10 % de la mémoire.
- Hyperconnexion contrainte par variété (mHC) : remplace les connexions résiduelles traditionnelles, garantissant la stabilité de l’entraînement pour des réseaux de dizaines de milliers de couches.
- Entraînement et inférence en précision mixte FP4/FP8 : première mise en œuvre dans l’industrie. Réduit la pression sur la bande passante VRAM de 50 % et double l’efficacité de l’inférence.
Sur le test SWE-bench Verified (capacité de codage), V4-Pro a obtenu 80,6 %, en tête de tous les modèles open source et quasiment à égalité avec Claude Opus 4.6 (80,8 %). Il a atteint 87,5 % sur MMLU-Pro et 85,0 % sur le raisonnement mathématique AIME 2025. Dans son rapport technique, DeepSeek a reconnu être « légèrement en retard de 3 à 6 mois sur GPT-5.4 et Gemini-3.1-Pro », mais compte tenu de l’écart de prix, cela est quasi négligeable.
III. Massacre tarifaire : la « ligne d’exécution » des grands modèles mondiaux
La tarification du V4-Pro a directement pulvérisé le système de prix des grands modèles à l’échelle mondiale. Voici une comparaison des prix de sortie des principaux modèles en juillet 2026 (en dollars américains par million de tokens) :
Graphique 1 : Comparaison des prix de sortie API des principaux modèles en juillet 2026 (échelle logarithmique)

La communauté des développeurs hors de Chine est parvenue à un consensus : Pour la grande majorité des scénarios à destination du grand public (C-end) et des petites et moyennes entreprises (B-end), encourir des dizaines de fois le coût d’inférence pour des gains de performance marginaux n’a aucune viabilité commerciale. Pour tout concurrent dont le prix est supérieur à celui de DeepSeek, il ne reste que deux voies : réduire drastiquement ses prix de manière proactive, ou abandonner totalement le marché de masse des développeurs.
Graphique 2 : Comparaison des critères de référence principaux (graphique radar)

IV. Impact sur les principaux modèles
4.1 OpenAI : de l’arrogance aux baisses de prix urgentes
OpenAI a été le plus directement touché. En 2025, son chiffre d’affaires annuel s’élevait à 13 milliards de dollars, ses dépenses totales à 34 milliards de dollars, et sa perte nette à 39 milliards de dollars, dont environ 8 milliards de pertes d’exploitation.
Le 30 juillet 2026, trois semaines seulement après la sortie de GPT-5.6, OpenAI a annoncé en urgence une baisse de prix de 80 % pour la version Luna. Le PDG Sam Altman a reconnu publiquement que le coût est le « plus grand défi du secteur » et a déclaré qu’« OpenAI est heureux de réduire ses prix de 75 % », ce que les observateurs ont interprété comme une réponse passive à DeepSeek.
Sur la plateforme OpenRouter, la consommation hebdomadaire de tokens par les modèles chinois a dépassé 60 %, tandis que celle des modèles américains est tombée sous les 20 % [9]. Les données de la plateforme cloud américaine Vercel montrent que la part d’utilisation des modèles DeepSeek sur le marché des entreprises est passée de 1 % en avril à 17 % en mai.
4.2 Anthropic : la stratégie de prix élevés sous pression
Claude Fable 5 est facturé 50 dollars par million de tokens de sortie, soit 57 fois celui de V4-Pro. En juin 2026, Anthropic a commencé à interdire aux utilisateurs hors de Chine d’utiliser Claude, réduisant ainsi volontairement son marché – une décision interprétée comme imposée par des coûts de calcul excessifs, visant à se concentrer sur les marchés à ARPU élevé.
4.3 Google : pénurie de puissance de calcul
Le carnet de commandes en retard de Google Cloud a atteint 460 milliards de dollars, et Gemini a commencé à imposer des quotas d’utilisation à de grands clients tels que Meta.
4.4 Microsoft : signaux de défection
Le 16 juin 2026, Microsoft a officiellement commencé à évaluer l’intégration de DeepSeek V4 dans Copilot Cowork pour remplacer les modèles d’OpenAI et d’Anthropic. Le PDG Satya Nadella a déclaré publiquement : « Des modèles moins chers et des choix plus larges renforceront la confiance du public dans l’IA ; le public ne tolérera pas que quelques modèles et entreprises monopolisent tout l’apprentissage. » Étant donné que Microsoft détient une participation de 27 % dans OpenAI, cette déclaration a ébranlé le secteur.
4.5 Nvidia : la fissuration de la douve CUDA
Le jour du lancement de DeepSeek V4, celui-ci a été entièrement adapté à huit grands fabricants chinois de GPU : Huawei Ascend, Cambricon, Hygon, Moore Threads, Muxi, Kunlun Core, Alibaba T-Head et Tianjic. Bernstein prévoit que la part de Nvidia sur le marché chinois des accélérateurs d’IA passera de 95 % à environ 8 % en 2026, tandis que celle de Huawei Ascend augmentera à 50-62 %.
Graphique 3 : Chronologie des événements clés de la guerre des prix des grands modèles en 2026

V. Frénésie du capital : valorisation de 500 milliards
En juin 2026 : a réalisé un premier tour de financement externe dépassant 50 milliards de yuans, pour une valorisation supérieure à 50 milliards de dollars. Parmi les investisseurs figuraient Liang Wenfeng à titre personnel (20 milliards de yuans), Tencent (10 milliards), CATL (5 milliards), JD.com (3 milliards) et le Fonds national d’investissement pour l’industrie de l’IA.
Août 2026 : a lancé un deuxième tour de financement de 50 milliards de yuans, avec une valorisation pré-money d’environ 500 milliards de yuans (environ 74 milliards de dollars).
La valorisation totale des quatre principaux laboratoires d’IA pure en Chine a atteint environ 159 milliards de dollars, contre pratiquement zéro il y a 18 mois.
VI. Données de marché : les modèles chinois dominent le classement mondial d’utilisation
Graphique 4 : Part mondiale des appels de tokens sur la plateforme OpenRouter (du 27 juillet au 2 août)

VII. Revirements et préoccupations
7.1 Pénurie de puissance de calcul, hausse des prix à venir
Le 6 août, DeepSeek a annoncé qu’il allait « augmenter considérablement les prix de ses API ». Sa puissance de calcul actuelle équivaut à seulement environ 20 000 GPU H100, loin derrière les concurrents américains tels qu’OpenAI.
7.2 Risques politiques
Le gouvernement américain est très vigilant quant à l’intégration des modèles de DeepSeek dans les infrastructures des entreprises américaines. Même déployés dans les centres de données Azure de Microsoft aux États-Unis, ils restent soumis à des examens de sécurité.
7.3 Paradoxe de la commercialisation
Le ratio prix/ventes (P/S) du V4-Pro a dépassé 3 800 fois, soit plusieurs dizaines de fois celui d’Anthropic, mais son chiffre d’affaires annualisé est extrêmement faible. La logique tarifaire de Liang Wenfeng était que « récupérer le coût du serveur en 10 mois est considéré comme un bénéfice raisonnable », et les investisseurs sont confrontés au risque d’inversion de valorisation.
VIII. Commentaire de SMM
SMM a commenté cette situation. Premièrement,le référentiel mondial de tarification des grands modèles est passé d’un accord tacite entre les trois oligopoles de la Silicon Valley à la « ligne de mort » définie par DeepSeek. Parallèlement, la voie d’efficacité extrême du MoE + attention éparse + précision mixte démontre que la performance de pointe ne dépend pas nécessairement de l’empilement de la puissance de calcul. Côté écosystème, les puces chinoises comme Huawei Ascend ont obtenu des opportunités de déploiement à grande échelle, et la barrière CUDA est en train d’être ébranlée,La fin de partie de la concurrence mondiale autour des grands modèles ne sera peut-être pas remportée par le modèle le plus puissant, ni par le moins cher, mais par la solution optimale sur la courbe du rapport « performance/coût », qui sera le vainqueur ultime.
Références
- DeepSeek V4 Pro arrive avec un contexte d’un million de tokens, bouleversant notre calcul des coûts — —
- AI Wiki —
- DeepSeek devient la ligne de mort de l’IA mondiale —
- DeepSeek-V4-Pro : le modèle open source qui réécrit les règles de l’IA —
- DeepSeek et Zhipu brisent le blocus de la puissance de calcul : le modèle Zhipu entre dans le top 3, DeepSeek réduit le coût à 1/20 —
- Comment DeepSeek et Alibaba font voler en éclats les barrières de prix de l’IA : un différentiel de coût de 70 fois bouleverse le paysage industriel mondial —
- Après la sortie officielle de DeepSeek-V4-Flash, des producteurs majeurs comme OpenAI ont sabré leurs prix —
- La guerre des prix de l’inférence IA expliquée —
- Le coût d’inférence de DeepSeek tombe à 1/36 de GPT-4o, comment va-t-il réécrire les règles du secteur ? —
- L’infrastructure de l’IA est devenue le genre d’activité que Munger déteste le plus —
- Microsoft évalue l’utilisation du modèle DeepSeek V4 pour réduire les coûts et gagner en efficacité, potentiellement en remplacement d’OpenAI et Anthropic —
- Guerre des prix de l’IA 2026 : pourquoi le vrai gagnant n’est ni DeepSeek ni OpenAI —
- Google rationne Gemini pour Meta : quand le calcul devient la ressource la plus rare —
- Microsoft lorgne DeepSeek V4 pour Copilot Cowork : ce que l’hébergement Azure ne peut pas résoudre —
- Boom des puces domestiques : ce que Nvidia craint le plus est arrivé —
- La grande migration de la puissance de calcul de l’IA : 2026, trois basculements simultanés —
- DeepSeek lève 7,4 milliards de dollars pour une valorisation de 50 milliards de dollars lors de son premier tour de table externe —
- Rapports : DeepSeek a relancé un deuxième tour de financement de 50 milliards de yuans —
- Valorisation jusqu’à 500 milliards de yuans, DeepSeek en tête du classement mondial des appels de grands modèles —
- Les prix bas, c’est fini ! DeepSeek s’apprête à augmenter fortement ses prix — \
- Quelles sont les perspectives de développement futur de DeepSeek ? —
![[Revue de midi de la puissance de calcul SMM] Le prix le plus bas de la 4090 dans le delta du Yangtsé augmente, et le pouvoir de négociation pour la puissance de calcul d'inférence dans l'est de la Chine bascule du côté de l'offre.](https://imgqn.smm.cn/usercenter/ipCjz20251217171734.jpeg)
![[SMM Computing Power Express] Un certain fournisseur de services cloud de calcul intelligent propose un loyer mensuel de 7 200 yuans par unité et par mois pour des serveurs 4090 à huit cartes, un tarif supérieur au précédent devis le plus bas.](https://imgqn.smm.cn/usercenter/SSKOK20251217171734.jpeg)
![L'explosion de la demande de puissance de calcul pour l'IA alimente la hausse continue des activités de feuille de cuivre ; les connecteurs haut débit pour câbles en cuivre se renforcent, Taichenguang mène les gains [SMM Express]](https://imgqn.smm.cn/usercenter/tXxfd20251217171713.jpg)
