[SMM Analysis] DeepSeek fixe une « ligne rouge », redéfinissant le pouvoir de tarification des grands modèles mondiaux

Publié: Aug 11, 2026 13:12
DeepSeek V4 Pro a déclenché une guerre des prix mondiale parmi les grands modèles de langage avec ses tarifs ultra-bas. OpenAI a réduit ses prix de 80 %, Anthropic s'est retirée des marchés hors de Chine, Microsoft évalue l'intégration, et la part de marché de Nvidia sur le marché chinois des GPU a chuté de 95 % à 8 %. Les modèles chinois ont représenté 60 % du volume total d'appels sur OpenRouter, surpassant les modèles américains pendant 14 semaines consécutives.

I. Aperçu de l'événement

Le 24 avril 2026, DeepSeek a officiellement publié la version de prévisualisation des grands modèles de la série V4, comprenant le modèle phare DeepSeek-V4-Pro (1,6 billion de paramètres totaux / 49 milliards de paramètres activés) et la version légère DeepSeek-V4-Flash (284 milliards de paramètres totaux / 13 milliards de paramètres activés). Les deux prennent nativement en charge une fenêtre de contexte d’un million de tokens et sont entièrement en open source sous licence MIT. La série V4 est devenue officiellement disponible le 20 juillet, et l’API de la version officielle V4-Flash-0731 a été lancée pour tests publics le 31 juillet.

Le même jour, DeepSeek a annoncé une réduction permanente de 75 % du prix de l’API V4-Pro. Dans les scénarios de cache hit, le prix d’entrée est tombé à 0,025 yuan par million de tokens, et le prix de sortie à 6 yuan par million de tokens — un nouveau prix plancher parmi les modèles de pointe mondiaux.


II. Percées technologiques : pas seulement une question de prix bas

La série V4 a introduit trois technologies fondamentales :

  1. Architecture d’attention hybride (CSA + HCA) : combine l’attention compressée parcimonieuse avec l’attention hautement compressée. Avec une fenêtre de contexte d’un million de tokens, le calcul d’inférence ne représente que 27 % de celui de V3.2, et le cache KV n’utilise que 10 % de la mémoire.
  2. Hyperconnexion contrainte par variété (mHC) : remplace les connexions résiduelles traditionnelles, garantissant la stabilité de l’entraînement pour des réseaux de dizaines de milliers de couches.
  3. Entraînement et inférence en précision mixte FP4/FP8 : première mise en œuvre dans l’industrie. Réduit la pression sur la bande passante VRAM de 50 % et double l’efficacité de l’inférence.

Sur le test SWE-bench Verified (capacité de codage), V4-Pro a obtenu 80,6 %, en tête de tous les modèles open source et quasiment à égalité avec Claude Opus 4.6 (80,8 %). Il a atteint 87,5 % sur MMLU-Pro et 85,0 % sur le raisonnement mathématique AIME 2025. Dans son rapport technique, DeepSeek a reconnu être « légèrement en retard de 3 à 6 mois sur GPT-5.4 et Gemini-3.1-Pro », mais compte tenu de l’écart de prix, cela est quasi négligeable.


III. Massacre tarifaire : la « ligne d’exécution » des grands modèles mondiaux

La tarification du V4-Pro a directement pulvérisé le système de prix des grands modèles à l’échelle mondiale. Voici une comparaison des prix de sortie des principaux modèles en juillet 2026 (en dollars américains par million de tokens) :

Graphique 1 : Comparaison des prix de sortie API des principaux modèles en juillet 2026 (échelle logarithmique)

La communauté des développeurs hors de Chine est parvenue à un consensus : Pour la grande majorité des scénarios à destination du grand public (C-end) et des petites et moyennes entreprises (B-end), encourir des dizaines de fois le coût d’inférence pour des gains de performance marginaux n’a aucune viabilité commerciale. Pour tout concurrent dont le prix est supérieur à celui de DeepSeek, il ne reste que deux voies : réduire drastiquement ses prix de manière proactive, ou abandonner totalement le marché de masse des développeurs.

Graphique 2 : Comparaison des critères de référence principaux (graphique radar)


IV. Impact sur les principaux modèles

4.1 OpenAI : de l’arrogance aux baisses de prix urgentes

OpenAI a été le plus directement touché. En 2025, son chiffre d’affaires annuel s’élevait à 13 milliards de dollars, ses dépenses totales à 34 milliards de dollars, et sa perte nette à 39 milliards de dollars, dont environ 8 milliards de pertes d’exploitation.

Le 30 juillet 2026, trois semaines seulement après la sortie de GPT-5.6, OpenAI a annoncé en urgence une baisse de prix de 80 % pour la version Luna. Le PDG Sam Altman a reconnu publiquement que le coût est le « plus grand défi du secteur » et a déclaré qu’« OpenAI est heureux de réduire ses prix de 75 % », ce que les observateurs ont interprété comme une réponse passive à DeepSeek.

Sur la plateforme OpenRouter, la consommation hebdomadaire de tokens par les modèles chinois a dépassé 60 %, tandis que celle des modèles américains est tombée sous les 20 % [9]. Les données de la plateforme cloud américaine Vercel montrent que la part d’utilisation des modèles DeepSeek sur le marché des entreprises est passée de 1 % en avril à 17 % en mai.

4.2 Anthropic : la stratégie de prix élevés sous pression

Claude Fable 5 est facturé 50 dollars par million de tokens de sortie, soit 57 fois celui de V4-Pro. En juin 2026, Anthropic a commencé à interdire aux utilisateurs hors de Chine d’utiliser Claude, réduisant ainsi volontairement son marché – une décision interprétée comme imposée par des coûts de calcul excessifs, visant à se concentrer sur les marchés à ARPU élevé.

4.3 Google : pénurie de puissance de calcul

Le carnet de commandes en retard de Google Cloud a atteint 460 milliards de dollars, et Gemini a commencé à imposer des quotas d’utilisation à de grands clients tels que Meta.

4.4 Microsoft : signaux de défection

Le 16 juin 2026, Microsoft a officiellement commencé à évaluer l’intégration de DeepSeek V4 dans Copilot Cowork pour remplacer les modèles d’OpenAI et d’Anthropic. Le PDG Satya Nadella a déclaré publiquement : « Des modèles moins chers et des choix plus larges renforceront la confiance du public dans l’IA ; le public ne tolérera pas que quelques modèles et entreprises monopolisent tout l’apprentissage. » Étant donné que Microsoft détient une participation de 27 % dans OpenAI, cette déclaration a ébranlé le secteur.

4.5 Nvidia : la fissuration de la douve CUDA

Le jour du lancement de DeepSeek V4, celui-ci a été entièrement adapté à huit grands fabricants chinois de GPU : Huawei Ascend, Cambricon, Hygon, Moore Threads, Muxi, Kunlun Core, Alibaba T-Head et Tianjic. Bernstein prévoit que la part de Nvidia sur le marché chinois des accélérateurs d’IA passera de 95 % à environ 8 % en 2026, tandis que celle de Huawei Ascend augmentera à 50-62 %.

Graphique 3 : Chronologie des événements clés de la guerre des prix des grands modèles en 2026


V. Frénésie du capital : valorisation de 500 milliards

En juin 2026 : a réalisé un premier tour de financement externe dépassant 50 milliards de yuans, pour une valorisation supérieure à 50 milliards de dollars. Parmi les investisseurs figuraient Liang Wenfeng à titre personnel (20 milliards de yuans), Tencent (10 milliards), CATL (5 milliards), JD.com (3 milliards) et le Fonds national d’investissement pour l’industrie de l’IA.

Août 2026 : a lancé un deuxième tour de financement de 50 milliards de yuans, avec une valorisation pré-money d’environ 500 milliards de yuans (environ 74 milliards de dollars).

La valorisation totale des quatre principaux laboratoires d’IA pure en Chine a atteint environ 159 milliards de dollars, contre pratiquement zéro il y a 18 mois.


VI. Données de marché : les modèles chinois dominent le classement mondial d’utilisation

Graphique 4 : Part mondiale des appels de tokens sur la plateforme OpenRouter (du 27 juillet au 2 août)


VII. Revirements et préoccupations

7.1 Pénurie de puissance de calcul, hausse des prix à venir

Le 6 août, DeepSeek a annoncé qu’il allait « augmenter considérablement les prix de ses API ». Sa puissance de calcul actuelle équivaut à seulement environ 20 000 GPU H100, loin derrière les concurrents américains tels qu’OpenAI.

7.2 Risques politiques

Le gouvernement américain est très vigilant quant à l’intégration des modèles de DeepSeek dans les infrastructures des entreprises américaines. Même déployés dans les centres de données Azure de Microsoft aux États-Unis, ils restent soumis à des examens de sécurité.

7.3 Paradoxe de la commercialisation

Le ratio prix/ventes (P/S) du V4-Pro a dépassé 3 800 fois, soit plusieurs dizaines de fois celui d’Anthropic, mais son chiffre d’affaires annualisé est extrêmement faible. La logique tarifaire de Liang Wenfeng était que « récupérer le coût du serveur en 10 mois est considéré comme un bénéfice raisonnable », et les investisseurs sont confrontés au risque d’inversion de valorisation.


VIII. Commentaire de SMM

SMM a commenté cette situation. Premièrement,le référentiel mondial de tarification des grands modèles est passé d’un accord tacite entre les trois oligopoles de la Silicon Valley à la « ligne de mort » définie par DeepSeek. Parallèlement, la voie d’efficacité extrême du MoE + attention éparse + précision mixte démontre que la performance de pointe ne dépend pas nécessairement de l’empilement de la puissance de calcul. Côté écosystème, les puces chinoises comme Huawei Ascend ont obtenu des opportunités de déploiement à grande échelle, et la barrière CUDA est en train d’être ébranlée,La fin de partie de la concurrence mondiale autour des grands modèles ne sera peut-être pas remportée par le modèle le plus puissant, ni par le moins cher, mais par la solution optimale sur la courbe du rapport « performance/coût », qui sera le vainqueur ultime.


Références

  1. DeepSeek V4 Pro arrive avec un contexte d’un million de tokens, bouleversant notre calcul des coûts — —
  2. AI Wiki
  3. DeepSeek devient la ligne de mort de l’IA mondiale
  4. DeepSeek-V4-Pro : le modèle open source qui réécrit les règles de l’IA
  5. DeepSeek et Zhipu brisent le blocus de la puissance de calcul : le modèle Zhipu entre dans le top 3, DeepSeek réduit le coût à 1/20
  6. Comment DeepSeek et Alibaba font voler en éclats les barrières de prix de l’IA : un différentiel de coût de 70 fois bouleverse le paysage industriel mondial
  7. Après la sortie officielle de DeepSeek-V4-Flash, des producteurs majeurs comme OpenAI ont sabré leurs prix
  8. La guerre des prix de l’inférence IA expliquée
  9. Le coût d’inférence de DeepSeek tombe à 1/36 de GPT-4o, comment va-t-il réécrire les règles du secteur ?
  10. L’infrastructure de l’IA est devenue le genre d’activité que Munger déteste le plus
  11. Microsoft évalue l’utilisation du modèle DeepSeek V4 pour réduire les coûts et gagner en efficacité, potentiellement en remplacement d’OpenAI et Anthropic
  12. Guerre des prix de l’IA 2026 : pourquoi le vrai gagnant n’est ni DeepSeek ni OpenAI
  13. Google rationne Gemini pour Meta : quand le calcul devient la ressource la plus rare
  14. Microsoft lorgne DeepSeek V4 pour Copilot Cowork : ce que l’hébergement Azure ne peut pas résoudre
  15. Boom des puces domestiques : ce que Nvidia craint le plus est arrivé
  16. La grande migration de la puissance de calcul de l’IA : 2026, trois basculements simultanés
  17. DeepSeek lève 7,4 milliards de dollars pour une valorisation de 50 milliards de dollars lors de son premier tour de table externe
  18. Rapports : DeepSeek a relancé un deuxième tour de financement de 50 milliards de yuans
  19. Valorisation jusqu’à 500 milliards de yuans, DeepSeek en tête du classement mondial des appels de grands modèles
  20. Les prix bas, c’est fini ! DeepSeek s’apprête à augmenter fortement ses prix — \
  21. Quelles sont les perspectives de développement futur de DeepSeek ?

Déclaration sur la source des données : À l'exception des informations publiques, toutes les autres données sont traitées par SMM sur la base d'informations publiques, d'échanges avec le marché et en s'appuyant sur le modèle de base de données interne de SMM. Ils sont fournis à titre indicatif uniquement et ne constituent pas des recommandations décisionnelles.

Les images de cet article contiennent des légendes traduites par IA à titre indicatif uniquement.

Pour toute demande d'information ou pour en savoir plus, veuillez contacter : lemonzhao@smm.cn
Pour plus d'informations sur l'accès à nos rapports de recherche, veuillez contacter :service.en@smm.cn
Actualités Connexes
[Revue de midi de la puissance de calcul SMM] Le prix le plus bas de la 4090 dans le delta du Yangtsé augmente, et le pouvoir de négociation pour la puissance de calcul d'inférence dans l'est de la Chine bascule du côté de l'offre.
il y a 1 heure
[Revue de midi de la puissance de calcul SMM] Le prix le plus bas de la 4090 dans le delta du Yangtsé augmente, et le pouvoir de négociation pour la puissance de calcul d'inférence dans l'est de la Chine bascule du côté de l'offre.
Lire la suite
[Revue de midi de la puissance de calcul SMM] Le prix le plus bas de la 4090 dans le delta du Yangtsé augmente, et le pouvoir de négociation pour la puissance de calcul d'inférence dans l'est de la Chine bascule du côté de l'offre.
[Revue de midi de la puissance de calcul SMM] Le prix le plus bas de la 4090 dans le delta du Yangtsé augmente, et le pouvoir de négociation pour la puissance de calcul d'inférence dans l'est de la Chine bascule du côté de l'offre.
Dans le delta du Yangtsé, le loyer mensuel le plus bas pour une 4090 est passé à 7 200 yuans (en hausse de 4,35 %), et le tarif horaire le plus bas par carte est passé à 1,25 yuan (en hausse de 4,17 %). En tant que carte d'inférence IA grand public, la 4090 a vu les ressources à bas prix dans la région continuellement absorbées, poussant les prix d'entrée de gamme à la hausse et réduisant la fourchette de prix. Le rapport de force a basculé en faveur de l'offre, et des réductions sporadiques de l'offre ont dominé.
il y a 1 heure
[SMM Computing Power Express] Un certain fournisseur de services cloud de calcul intelligent propose un loyer mensuel de 7 200 yuans par unité et par mois pour des serveurs 4090 à huit cartes, un tarif supérieur au précédent devis le plus bas.
il y a 1 heure
[SMM Computing Power Express] Un certain fournisseur de services cloud de calcul intelligent propose un loyer mensuel de 7 200 yuans par unité et par mois pour des serveurs 4090 à huit cartes, un tarif supérieur au précédent devis le plus bas.
Lire la suite
[SMM Computing Power Express] Un certain fournisseur de services cloud de calcul intelligent propose un loyer mensuel de 7 200 yuans par unité et par mois pour des serveurs 4090 à huit cartes, un tarif supérieur au précédent devis le plus bas.
[SMM Computing Power Express] Un certain fournisseur de services cloud de calcul intelligent propose un loyer mensuel de 7 200 yuans par unité et par mois pour des serveurs 4090 à huit cartes, un tarif supérieur au précédent devis le plus bas.
SMM a appris qu’un fournisseur de services de cloud computing intelligent a récemment livré des serveurs RTX 4090 à 8 cartes pour un prix de transaction de 7 200 yuans par mois et par unité. Le marché avait précédemment affiché un prix relativement bas de 6 900 yuans par mois et par unité. Le dernier prix externe est supérieur d’environ 300 yuans à ce point bas, ce qui indique que, malgré une offre abondante de modèles d’entrée de gamme, les distributeurs n’ont pas continué à baisser leurs tarifs externes. SMM estime que la stabilisation des prix externes de la 4090 témoigne que la demande dans le segment bas et milieu de gamme de la puissance de calcul n’a pas encore subi de contraction brutale.
il y a 1 heure
L'explosion de la demande de puissance de calcul pour l'IA alimente la hausse continue des activités de feuille de cuivre ; les connecteurs haut débit pour câbles en cuivre se renforcent, Taichenguang mène les gains [SMM Express]
il y a 1 heure
L'explosion de la demande de puissance de calcul pour l'IA alimente la hausse continue des activités de feuille de cuivre ; les connecteurs haut débit pour câbles en cuivre se renforcent, Taichenguang mène les gains [SMM Express]
Lire la suite
L'explosion de la demande de puissance de calcul pour l'IA alimente la hausse continue des activités de feuille de cuivre ; les connecteurs haut débit pour câbles en cuivre se renforcent, Taichenguang mène les gains [SMM Express]
L'explosion de la demande de puissance de calcul pour l'IA alimente la hausse continue des activités de feuille de cuivre ; les connecteurs haut débit pour câbles en cuivre se renforcent, Taichenguang mène les gains [SMM Express]
il y a 1 heure