[Analyse SMM] Les fournisseurs de puissance de calcul passent de la location aux jetons, face à la compression des marges et à une demande en forte hausse

Publié: Aug 18, 2026 09:36
Depuis juillet 2026, les fournisseurs chinois de calcul passent de la location de GPU à la facturation au jeton — certains qualifient la location de « activité annexe ». Les marges de location se contractent sous l’effet d’ancrages de prix publics (4090, 8 GPU : 7 200 CNY/mois) et des majorations des courtiers ; la hausse des prix de l’API DeepSeek du 17 août (×3 à ×5) élargit les écarts des revendeurs ; les appels quotidiens en jetons atteignent 140 000 milliards en mars 2026, soit ×1 000 en deux ans. SMM : reprise des marges, pas substitution — la location de GPU haut de gamme reste sous tension ; convertis : petits IDC, revendeurs, hyperscalers

Depuis juillet 2026, plusieurs prestataires de services de puissance de calcul contactés par SMM déplacent leur centre d’activité de la location de serveurs bare metal vers des services de facturation basés sur les Tokens, certains déclarant sans détour que « la location de puissance de calcul est secondaire ».D’un côté, les prix de location ont été nivelés par des points d’ancrage visibles publiquement, et les majorations en cascade des intermédiaires ont érodé les marges brutes des expéditeurs ; de l’autre, le volume moyen quotidien d’appels Token a été multiplié par plus de 1 000 en deux ans, et les hausses de prix officielles des API ont élargi l’espace d’arbitrage pour le transit/la revente— derrière la migration de l’unité de facturation, de la « vente d’heures-carte » à la « vente de Tokens », se cache une double réalité : des marges brutes de location au plus bas et une flambée de la demande d’inférence.


I. Phénomène : plusieurs prestataires affirment que « la location est secondaire », et les Tokens sont devenus l’axe principal

Selon SMM, depuis juillet, des prestataires de services de puissance de calcul contactés via plusieurs canaux ont réduit de manière proactive le courtage de mise en relation pour la location et se sont tournés vers les activités Token, avec une accélération mois après mois :

Un prestataire IDC dans l’est de la Chine(trois centres de données construits en propre) : a indiqué explicitement qu’ilpromeut actuellement principalement les Tokens, la location de puissance de calcul étant secondaire ; il a lancé sa propre plateforme Token et a communiqué une structure complète de remises — 40 % du prix catalogue à partir de minuit la nuit, des remises différentes selon les modèles, et « plus le modèle est populaire, plus la remise est faible » ; les remises Token des fournisseurs cloud se situent autour de 46 % à 80 % du prix catalogue.

Un prestataire de puissance de calcul : après réception d’informations de mise en relation pour l’approvisionnement en cartes, a répondu directement que son « centre est orienté vers le modèle Token » et qu’il ne prend plus en charge la mise en relation pour la location.

Un prestataire de cloud de calcul intelligent : son activité Token adopte un modèle d’agence de transit, achetant à50 %–60 %des prix cotés par le producteur d’origine puis revendant ; ses clients actuels sont principalement des utilisateurs de petites entreprises (B) et du grand public (C), et l’activité vient de démarrer.

Un opérateur : a lancé un modèle de déploiement privé Token, fournissant à des clients clés des lignes dédiées sécurisées connectées directement aux centres de données ; les remises pour clients clés vont de 8,5 % à 80 % du prix catalogue, avec des ajustements de prix environ une fois par mois.

Un grand producteur de cloud : selon les retours des canaux, son centre de gravité s’est déjà déplacé vers les Tokens et il n’est « pas très intéressé » par l’activité de location de cartes.

D’après l’impression directe de SMM issue des échanges courants, de nombreux prestataires ne font plus réellement de location et se tournent vers les Tokens.Le marché a même vu des partenaires viser le « partage des revenus Token » : ils amènent des clients et des ressources de modèles pour rechercher de la puissance de calcul inutilisée, avec un point de départ de coopération à 200 millions de TPM (appels de Tokens par minute), et en indiquant explicitement qu’« une coopération fondée sur un modèle de location mensuelle ne fonctionnera pas ».

Graphique 1 : Panorama de la structure des remises Token : tarification par paliers, de 40 % du prix catalogue la nuit jusqu’à des remises de 8,5 % proposées par les opérateurs


II. Côté offre : les marges brutes de la location ont été aplanies par l’ancrage des prix, tandis que la tarification Token offre une plus grande autonomie

La principale force motrice de ce basculement a été la compression continue des marges bénéficiaires du côté de la location.

Côté location — logique de « gros », avec un revenu mensuel plafonné. En prenant comme exemple un serveur 4090 à huit GPU, l’ancre de transaction actuelle du marché était d’environ 7 200 yuans par unité et par mois. Dans le courtage primaire, chaque revente ajoutait environ 300 à 400 yuans par unité et par mois ; après 2 à 3 reventes, le prix affiché pouvait être poussé à 8 500 yuans. Cependant, l’ancre de prix était publique et transparente, et le profit des étapes de majoration allait à la chaîne de courtage, laissant une marge brute limitée du côté des détenteurs d’actifs. Par ailleurs, le marché manquait de cotations unifiées standardisées ; les courtiers représentaient une part élevée, et les véritables propriétaires d’actifs disposaient d’un pouvoir de négociation limité lors des discussions tarifaires.

Graphique 2 : Loyer mensuel d’une 4090 à huit GPU — sous ancrage des prix, divergence entre les majorations des courtiers et la marge brute des détenteurs d’actifs

Côté Token — logique de « détail », avec des revenus liés à l’usage. Les mécanismes de tarification Token étaient flexibles : 60 % de remise à partir de minuit, des remises fluctuant avec la popularité des modèles, et une refixation mensuelle des prix en fonction du marché. Pour le même serveur, les revenus de location mensuelle étaient plafonnés, tandis que la facturation Token à l’usage offrait une plus grande élasticité de production par GPU lors des pics de demande ; les remises en heures creuses pouvaient aussi « écrêter les pics et combler les creux », en augmentant le taux d’utilisation à pleine charge.

Point de vue SMM : Une fois l’offre devenue homogène, la tarification du leasing a été ancrée par le marché ; les unités de tarification des tokens étaient la « sortie d’inférence réelle », avec le pouvoir de fixation des prix entre les mains des prestataires eux-mêmes — cela a marqué un basculement de la logique commerciale, de la vente de ressources à la vente de résultats, et la structure de marge brute a été reconstruite en conséquence.


III. Catalyseur de prix : hausse des prix de l’API officielle mise en œuvre, élargissant la fenêtre d’arbitrage via transit

DeepSeek a officiellement mis en œuvre une nouvelle série d’ajustements des prix de l’API à partir du 17 août, avec les modèles principaux en hausse de 3 à 5 fois et certains postes atteignant 10 fois ; le prix de sortie de la version Pro est passé de 6 yuans par million de tokens à 27 yuans. Côté canaux, SMM a appris que certains opérateurs ont interprété l’essentiel comme un retour au niveau de prix d’origine avant les précédentes promotions de vente à environ 2,5 de remise, plutôt qu’une hausse entièrement nouvelle.

Après la mise en œuvre de la hausse, l’écart entre les prix officiels affichés et le prix d’achat de 50–60 % via des canaux de transit s’est creusé, laissant un espace d’arbitrage plus important pour les modèles de transit et d’agence de tokens — c’est aussi pourquoi le système de remise sur les tokens a été mentionné à plusieurs reprises dans les communications des canaux depuis la mi-août : les prestataires faisaient sérieusement leurs calculs à ce sujet.

Graphique 3 : Prix de sortie DeepSeek Pro — la hausse officielle des prix élargit la fenêtre d’arbitrage via transit

Des informations publiques ont montré que depuis 2026, les prix des API pour les modèles à fortes capacités ont connu une hausse par étapes : le prix API de Zhipu au T1 a augmenté de 83 %, tandis que le volume d’appels a tout de même progressé de 400 % ; pour la série Hunyuan de Tencent Cloud, les prix de certains modèles ont été multipliés par plus de 4. La tarification des tokens passait d’une logique unique de baisse des prix à une tarification par paliers : les tokens d’entrée de gamme se rapprochaient de la commoditisation et se concurrençaient sur les prix, tandis que les tokens haut de gamme augmentaient leurs prix grâce à des capacités rares ; les prestataires disposant de capacités de revente et d’intégration en ont fortement bénéficié.

Point de vue SMM : L’intention initiale de la hausse officielle des prix était de réparer sa propre économie unitaire, mais elle a objectivement accru le dividende d’écart de prix pour les canaux intermédiaires — chaque ajustement de prix de l’OEM créait une opportunité pour les distributeurs de canaux de tokens de refixer les prix.


IV. Côté demande : le nombre moyen quotidien d’appels de Tokens a augmenté de plus de 1 000× en deux ans ; les clients voulaient des API, pas des machines

Les données du secteur ont apporté une note de bas de page à ce basculement.Des données de l’Administration nationale des données ont montré que le nombre moyen quotidien d’appels de Tokens en Chine était passé d’environ 100 milliards au début de 2024 à plus de 140 000 milliards en mars 2026, soit une hausse de plus de 1 000× en deux ans. Lors de la conférence WAIC 2026 cette année, « Token factory » est devenu le mot-clé le plus en vue, et le centre de gravité du secteur s’est déplacé de l’entraînement centralisé vers l’inférence à grande échelle.

Graphique 4 : nombre moyen quotidien d’appels de Tokens en Chine : bond du niveau des 100 milliards à celui des 100 000 milliards

Le suivi côté offre a été tout aussi soutenu :

  • les trois principaux opérateurs télécoms ont lancé des forfaits Tokens, vendant des Tokens sous forme de lots de données ; en mai, Shanghai Telecom est devenu le premier opérateur local à publier un forfait tarifaire Tokens, avec 1 yuan correspondant à une allocation de 250 000 points de quota, et des API standard permettant des appels à plus de 30 grands modèles grand public
  • Après qu’une entreprise cotée de puissance de calcul a fait évoluer son modèle de livraison, passant de la location de puissance de calcul à une facturation basée sur l’usage réel de Tokens, son chiffre d’affaires du S1 a augmenté de 497 % en glissement annuel, son bénéfice net de 540 % en glissement annuel, et elle est passée des pertes aux profits
  • Certains centres de calcul intelligent ont adopté une structure d’exploitation « moitié location complète en gros, moitié Tokens au détail », avec plus de 2 000 utilisateurs côté Tokens au détail
  • Hors de Chine, on a également vu émergerun modèle d’infrastructure d’inférence combinant l’ordonnancement automatisé de GPU inactifs et un partage des revenus en Tokens, la monétisation de la puissance de calcul inutilisée devenant un nouveau point d’entrée pour l’économie des Tokens

Point de vue SMM : La structure côté demande avait changé : les PME et les clients grand public ne se souciaient pas des GPU et ne voulaient pas de bare metal ; ils voulaient seulement une clé API.Les prestataires de services de location se retrouvaient coincés au milieu : ils ne pouvaient pas sécuriser en amont une offre de GPU à bas prix, tandis qu’en aval les clients n’avaient plus besoin « d’une machine entière ». Les Tokens étaient la solution à ce décalage structurel.


V. Observations sur les frontières : la location de GPU haut de gamme est restée résiliente, et le basculement s’est concentré chez trois types d’acteurs

Il convient de noter que le « passage de la location aux Tokens » n’était pas un phénomène à l’échelle de l’ensemble du secteur. Les contre-preuves recueillies par SMM étaient tout aussi claires : les modèles de cartes haut de gamme tels que la H200 restaient en offre très limitée pour la location—y compris des cas où des fournisseurs ont rompu des contrats pendant la période de location et ont revendu la capacité (avec seulement une semaine de préavis), un cluster de 128 cartes loué en bloc à 116 000 yuans par carte et par mois sans possibilité de le scinder en commandes plus petites, et un centre de calcul intelligent à Lingang où 2 000 cartes domestiques Muxi C500 ont été entièrement sous-traitées par deux entreprises, qui « estimaient encore que ce n’était pas suffisant ».

Ceux qui ont réellement opéré un pivot complet se répartissaient en trois catégories : les IDC de petite et moyenne taille et les fournisseurs de services cloud de calcul intelligent sans avantage d’approvisionnement en cartes, les acteurs de canal initialement positionnés comme agents de transit, et les principaux fournisseurs cloud qui, dès le départ, ne dépendaient pas des cartes louées. Moins l’approvisionnement en cartes d’un prestataire était tendu, plus son pivot était complet ; les détenteurs confrontés à une pénurie extrême utilisaient encore des contrats de long terme pour verrouiller des loyers de location rares.


VI. Conclusions et perspectives : le changement d’unité de facturation est une réparation de la marge brute, pas un remplacement de modèle

Selon SMM : dans ce cycle, le basculement des prestataires vers le Token résulte d’une résonance entre forces de poussée et de traction — côté poussée, l’ancrage des prix en fin de location et la compression des marges brutes des détenteurs de cartes due aux majorations des intermédiaires ; côté traction, la croissance exponentielle de la demande d’inférence, les hausses de prix officielles élargissant l’écart de prix du transit, et une élasticité des revenus plus élevée sous une facturation à l’usage ; ajouté au fait que les clients Token supportent des coûts de changement élevés après connexion via API et présentent une fidélité nettement supérieure à celle des clients de location pouvant partir à tout moment, la logique commerciale du passage de « vendre des ressources » à « vendre un résultat » est évidente. Pour un même lot de serveurs, le wholesale encaisse un loyer mensuel tandis que le retail facture au Token — le contrat n’a pas changé ; ce qui a changé, c’est l’unité de mesure : d’un côté, on affirme que les marges brutes de la location ont touché un plancher, de l’autre, on constate une envolée de la demande d’inférence.

Perspectives :

À court terme (3–6 mois) : l’effet de la hausse de prix de DeepSeek devrait se diffuser ; le dividende lié à l’écart entre prix officiels et prix de transit devrait se poursuivre ; l’expansion des modèles de transit et d’agence Token devrait s’accélérer ; et les prestataires de petite et moyenne taille devraient continuer à lancer des plateformes Token à un rythme soutenu.

Moyen terme (6–12 mois) : la tarification des Tokens par paliers devrait s’accentuer ; la banalisation des Tokens d’entrée de gamme devrait intensifier un remaniement des canaux ; si les fabricants d’origine relancent des promotions et des remises à grande échelle, la marge d’arbitrage de transit sera comprimée, mettant à l’épreuve la capacité des prestataires de services à verrouiller leurs clients et à fournir de la valeur ajoutée.

Long terme (plus d’un an) : la variable clé réside dans l’offre de cartes haut de gamme — si l’approvisionnement en cartes NVIDIA reste contraint et si la location de cartes haut de gamme demeure un marché de vendeurs, la structure à double voie « percevoir des loyers sur des cartes en offre tendue + vendre des Tokens sur des cartes en offre non tendue » fonctionnera en parallèle sur le long terme


Sources de données

  1. Administration nationale des données — données sur le volume moyen quotidien d’invocations de Tokens en Chine (environ 100 milliards de fois début 2024 → plus de 14 billions de fois en mars 2026)
  2. People’s Daily Online (2026-07-31), « L’industrie fait entrer les services de puissance de calcul dans l’“ère du Token” » — « Token Factory » de la WAIC 2026, et données de rapports semestriels sur la facturation au Token d’entreprises cotées de puissance de calcul
  3. Rapport de recherche de Guojin Securities (2026-06) — forfaits tarifaires Token de Shanghai Telecom, forfaits Token des trois principaux opérateurs, et modèle de partage des revenus Token sur GPU inactifs
  4. Informations publiques de marché — ajustement des prix API et volume d’appels de Zhipu au T1 2026, et ajustements de prix de la série Hunyuan de Tencent Cloud

Informations obtenues par SMM :

  1. Échanges réguliers avec un prestataire de services IDC en Chine de l’Est — promotion principalement des Tokens, avec la location de puissance de calcul en complément ; structure de remises Token (–60 % la nuit, fluctuation selon le modèle, et –46 % à –80 % pour les fournisseurs cloud)
  2. Échanges réguliers avec un fournisseur de cloud de calcul intelligent — modèle de transit Token acheté à 50–60 % du prix du fabricant d’origine, et un mix limité de clients B/C-end
  3. Échanges réguliers avec un opérateur — modèle de déploiement privé Token, grands comptes à 85–80 % du prix catalogue, et la hausse de prix de DeepSeek correspondant essentiellement à un retour au prix d’origine d’avant la remise de 2,5
  4. Échanges de canal avec un prestataire de services de puissance de calcul — « le centre est orienté vers le modèle Token »
  5. Retours de canal — le centre d’un fournisseur cloud leader est sur le Token ; l’ancre de transaction de la 4090 à 7 200 yuans par carte-mois, avec des intermédiaires ajoutant 300–400 yuans par lot ; et les 2 000 cartes Muxi C500 de Lingang entièrement sous-traitées
 

Déclaration sur la source des données : À l'exception des informations publiques, toutes les autres données sont traitées par SMM sur la base d'informations publiques, d'échanges avec le marché et en s'appuyant sur le modèle de base de données interne de SMM. Ils sont fournis à titre indicatif uniquement et ne constituent pas des recommandations décisionnelles.

Pour toute demande d'information ou pour en savoir plus, veuillez contacter : lemonzhao@smm.cn
Pour plus d'informations sur l'accès à nos rapports de recherche, veuillez contacter :service.en@smm.cn
Actualités Connexes
[SMM Express de puissance de calcul] 128 unités de contrats à terme 5090 livrées par lots ; le bailleur explore un accord à long terme de cinq ans
il y a 1 heure
[SMM Express de puissance de calcul] 128 unités de contrats à terme 5090 livrées par lots ; le bailleur explore un accord à long terme de cinq ans
Lire la suite
[SMM Express de puissance de calcul] 128 unités de contrats à terme 5090 livrées par lots ; le bailleur explore un accord à long terme de cinq ans
[SMM Express de puissance de calcul] 128 unités de contrats à terme 5090 livrées par lots ; le bailleur explore un accord à long terme de cinq ans
SMM a appris qu’un opérateur de l’est de la Chine reçoit des livraisons, par lots, de 128 unités de contrats à terme sur RTX 5090. Depuis fin juin, SMM suit l’état des livraisons ; à ce jour, l’exécution des contrats est normale, avec plus de 40 unités livrées. Le prix attendu pour une location contractuelle de trois ans est de 13 000 yuans par unité et par mois. Le bailleur étudie également un modèle d’accord à long terme sur cinq ans. SMM estime que la bonne exécution des contrats à terme de location de 5090, conjuguée à l’exploration d’accords à long terme sur cinq ans, indique que les fournisseurs favorisent l’évolution de la location de puissance de calcul vers une quasi-commoditisation et un verrouillage sur des durées plus longues
il y a 1 heure
[Express de puissance de calcul SMM] 64 serveurs H100 à huit GPU disponibles à la location dans le nord de la Chine, loyer mensuel de 75 000, engagement ferme de quatre ans
il y a 3 heures
[Express de puissance de calcul SMM] 64 serveurs H100 à huit GPU disponibles à la location dans le nord de la Chine, loyer mensuel de 75 000, engagement ferme de quatre ans
Lire la suite
[Express de puissance de calcul SMM] 64 serveurs H100 à huit GPU disponibles à la location dans le nord de la Chine, loyer mensuel de 75 000, engagement ferme de quatre ans
[Express de puissance de calcul SMM] 64 serveurs H100 à huit GPU disponibles à la location dans le nord de la Chine, loyer mensuel de 75 000, engagement ferme de quatre ans
SMM a appris que 64 serveurs H100 à huit GPU ont été mis sur le marché en Chine du Nord, avec un loyer mensuel de 75 000 yuans par unité (contrat à durée fixe de quatre ans) et de 76 000 yuans par unité (contrat à durée fixe de cinq ans). Chaque serveur était configuré avec 8× GPU H100 80G, un CPU Intel 8468, 2 To de mémoire DDR5 et une carte réseau 400G. Les cartes de calcul étaient interconnectées à haute vitesse via un commutateur IB. SMM estime que l’arrivée sur le marché de clusters H100 haut de gamme sous contrat à durée fixe de quatre ans reflète une demande d’entraînement haut de gamme se concentrant de plus en plus sur le verrouillage des prix sur le long terme
il y a 3 heures
[SMM Hashrate Express] La sous-location de locations de hashrate est largement répandue ; les nouveaux entrants se tournent vers les ressources existantes
il y a 19 heures
[SMM Hashrate Express] La sous-location de locations de hashrate est largement répandue ; les nouveaux entrants se tournent vers les ressources existantes
Lire la suite
[SMM Hashrate Express] La sous-location de locations de hashrate est largement répandue ; les nouveaux entrants se tournent vers les ressources existantes
[SMM Hashrate Express] La sous-location de locations de hashrate est largement répandue ; les nouveaux entrants se tournent vers les ressources existantes
SMM a appris que le modèle de sous-location de serveurs continuait de dominer le marché. Les prix d’achat des serveurs GPU NVIDIA fluctuaient à des niveaux élevés et manquaient de référence, le prix d’achat des cartes à ventilation 5090 approchant 40 000 yuans l’unité. De nombreux nouveaux entrants dans le secteur de la location de puissance de calcul se sont tournés vers l’intégration de ressources existantes plutôt que vers l’achat de matériel supplémentaire. SMM estimait que l’absence de référence pour les prix d’achat poussait l’offre à activer les capacités existantes via la sous-location, et que le secteur était entré dans une phase de concurrence autour des ressources existantes
il y a 19 heures