[Análisis SMM]Los proveedores de potencia de cómputo pasan del arrendamiento a los tokens ante el estrechamiento de márgenes y la demanda en auge

Publicado: Aug 18, 2026 09:36
Desde julio de 2026, los proveedores informáticos chinos están pasando del alquiler de GPU a la facturación por tokens; algunos llaman al alquiler «un negocio secundario». Los márgenes del alquiler se reducen por anclas de precios públicos (4090 de 8 GPU: 7.200 CNY/mes) y los recargos de los intermediarios; la subida de precios de la API de DeepSeek del 17 de agosto (3–5x) amplía los diferenciales de los revendedores; las llamadas diarias de tokens alcanzaron los 140 billones en marzo de 2026, un aumento de 1.000x en 2 años. SMM: recuperación de márgenes, no sustitución: el alquiler de GPU de gama alta sigue ajustado; conversos: pequeños IDC, revendedores e hiperescaladores

Desde julio de 2026, varios proveedores de servicios de potencia de cómputo contactados por SMM han estado trasladando su centro operativo del arrendamiento bare metal a servicios de facturación basados en Tokens, y algunos han afirmado sin rodeos que «el arrendamiento de potencia de cómputo es secundario».Por un lado, los precios de arrendamiento se aplanaron por puntos de referencia visibles públicamente, y las capas de márgenes de intermediarios erosionaron el margen bruto de los proveedores; por otro lado, el volumen medio diario de llamadas de Tokens creció más de 1.000 veces en dos años, y las subidas oficiales de precios de las API ampliaron el espacio de arbitraje para el tránsito/reventa—detrás de la migración de la unidad de facturación de «vender horas de tarjeta» a «vender Tokens» está la doble realidad de que los márgenes brutos del arrendamiento tocaron fondo y de un aumento de la demanda de inferencia.


I. Fenómeno: varios proveedores dicen que «el arrendamiento es secundario» y los Tokens se han convertido en el foco principal

Según SMM, desde julio, los proveedores de servicios de potencia de cómputo contactados por múltiples canales han reducido de forma proactiva el emparejamiento de arrendamientos y se han desplazado hacia negocios de Tokens, intensificándose el cambio mes a mes:

Un proveedor de servicios IDC en el este de China(tres centros de datos de construcción propia): declaró explícitamente que actualmentepromueve principalmente Tokens, y que el arrendamiento de potencia de cómputo es secundario; ha lanzado su propia plataforma de Tokens y ha divulgado una estructura completa de descuentos: 40% del precio de lista a partir de medianoche por la noche, distintos descuentos según el modelo, y «cuanto más popular el modelo, menor el descuento»; los rangos de descuento de Tokens de los proveedores de nube se sitúan aproximadamente entre el 46% y el 80% del precio de lista.

Un proveedor de servicios de potencia de cómputo: al recibir información de emparejamiento de suministro de tarjetas, respondió directamente que su «centro está en la dirección del modelo de Tokens», y que ya no asume el emparejamiento de arrendamientos.

Un proveedor de servicios de nube de cómputo inteligente: su negocio de Tokens adopta un modelo de agencia de tránsito, comprando a50%–60%de los precios cotizados por el productor original y revendiendo; sus clientes actuales son principalmente usuarios de pequeñas empresas (B) y del segmento C, y el negocio acaba de arrancar.

Un operador: lanzó un modelo de despliegue privado de Tokens, proporcionando a clientes clave líneas dedicadas seguras conectadas directamente a centros de datos; los descuentos para clientes clave son del 8,5% al 80% del precio de lista, con ajustes de precio aproximadamente una vez al mes.

Un productor líder de nube: los comentarios del canal indicaron que su foco ya se ha desplazado a los Tokens y que “no está tan interesado” en el negocio de arrendamiento de tarjetas.

La impresión directa de SMM, a partir de comunicaciones rutinarias, fue que muchos proveedores de servicios ya no están realmente haciendo leasing y se están moviendo hacia Tokens.El mercado incluso ha visto socios que apuntan al “reparto de ingresos por Tokens”: llevan clientes y recursos de modelos para buscar potencia de cómputo ociosa, con un punto de partida de cooperación de 200 millones de TPM (llamadas de Tokens por minuto), y declarando explícitamente que “la cooperación basada en un modelo de alquiler mensual no funcionará”.

Gráfico 1: Panorama de la estructura de descuentos de Tokens: precios escalonados desde el 40% del precio de lista por la noche hasta descuentos del 8,5% ofrecidos por los operadores


II. Lado de la oferta: los márgenes brutos del leasing se aplanaron por el anclaje de precios, mientras que la fijación de precios por Tokens ofrece mayor autonomía

La fuerza principal que impulsó el cambio fue la continua compresión de los márgenes de beneficio en el lado del leasing.

Lado del leasing: lógica de “mayorista”, con ingresos mensuales limitados. Tomando como ejemplo un servidor 4090 de ocho GPU, el ancla actual de transacción de mercado era de aproximadamente 7.200 yuanes por unidad·mes. En el corretaje primario, cada reventa añadía unos 300–400 yuanes por unidad·mes; tras 2–3 traspasos, el precio cotizado podía empujarse hasta 8.500 yuanes. Sin embargo, el ancla de precios era pública y transparente, y la ganancia de las etapas de recargo iba a la cadena de intermediación, dejando un margen bruto limitado del lado del propietario del activo. Mientras tanto, el mercado carecía de cotizaciones unificadas estandarizadas; los intermediarios representaban una proporción alta, y los verdaderos propietarios de activos tenían un poder de negociación limitado en las negociaciones de precios.

Gráfico 2: Alquiler mensual de 4090 de ocho GPU: bajo el anclaje de precios, divergencia entre los recargos de los intermediarios y el margen bruto del propietario del activo

Lado de Tokens: lógica de “minorista”, con ingresos vinculados al uso. Los mecanismos de precios por Tokens eran flexibles: 60% de descuento a partir de medianoche, descuentos que fluctuaban con la popularidad del modelo y reajuste mensual de precios en línea con el mercado. Para el mismo servidor, los ingresos por alquiler mensual estaban limitados, mientras que la facturación por Tokens basada en el uso ofrecía mayor elasticidad de producción por GPU durante picos de demanda; los descuentos en los valles de baja demanda también podían “recortar picos y rellenar valles”, aumentando la utilización a plena carga.

Perspectiva de SMM: Los precios del leasing, una vez que la oferta se volvió homogénea, quedaron anclados por el mercado; las unidades de precio por token eran la «salida real de inferencia», y el poder de fijación de precios estaba en manos de los propios proveedores del servicio—esto representó un cambio en la lógica de negocio, de vender recursos a vender resultados, y la estructura del margen bruto se reconstruyó en consecuencia.


III. Catalizador de precios: se implementa el aumento del precio de la API oficial, ampliando la ventana de arbitraje por canales de tránsito

DeepSeek implementó oficialmente una nueva ronda de ajustes de precios de la API a partir del 17 de agosto, con los modelos principales subiendo entre 3 y 5 veces y algunos ítems alcanzando 10 veces; el precio de salida de la versión Pro subió de 6 yuanes por millón de tokens a 27 yuanes. Del lado del canal, SMM supo que algunos operadores interpretaron el fondo del cambio como un retorno al nivel de precios original previo a las anteriores promociones de venta con un descuento aproximado de 2,5 veces, más que como una subida de precios completamente nueva.

Tras implementarse el aumento, la brecha entre los precios oficiales de lista y el precio de compra del 50–60% vía canales de tránsito se amplió, dejando un espacio de arbitraje mayor para los modelos de tránsito y agencia de tokens—esta fue también la razón por la que el sistema de descuentos de tokens se mencionó repetidamente en las comunicaciones de canal desde mediados de agosto:los proveedores de servicios estaban haciendo números seriamente con esto.

Gráfico 3: Precio de salida de DeepSeek Pro—El aumento oficial de precios amplía la ventana de arbitraje por canales de tránsito

La información pública mostró que, desde 2026, los precios de la API para modelos de alta capacidad registraron un aumento por etapas:el precio de la API de Zhipu en el 1T aumentó un 83%, mientras que el volumen de llamadas aún creció un 400%; en la serie Hunyuan de Tencent Cloud, los precios de algunos modelos subieron más de 4 veces. La fijación de precios por token estaba pasando de una lógica única de recorte de precios a una tarificación escalonada: los tokens de gama baja se acercaban a la comoditización y competían en precio, mientras que los tokens de gama alta subían precios apoyándose en capacidades escasas; los proveedores de servicios con capacidades de reventa e integración se beneficiaron de forma significativa.

Perspectiva de SMM: La intención original del aumento oficial de precios era reparar su propia economía unitaria, pero objetivamente elevó el dividendo del diferencial de precios para los canales intermediarios—cada vez que el OEM ajustaba los precios, creaba una oportunidad para que los distribuidores del canal de tokens reprecificaran.


IV. Lado de la demanda: el promedio diario de llamadas de Tokens aumentó más de 1.000 veces en dos años; los clientes querían APIs, no máquinas

Los datos del sector aportaron una nota al pie de este cambio.Datos de la Administración Nacional de Datos mostraron que el promedio diario de llamadas de Tokens en China había aumentado de unos 100.000 millones a comienzos de 2024 a más de 140 billones en marzo de 2026, un incremento de más de 1.000 veces en dos años. En la conferencia WAIC 2026 de este año, “fábrica de Tokens” se convirtió en la palabra clave más popular, y el foco del sector se extendió del entrenamiento centralizado a la inferencia a escala.

Gráfico 4: Promedio diario de llamadas de Tokens en China: salto del nivel de 100.000 millones al nivel de 100 billones

El seguimiento por el lado de la oferta fue igual de intenso:

  • los tres principales operadores de telecomunicaciones lanzaron paquetes de Tokens, vendiendo Tokens en forma de paquetes de datos; en mayo, Shanghai Telecom se convirtió en el primer operador local en publicar un paquete tarifario de Tokens, en el que 1 yuan equivalía a una asignación de 250.000 puntos de cuota, y APIs estándar permitían llamadas a más de 30 modelos grandes convencionales
  • Tras que una empresa cotizada de potencia de cómputo actualizara su modelo de entrega desde el arrendamiento de potencia de cómputo a la facturación basada en el uso real de Tokens, sus ingresos del primer semestre aumentaron un 497% interanual, el beneficio neto subió un 540% interanual y pasó de pérdidas a ganancias
  • Algunos centros de cómputo inteligente adoptaron una estructura operativa de “mitad arrendamiento completo al por mayor, mitad venta minorista de Tokens”, con más de 2.000 usuarios en el lado minorista de Tokens
  • Fuera de China, también surgióun modelo de infraestructura de inferencia de programación automatizada de GPUs ociosas más reparto de ingresos por Tokens, convirtiéndose la monetización de la potencia de cómputo ociosa en un nuevo punto de entrada para la economía de Tokens

Perspectiva de SMM: La estructura del lado de la demanda había cambiado: las pymes y los clientes consumidores no se preocupaban por las GPUs ni querían bare metal; solo querían una clave de API.Los proveedores de servicios de arrendamiento quedaron atrapados en medio: no podían asegurar un suministro de GPUs de bajo precio aguas arriba, mientras que aguas abajo los clientes ya no necesitaban “una máquina completa”. Los Tokens fueron la solución a este desajuste estructural.


V. Observaciones sobre los límites: el arrendamiento de GPUs de gama alta se mantuvo resiliente, y el cambio se concentró entre tres tipos de actores

Cabe señalar que “pasar del arrendamiento a Tokens” no fue un fenómeno de toda la industria. La evidencia en contra que aprendió SMM fue igualmente clara: los modelos de tarjetas de gama alta, como la H200, seguían con una oferta muy ajustada para el arrendamiento—incluidos casos en los que los proveedores incumplieron contratos durante el periodo de arrendamiento y revendieron la capacidad (con solo una semana de preaviso), un clúster de 128 tarjetas arrendado en conjunto a 116.000 yuanes por tarjeta-mes sin posibilidad de dividirlo en pedidos más pequeños, y un centro de computación inteligente en Lingang donde 2.000 tarjetas nacionales Muxi C500 fueron subcontratadas por completo por dos empresas, que “aun así sentían que no era suficiente”.

Quienes realmente pivotaron a fondo se dividieron en tres categorías: IDC pequeños y medianos y proveedores de servicios en la nube de computación inteligente sin ventaja en el suministro de tarjetas, actores de canal que comenzaron como agentes de tránsito, y proveedores líderes de nube que desde el principio nunca dependieron de tarjetas arrendadas. Cuanto menos ajustadas estaban las tarjetas de un proveedor de servicios, más a fondo pivotaba; los propietarios que enfrentaban una escasez extrema seguían usando contratos a largo plazo para asegurar rentas de arrendamiento escasas.


VI. Conclusiones y perspectivas: El cambio en las unidades de facturación es una reparación del margen bruto, no un reemplazo del modelo

SMM cree: en esta ronda, el giro de los proveedores de servicios hacia Token es una resonancia de fuerzas de empuje y tracción: por el lado del empuje, el anclaje de precios al final del arrendamiento y la compresión de los márgenes brutos de los propietarios de tarjetas debido a los recargos de intermediarios; por el lado de la tracción, el crecimiento exponencial de la demanda de inferencia, las subidas oficiales de precios que amplían el diferencial de precios del tránsito y una mayor elasticidad de ingresos bajo la facturación basada en el uso; sumado a que los clientes de Token afrontan altos costes de cambio tras conectarse vía API y presentan una fidelidad significativamente mayor que los clientes de arrendamiento, que pueden marcharse en cualquier momento, la lógica de negocio del cambio de los proveedores de servicios de “vender recursos” a “vender resultados” es clara. Para el mismo lote de servidores, el mayorista cobra la renta mensualmente mientras el minorista cobra por Token: el contrato no ha cambiado; lo que ha cambiado es la unidad de medida: una parte dice que los márgenes brutos del arrendamiento han tocado fondo, mientras la otra dice que la demanda de inferencia se está disparando.

Perspectivas:

A corto plazo (3–6 meses): se espera que el efecto de la subida de precios de DeepSeek se intensifique; se espera que continúe el dividendo del diferencial entre el precio oficial y el de tránsito; se espera que se acelere la expansión de los modelos de tránsito y agencia de Token; y se espera que los proveedores de servicios pequeños y medianos sigan lanzando plataformas Token en rápida sucesión.

Mediano plazo (6–12 meses): se espera que la tarificación escalonada por Token se profundice; se prevé que la mercantilización de los Token de gama baja intensifique una reconfiguración de canales; si los fabricantes originales reanudan promociones y descuentos de ventas a gran escala, el margen para el arbitraje de tránsito se comprimirá, poniendo a prueba la retención de clientes y las capacidades de valor añadido de los proveedores de servicios.

Largo plazo (más de 1 año): la variable clave reside en la oferta de tarjetas de gama alta: si la oferta de tarjetas NVIDIA sigue restringida y el arrendamiento de tarjetas de gama alta continúa siendo un mercado de vendedores, la estructura de doble vía de «cobrar rentas por tarjetas con oferta ajustada + vender Token en tarjetas sin oferta ajustada» se mantendrá en paralelo a largo plazo


Fuentes de datos

  1. Administración Nacional de Datos — datos del volumen medio diario de invocaciones de Token en China (aprox. 100.000 millones de veces a inicios de 2024 → superando los 14 billones de veces en marzo de 2026)
  2. People’s Daily Online (2026-07-31), «La industria está impulsando los servicios de potencia de cómputo hacia la “era Token”» — WAIC 2026 «Token Factory» y datos de informes semestrales sobre facturación basada en Token de empresas cotizadas de potencia de cómputo
  3. Informe de investigación de Guojin Securities (2026-06) — paquetes tarifarios de Token de Shanghai Telecom, paquetes de Token de los tres principales operadores y un modelo de reparto de ingresos por Token de GPU ociosas
  4. Información pública del mercado — ajuste de precios de API de Zhipu en el 1T de 2026 y volumen de llamadas, y ajustes de precio de la serie Hunyuan de Tencent Cloud

Información obtenida por SMM:

  1. Comunicación habitual con un proveedor de servicios IDC en el este de China — promueve principalmente Token, con el arrendamiento de potencia de cómputo como complemento; estructura de descuentos de Token (60% de descuento por la noche, flotación según el modelo y 46–80% de descuento para proveedores de nube)
  2. Comunicación habitual con un proveedor de servicios de nube de computación inteligente — modelo de tránsito de Token comprando al 50–60% del precio del fabricante original, y una pequeña mezcla de clientes B/C-end
  3. Comunicación habitual con un operador — modelo de despliegue privado de Token, cuentas clave al 85–80% del precio de lista, y la subida de precio de DeepSeek siendo esencialmente una restauración del precio original previo al descuento 2,5
  4. Comunicación de canal con un proveedor de servicios de potencia de cómputo — «el foco está en la dirección del modelo Token»
  5. Comentarios del canal — el foco de un proveedor líder de nube está en Token; el ancla de transacción de la 4090 en 7.200 yuanes por tarjeta-mes, con intermediarios añadiendo 300–400 yuanes por lote; y el Muxi C500 de Lingang de 2.000 tarjetas totalmente subcontratado
 

Declaración de Fuente de Datos: Excepto la información disponible públicamente, todos los demás datos son procesados por SMM basándose en información pública, comunicación de mercado y confiando en el modelo de base de datos interna de SMM. Son solo para referencia y no constituyen recomendaciones para la toma de decisiones.

Para cualquier consulta o para obtener más información, por favor contacte: lemonzhao@smm.cn
Para más información sobre cómo acceder a nuestros informes de investigación, contacte con:service.en@smm.cn
Noticias relacionadas
[Expreso de potencia de cómputo de SMM] 128 unidades de futuros 5090 entregadas por lotes; el arrendador explora un acuerdo a largo plazo de cinco años
hace 1 hora
[Expreso de potencia de cómputo de SMM] 128 unidades de futuros 5090 entregadas por lotes; el arrendador explora un acuerdo a largo plazo de cinco años
Leer más
[Expreso de potencia de cómputo de SMM] 128 unidades de futuros 5090 entregadas por lotes; el arrendador explora un acuerdo a largo plazo de cinco años
[Expreso de potencia de cómputo de SMM] 128 unidades de futuros 5090 entregadas por lotes; el arrendador explora un acuerdo a largo plazo de cinco años
SMM se enteró de que un operador del este de China ha estado recibiendo entregas por lotes de 128 unidades de futuros de RTX 5090. Desde finales de junio, SMM ha estado siguiendo el estado de las entregas; hasta la fecha, el cumplimiento del contrato ha sido normal, con más de 40 unidades entregadas. El precio previsto para el arrendamiento bajo un contrato de tres años es de 13.000 yuanes por unidad al mes. El arrendador también está explorando un modelo de acuerdo a largo plazo de cinco años. SMM considera que el desempeño estable de los futuros de arrendamiento de 5090, junto con la exploración de acuerdos a largo plazo de cinco años, indica que los proveedores están impulsando la evolución del arrendamiento de potencia de cómputo hacia una cuasi-mercantilización y un bloqueo a más largo plazo
hace 1 hora
[Expreso de potencia de cómputo de SMM] 64 servidores H100 de ocho GPU disponibles para alquiler en el norte de China, renta mensual de 75.000, plazo cerrado de cuatro años
hace 3 horas
[Expreso de potencia de cómputo de SMM] 64 servidores H100 de ocho GPU disponibles para alquiler en el norte de China, renta mensual de 75.000, plazo cerrado de cuatro años
Leer más
[Expreso de potencia de cómputo de SMM] 64 servidores H100 de ocho GPU disponibles para alquiler en el norte de China, renta mensual de 75.000, plazo cerrado de cuatro años
[Expreso de potencia de cómputo de SMM] 64 servidores H100 de ocho GPU disponibles para alquiler en el norte de China, renta mensual de 75.000, plazo cerrado de cuatro años
SMM se enteró de que se lanzaron 64 servidores H100 de ocho GPU en el norte de China, con un alquiler mensual de 75.000 yuanes por unidad (plazo fijo de cuatro años) y 76.000 yuanes por unidad (plazo fijo de cinco años). Cada servidor estaba configurado con 8 GPU H100 de 80G, una CPU Intel 8468, 2 TB de memoria DDR5 y una tarjeta de red de 400G. Las tarjetas de cómputo estaban interconectadas a alta velocidad mediante un conmutador IB. SMM consideró que la entrada al mercado de clústeres H100 de alta especificación bajo un plazo fijo de cuatro años reflejaba que la demanda de entrenamiento de gama alta se está concentrando cada vez más en el bloqueo de precios a largo plazo
hace 3 horas
[SMM Hashrate Express] El subarrendamiento de alquileres de hashrate está muy extendido; los nuevos participantes se orientan hacia recursos existentes
hace 19 horas
[SMM Hashrate Express] El subarrendamiento de alquileres de hashrate está muy extendido; los nuevos participantes se orientan hacia recursos existentes
Leer más
[SMM Hashrate Express] El subarrendamiento de alquileres de hashrate está muy extendido; los nuevos participantes se orientan hacia recursos existentes
[SMM Hashrate Express] El subarrendamiento de alquileres de hashrate está muy extendido; los nuevos participantes se orientan hacia recursos existentes
SMM se enteró de que el modelo de subarrendamiento de servidores seguía predominando en el mercado. Los precios de compra de los servidores GPU de NVIDIA fluctuaban en niveles altos y carecían de un referente de precios, y el precio de compra de las tarjetas 5090 con ventilador se acercaba a 40.000 yuanes por unidad. Muchos nuevos participantes en el sector del arrendamiento de potencia de cómputo se orientaron a integrar los recursos existentes en lugar de adquirir hardware adicional. SMM consideró que la falta de un referente para los precios de compra estaba obligando al lado de la oferta a activar la capacidad existente mediante el subarrendamiento, y que el sector había entrado en una fase de competencia por los recursos existentes.
hace 19 horas
[Análisis SMM]Los proveedores de potencia de cómputo pasan del arrendamiento a los tokens ante el estrechamiento de márgenes y la demanda en auge - Shanghai Metals Market (SMM)