Desde julio de 2026, varios proveedores de servicios de potencia de cómputo contactados por SMM han estado trasladando su centro operativo del arrendamiento bare metal a servicios de facturación basados en Tokens, y algunos han afirmado sin rodeos que «el arrendamiento de potencia de cómputo es secundario».Por un lado, los precios de arrendamiento se aplanaron por puntos de referencia visibles públicamente, y las capas de márgenes de intermediarios erosionaron el margen bruto de los proveedores; por otro lado, el volumen medio diario de llamadas de Tokens creció más de 1.000 veces en dos años, y las subidas oficiales de precios de las API ampliaron el espacio de arbitraje para el tránsito/reventa—detrás de la migración de la unidad de facturación de «vender horas de tarjeta» a «vender Tokens» está la doble realidad de que los márgenes brutos del arrendamiento tocaron fondo y de un aumento de la demanda de inferencia.
I. Fenómeno: varios proveedores dicen que «el arrendamiento es secundario» y los Tokens se han convertido en el foco principal
Según SMM, desde julio, los proveedores de servicios de potencia de cómputo contactados por múltiples canales han reducido de forma proactiva el emparejamiento de arrendamientos y se han desplazado hacia negocios de Tokens, intensificándose el cambio mes a mes:
Un proveedor de servicios IDC en el este de China(tres centros de datos de construcción propia): declaró explícitamente que actualmentepromueve principalmente Tokens, y que el arrendamiento de potencia de cómputo es secundario; ha lanzado su propia plataforma de Tokens y ha divulgado una estructura completa de descuentos: 40% del precio de lista a partir de medianoche por la noche, distintos descuentos según el modelo, y «cuanto más popular el modelo, menor el descuento»; los rangos de descuento de Tokens de los proveedores de nube se sitúan aproximadamente entre el 46% y el 80% del precio de lista.
Un proveedor de servicios de potencia de cómputo: al recibir información de emparejamiento de suministro de tarjetas, respondió directamente que su «centro está en la dirección del modelo de Tokens», y que ya no asume el emparejamiento de arrendamientos.
Un proveedor de servicios de nube de cómputo inteligente: su negocio de Tokens adopta un modelo de agencia de tránsito, comprando a50%–60%de los precios cotizados por el productor original y revendiendo; sus clientes actuales son principalmente usuarios de pequeñas empresas (B) y del segmento C, y el negocio acaba de arrancar.
Un operador: lanzó un modelo de despliegue privado de Tokens, proporcionando a clientes clave líneas dedicadas seguras conectadas directamente a centros de datos; los descuentos para clientes clave son del 8,5% al 80% del precio de lista, con ajustes de precio aproximadamente una vez al mes.
Un productor líder de nube: los comentarios del canal indicaron que su foco ya se ha desplazado a los Tokens y que “no está tan interesado” en el negocio de arrendamiento de tarjetas.
La impresión directa de SMM, a partir de comunicaciones rutinarias, fue que muchos proveedores de servicios ya no están realmente haciendo leasing y se están moviendo hacia Tokens.El mercado incluso ha visto socios que apuntan al “reparto de ingresos por Tokens”: llevan clientes y recursos de modelos para buscar potencia de cómputo ociosa, con un punto de partida de cooperación de 200 millones de TPM (llamadas de Tokens por minuto), y declarando explícitamente que “la cooperación basada en un modelo de alquiler mensual no funcionará”.
Gráfico 1: Panorama de la estructura de descuentos de Tokens: precios escalonados desde el 40% del precio de lista por la noche hasta descuentos del 8,5% ofrecidos por los operadores

II. Lado de la oferta: los márgenes brutos del leasing se aplanaron por el anclaje de precios, mientras que la fijación de precios por Tokens ofrece mayor autonomía
La fuerza principal que impulsó el cambio fue la continua compresión de los márgenes de beneficio en el lado del leasing.
Lado del leasing: lógica de “mayorista”, con ingresos mensuales limitados. Tomando como ejemplo un servidor 4090 de ocho GPU, el ancla actual de transacción de mercado era de aproximadamente 7.200 yuanes por unidad·mes. En el corretaje primario, cada reventa añadía unos 300–400 yuanes por unidad·mes; tras 2–3 traspasos, el precio cotizado podía empujarse hasta 8.500 yuanes. Sin embargo, el ancla de precios era pública y transparente, y la ganancia de las etapas de recargo iba a la cadena de intermediación, dejando un margen bruto limitado del lado del propietario del activo. Mientras tanto, el mercado carecía de cotizaciones unificadas estandarizadas; los intermediarios representaban una proporción alta, y los verdaderos propietarios de activos tenían un poder de negociación limitado en las negociaciones de precios.
Gráfico 2: Alquiler mensual de 4090 de ocho GPU: bajo el anclaje de precios, divergencia entre los recargos de los intermediarios y el margen bruto del propietario del activo

Lado de Tokens: lógica de “minorista”, con ingresos vinculados al uso. Los mecanismos de precios por Tokens eran flexibles: 60% de descuento a partir de medianoche, descuentos que fluctuaban con la popularidad del modelo y reajuste mensual de precios en línea con el mercado. Para el mismo servidor, los ingresos por alquiler mensual estaban limitados, mientras que la facturación por Tokens basada en el uso ofrecía mayor elasticidad de producción por GPU durante picos de demanda; los descuentos en los valles de baja demanda también podían “recortar picos y rellenar valles”, aumentando la utilización a plena carga.
Perspectiva de SMM: Los precios del leasing, una vez que la oferta se volvió homogénea, quedaron anclados por el mercado; las unidades de precio por token eran la «salida real de inferencia», y el poder de fijación de precios estaba en manos de los propios proveedores del servicio—esto representó un cambio en la lógica de negocio, de vender recursos a vender resultados, y la estructura del margen bruto se reconstruyó en consecuencia.
III. Catalizador de precios: se implementa el aumento del precio de la API oficial, ampliando la ventana de arbitraje por canales de tránsito
DeepSeek implementó oficialmente una nueva ronda de ajustes de precios de la API a partir del 17 de agosto, con los modelos principales subiendo entre 3 y 5 veces y algunos ítems alcanzando 10 veces; el precio de salida de la versión Pro subió de 6 yuanes por millón de tokens a 27 yuanes. Del lado del canal, SMM supo que algunos operadores interpretaron el fondo del cambio como un retorno al nivel de precios original previo a las anteriores promociones de venta con un descuento aproximado de 2,5 veces, más que como una subida de precios completamente nueva.
Tras implementarse el aumento, la brecha entre los precios oficiales de lista y el precio de compra del 50–60% vía canales de tránsito se amplió, dejando un espacio de arbitraje mayor para los modelos de tránsito y agencia de tokens—esta fue también la razón por la que el sistema de descuentos de tokens se mencionó repetidamente en las comunicaciones de canal desde mediados de agosto:los proveedores de servicios estaban haciendo números seriamente con esto.
Gráfico 3: Precio de salida de DeepSeek Pro—El aumento oficial de precios amplía la ventana de arbitraje por canales de tránsito

La información pública mostró que, desde 2026, los precios de la API para modelos de alta capacidad registraron un aumento por etapas:el precio de la API de Zhipu en el 1T aumentó un 83%, mientras que el volumen de llamadas aún creció un 400%; en la serie Hunyuan de Tencent Cloud, los precios de algunos modelos subieron más de 4 veces. La fijación de precios por token estaba pasando de una lógica única de recorte de precios a una tarificación escalonada: los tokens de gama baja se acercaban a la comoditización y competían en precio, mientras que los tokens de gama alta subían precios apoyándose en capacidades escasas; los proveedores de servicios con capacidades de reventa e integración se beneficiaron de forma significativa.
Perspectiva de SMM: La intención original del aumento oficial de precios era reparar su propia economía unitaria, pero objetivamente elevó el dividendo del diferencial de precios para los canales intermediarios—cada vez que el OEM ajustaba los precios, creaba una oportunidad para que los distribuidores del canal de tokens reprecificaran.
IV. Lado de la demanda: el promedio diario de llamadas de Tokens aumentó más de 1.000 veces en dos años; los clientes querían APIs, no máquinas
Los datos del sector aportaron una nota al pie de este cambio.Datos de la Administración Nacional de Datos mostraron que el promedio diario de llamadas de Tokens en China había aumentado de unos 100.000 millones a comienzos de 2024 a más de 140 billones en marzo de 2026, un incremento de más de 1.000 veces en dos años. En la conferencia WAIC 2026 de este año, “fábrica de Tokens” se convirtió en la palabra clave más popular, y el foco del sector se extendió del entrenamiento centralizado a la inferencia a escala.
Gráfico 4: Promedio diario de llamadas de Tokens en China: salto del nivel de 100.000 millones al nivel de 100 billones

El seguimiento por el lado de la oferta fue igual de intenso:
- los tres principales operadores de telecomunicaciones lanzaron paquetes de Tokens, vendiendo Tokens en forma de paquetes de datos; en mayo, Shanghai Telecom se convirtió en el primer operador local en publicar un paquete tarifario de Tokens, en el que 1 yuan equivalía a una asignación de 250.000 puntos de cuota, y APIs estándar permitían llamadas a más de 30 modelos grandes convencionales
- Tras que una empresa cotizada de potencia de cómputo actualizara su modelo de entrega desde el arrendamiento de potencia de cómputo a la facturación basada en el uso real de Tokens, sus ingresos del primer semestre aumentaron un 497% interanual, el beneficio neto subió un 540% interanual y pasó de pérdidas a ganancias
- Algunos centros de cómputo inteligente adoptaron una estructura operativa de “mitad arrendamiento completo al por mayor, mitad venta minorista de Tokens”, con más de 2.000 usuarios en el lado minorista de Tokens
- Fuera de China, también surgióun modelo de infraestructura de inferencia de programación automatizada de GPUs ociosas más reparto de ingresos por Tokens, convirtiéndose la monetización de la potencia de cómputo ociosa en un nuevo punto de entrada para la economía de Tokens
Perspectiva de SMM: La estructura del lado de la demanda había cambiado: las pymes y los clientes consumidores no se preocupaban por las GPUs ni querían bare metal; solo querían una clave de API.Los proveedores de servicios de arrendamiento quedaron atrapados en medio: no podían asegurar un suministro de GPUs de bajo precio aguas arriba, mientras que aguas abajo los clientes ya no necesitaban “una máquina completa”. Los Tokens fueron la solución a este desajuste estructural.
V. Observaciones sobre los límites: el arrendamiento de GPUs de gama alta se mantuvo resiliente, y el cambio se concentró entre tres tipos de actores
Cabe señalar que “pasar del arrendamiento a Tokens” no fue un fenómeno de toda la industria. La evidencia en contra que aprendió SMM fue igualmente clara: los modelos de tarjetas de gama alta, como la H200, seguían con una oferta muy ajustada para el arrendamiento—incluidos casos en los que los proveedores incumplieron contratos durante el periodo de arrendamiento y revendieron la capacidad (con solo una semana de preaviso), un clúster de 128 tarjetas arrendado en conjunto a 116.000 yuanes por tarjeta-mes sin posibilidad de dividirlo en pedidos más pequeños, y un centro de computación inteligente en Lingang donde 2.000 tarjetas nacionales Muxi C500 fueron subcontratadas por completo por dos empresas, que “aun así sentían que no era suficiente”.
Quienes realmente pivotaron a fondo se dividieron en tres categorías: IDC pequeños y medianos y proveedores de servicios en la nube de computación inteligente sin ventaja en el suministro de tarjetas, actores de canal que comenzaron como agentes de tránsito, y proveedores líderes de nube que desde el principio nunca dependieron de tarjetas arrendadas. Cuanto menos ajustadas estaban las tarjetas de un proveedor de servicios, más a fondo pivotaba; los propietarios que enfrentaban una escasez extrema seguían usando contratos a largo plazo para asegurar rentas de arrendamiento escasas.
VI. Conclusiones y perspectivas: El cambio en las unidades de facturación es una reparación del margen bruto, no un reemplazo del modelo
SMM cree: en esta ronda, el giro de los proveedores de servicios hacia Token es una resonancia de fuerzas de empuje y tracción: por el lado del empuje, el anclaje de precios al final del arrendamiento y la compresión de los márgenes brutos de los propietarios de tarjetas debido a los recargos de intermediarios; por el lado de la tracción, el crecimiento exponencial de la demanda de inferencia, las subidas oficiales de precios que amplían el diferencial de precios del tránsito y una mayor elasticidad de ingresos bajo la facturación basada en el uso; sumado a que los clientes de Token afrontan altos costes de cambio tras conectarse vía API y presentan una fidelidad significativamente mayor que los clientes de arrendamiento, que pueden marcharse en cualquier momento, la lógica de negocio del cambio de los proveedores de servicios de “vender recursos” a “vender resultados” es clara. Para el mismo lote de servidores, el mayorista cobra la renta mensualmente mientras el minorista cobra por Token: el contrato no ha cambiado; lo que ha cambiado es la unidad de medida: una parte dice que los márgenes brutos del arrendamiento han tocado fondo, mientras la otra dice que la demanda de inferencia se está disparando.
Perspectivas:
A corto plazo (3–6 meses): se espera que el efecto de la subida de precios de DeepSeek se intensifique; se espera que continúe el dividendo del diferencial entre el precio oficial y el de tránsito; se espera que se acelere la expansión de los modelos de tránsito y agencia de Token; y se espera que los proveedores de servicios pequeños y medianos sigan lanzando plataformas Token en rápida sucesión.
Mediano plazo (6–12 meses): se espera que la tarificación escalonada por Token se profundice; se prevé que la mercantilización de los Token de gama baja intensifique una reconfiguración de canales; si los fabricantes originales reanudan promociones y descuentos de ventas a gran escala, el margen para el arbitraje de tránsito se comprimirá, poniendo a prueba la retención de clientes y las capacidades de valor añadido de los proveedores de servicios.
Largo plazo (más de 1 año): la variable clave reside en la oferta de tarjetas de gama alta: si la oferta de tarjetas NVIDIA sigue restringida y el arrendamiento de tarjetas de gama alta continúa siendo un mercado de vendedores, la estructura de doble vía de «cobrar rentas por tarjetas con oferta ajustada + vender Token en tarjetas sin oferta ajustada» se mantendrá en paralelo a largo plazo
Fuentes de datos
- Administración Nacional de Datos — datos del volumen medio diario de invocaciones de Token en China (aprox. 100.000 millones de veces a inicios de 2024 → superando los 14 billones de veces en marzo de 2026)
- People’s Daily Online (2026-07-31), «La industria está impulsando los servicios de potencia de cómputo hacia la “era Token”» — WAIC 2026 «Token Factory» y datos de informes semestrales sobre facturación basada en Token de empresas cotizadas de potencia de cómputo
- Informe de investigación de Guojin Securities (2026-06) — paquetes tarifarios de Token de Shanghai Telecom, paquetes de Token de los tres principales operadores y un modelo de reparto de ingresos por Token de GPU ociosas
- Información pública del mercado — ajuste de precios de API de Zhipu en el 1T de 2026 y volumen de llamadas, y ajustes de precio de la serie Hunyuan de Tencent Cloud
Información obtenida por SMM:
- Comunicación habitual con un proveedor de servicios IDC en el este de China — promueve principalmente Token, con el arrendamiento de potencia de cómputo como complemento; estructura de descuentos de Token (60% de descuento por la noche, flotación según el modelo y 46–80% de descuento para proveedores de nube)
- Comunicación habitual con un proveedor de servicios de nube de computación inteligente — modelo de tránsito de Token comprando al 50–60% del precio del fabricante original, y una pequeña mezcla de clientes B/C-end
- Comunicación habitual con un operador — modelo de despliegue privado de Token, cuentas clave al 85–80% del precio de lista, y la subida de precio de DeepSeek siendo esencialmente una restauración del precio original previo al descuento 2,5
- Comunicación de canal con un proveedor de servicios de potencia de cómputo — «el foco está en la dirección del modelo Token»
- Comentarios del canal — el foco de un proveedor líder de nube está en Token; el ancla de transacción de la 4090 en 7.200 yuanes por tarjeta-mes, con intermediarios añadiendo 300–400 yuanes por lote; y el Muxi C500 de Lingang de 2.000 tarjetas totalmente subcontratado
![[Expreso de potencia de cómputo de SMM] 128 unidades de futuros 5090 entregadas por lotes; el arrendador explora un acuerdo a largo plazo de cinco años](https://imgqn.smm.cn/usercenter/JYbQQ20251217171736.jpg)
![[Expreso de potencia de cómputo de SMM] 64 servidores H100 de ocho GPU disponibles para alquiler en el norte de China, renta mensual de 75.000, plazo cerrado de cuatro años](https://imgqn.smm.cn/usercenter/gpWpd20251217171734.jpeg)
![[SMM Hashrate Express] El subarrendamiento de alquileres de hashrate está muy extendido; los nuevos participantes se orientan hacia recursos existentes](https://imgqn.smm.cn/usercenter/obeMy20251217171735.jpg)
