[Análise SMM] Provedores de poder computacional migram de locação para tokens em meio à compressão das margens e à demanda crescente

Publicado: Aug 18, 2026 09:36
Desde jul. de 2026, provedores chineses de computação estão migrando do aluguel de GPUs para a cobrança por tokens — alguns chamam o aluguel de “um negócio paralelo”. As margens do aluguel encolhem sob âncoras públicas de preço (4090 com 8 GPUs: ¥ 7.200/mês) e sobretaxas de corretores; o aumento da API da DeepSeek em 17 de ago. (3–5x) amplia os spreads dos revendedores; as chamadas diárias por tokens chegaram a 140 trilhões em mar. de 2026, alta de 1.000x em 2 anos. SMM: recuperação de margem, não substituição — o aluguel de GPUs de ponta segue apertado; convertidos: pequenos IDCs, revendedores, hyperscalers

Desde julho de 2026, vários provedores de serviços de poder computacional contatados pela SMM vêm transferindo seu centro operacional do aluguel de bare metal para serviços de cobrança baseados em Tokens, com alguns afirmando de forma direta que “o aluguel de poder computacional é secundário”.De um lado, os preços de aluguel foram nivelados por pontos de referência publicamente visíveis, e as camadas de margens de intermediários corroeram as margens brutas dos remetentes; de outro, o volume médio diário de chamadas de Tokens cresceu mais de 1.000x em dois anos, e os aumentos oficiais de preços de API ampliaram o espaço de arbitragem para trânsito/revenda—por trás da migração da unidade de cobrança de “vender horas de placa” para “vender Tokens” está a dupla realidade de as margens brutas do aluguel terem chegado ao fundo e de uma disparada na demanda por inferência.


I. Fenômeno: vários provedores dizem que “o aluguel é secundário”, e Tokens se tornaram o foco principal

Segundo a SMM, desde julho, provedores de serviços de poder computacional contatados por múltiplos canais reduziram proativamente o matchmaking de aluguel e migraram para negócios de Tokens, com a mudança se intensificando mês a mês:

Um provedor de serviços de IDC no leste da China(três data centers próprios): declarou explicitamente que, no momento, estápromovendo principalmente Tokens, com o aluguel de poder computacional como secundário; lançou sua própria plataforma de Tokens e divulgou uma estrutura completa de descontos — 40% do preço de tabela a partir da meia-noite durante a noite, descontos diferentes para modelos diferentes e “quanto mais popular o modelo, menor o desconto”; a faixa de desconto de Tokens dos provedores de nuvem fica em torno de 46%–80% do preço de tabela.

Um provedor de serviços de poder computacional: ao receber informações de matchmaking de fornecimento de placas, respondeu diretamente que seu “foco está na direção do modelo de Tokens” e que não realiza mais matchmaking de aluguel.

Um provedor de serviços de nuvem de computação inteligente: seu negócio de Tokens adota um modelo de agência de trânsito, comprando a50%–60%dos preços cotados pelo produtor original e revendendo; seus clientes atuais são principalmente usuários de pequenas empresas (B) e do consumidor final (C), e o negócio está apenas começando.

Uma operadora: lançou um modelo de implantação privada de Tokens, fornecendo a clientes-chave linhas dedicadas seguras conectadas diretamente aos data centers; os descontos para clientes-chave são de 8,5%–80% do preço de tabela, com ajustes de preço cerca de uma vez por mês.

Um produtor líder de nuvem: o feedback do canal indicou que seu foco já migrou para Tokens e que ele “não tem tanto interesse” no negócio de locação de placas.

A impressão direta da SMM, a partir de comunicações rotineiras, foi que muitos provedores de serviço já não estão realmente fazendo locação e estão migrando para Tokens.O mercado chegou a ver parceiros mirando “compartilhamento de receita de Tokens” — trazendo clientes e recursos de modelos para buscar poder computacional ocioso, com ponto de partida de cooperação de 200 milhões de TPM (chamadas de Token por minuto), e afirmando explicitamente que “cooperação baseada em um modelo de aluguel mensal não funciona”.

Gráfico 1: Panorama da estrutura de descontos de Tokens: preços em camadas, de 40% do preço de tabela à noite a descontos de 8,5% oferecidos por operadores


II. Lado da oferta: as margens brutas da locação foram achatadas pela ancoragem de preços, enquanto a precificação por Tokens oferece maior autonomia

A principal força que impulsionou a mudança foi a compressão contínua das margens de lucro no lado da locação.

Lado da locação — lógica de “atacado”, com receita mensal limitada. Tomando como exemplo um servidor 4090 com oito GPUs, a âncora atual de transação no mercado era de cerca de 7.200 yuans por unidade·mês. Na corretagem primária, cada revenda adicionava cerca de 300–400 yuans por unidade·mês; após 2–3 repasses, o preço cotado podia ser elevado para 8.500 yuans. No entanto, a âncora de preço era pública e transparente, e o lucro das etapas de ágio ficava com a cadeia de corretagem, deixando margem bruta limitada do lado do proprietário do ativo. Ao mesmo tempo, o mercado carecia de cotações unificadas padronizadas; os corretores respondiam por uma parcela elevada, e os verdadeiros proprietários de ativos tinham poder de barganha limitado nas negociações de preço.

Gráfico 2: Aluguel mensal do 4090 com oito GPUs — sob ancoragem de preços, divergência entre os ágios dos corretores e a margem bruta do proprietário do ativo

Lado dos Tokens — lógica de “varejo”, com receita vinculada ao uso. Os mecanismos de precificação por Tokens eram flexíveis: 60% de desconto a partir da meia-noite, descontos variando conforme a popularidade do modelo e reajuste mensal em linha com o mercado. Para o mesmo servidor, a receita de aluguel mensal era limitada, enquanto a cobrança por Tokens baseada em uso oferecia maior elasticidade de produção por GPU durante picos de demanda; descontos em períodos de vale fora de pico também podiam “aparar picos e preencher vales”, elevando a utilização em carga total.

Perspetiva da SMM: O preço do leasing, quando a oferta se tornou homogénea, passou a ser ancorado pelo mercado; as unidades de preço por Token eram a “saída efetiva de inferência”, com o poder de fixação de preços nas mãos dos próprios prestadores de serviço—isto representou uma mudança na lógica de negócio, de vender recursos para vender resultados, e a estrutura de margem bruta foi reconstruída em conformidade.


III. Catalisador de Preço: Aumento Oficial do Preço da API Implementado, Ampliando a Janela de Arbitragem via Canais de Trânsito

A DeepSeek implementou oficialmente uma nova ronda de ajustes de preços da API a partir de 17 de agosto, com os modelos principais a subirem 3–5x e alguns itens a atingirem 10x; o preço de saída da versão Pro subiu de 6 yuans por milhão de tokens para 27 yuans. Do lado dos canais, a SMM apurou que alguns operadores interpretaram a medida como um regresso ao nível de preços original antes das anteriores promoções de vendas com desconto de cerca de 2,5x, e não como um aumento de preços totalmente novo.

Após a implementação do aumento, o diferencial entre os preços oficiais de tabela e o preço de compra de 50–60% via canais de trânsito alargou-se, deixando um espaço de arbitragem maior para modelos de trânsito de Tokens e de agência—isto também explica por que o sistema de descontos de Tokens tem sido repetidamente mencionado nas comunicações dos canais desde meados de agosto:os prestadores de serviço estavam a fazer contas a sério sobre isto.

Gráfico-3: Preço de Saída do DeepSeek Pro—O Aumento Oficial do Preço Amplia a Janela de Arbitragem via Canais de Trânsito

Informações públicas mostraram que, desde 2026, os preços de API para modelos de alta capacidade registaram uma subida faseada:o preço da API da Zhipu no 1.º trimestre aumentou 83%, enquanto o volume de chamadas ainda cresceu 400%; na série Hunyuan da Tencent Cloud, os preços de alguns modelos subiram mais de 4x. A precificação por Token estava a mudar de uma lógica única de corte de preços para uma precificação por níveis: Tokens de gama baixa aproximavam-se da comoditização e competiam por preço, enquanto Tokens de gama alta aumentavam preços apoiados em capacidades escassas; prestadores de serviço com capacidades de revenda e integração beneficiaram significativamente.

Perspetiva da SMM: A intenção original do aumento oficial de preços era reparar a sua própria economia unitária, mas, objetivamente, elevou o dividendo do diferencial de preços para canais intermediários—cada vez que o OEM ajustava preços, criava uma oportunidade para distribuidores de canais de Tokens reajustarem preços.


IV. Lado da demanda: as chamadas médias diárias de Tokens aumentaram mais de 1.000x em dois anos; os clientes queriam APIs, não máquinas

Dados do setor reforçaram essa mudança.Dados da Administração Nacional de Dados mostraram que a média diária de chamadas de Tokens na China aumentou de cerca de 100 bilhões no início de 2024 para mais de 140 trilhões em março de 2026, um aumento de mais de 1.000x em dois anos. Na conferência WAIC 2026 deste ano, “fábrica de Tokens” tornou-se a palavra-chave mais em alta, e o foco do setor se estendeu do treinamento centralizado para a inferência em escala.

Gráfico 4: Média diária de chamadas de Tokens na China: saltando do patamar de 100 bilhões para o patamar de 100 trilhões

O acompanhamento do lado da oferta foi igualmente intenso:

  • as três principais operadoras de telecomunicações lançaram pacotes de Tokens, vendendo Tokens na forma de franquias de dados; em maio, a Shanghai Telecom tornou-se a primeira operadora local a lançar um pacote tarifário de Tokens, com 1 yuan correspondendo a uma franquia de 250.000 pontos de cota, e APIs padrão permitindo chamadas a mais de 30 grandes modelos mainstream
  • Depois que uma empresa de poder computacional listada atualizou seu modelo de entrega de locação de poder computacional para cobrança com base no uso real de Tokens, sua receita do 1º semestre aumentou 497% a/a, o lucro líquido aumentou 540% a/a, e ela reverteu prejuízos e passou a lucrar
  • Alguns centros de computação inteligente adotaram uma estrutura operacional de “metade atacado com locação integral, metade varejo de Tokens”, com mais de 2.000 usuários no lado de varejo de Tokens
  • Fora da China, também surgiuum modelo de infraestrutura de inferência de agendamento automatizado de GPUs ociosas mais compartilhamento de receita de Tokens, com a monetização de poder computacional ocioso tornando-se um novo ponto de entrada para a economia de Tokens

Visão da SMM: A estrutura do lado da demanda mudou — clientes de PMEs e consumidores não se importavam com GPUs e não queriam bare metal; queriam apenas uma chave de API.Os provedores de serviços de locação ficaram no meio do caminho: não conseguiam garantir, a montante, oferta de GPUs a baixo preço, enquanto, a jusante, os clientes já não precisavam de “uma máquina inteira”. Tokens foram a solução para esse descompasso estrutural.


V. Observações de fronteira: a locação de GPUs de alto desempenho permaneceu resiliente, e a mudança se concentrou em três tipos de participantes

Cabe notar que “migrar da locação para Tokens” não foi um fenômeno de todo o setor. A contraprova que a SMM apurou foi igualmente clara: modelos de placas de alto desempenho, como a H200, continuaram com oferta muito restrita para locação—incluindo casos em que fornecedores violaram contratos durante o período de locação e revenderam a capacidade (com apenas uma semana de aviso prévio), um cluster de 128 placas locado como um todo a 116.000 yuans por placa-mês, sem divisão em pedidos menores, e um centro de computação inteligente em Lingang onde 2.000 placas domésticas Muxi C500 foram totalmente subcontratadas por duas empresas, que “ainda achavam que não era suficiente”.

Os que de fato fizeram uma virada completa se enquadraram em três categorias: IDCs de pequeno e médio porte e provedores de serviços de nuvem de computação inteligente sem vantagem no fornecimento de placas, players de canal que começaram como agentes de intermediação e provedores líderes de nuvem que, desde o início, nunca dependeram de placas locadas. Quanto menos restritas eram as placas de um provedor, mais completa foi a virada; já os proprietários diante de escassez extrema ainda usavam contratos de longo prazo para travar aluguéis escassos.


VI. Conclusões e Perspectivas: A mudança na unidade de cobrança é um reparo de margem bruta, não uma substituição de modelo

A SMM acredita: nesta rodada, a migração dos provedores de serviços para Token é uma ressonância de forças de empurrão e tração — do lado do empurrão, a ancoragem de preços no fim da locação e a compressão das margens brutas dos proprietários de placas devido a markups de intermediários; do lado da tração, o crescimento exponencial da demanda por inferência, aumentos oficiais de preços ampliando o spread entre preço de intermediação e preço oficial, e maior elasticidade de receita sob cobrança por uso; somado ao fato de que clientes de Token enfrentam altos custos de troca após a conexão via API e têm uma fidelização significativamente mais forte do que clientes de locação, que podem sair a qualquer momento, fica clara a lógica de negócios da mudança de “vender recursos” para “vender output”. Para o mesmo lote de servidores, no atacado cobra-se aluguel mensalmente, enquanto no varejo cobra-se por Token — o contrato não mudou; o que mudou foi a unidade de medida: um lado diz que as margens brutas da locação chegaram ao fundo, enquanto o outro diz que a demanda por inferência está disparando.

Perspectivas:

Curto prazo (3–6 meses): espera-se que o efeito do aumento de preços da DeepSeek se intensifique; espera-se que o dividendo do spread entre preço oficial e preço de intermediação continue; espera-se que a expansão de modelos de intermediação e agência de Token acelere; e espera-se que provedores de pequeno e médio porte continuem lançando plataformas Token em rápida sucessão.

Médio prazo (6–12 meses): espera-se que o preço escalonado por Token se aprofunde; a comoditização de Tokens de baixo nível deve intensificar uma reorganização dos canais; se os fabricantes originais retomarem promoções e descontos de vendas em larga escala, o espaço para arbitragem de intermediação será comprimido, testando a capacidade de retenção de clientes e de agregação de valor dos prestadores de serviços.

Longo prazo (mais de 1 ano): a variável central está na oferta de placas de alto desempenho — se a oferta de placas NVIDIA continuar restrita e o leasing de placas de alto desempenho permanecer um mercado de vendedores, a estrutura de dupla via de “cobrar aluguel de placas com oferta apertada + vender Token em placas sem oferta apertada” seguirá em paralelo no longo prazo


Fontes de dados

  1. Administração Nacional de Dados — dados do volume médio diário de invocações de Token na China (cerca de 100 bilhões de vezes no início de 2024 → ultrapassando 14 trilhões de vezes em março de 2026)
  2. People’s Daily Online (2026-07-31), “A indústria está impulsionando os serviços de poder computacional para a ‘Era do Token’” — “Token Factory” da WAIC 2026 e dados de relatórios semestrais sobre faturamento baseado em Token de empresas listadas de poder computacional
  3. Relatório de pesquisa da Guojin Securities (2026-06) — pacotes tarifários de Token da Shanghai Telecom, pacotes de Token das três principais operadoras e um modelo de compartilhamento de receita de Token de GPU ociosa
  4. Informações públicas de mercado — ajuste de preços de API e volume de chamadas da Zhipu no 1º tri de 2026 e ajustes de preços da série Hunyuan da Tencent Cloud

Informações obtidas pela SMM:

  1. Comunicação rotineira com um provedor de serviços IDC no leste da China — promovendo principalmente Token, com leasing de poder computacional como complemento; estrutura de descontos de Token (60% de desconto à noite, flutuação por modelo e 46–80% de desconto para provedores de nuvem)
  2. Comunicação rotineira com um provedor de nuvem de computação inteligente — modelo de intermediação de Token comprando a 50–60% do preço do fabricante original e uma pequena mistura de clientes B/C-end
  3. Comunicação rotineira com uma operadora — modelo de implantação privada de Token, contas-chave a 85–80% do preço de tabela, e o aumento de preço do DeepSeek sendo essencialmente uma restauração do preço original anterior ao desconto de 2,5
  4. Comunicação de canal com um provedor de serviços de poder computacional — “o foco está na direção do modelo Token”
  5. Feedback de canal — o foco de um provedor líder de nuvem está em Token; a âncora de transação da 4090 em 7.200 yuans por placa-mês, com intermediários adicionando 300–400 yuans por lote; e o Muxi C500 de Lingang, com 2.000 placas, totalmente subcontratado
 

Declaração sobre a Fonte de Dados: Com exceção das informações publicamente disponíveis, todos os demais dados são processados pela SMM com base em informações publicamente disponíveis, comunicação de mercado e com base no modelo de base de dados interna da SMM. São apenas para referência e não constituem recomendações para a tomada de decisão.

Para quaisquer perguntas ou para obter mais informações, entre em contato: lemonzhao@smm.cn
Para mais informações sobre como aceder aos nossos relatórios de investigação, entre em contato:service.en@smm.cn
Notícias Relacionadas
[Expresso de Poder de Computação SMM] 128 unidades de futuros 5090 entregues em lotes; locador avalia um acordo de longo prazo de cinco anos
há 1 hora
[Expresso de Poder de Computação SMM] 128 unidades de futuros 5090 entregues em lotes; locador avalia um acordo de longo prazo de cinco anos
Leia mais
[Expresso de Poder de Computação SMM] 128 unidades de futuros 5090 entregues em lotes; locador avalia um acordo de longo prazo de cinco anos
[Expresso de Poder de Computação SMM] 128 unidades de futuros 5090 entregues em lotes; locador avalia um acordo de longo prazo de cinco anos
A SMM soube que uma operadora no leste da China vem recebendo entregas, em lotes, de 128 unidades de futuros de RTX 5090. Desde o fim de junho, a SMM acompanha o status das entregas; até o momento, o cumprimento do contrato tem sido normal, com mais de 40 unidades entregues. O preço esperado para um contrato de locação de três anos é de 13.000 yuans por unidade por mês. O locador também está explorando um modelo de acordo de longo prazo de cinco anos. A SMM acredita que o desempenho estável dos futuros de locação de 5090, juntamente com a exploração de acordos de longo prazo de cinco anos, indica que os fornecedores estão promovendo a evolução da locação de poder computacional rumo à quase comoditização e a travas de prazo mais longas.
há 1 hora
[Expresso de Poder de Computação SMM] 64 servidores H100 com oito GPUs no Norte da China disponíveis para locação, aluguel mensal de 75.000, prazo fechado de quatro anos
há 3 horas
[Expresso de Poder de Computação SMM] 64 servidores H100 com oito GPUs no Norte da China disponíveis para locação, aluguel mensal de 75.000, prazo fechado de quatro anos
Leia mais
[Expresso de Poder de Computação SMM] 64 servidores H100 com oito GPUs no Norte da China disponíveis para locação, aluguel mensal de 75.000, prazo fechado de quatro anos
[Expresso de Poder de Computação SMM] 64 servidores H100 com oito GPUs no Norte da China disponíveis para locação, aluguel mensal de 75.000, prazo fechado de quatro anos
A SMM soube que 64 servidores H100 de oito GPUs foram disponibilizados no Norte da China, com aluguel mensal de 75.000 yuans por unidade (prazo fixo de quatro anos) e 76.000 yuans por unidade (prazo fixo de cinco anos). Cada servidor foi configurado com 8× GPUs H100 80G, uma CPU Intel 8468, 2 TB de memória DDR5 e uma placa de rede 400G. As placas de computação foram interconectadas em alta velocidade por meio de um switch IB. A SMM avaliou que a entrada no mercado de clusters H100 de alta especificação sob prazo fixo de quatro anos refletiu que a demanda por treinamento de ponta está cada vez mais se concentrando em travamento de preços de longo prazo
há 3 horas
[SMM Hashrate Express] A sublocação de aluguéis de hashrate é generalizada; novos participantes migram para recursos existentes
há 19 horas
[SMM Hashrate Express] A sublocação de aluguéis de hashrate é generalizada; novos participantes migram para recursos existentes
Leia mais
[SMM Hashrate Express] A sublocação de aluguéis de hashrate é generalizada; novos participantes migram para recursos existentes
[SMM Hashrate Express] A sublocação de aluguéis de hashrate é generalizada; novos participantes migram para recursos existentes
A SMM soube que o modelo de sublocação de servidores continuou a prevalecer no mercado. Os preços de aquisição de servidores GPU da NVIDIA oscilaram em níveis elevados e careceram de uma referência de preço, com o preço de aquisição de placas 5090 com ventoinha aproximando-se de 40.000 yuans por unidade. Muitos novos participantes no setor de locação de poder computacional passaram a integrar recursos existentes, em vez de comprar hardware adicional. A SMM considerou que a ausência de uma referência para os preços de aquisição estava a forçar o lado da oferta a ativar a capacidade existente por meio da sublocação e que o setor entrou numa fase de competição por recursos existentes.
há 19 horas
[Análise SMM] Provedores de poder computacional migram de locação para tokens em meio à compressão das margens e à demanda crescente - Shanghai Metals Market (SMM)