Desde julho de 2026, vários provedores de serviços de poder computacional contatados pela SMM vêm transferindo seu centro operacional do aluguel de bare metal para serviços de cobrança baseados em Tokens, com alguns afirmando de forma direta que “o aluguel de poder computacional é secundário”.De um lado, os preços de aluguel foram nivelados por pontos de referência publicamente visíveis, e as camadas de margens de intermediários corroeram as margens brutas dos remetentes; de outro, o volume médio diário de chamadas de Tokens cresceu mais de 1.000x em dois anos, e os aumentos oficiais de preços de API ampliaram o espaço de arbitragem para trânsito/revenda—por trás da migração da unidade de cobrança de “vender horas de placa” para “vender Tokens” está a dupla realidade de as margens brutas do aluguel terem chegado ao fundo e de uma disparada na demanda por inferência.
I. Fenômeno: vários provedores dizem que “o aluguel é secundário”, e Tokens se tornaram o foco principal
Segundo a SMM, desde julho, provedores de serviços de poder computacional contatados por múltiplos canais reduziram proativamente o matchmaking de aluguel e migraram para negócios de Tokens, com a mudança se intensificando mês a mês:
Um provedor de serviços de IDC no leste da China(três data centers próprios): declarou explicitamente que, no momento, estápromovendo principalmente Tokens, com o aluguel de poder computacional como secundário; lançou sua própria plataforma de Tokens e divulgou uma estrutura completa de descontos — 40% do preço de tabela a partir da meia-noite durante a noite, descontos diferentes para modelos diferentes e “quanto mais popular o modelo, menor o desconto”; a faixa de desconto de Tokens dos provedores de nuvem fica em torno de 46%–80% do preço de tabela.
Um provedor de serviços de poder computacional: ao receber informações de matchmaking de fornecimento de placas, respondeu diretamente que seu “foco está na direção do modelo de Tokens” e que não realiza mais matchmaking de aluguel.
Um provedor de serviços de nuvem de computação inteligente: seu negócio de Tokens adota um modelo de agência de trânsito, comprando a50%–60%dos preços cotados pelo produtor original e revendendo; seus clientes atuais são principalmente usuários de pequenas empresas (B) e do consumidor final (C), e o negócio está apenas começando.
Uma operadora: lançou um modelo de implantação privada de Tokens, fornecendo a clientes-chave linhas dedicadas seguras conectadas diretamente aos data centers; os descontos para clientes-chave são de 8,5%–80% do preço de tabela, com ajustes de preço cerca de uma vez por mês.
Um produtor líder de nuvem: o feedback do canal indicou que seu foco já migrou para Tokens e que ele “não tem tanto interesse” no negócio de locação de placas.
A impressão direta da SMM, a partir de comunicações rotineiras, foi que muitos provedores de serviço já não estão realmente fazendo locação e estão migrando para Tokens.O mercado chegou a ver parceiros mirando “compartilhamento de receita de Tokens” — trazendo clientes e recursos de modelos para buscar poder computacional ocioso, com ponto de partida de cooperação de 200 milhões de TPM (chamadas de Token por minuto), e afirmando explicitamente que “cooperação baseada em um modelo de aluguel mensal não funciona”.
Gráfico 1: Panorama da estrutura de descontos de Tokens: preços em camadas, de 40% do preço de tabela à noite a descontos de 8,5% oferecidos por operadores

II. Lado da oferta: as margens brutas da locação foram achatadas pela ancoragem de preços, enquanto a precificação por Tokens oferece maior autonomia
A principal força que impulsionou a mudança foi a compressão contínua das margens de lucro no lado da locação.
Lado da locação — lógica de “atacado”, com receita mensal limitada. Tomando como exemplo um servidor 4090 com oito GPUs, a âncora atual de transação no mercado era de cerca de 7.200 yuans por unidade·mês. Na corretagem primária, cada revenda adicionava cerca de 300–400 yuans por unidade·mês; após 2–3 repasses, o preço cotado podia ser elevado para 8.500 yuans. No entanto, a âncora de preço era pública e transparente, e o lucro das etapas de ágio ficava com a cadeia de corretagem, deixando margem bruta limitada do lado do proprietário do ativo. Ao mesmo tempo, o mercado carecia de cotações unificadas padronizadas; os corretores respondiam por uma parcela elevada, e os verdadeiros proprietários de ativos tinham poder de barganha limitado nas negociações de preço.
Gráfico 2: Aluguel mensal do 4090 com oito GPUs — sob ancoragem de preços, divergência entre os ágios dos corretores e a margem bruta do proprietário do ativo

Lado dos Tokens — lógica de “varejo”, com receita vinculada ao uso. Os mecanismos de precificação por Tokens eram flexíveis: 60% de desconto a partir da meia-noite, descontos variando conforme a popularidade do modelo e reajuste mensal em linha com o mercado. Para o mesmo servidor, a receita de aluguel mensal era limitada, enquanto a cobrança por Tokens baseada em uso oferecia maior elasticidade de produção por GPU durante picos de demanda; descontos em períodos de vale fora de pico também podiam “aparar picos e preencher vales”, elevando a utilização em carga total.
Perspetiva da SMM: O preço do leasing, quando a oferta se tornou homogénea, passou a ser ancorado pelo mercado; as unidades de preço por Token eram a “saída efetiva de inferência”, com o poder de fixação de preços nas mãos dos próprios prestadores de serviço—isto representou uma mudança na lógica de negócio, de vender recursos para vender resultados, e a estrutura de margem bruta foi reconstruída em conformidade.
III. Catalisador de Preço: Aumento Oficial do Preço da API Implementado, Ampliando a Janela de Arbitragem via Canais de Trânsito
A DeepSeek implementou oficialmente uma nova ronda de ajustes de preços da API a partir de 17 de agosto, com os modelos principais a subirem 3–5x e alguns itens a atingirem 10x; o preço de saída da versão Pro subiu de 6 yuans por milhão de tokens para 27 yuans. Do lado dos canais, a SMM apurou que alguns operadores interpretaram a medida como um regresso ao nível de preços original antes das anteriores promoções de vendas com desconto de cerca de 2,5x, e não como um aumento de preços totalmente novo.
Após a implementação do aumento, o diferencial entre os preços oficiais de tabela e o preço de compra de 50–60% via canais de trânsito alargou-se, deixando um espaço de arbitragem maior para modelos de trânsito de Tokens e de agência—isto também explica por que o sistema de descontos de Tokens tem sido repetidamente mencionado nas comunicações dos canais desde meados de agosto:os prestadores de serviço estavam a fazer contas a sério sobre isto.
Gráfico-3: Preço de Saída do DeepSeek Pro—O Aumento Oficial do Preço Amplia a Janela de Arbitragem via Canais de Trânsito

Informações públicas mostraram que, desde 2026, os preços de API para modelos de alta capacidade registaram uma subida faseada:o preço da API da Zhipu no 1.º trimestre aumentou 83%, enquanto o volume de chamadas ainda cresceu 400%; na série Hunyuan da Tencent Cloud, os preços de alguns modelos subiram mais de 4x. A precificação por Token estava a mudar de uma lógica única de corte de preços para uma precificação por níveis: Tokens de gama baixa aproximavam-se da comoditização e competiam por preço, enquanto Tokens de gama alta aumentavam preços apoiados em capacidades escassas; prestadores de serviço com capacidades de revenda e integração beneficiaram significativamente.
Perspetiva da SMM: A intenção original do aumento oficial de preços era reparar a sua própria economia unitária, mas, objetivamente, elevou o dividendo do diferencial de preços para canais intermediários—cada vez que o OEM ajustava preços, criava uma oportunidade para distribuidores de canais de Tokens reajustarem preços.
IV. Lado da demanda: as chamadas médias diárias de Tokens aumentaram mais de 1.000x em dois anos; os clientes queriam APIs, não máquinas
Dados do setor reforçaram essa mudança.Dados da Administração Nacional de Dados mostraram que a média diária de chamadas de Tokens na China aumentou de cerca de 100 bilhões no início de 2024 para mais de 140 trilhões em março de 2026, um aumento de mais de 1.000x em dois anos. Na conferência WAIC 2026 deste ano, “fábrica de Tokens” tornou-se a palavra-chave mais em alta, e o foco do setor se estendeu do treinamento centralizado para a inferência em escala.
Gráfico 4: Média diária de chamadas de Tokens na China: saltando do patamar de 100 bilhões para o patamar de 100 trilhões

O acompanhamento do lado da oferta foi igualmente intenso:
- as três principais operadoras de telecomunicações lançaram pacotes de Tokens, vendendo Tokens na forma de franquias de dados; em maio, a Shanghai Telecom tornou-se a primeira operadora local a lançar um pacote tarifário de Tokens, com 1 yuan correspondendo a uma franquia de 250.000 pontos de cota, e APIs padrão permitindo chamadas a mais de 30 grandes modelos mainstream
- Depois que uma empresa de poder computacional listada atualizou seu modelo de entrega de locação de poder computacional para cobrança com base no uso real de Tokens, sua receita do 1º semestre aumentou 497% a/a, o lucro líquido aumentou 540% a/a, e ela reverteu prejuízos e passou a lucrar
- Alguns centros de computação inteligente adotaram uma estrutura operacional de “metade atacado com locação integral, metade varejo de Tokens”, com mais de 2.000 usuários no lado de varejo de Tokens
- Fora da China, também surgiuum modelo de infraestrutura de inferência de agendamento automatizado de GPUs ociosas mais compartilhamento de receita de Tokens, com a monetização de poder computacional ocioso tornando-se um novo ponto de entrada para a economia de Tokens
Visão da SMM: A estrutura do lado da demanda mudou — clientes de PMEs e consumidores não se importavam com GPUs e não queriam bare metal; queriam apenas uma chave de API.Os provedores de serviços de locação ficaram no meio do caminho: não conseguiam garantir, a montante, oferta de GPUs a baixo preço, enquanto, a jusante, os clientes já não precisavam de “uma máquina inteira”. Tokens foram a solução para esse descompasso estrutural.
V. Observações de fronteira: a locação de GPUs de alto desempenho permaneceu resiliente, e a mudança se concentrou em três tipos de participantes
Cabe notar que “migrar da locação para Tokens” não foi um fenômeno de todo o setor. A contraprova que a SMM apurou foi igualmente clara: modelos de placas de alto desempenho, como a H200, continuaram com oferta muito restrita para locação—incluindo casos em que fornecedores violaram contratos durante o período de locação e revenderam a capacidade (com apenas uma semana de aviso prévio), um cluster de 128 placas locado como um todo a 116.000 yuans por placa-mês, sem divisão em pedidos menores, e um centro de computação inteligente em Lingang onde 2.000 placas domésticas Muxi C500 foram totalmente subcontratadas por duas empresas, que “ainda achavam que não era suficiente”.
Os que de fato fizeram uma virada completa se enquadraram em três categorias: IDCs de pequeno e médio porte e provedores de serviços de nuvem de computação inteligente sem vantagem no fornecimento de placas, players de canal que começaram como agentes de intermediação e provedores líderes de nuvem que, desde o início, nunca dependeram de placas locadas. Quanto menos restritas eram as placas de um provedor, mais completa foi a virada; já os proprietários diante de escassez extrema ainda usavam contratos de longo prazo para travar aluguéis escassos.
VI. Conclusões e Perspectivas: A mudança na unidade de cobrança é um reparo de margem bruta, não uma substituição de modelo
A SMM acredita: nesta rodada, a migração dos provedores de serviços para Token é uma ressonância de forças de empurrão e tração — do lado do empurrão, a ancoragem de preços no fim da locação e a compressão das margens brutas dos proprietários de placas devido a markups de intermediários; do lado da tração, o crescimento exponencial da demanda por inferência, aumentos oficiais de preços ampliando o spread entre preço de intermediação e preço oficial, e maior elasticidade de receita sob cobrança por uso; somado ao fato de que clientes de Token enfrentam altos custos de troca após a conexão via API e têm uma fidelização significativamente mais forte do que clientes de locação, que podem sair a qualquer momento, fica clara a lógica de negócios da mudança de “vender recursos” para “vender output”. Para o mesmo lote de servidores, no atacado cobra-se aluguel mensalmente, enquanto no varejo cobra-se por Token — o contrato não mudou; o que mudou foi a unidade de medida: um lado diz que as margens brutas da locação chegaram ao fundo, enquanto o outro diz que a demanda por inferência está disparando.
Perspectivas:
Curto prazo (3–6 meses): espera-se que o efeito do aumento de preços da DeepSeek se intensifique; espera-se que o dividendo do spread entre preço oficial e preço de intermediação continue; espera-se que a expansão de modelos de intermediação e agência de Token acelere; e espera-se que provedores de pequeno e médio porte continuem lançando plataformas Token em rápida sucessão.
Médio prazo (6–12 meses): espera-se que o preço escalonado por Token se aprofunde; a comoditização de Tokens de baixo nível deve intensificar uma reorganização dos canais; se os fabricantes originais retomarem promoções e descontos de vendas em larga escala, o espaço para arbitragem de intermediação será comprimido, testando a capacidade de retenção de clientes e de agregação de valor dos prestadores de serviços.
Longo prazo (mais de 1 ano): a variável central está na oferta de placas de alto desempenho — se a oferta de placas NVIDIA continuar restrita e o leasing de placas de alto desempenho permanecer um mercado de vendedores, a estrutura de dupla via de “cobrar aluguel de placas com oferta apertada + vender Token em placas sem oferta apertada” seguirá em paralelo no longo prazo
Fontes de dados
- Administração Nacional de Dados — dados do volume médio diário de invocações de Token na China (cerca de 100 bilhões de vezes no início de 2024 → ultrapassando 14 trilhões de vezes em março de 2026)
- People’s Daily Online (2026-07-31), “A indústria está impulsionando os serviços de poder computacional para a ‘Era do Token’” — “Token Factory” da WAIC 2026 e dados de relatórios semestrais sobre faturamento baseado em Token de empresas listadas de poder computacional
- Relatório de pesquisa da Guojin Securities (2026-06) — pacotes tarifários de Token da Shanghai Telecom, pacotes de Token das três principais operadoras e um modelo de compartilhamento de receita de Token de GPU ociosa
- Informações públicas de mercado — ajuste de preços de API e volume de chamadas da Zhipu no 1º tri de 2026 e ajustes de preços da série Hunyuan da Tencent Cloud
Informações obtidas pela SMM:
- Comunicação rotineira com um provedor de serviços IDC no leste da China — promovendo principalmente Token, com leasing de poder computacional como complemento; estrutura de descontos de Token (60% de desconto à noite, flutuação por modelo e 46–80% de desconto para provedores de nuvem)
- Comunicação rotineira com um provedor de nuvem de computação inteligente — modelo de intermediação de Token comprando a 50–60% do preço do fabricante original e uma pequena mistura de clientes B/C-end
- Comunicação rotineira com uma operadora — modelo de implantação privada de Token, contas-chave a 85–80% do preço de tabela, e o aumento de preço do DeepSeek sendo essencialmente uma restauração do preço original anterior ao desconto de 2,5
- Comunicação de canal com um provedor de serviços de poder computacional — “o foco está na direção do modelo Token”
- Feedback de canal — o foco de um provedor líder de nuvem está em Token; a âncora de transação da 4090 em 7.200 yuans por placa-mês, com intermediários adicionando 300–400 yuans por lote; e o Muxi C500 de Lingang, com 2.000 placas, totalmente subcontratado
![[Expresso de Poder de Computação SMM] 128 unidades de futuros 5090 entregues em lotes; locador avalia um acordo de longo prazo de cinco anos](https://imgqn.smm.cn/usercenter/JYbQQ20251217171736.jpg)
![[Expresso de Poder de Computação SMM] 64 servidores H100 com oito GPUs no Norte da China disponíveis para locação, aluguel mensal de 75.000, prazo fechado de quatro anos](https://imgqn.smm.cn/usercenter/gpWpd20251217171734.jpeg)
![[SMM Hashrate Express] A sublocação de aluguéis de hashrate é generalizada; novos participantes migram para recursos existentes](https://imgqn.smm.cn/usercenter/obeMy20251217171735.jpg)
