Token mata aplicativos de IA

By: rootdata|2026/07/30 23:58:00
0
Compartilhar
copy
Avalie no GoogleAvalie no Google

Autor: Li Nan, Huang Xiaoyi, Yoky, Sun Rui, Silicon Star

Editor | Wang Zhaoyang

Em meados de 2026, a startup de geração de vídeos AI OiiOii tinha um saldo de caixa de nove dígitos em RMB, mas ainda assim iniciou uma nova rodada de financiamento.

Anteriormente, ela assinou um acordo de quadro anual com a plataforma de serviços em nuvem Volcano Engine, pertencente ao ByteDance: OiiOii deve pagar 50 milhões de RMB ao Volcano Engine até o final de 2026.

Isso deixou o caixa da OiiOii um pouco apertado. E os 50 milhões de RMB seriam usados para comprar a versão "pura" da API do modelo de geração de vídeo multimodal Seedance 2.0, o produto de IA mais bem-sucedido do ByteDance.

A chamada "versão pura" refere-se à API Seedance fornecida pelo canal oficial do Volcano Engine, que oferece permissões completas.

Após o impressionante desempenho do Seedance 2.0 na indústria de IA e em todo o setor de produção cinematográfica, o mercado ficou saturado com APIs Seedance de origens complexas, com alguns prestadores de serviços intermediários desconhecidos misturando e vendendo o Seedance 2.0 e suas versões de baixo custo - Seedance 2.0 mini e Seedance 2.0 fast - a preços relativamente baixos. Os usuários que desejam gerar um filme de qualidade acabam recebendo apenas um produto de baixa qualidade.

A API "pura" do Seedance 2.0 é a linha de vida dos aplicativos de geração de vídeos AI. Assim como os grandes modelos de linguagem dependem de GPUs de alto desempenho da Nvidia, a API dos modelos de ponta e os tokens gerados pela chamada da API também determinam fundamentalmente a capacidade básica dos aplicativos de IA - que geralmente são chamados de Agentes de IA.

Portanto, os tokens dos modelos de ponta tornaram-se uma moeda escassa e cara. E o Seedance 2.0 é, sem dúvida, o modelo de vídeo mais poderoso atualmente disponível no planeta.

De acordo com informações oficiais, o Seedance 2.0 gera vídeos em 720p sem entrada de vídeo a um custo de 46 RMB por milhão de tokens, com um custo de cerca de 0,99 RMB por segundo de vídeo. Em comparação, o custo do Ling3.0 para gerar vídeos em 720p é de 0,6 RMB, enquanto o Vidu Q3-pro custa cerca de 0,68 RMB, tornando o Seedance 2.0 significativamente mais caro.

A OiiOii, que se destaca na geração de séries e curtas, precisa do poderoso Seedance 2.0, mas gastar quase 40% do fluxo de caixa da empresa para comprar seus tokens parece um pouco insano.

Para as startups de aplicativos de IA de hoje, isso já é uma prática comum. Em comparação com as startups de grandes modelos de linguagem (incluindo OpenAI e Anthropic), que geralmente usam de 70% a 80% do montante de financiamento diretamente para comprar ou alugar GPUs e pagar por poder computacional em nuvem, isso não é nada.

O que a OiiOii está comprando não é a quantidade de tokens consumidos com base em uma necessidade real de negócios, mas sim o direito de lançamento da API do Seedance 2.0.

Poucas pessoas notaram que o dia em que a OiiOii encerrou os testes internos e foi oficialmente lançada, em 2 de abril de 2026, foi também o dia em que o Seedance 2.0 foi aberto para testes públicos para empresas. Isso parece mais como se o Volcano Engine estivesse anunciando que a OiiOii se tornaria uma das primeiras distribuidoras do Seedance 2.0, em vez de a OiiOii ter lançado seu próprio Agente de vídeo naquele dia.

Isso não é importante; o que realmente importa é fornecer antecipadamente a versão "pura" do Seedance 2.0.

A "versão pura" do Seedance 2.0 vem com um conjunto completo de direitos, como acesso ao banco de dados de rostos e número máximo de concorrência. Isso determina diretamente se o produto da startup pode funcionar sem problemas.

Se um aplicativo de geração de vídeos AI é voltado para o consumidor final, os usuários precisam gerar vídeos em tempo real, o que requer um número suficiente de concorrências. E quando o modelo é lançado, a capacidade computacional é limitada; se não puder obter suporte de concorrência do Volcano Engine, os usuários do Agente terão que esperar na fila, enfrentar atrasos ou até mesmo não conseguir gerar vídeos.

Um profissional de aplicativos de vídeo AI nos revelou: um quadro anual de 10 milhões de RMB do Seedance 2.0 corresponde a cerca de 400 concorrências, enquanto um quadro anual de 5 milhões de RMB corresponde a cerca de 200 concorrências. Onde está a diferença de preço, é onde a experiência do usuário também se deteriora.

Fonte da imagem: Volcano Ark

Os usuários podem acessar mais recursos de rostos armazenados, em vez de usar aquelas poucas "faces AI" que ficam cada vez mais assustadoras, seguindo os preços do quadro anual do Seedance. A diferença entre comprar ou não é a diferença entre a vida e a morte do produto; você parece não ter escolha.

"Taxa de perda bruta"

Com a capacidade dos modelos de ponta determinando o teto de capacidade dos aplicativos de IA, e com preços altos restringindo os aplicativos de IA, cobrar taxas de assinatura dos usuários com base no preço dos tokens se tornou um negócio de "subarrendador", uma equação matemática que nunca pode ser resolvida, uma função variável na tabela de preços de um modelo.

Ainda assim, o direito de lançamento do Seedance 2.0 que a OiiOii obteve não é exclusivo. Várias concorrentes da OiiOii, como LibTV e Flova, também conseguiram a qualificação de "lançamento inicial" do Seedance 2.0, quase ao mesmo tempo anunciando com destaque que seus produtos estavam integrados ao Seedance 2.0, com preços igualmente altos.

O Volcano Engine é assim tão generoso; ele não dará a nenhuma empresa o privilégio de um lançamento exclusivo do Seedance 2.0, nem mesmo para os contratos de maior valor. Além disso, a linha de preço do Volcano Engine é muito rígida: quase sem descontos, o consumo de tokens em contratos de milhões de RMB é baseado em um retorno de 10%, ou seja, no máximo 10% do valor do contrato em vouchers de capacidade.

Por outro lado, o Volcano proíbe estritamente a revenda, evitando que tokens de baixo preço entrem no mercado cinza.

Dentro desse mecanismo, um fato cruel se revela: ferramentas de vídeo AI quase não conseguem lucrar com tokens do Seedance 2.0 em sua forma completa.

Teoricamente, se os tokens do Seedance 2.0 fossem vendidos aos clientes pelo preço original, sem considerar os retornos, a margem de lucro bruta seria de no máximo 10%. Mas na realidade, nenhuma ferramenta de geração de vídeos AI venderá os tokens do Seedance 2.0 a um preço mais alto - nem mesmo pelo preço original. Afinal, teoricamente, qualquer um pode fazer negócios diretamente com o Volcano Engine. Se há intermediários lucrando com a diferença, por que não negociar diretamente?

De acordo com reportagens da "Inteligência Emergente": empresas de produção de séries e filmes também costumam comprar diretamente a API "completa" do Seedance 2.0, incluindo empresas líderes do setor, com a maior recarga sendo de 50 milhões. Isso demonstra claramente o desejo do mercado pelo Seedance 2.0 e significa que as startups de aplicativos de IA que obtêm os direitos máximos do Seedance 2.0, se não oferecerem preços competitivos para os tokens, não terão usuários.

"Produtos com características de ferramenta não têm lealdade." Um investidor de capital de risco nos disse.

Assim, uma "estratégia alternativa" surgiu: empresas de aplicativos de IA de ponta começaram a reduzir preços ativamente para atrair clientes, até mesmo começando a revender tokens.

A empresa-mãe da LibLib, a Evoken, é a maior compradora de tokens de aplicativos de IA na China. Ela começou na comunidade de modelos de código aberto e rapidamente se transformou em uma plataforma de criação multimodal. Ao mesmo tempo, ela fez várias rodadas de financiamento agressivas, recentemente completando uma rodada de financiamento de 300 milhões de dólares, com uma avaliação pós-investimento superior a 2 bilhões de dólares, formando uma barreira abrangente de capital e produtos - LibLib AI é uma comunidade de criação e uma plataforma de geração de imagens, enquanto Lovart e Xingliu atendem respectivamente os mercados de design no exterior e na China, e a LibTV se concentra na produção de vídeos profissionais...

No entanto, a Evoken não desenvolveu nenhum modelo por conta própria, nem mesmo um modelo de treinamento posterior. Isso leva a debates frequentes sobre se a empresa é apenas um intermediário de modelos de ponta, sem barreiras tecnológicas. Mas, sem dúvida, a Evoken é um grande cliente de tokens de modelos de ponta.

No que diz respeito a ferramentas de vídeo, a LibTV é um cliente de ponta do Seedance 2.0, assinando um grande contrato de 50 milhões de RMB para usar como munição para o LibTV Agent. E no que diz respeito a ferramentas de design, o Nano Banana fez sucesso no ano passado, e a Lovart, sob a LibLib, também assinou um contrato de pacote de milhões de dólares com o Google Cloud.

No entanto, de acordo com estimativas de plataformas de terceiros como Similarweb: em junho de 2026, o site da Lovart teve cerca de 3,1 milhões de visitas mensais, enquanto o site da LibTV teve cerca de 2,2 milhões de visitas mensais. Esse volume de tráfego já é considerável, mas visitas e criações não são equivalentes. As informações públicas indicam que a LibTV tem dezenas de milhares de usuários pagantes, embora já tenha superado a maioria de seus concorrentes, é praticamente certo que não conseguirá consumir todos os tokens do Seedance 2.0 que a empresa comprou a um custo elevado.

O Volcano Engine não aceita "devoluções" de tokens, o que gerou uma nova fonte de receita para as empresas de aplicativos de IA.

O fundador e CEO da Evoken, Chen Mian, mencionou em uma entrevista ao "Latepost" que a LibTV estava vendendo a chave da API do Seedance 2.0 para lucrar com a diferença, mas ele negou claramente.

O que soubemos é que a LibTV não "lucra" com a revenda da chave da API do Seedance 2.0, pois está vendendo a um preço de prejuízo.

Alguns concorrentes da LibTV, que trabalham com geração de vídeos AI, nos disseram que a LibLib tentou várias vezes vender a API do Seedance 2.0 para eles, a um preço mais barato do que ir diretamente ao Volcano Engine: ao comprar diretamente do Volcano, contratos acima de 10 milhões de RMB podem obter um retorno de 10% em vouchers de capacidade; mas a LibLib ainda pode oferecer um retorno adicional de 10% sobre isso.

É claro que não há diferença de preço, e muito menos lucro, mas isso gera receita. Isso pode aumentar a ARR (receita recorrente anual) da LibTV, fornecendo suporte numérico para narrativas de financiamento futuras.

Esses tipos de ARR são essencialmente receitas de "perda bruta": obtendo tokens a um preço de contrato com 10% de desconto, e depois vendendo a um preço ainda mais baixo para concorrentes que precisam de tokens a preços mais baixos, a estrutura é uma venda deficitária.

Isso gera não uma margem de lucro, mas uma "taxa de perda bruta".

Por outro lado, a estratégia de preços da LibTV e Lovart para usuários pagantes também faz com que a margem de lucro de uma empresa de aplicativos de IA pareça ilusória.

Podemos fazer uma conta rápida...

O preço médio mensal da assinatura contínua do LibTV Standard é de 47,4 yuan, e o site estima que pode gerar um vídeo Seedance 2.0 em 720P de 56 segundos, o que equivale a uma receita de aproximadamente 0,85 yuan por segundo para os membros. Supondo que o usuário utilize todo o crédito para o Seedance 2.0 sem entrada de vídeo e considerando o preço de mercado da Volcano Engine de cerca de 0,99 yuan/segundo, e apenas calculando o custo da chamada do modelo, a margem bruta marginal é de cerca de -17%. Mesmo que 10% dos vouchers de poder computacional possam ser totalmente resgatados, essa margem bruta marginal ainda seria de cerca de -5%. Além disso, isso ainda precisa cobrir descontos noturnos, créditos de abertura de conta e promoções temporárias.

A situação da Lovart é semelhante. Se todos os pontos forem usados para gerar imagens de qualidade média de 1K com o GPT Image 2, considerando os benefícios do pacote Pro mais popular e o preço promocional de 39 dólares da "Festa de Fim de Mês" e a precificação padrão da API da OpenAI, quando os usuários utilizam o máximo, a margem bruta marginal é de cerca de -87% (há alguns dias, o preço médio mensal após o desconto desse pacote ainda era de 45 dólares, correspondendo a uma margem bruta de cerca de -60%).

No entanto, tudo isso faz parte de um "teste de estresse". Na realidade, os usuários podem não utilizar todo o crédito e podem optar por modelos e soluções de geração com custos mais baixos, e a plataforma pode conseguir diferentes níveis de desconto ao adquirir APIs de diferentes modelos, reduzindo assim as perdas reais.

O CEO da Yanyu Technology, Chen Mian, também comentou sobre isso em uma entrevista ao "Latepost": se os usuários utilizarem todos os tokens do pacote, o LibTV certamente terá prejuízo. Mas se um usuário comprar 1 milhão de pontos e usar apenas 200 mil, os 800 mil restantes se tornam lucro. Também há usuários do mercado negro que fazem engenharia reversa nas contas de assinatura anual do LibTV para transformá-las em APIs, o que resulta em prejuízos, portanto, é necessário regular isso.

O que se chama de "engenharia reversa" tem um exemplo claro: em fevereiro de 2026, o operador do influente WeChat oficial "Web 3 Sky City" denunciou a aplicação de design visual Lovart, afirmando que pagou 540 dólares pela assinatura do Lovart Pro, mas 10 dias depois sua conta foi banida e ele não recebeu reembolso. O "senhor da cidade" não obteve resposta após apelar por e-mail e tentar se comunicar com membros da equipe da Lovart.

De acordo com o que sabemos, a conta do "senhor da cidade" foi considerada pela equipe de controle interno da Lovart como tendo realizado "engenharia reversa", e a empresa também implementou medidas de controle mais rigorosas. A decisão de não se comunicar mais com o "senhor da cidade" e de não reembolsá-lo foi tomada pelo próprio Chen Mian.

Esse incidente gerou uma grande controvérsia, levantando discussões sobre o mecanismo de pré-pagamento de softwares de aplicação de IA, a transparência dos padrões de banimento e a proteção dos direitos dos consumidores, evidenciando quão frágil é o modelo de negócios que espera que os usuários apenas paguem sem consumir os créditos de token; além disso, em um ambiente onde o preço do token é extremamente sensível, quantas brechas para arbitragem reversa existem.

Na verdade, quem realmente faz "engenharia reversa" e vende os tokens de assinatura não utilizados como APIs é a própria Lovart ou LibTV.

Porque os tokens que os usuários não consomem não se tornam realmente lucro; as empresas de aplicações de IA já pagaram por esses créditos aos fornecedores de modelos.

Eles estão incluídos no quadro anual. A lógica dos fornecedores de modelos fortes é: o que for usado pode ser comprado novamente, o que não for usado não será reembolsado. A chamada de 1 milhão de pontos usados 200 mil, os 800 mil restantes não se tornam lucro. Ou seja, os créditos de token "não utilizados" se tornam, na verdade, o "estoque" das empresas de aplicações de IA.

Uma vez que é estoque, deve ser liquidado, caso contrário, as perdas serão maiores. Isso explica por que outras equipes de geração de vídeo de IA recebem convites para comprar tokens da LibTV a preços com desconto. O combate da empresa ao "venda reversa" de tokens na verdade é uma disputa pela qualificação de revenda de tokens com os usuários.

Comparado às perdas causadas pela venda de "estoque" de tokens a preços com desconto, as perdas resultantes do uso total dos direitos pelos usuários são ainda maiores. Mesmo que a ideia de que "tokens não utilizados são lucro" possa ser válida, ela limita o teto do modelo de lucro — quando todos os usuários apenas recarregam, mas não consomem um único token, seu lucro teoricamente pode ser maximizado.

Cada token que o usuário consome o aproxima mais da perda. Isso cria uma perigosa seleção reversa: quanto mais baixo o preço, mais fácil atrair usuários pesados que consomem modelos caros, e esses usuários têm uma taxa de uso de pontos mais alta, deixando menos receita retida para a plataforma.

Esse ciclo pode levar a um aumento das perdas das empresas de aplicações de IA, e a única vantagem é ter um ARR mais atraente a curto prazo.

As empresas de aplicações de IA estão cientes disso, mas ao apresentar aos investidores, ainda conseguem esconder essas "armadilhas". Um investidor de VC nos revelou: a margem bruta que a LibLib apresenta aos investidores e ao mercado de capitais pode ser positiva.

Isso realmente testa as "habilidades financeiras": créditos de presente, promoções temporárias, descontos noturnos... todos esses custos rígidos que realmente consomem a margem bruta podem ser contabilizados como taxas de vendas, e a alta taxa de vendas inicial pode ser chamada de "investimento em crescimento"; toda a receita — incluindo a receita da compra de pontos de assinatura pelos usuários e a receita da revenda de tokens — pode ser contabilizada a preço cheio, tornando possível alcançar uma "margem bruta positiva" sob diferentes critérios.

Em nossas conversas com vários investidores e empreendedores, um consenso é: mesmo considerando a margem mais ampla, a faixa de margem bruta das aplicações de IA com modelo de negócios centrado no consumo e venda de tokens geralmente é de apenas 10%-25%, quase incapaz de cobrir todos os custos.

A maioria das equipes de startups de IA na China começou a expandir para o mercado externo desde o primeiro dia, mas pessoas informadas calcularam que o custo de aquisição de um usuário pagante no exterior é de cerca de 200 dólares, enquanto o usuário paga em média 50 dólares, e a margem bruta do token não cobre nem mesmo o crescimento do usuário, sem mencionar as despesas de pesquisa e desenvolvimento, operação e gestão.

Nos últimos anos, o mercado de capitais e o círculo de startups preferiram entender as aplicações de IA sob a estrutura de SaaS. Mas agora os investidores já estão despertos: "SaaS é mais barato quanto mais usuários, enquanto as aplicações de IA, quanto mais usuários, mais prejuízo você tem".

Isso destaca a diferença essencial entre aplicações de IA e software tradicional — o custo marginal do SaaS tradicional se dilui com a escala, enquanto o custo marginal das aplicações de IA reaparece com o aumento do uso. Quanto mais os usuários amam usar, mais tokens são necessários; quanto mais tokens, maior o custo.

Em um nível fundamental, as empresas de aplicações de IA operam uma "cadeia de giro de tokens que está continuamente perdendo dinheiro", que é a "taxa de perda bruta".

"Controlador de Tokens"

As startups de aplicações de IA também não estão cientes de que os tokens são um poço sem fundo e ainda assim continuam a entrar, elas também estão em meio ao caos.

A compra de tokens dos fornecedores de modelos tem um custo aparente, mas a precificação do produto, subsídios aos usuários e cálculos de margem bruta são todos guiados pelo sistema de liquidação posterior dos modelos. O que inicialmente parecia ser uma margem bruta, após a fatura ser emitida, se transforma em uma taxa de perda bruta.

Tomando o Seedance 2.0 como exemplo: o custo real de geração de um vídeo considera simultaneamente a duração do vídeo de entrada, a duração do vídeo de saída, a resolução de saída, a taxa de quadros, a versão do modelo, a duração mínima de cobrança e as faixas de duração. A API do modelo de vídeo pode cobrar uniformemente 4 segundos para vídeos de 1 a 4 segundos, e o aumento entre diferentes comprimentos muitas vezes não é linear. Após a assinatura, as empresas de aplicações de IA geram consumo diariamente, mas geralmente só conseguem ver os custos detalhados na fatura após T+N dias.

Isso cria um estado típico de "estar preso nos tokens": a empresa conhece o custo aparente dos tokens, mas não sabe como o custo real será amplificado, de que forma e em que momento.

No entanto, as equipes de startups de IA não conseguem escapar dessa dependência, mas acabam se aprofundando cada vez mais. Afinal, elas não podem viver sem os "benefícios" trazidos pelos modelos de ponta.

Se apresentássemos a origem dos custos das aplicações de IA em uma fórmula, seria: "Custo real de geração = Preço por geração × Número médio de tentativas". Isso se aplica a vídeos, imagens ou design de PPT.

Modelos de ponta têm uma alta taxa de sucesso na geração, o que reduz o número de tentativas, e às vezes isso pode até tornar o custo de cálculo subjacente mais baixo.

Como as equipes de aplicações de IA devem escolher entre modelos de ponta, que têm altos custos iniciais, bons resultados e poucas tentativas, e modelos sub-ótimos, que têm baixos custos iniciais, chamadas baratas, muitas tentativas, custos totais mais altos e podem sacrificar a retenção de conversão?

Fontes da indústria revelaram: para aumentar as vendas, os clientes da Keling 1.0 puderam obter um desconto mínimo de 65% por um longo período. Esse nível de desconto já é deficitário para os custos de raciocínio da Keling, e com a atualização do modelo Keling, os custos de raciocínio aumentam, esse preço é uma perda sobre perda. O único objetivo é roubar clientes.

E o resultado objetivo é: aqueles que tentam vender mais tokens para as empresas de aplicações a preços mais baixos ainda serão deixados de lado. Um exemplo que pode corroborar isso é: o Seedance 2.0 ainda tem um volume de solicitações diário estável acima de 3000, enquanto o Keling 3.0 tem apenas 300-400.

Portanto, para resolver a "taxa de perda bruta" inerente, as duas maneiras mais diretas são: aumentar o preço do produto ou reduzir o custo dos tokens. Atualmente, a maioria das startups de aplicações de IA optou pela segunda opção.

Na superfície, todos estão ativamente iterando produtos, atualizando funções e criando diferenciais, mas na verdade, uma grande parte da energia está sendo gasta em encontrar tokens mais baratos. E os tokens baratos vêm de várias fontes.

Primeiro, a venda a preços baixos das empresas de AI Agent "upstream" é um canal importante.

Como mencionado anteriormente, a LibLib vende tokens com 19% de desconto para equipes de aplicações de IA que são menores e não podem pagar pela versão completa do Seedance 2.0. Algumas startups acolhem esse "desconto", enquanto outras temem violar a política de vendas da Volcano Engine e hesitam em aceitar.

Em segundo lugar, colegas que estão se transformando de negócios também podem oferecer tokens a preços baixos.

Como mencionado anteriormente, as políticas anuais dos principais fornecedores de modelos são bastante rígidas, com limites mínimos de consumo, "sem prorrogação" — se não forem consumidos dentro de um ano, os créditos restantes de tokens são zerados. Essa é também a razão pela qual a revenda de tokens é frequentemente proibida pelos fornecedores de modelos, seja para limitar perdas, recuperar custos ou "gerar" margens brutas, as equipes de aplicações de IA precisam fazer isso.

Particularmente quando algumas empresas queimam dinheiro e falham em contar histórias, incapazes de continuar ou à beira da falência, os "enormes" créditos de tokens restantes podem ser vendidos a preços extremamente baixos.

Um detalhe interessante é: algumas empresas gastam mais de 10 milhões em compras de tokens, mas o principal objetivo não é fazer negócios, mas contar histórias: dizer ao mercado de capitais que se tornaram grandes clientes de fornecedores de modelos de ponta, demonstrando sua força e rapidamente levantando mais uma rodada de financiamento. Um investidor de VC nos disse que a compra de tokens em algumas equipes de startups já se tornou completamente "desconectada da realidade".

Além disso, buscar subsídios do governo é um canal comum e mais confiável para obter tokens a preços mais baixos.

Os governos locais de nível urbano oferecerão subsídios de poder computacional ou modelos para empresas de IA reconhecidas em suas áreas, permitindo que as empresas de aplicação reduzam o custo dos tokens para 75% a 90% do preço original. No entanto, esses recursos não são comuns, e para obter tokens a preços baixos, todos precisam "usar suas habilidades".

No fundo, todos estão tentando encontrar maneiras de conseguir tokens mais baratos. Essa busca pela maximização de tokens baratos inevitavelmente levará à proliferação de "estações de transferência".

Como uma indústria de IA subterrânea, a "estação de transferência" é essencialmente um atacado de tokens para varejo. Elas podem ser divididas em três categorias principais.

A primeira categoria é a revenda "regular", que compra em grande escala tokens de modelos estrangeiros, obtendo descontos e revendendo no mercado interno, o que ainda é considerado uma lógica de revendedor "normal".

A segunda categoria é a produção totalmente ilegal, geralmente operada por indivíduos, onde "um milhão de tokens por três reais" pode desaparecer a qualquer momento ou ser fechado.

A terceira categoria é a "poolização" de recursos. Essas estações de transferência operam reunindo limites de tokens de vários canais dispersos, criando uma camada de roteamento unificada.

As estações de transferência são uma das principais fontes de tokens baratos no mercado de aplicações de IA. No entanto, os preços desses recursos variam muito e a qualidade não é estável. No caso da geração de vídeos, o fenômeno de "diluição" é comum.

Uma estação de transferência que "fornece" para uma startup de IA nos disse: "Por exemplo, ao chamar a API da Keling, em 10 chamadas, 8 são da Keling e 2 são do modelo dessa empresa. Se a estação de transferência quiser ganhar mais, ajusta essa proporção".

As empresas de aplicação de IA estão cientes disso, mas algumas ainda "aceitam" tokens diluídos em seus produtos, o que reduz ainda mais a qualidade do serviço que os usuários finais recebem. Afinal, "não conseguir um bom resultado" é a norma, e mesmo que os usuários suspeitem que o que estão usando não é o que deveria ser, eles podem dar uma explicação.

Mesmo com todos esses canais, as empresas de aplicação de IA ainda estão tentando reduzir ainda mais os custos.

Para realmente reduzir legalmente os custos dos tokens e encontrar um espaço de lucro nas demonstrações financeiras, algumas startups inventaram outro caminho: projetar seus produtos como um controlador de tokens preciso — limitando a duração, criando pacotes em camadas, degradando modelos e ocultando parâmetros, para reduzir o impacto dos tokens sobre a margem de lucro.

Especificamente, algumas aplicações limitam diretamente a duração dos vídeos gerados pelos usuários, como gerar uniformemente vídeos de 4 segundos, evitando o desperdício de cobrar por 4 segundos quando o vídeo é de apenas 3 segundos.

A "armadilha de pacotes" é uma abordagem ainda mais astuta, onde algumas aplicações não oferecem o melhor modelo no pacote intermediário, nem abrem o modelo ideal para cenários de alto consumo, e ainda projetam pacotes que os usuários "não conseguem usar completamente", esperando que os usuários sejam inativos e usem menos, obtendo assim um espaço para arbitragem.

Eles usam fórmulas como "número de usuários do pacote de 199 reais × 2 bilhões de tokens reservados" para negociar preços de atacado com os fornecedores de modelos, obtendo preços de compra muito abaixo da demanda real de consumo. A parte que não é consumida é então revendida como "estação de transferência".

Um VC nos contou que, ao realizar a devida diligência em uma empresa, descobriu essas "irregularidades" e perguntou se seus usuários realmente poderiam consumir tantos tokens, enquanto o fundador apenas enfatizava o número de usuários que compraram aquele pacote, evitando falar sobre o volume real de consumo.

Os investidores não ficaram felizes com isso; um negócio onde a atividade do usuário e a margem de lucro são inversamente proporcionais não é um bom negócio.

As aplicações de IA "nascem para os tokens", gerando uma questão que abala as fundações das empresas: os produtos não são mais projetados apenas em torno da experiência do usuário, mas cada vez mais em torno de "como fazer os usuários consumirem menos tokens".

Claro, também existem métodos de redução de custos que levam em conta a experiência do usuário. Por exemplo, chamar primeiro um modelo de vídeo mais barato para gerar uma versão de baixa resolução e depois usar tecnologia de super-resolução para melhorar a clareza. Algumas ferramentas de IA também reduzem o número de chamadas usando palavras-chave, fluxos de trabalho, controle de parâmetros, pós-processamento, cache e roteamento de modelos, economizando assim tokens.

Entre elas, a OiiOii é uma das empresas que projetou o "controlador de tokens" de forma mais engenhosa.

A OiiOii chama os pontos comprados pelos usuários de "caixa de almoço". Ao contrário da LibTV, que uma vez adotou uma abordagem agressiva de preços, a principal estratégia da OiiOii (com várias imagens de referência, 10 segundos 140 caixas de almoço) resulta em um preço de 0,96 reais/segundo, somando a exportação em alta definição, o preço total fica em torno de 0,99 reais/segundo, basicamente equivalente ao preço de venda do token da Seedance 2.0, com um espaço de lucro que pode ser apertado, embora ainda seja magro.

Ela consegue fazer isso devido a alguns designs engenhosos:

A interface não exibe as especificações do vídeo e a dedução de pontos, mas leva os usuários diretamente ao processo de criação de roteiro — personagem — cena — storyboard — vídeo, sem dar aos usuários a oportunidade de "sentir dor" a qualquer momento, nem informar quais modelos estão sendo usados no processo de criação inicial, seja Seedance, Keling ou Sora 2, ou até mesmo outros modelos mais baratos. Somente na etapa do storyboard, os usuários podem escolher o modelo. Os usuários não podem otimizar o consumo, nem comparar os preços de outros fornecedores, e só podem temporariamente esquecer o preço; a "falta de transparência" é seu mecanismo de proteção de margem de lucro.

No entanto, a OiiOii se atreve a definir preços e projetar mecanismos de tokens dessa forma porque tem uma boa reputação e reconhecimento entre grupos de produção de vídeos profissionais, como animações e quadrinhos. Além da luta pela sobrevivência com os tokens, estabeleceu uma certa singularidade.

Um funcionário de BD de um provedor de serviços em nuvem que lida bastante com clientes de curtas e animações nos disse: "A OiiOii tem um certo reconhecimento no círculo de curtas e animações, e recentemente a LibTV também está se destacando. Esses clientes mencionam que o fluxo de trabalho da LibTV é fácil de usar e a interface é boa."

Anteriormente, a razão central pela qual a LibTV recebeu atenção foi a controversa "relação custo-benefício" e "taxa de perda de margem". Com a melhoria e o avanço do produto, a LibTV, que sempre se destacou pela redução de preços dos tokens, também ganhou um pouco de espaço para aumentar os preços.

Em junho, a LibTV Agent foi lançada. Ela leva a geração de vídeos de IA de um único quadro para a entrega de um filme completo, completando automaticamente planejamento, storyboard, geração e edição através de habilidades profissionais, enquanto mantém o storyboard e o fluxo de trabalho de s para modificações manuais; a mesa de direção 3D, a biblioteca de personagens e a memória de longo prazo também melhoraram ainda mais a consistência entre personagens e quadros.

Em seguida, a LibTV aumentou os preços de forma rara e ousada.

Os preços de assinatura anual contínua para os dois níveis da versão suprema da LibTV, que eram 8499 e 10999 reais no primeiro ano, agora aumentaram em 1000 reais. O preço mínimo correspondente para chamar a Seedance 2.0, que antes podia ser de 0,37 reais por segundo, agora é de 0,41 reais por segundo.

Isso gerou reclamações de alguns usuários sensíveis a preços, mas com a melhoria da experiência do produto, essa também é uma medida inevitável.

Em vez de aumentar os preços, há uma abordagem mais direta, que é atacar o mercado externo e definir um preço mais alto. Para aumentar a margem de lucro, quase todas as aplicações de IA chinesas priorizam atender o mercado global, especialmente regiões como Europa, América do Norte e Japão, onde a disposição dos usuários para pagar é maior. A Lovart, uma empresa sob a Yanyu Technology, também é uma das tentativas ativas.

De acordo com reportagens anteriores da Elsewhere: a Lovart foi muito inspirada pela Manus. Quando a capacidade do modelo ultrapassou um ponto crítico, a Manus rapidamente encapsulou isso em um produto com boa experiência, enquanto a Lovart, ao saber que o GPT-image-1 seria lançado em três semanas, retirou as melhores pessoas da empresa para desenvolver em Shanghai. A Manus completou o início frio ao entrar em contato ativamente com grandes influenciadores de tecnologia do Vale do Silício, enquanto a Lovart se espalhou com a ajuda de influenciadores de tecnologia no exterior. Um pôster do Tesla Cybertruck gerado por usuários até recebeu um "like" de Elon Musk.

No entanto, a expansão da Lovart no exterior não foi um caminho fácil. Desde o lançamento em maio de 2025, a Lovart formou uma equipe local no Vale do Silício para cuidar do crescimento de usuários e operações de mercado, mas essa equipe estava cheia de turbulências. Até o final de 2025, membros da equipe americana, incluindo a cofundadora da Lovart, COO Elena Leung, e a cofundadora Aimee Yang, deixaram a empresa, e os membros atuais da equipe são todos novos que se juntaram no primeiro semestre de 2026.

Na busca por usuários "de maior valor líquido" no mercado global, melhorar a engenharia e o design do produto para aumentar os preços, e a configuração refinada do "controlador de tokens" das aplicações de IA, cada vez mais equipes de startups de IA estão enfrentando escolhas difíceis. E projetar um controlador de tokens refinado é, de fato, a opção mais controlável em termos de resultados.

No entanto, se todas as startups de aplicações de IA tiverem que se projetar primeiro como controladores de tokens, elas nunca poderão oferecer uma verdadeira experiência do usuário e realmente melhorar a força do produto. Em uma competição de mercado maior, isso pode torná-las mais passivas.

A ameaça mais óbvia vem dos gigantes.

Quando gigantes da internet com poder de produto forte, aproveitando o avanço de seus próprios modelos e a capacidade de modelos de terceiros, rapidamente estabelecem sua matriz de produtos de aplicações de IA com grandes investimentos e sem medo de consumir tokens, o futuro das startups é pressionado. A ascensão do Tencent WorkBuddy e a capacidade de produto por trás dele é um exemplo que os empreendedores de aplicações de IA devem observar e ficar atentos.

Desde que foi lançado em teste público em março de 2026, o Tencent expandiu a exposição através de fluxos de informações do WeChat, contas públicas, anúncios em metrôs e escritórios, além de medidas como registro de bônus, recompensas de check-in, isenção de modelos e créditos em dobro, atraindo um grande número de usuários para o WorkBuddy. A iteração de alta frequência que ocorreu simultaneamente consolidou ainda mais a posição do WorkBuddy na onda de produtividade de IA.

Somente em junho de 2026, este produto completou pelo menos 17 lançamentos de versão, às vezes até duas atualizações em um dia. Além de corrigir rapidamente bugs, o WorkBuddy também se integrou rapidamente a aplicações do ecossistema Tencent, como Tencent Docs e WeChat empresarial, e aprimorou capacidades como colaboração de múltiplos agentes, tarefas em nuvem e gerenciamento de projetos empresariais, tornando-se uma nova estrela de IA que superou o Yuanbao dentro da Tencent.

Ao divulgar os resultados do primeiro trimestre em maio, a Tencent afirmou sem rodeios que, em termos de contas ativas diárias, o WorkBuddy se tornou o serviço de IA mais popular da China. De acordo com dados da Analysys, de março a junho, o volume de visitas mensais do WorkBuddy no PC cresceu de 8,85 milhões para 20,97 milhões, mais que dobrou.

Esse é um resultado que qualquer empresa de aplicação de IA invejaria, mas não conseguiria alcançar. O Workbuddy pode acessar todos os recursos de tráfego da Tencent e, mais importante, não precisa gerenciar cuidadosamente o controle de tokens como as startups.

Fugindo da Crise

Cada vez mais empreendedores de aplicações de IA estão começando a explorar caminhos fora dos tokens.

O famoso empreendedor Zhang Yueguang postou em junho no Xiaohongshu: ao avaliar se uma aplicação de IA é viável, os verdadeiros três principais indicadores são a margem de lucro dos usuários pagantes, a taxa de renovação e o CAC (custo de aquisição de clientes). Para alcançar os dois primeiros de forma saudável, é necessário transformar o modelo de negócios de venda de tokens em outro modelo de negócios ou vender tokens para usuários que não são sensíveis ao preço dos tokens. "Todos os produtos que vendem tokens baseados em usuários sensíveis a tokens só podem ser negócios de fornecedores de modelos."

O produto de empreendedorismo de Zhang Yueguang corresponde a duas soluções diferentes que ele encontrou.

Uma é a Xingmian, que tenta cobrir os custos do token com receitas de jogos e IP; a outra é a Dokie, que busca fazer com que os usuários paguem por um resultado utilizável, em vez de comparar o custo de cada chamada de modelo. Além disso, segundo suas atualizações públicas, a Dokie reduziu completamente a cota de testes gratuitos em mais de 140 países, o que, na prática, não teve impacto significativo nas receitas pagas.

Por muito tempo, o "token Maxxing" foi considerado um padrão, com a indústria perseguindo avidamente o consumo de tokens, vendo isso como um símbolo de produtos robustos e um mercado saudável. Mas todos finalmente perceberam que a busca pelo consumo de tokens estava fora de foco; a estrutura de margem bruta é o verdadeiro indicador. Em outras palavras, as empresas que realmente vivem de tokens não são aquelas que queimam mais tokens, mas sim aquelas que conseguem vender os tokens de uma maneira diferente.

Um exemplo típico está no campo de "hardware + aplicações", sendo o representante mais emblemático a Plaud.

De acordo com nossas informações, o lucro líquido dos serviços de IA não relacionados a hardware da Plaud já atingiu dezenas de milhões de dólares em escala anual. Sua meta de vendas total para 2026 é de 500 milhões de dólares, com mais de 2 milhões de usuários instalados.

Por trás disso está a diferença na estrutura de pagamento.

Primeiro, o próprio hardware. Na indústria de eletrônicos de consumo, o preço de varejo do terminal geralmente precisa atingir o custo do BOM, ou seja, cerca de 3 vezes o custo dos materiais, para que a empresa possa obter um espaço de operação sustentável. O preço do Plaud Note Pro é de cerca de 179-189 dólares, com um custo de BOM de cerca de 60 dólares, resultando em uma margem bruta de hardware de cerca de 67%, que está de acordo com essa regra.

Mais importante ainda é a receita de assinaturas de IA. Sua assinatura de IA é dividida em dois níveis: Pro, com pagamento anual de cerca de 8,33 dólares por mês, e Unlimited, com pagamento anual de cerca de 20 dólares por mês. Esse preço não é caro nem barato; o ponto chave é que seu cenário de IA é leve, focando principalmente em transcrição e resumo, não em geração de vídeo ou raciocínio avançado. Segundo uma estimativa de um fornecedor da Plaud: com uma receita de assinatura de 8-20 dólares/mês/pessoa, o custo de processamento de IA da Plaud é de cerca de 1-2 dólares/mês/pessoa, permitindo que a margem bruta de software da Plaud alcance cerca de 75%-90%.

De modo geral, a situação do hardware é relativamente melhor do que a do software, pois não há competição direta com empresas de modelos ou produtos de modelos, além de haver espaço para preços premium.

Um empreendedor de hardware de IA classificou os produtos no mercado em várias categorias:

Primeiro, o tipo de hardware autossuficiente. Com preços três vezes mais altos na China e cinco vezes mais altos no exterior, o hardware não perde dinheiro, e com a assinatura ainda pode gerar lucro.

Segundo, o tipo de hardware de baixa margem + assinatura compensatória. A Plaud se encaixa nessa categoria.

Terceiro, o tipo de crescimento por financiamento, que muitas startups de hardware de IA iniciais pertencem a essa categoria; e por último, o tipo de baixo preço de hardware + sem assinatura. Por exemplo, a maioria dos produtos de IA de companhia/IA de brinquedo na China depende principalmente do hardware para ganhar um pouco, subsidiando os custos de tokens.

No entanto, segundo a percepção desse empreendedor, o hardware também está se tornando mais competitivo, e os preços que superam três vezes o custo do BOM não podem ser sustentados. "Margens muito baixas serão consumidas por canais, serviços pós-venda e devoluções; se apenas buscar margens de hardware, pode acabar elevando demais o preço de compra inicial, afetando a escala de vendas e a conversão de assinaturas subsequentes." Se isso realmente acontecer, então o hardware de IA também precisará encontrar novos caminhos.

Além das soluções específicas para empresas de hardware, algumas ideias mais gerais também estão surgindo.

Uma tendência recente é que cada vez mais aplicações de IA, incluindo empresas de hardware, começam a "treinar" seus próprios modelos após o desenvolvimento.

Recentemente, o fundador do famoso produto de hardware "AI Mushroom", Swoii, conhecido como "Tio He", nos revelou que eles estão utilizando modelos desenvolvidos internamente para alcançar personalização de baixo custo, atendendo às necessidades de cenários UGC dos usuários, aumentando a satisfação e a disposição para pagar dos usuários.

A Mindverse, uma empresa de aplicações de IA que se destacou com o Macaron, está se transformando em uma empresa de pesquisa de modelos, e sua divisão Mind Lab acaba de lançar e abrir o peso do modelo Macaron-V1, que não só atende seus próprios produtos, mas também começa a fornecer modelos e capacidades de treinamento posterior para mais aplicações B2B.

Além disso, soubemos que o conhecido empreendedor em série, fundador da Teambition e ex-vice-presidente de produtos da Feishu, Qi Junyuan, está empreendendo novamente, e sua equipe está desenvolvendo e testando um produto de agente de IA, que também se baseia em grande parte em modelos de borda desenvolvidos internamente, minimizando a dependência de APIs e tokens de fornecedores de modelos.

Embora esses produtos tenham cenários diferentes, há uma lógica comum importante por trás das diferenças: cada vez mais empreendedores dedicados a criar bons produtos de IA percebem que treinar um modelo internamente e integrá-lo com a aplicação é muito mais econômico do que simplesmente comprar tokens de fornecedores de modelos.

Particularmente aquelas empresas de aplicações de IA com cenários claros, dados ricos e uma escala de chamadas estável, têm a oportunidade de substituir APIs de modelos SOTA caros por modelos dedicados, criando modelos verticais através do treinamento posterior. À medida que a escala de chamadas aumenta, o investimento único em treinamento de modelos é diluído ao longo do tempo, permitindo uma redução significativa no custo por token.

Se esse caminho for bem-sucedido, as aplicações de IA se tornarão mais populares. Quanto ao momento atual, projetos de IA puramente de software já estão esfriando no círculo de capital.

Alguns investidores afirmam que, no primeiro semestre deste ano, o foco de alguns fundos de primeira linha se voltou para inteligência corporal e hardware. Não que eles não estejam investindo em software. Todos ainda estão observando a direção B2B, especialmente aplicações específicas voltadas para "pequenos empresários ricos" estão sendo favorecidas. A a16z investiu continuamente em vários projetos de IA envolvidos em odontologia, operações médicas e serviços domésticos em junho. No projeto de primavera da Qiji Chuangtan, também surgiram várias empresas voltadas para fábricas, marcas e empresas que atuam no exterior.

Essa mudança não é difícil de entender. Embora "pequenos empresários ricos" se preocupem com preços, eles se preocupam mais se as ferramentas podem ajudá-los a produzir mais e fechar mais negócios. Desde que os benefícios gerados pela IA sejam claramente superiores ao custo de uso, taxas anuais de várias dezenas de milhares de dólares ou até mais valem a pena. Os negócios de IA que os atendem podem ser "pequenos", mas podem realmente gerar lucro nos negócios.

Além disso, o FDE está em ascensão, refletindo e superando a dificuldade dos tokens de aplicações de IA. O FDE muda o ponto de ancoragem do valor do produto de "quantos tokens foram utilizados" para "o que foi realizado para o cliente", dando às startups a oportunidade de realmente cobrar com base nos resultados entregues. Quando os tokens em si não determinam mais o teto de valor do produto, as aplicações de IA também têm a chance de obter mais lucros.

Em última análise, os tokens compram apenas um ingresso de entrada, e não uma barreira de proteção. Se não conseguirem escapar, acabarão sendo devorados pelos próprios tokens.

Preço de --

--

Este conteúdo é fornecido apenas para fins informativos gerais e não constitui aconselhamento financeiro, de investimento, jurídico ou tributário. Quaisquer eventos, recompensas, promoções online ou informações relacionadas mencionadas neste documento não devem ser consideradas uma recomendação, solicitação ou convite para comprar, vender, negociar ou realizar qualquer outra transação com criptoativos. Criptoativos são altamente voláteis e podem resultar em perdas. A disponibilidade dos serviços, produtos e eventos relacionados da WEEX pode variar conforme a região. É de sua responsabilidade garantir que sua participação esteja em conformidade com as leis e regulamentações locais aplicáveis.

Você também pode gostar

iconiconiconiconiconiconicon
Atendimento ao cliente:@weikecs
Parcerias comerciais:@weikecs
Quant trading e MM:[email protected]
Programa VIP:[email protected]