TradingKey - Os grandes modelos de linguagem de IA chineses voltaram a ser o foco das atenções do mercado global.
Recentemente, a desenvolvedora chinesa de IA Moonshot AI lançou oficialmente seu grande modelo de última geração, o Kimi K3. Com sua arquitetura de pesos abertos, desempenho próximo ao dos principais modelos do mundo e custos de inferência mais competitivos, o Kimi K3 rapidamente gerou discussões acaloradas nos círculos de tecnologia e nos mercados de capitais no exterior.
Após o anúncio, o mercado temeu brevemente que a lógica das gigantes globais de tecnologia de continuar investindo centenas de bilhões de dólares para construir infraestrutura de IA pudesse ser afetada pelo surgimento de mais modelos de IA de alto desempenho e baixo custo, e o setor de chips de IA dos EUA também registrou uma correção notável.
No entanto, um número crescente de analistas acredita que o Kimi K3 não seja necessariamente um fator negativo para o setor de chips de IA. Em vez disso, o melhor desempenho do modelo e os menores custos de uso podem reduzir as barreiras para as aplicações de IA, atraindo mais usuários, maior frequência de chamadas e uma demanda de inferência em maior escala. O "paradoxo de Jevons" da economia pode estar se repetindo mais uma vez na indústria de IA.
O Kimi K3 é o modelo carro-chefe lançado pela Moonshot AI em julho de 2026, voltado principalmente para cenários de aplicação como programação de longo ciclo, trabalho de conhecimento complexo e agentes de IA.
De acordo com informações divulgadas pela Moonshot AI, o Kimi K3 adota uma arquitetura de Mistura de Especialistas (MoE), com um total de 2,8 trilhões de parâmetros e uma janela de contexto de 1 milhão de tokens, além de oferecer suporte nativo à compreensão visual. Entre os seus 896 módulos de especialistas, apenas 16 são ativados por cálculo para melhorar a capacidade do modelo e a eficiência de inferência. Vale ressaltar que 2,8 trilhões é a escala total de parâmetros, o que não significa que cada token gerado invoque todos os parâmetros.
O Kimi K3 apresentou um desempenho excelente em avaliações de programação frontend, chegando a ocupar uma posição próxima ao topo da tabela de classificação do Frontend Code Arena com uma pontuação de 1.679. No entanto, essa conquista se limita a testes de programação específicos e não equivale a superar de forma abrangente os modelos carro-chefe da OpenAI e da Anthropic em termos de capacidades gerais.
O preço também é um dos principais motivos para a atenção em torno do Kimi K3. A tabela de preços oficial da API mostra uma tarifa de US$ 3 por milhão de tokens de entrada — caindo para US$ 0,30 em caso de acerto de cache (cache hit) — e de US$ 15 por milhão de tokens de saída. Para agentes de IA que precisam recuperar repetidamente bases de código, documentos corporativos e contextos longos, o mecanismo de cache pode reduzir significativamente os custos de entrada.
No entanto, um "preço unitário menor por token" não equivale a uma redução proporcional no custo real de todas as tarefas. A extensão da saída do modelo, o tempo de inferência, a taxa de acerto de cache e a taxa de conclusão de tarefas impactarão o custo final.
Portanto, a verdadeira mudança trazida pelo Kimi K3 não é simplesmente o início de uma guerra de preços, mas sim impulsionar uma adoção mais ampla de modelos avançados com uma melhor relação custo-benefício.
Após o lançamento do Kimi K3, alguns investidores demonstraram preocupação de que a maior eficiência do modelo pudesse reduzir o uso de GPUs. No entanto, a julgar pelas operações reais, uma queda nos custos unitários de inferência não equivale diretamente a uma redução na demanda total por chips.
O Kimi K3 adota uma arquitetura esparsa de Mistura de Especialistas (MoE), ativando apenas um subconjunto de módulos especialistas durante cada inferência, o que ajuda a controlar a sobrecarga computacional por execução. No entanto, o modelo ainda precisa armazenar e gerenciar volumes massivos de dados de pesos, ao mesmo tempo em que processa contextos de até 1 milhão de tokens. Em implantações de larga escala, essas tarefas ainda dependem de GPUs, aceleradores de IA, memória de alta largura de banda, redes de alta velocidade e clusters de servidores.
Mais importante ainda, à medida que os custos dos modelos diminuem, o número de usuários e a frequência de uso podem crescer de forma ainda mais rápida. Após o lançamento do Kimi K3, o volume de solicitações dos usuários aproximou-se rapidamente do limite de capacidade dos clusters de computação existentes. A Moonshot AI suspendeu temporariamente novas assinaturas de usuários para priorizar os recursos de capacidade computacional para os usuários existentes. Isso indica que, à medida que os modelos se tornam mais baratos e fáceis de usar, a nova demanda pode consumir rapidamente a capacidade computacional economizada pelos ganhos de eficiência.
Este é precisamente o cerne do 'Paradoxo de Jevons': à medida que a eficiência na utilização de um recurso melhora, o custo unitário cai, mas, como o escopo de aplicação se expande, seu consumo total pode, na verdade, aumentar.
No setor de IA, as melhorias na eficiência dos modelos podem reduzir as barreiras para que as empresas implementem atendimento inteligente ao cliente, assistentes de programação, agentes de escritório, análise financeira e sistemas de assistência médica. À medida que mais aplicações rodam continuamente, o volume diário de solicitações de inferência disparará, impulsionando, em última análise, o crescimento contínuo da demanda por capacidade computacional, memória e infraestrutura de data centers.
Embora o paradoxo de Jevons ofereça uma explicação otimista para a demanda por chips de IA, este não é um resultado inevitável. Se, no longo prazo, o ritmo de ganho de eficiência dos modelos superar o crescimento de usuários e aplicações, a redução do poder computacional necessário por tarefa ainda poderá comprimir uma parte da demanda por hardware.
Os investimentos em infraestrutura de IA devem, em última análise, enfrentar o teste dos retornos comerciais. Se as empresas aportarem volumes maciços de capital na construção de data centers, mas não conseguirem gerar receita suficiente por meio de assinaturas, publicidade, serviços em nuvem ou softwares corporativos, a taxa de crescimento das despesas de capital poderá desacelerar. O grau de benefício para as diferentes empresas de chips também irá divergir, e nem todas as ações ligadas ao conceito de IA crescerão no mesmo ritmo.
O Kimi K3 também poderá intensificar a concorrência de preços no mercado de modelos. À medida que os modelos de código aberto ou de pesos abertos reduzem cada vez mais a diferença em relação às capacidades dos modelos de código fechado, as margens de lucro de API das empresas de IA podem ficar sob pressão. Para reduzir custos, os desenvolvedores de modelos darão maior ênfase a chips personalizados, tecnologias de quantização, otimização de inferência e estratégias de múltiplos fornecedores, o que poderia enfraquecer o poder de barganha dos fabricantes de GPUs de uso geral em determinados mercados.
Portanto, o impacto dos modelos de baixo custo na indústria de chips de IA não é uma via de mão única positiva. Embora, por um lado, expanda o mercado de aplicações de IA, por outro, também força as empresas de infraestrutura a melhorar a eficiência energética e a reduzir os custos unitários de computação.