A Moonshot AI publicou os pesos do Kimi K3, um modelo multimodal Mixture-of-Experts com 2,8 trilhões de parâmetros totais. A liberação permite que diferentes provedores ofereçam o modelo, mas não transforma o K3 em uma ferramenta que possa ser executada em um computador doméstico.
O repositório oficial apresenta o Kimi K3 como o modelo mais capaz da empresa até agora. A arquitetura ativa 104 bilhões de parâmetros por token, selecionando 16 de 896 especialistas, e oferece uma janela de contexto de 1.048.576 tokens. Os pesos usam quantização MXFP4 e o modelo combina texto e imagem.
Em português do Brasil, o número informado pela Moonshot AI é 2,8 trilhões de parâmetros. A transcrição original está em espanhol, idioma em que trillion em inglês pode ser traduzido como billón conforme a escala usada. A conversão precisa ser adaptada ao idioma de publicação para não reduzir o número por um fator de mil.
Pesos abertos não significam execução local
A principal consequência da liberação não é permitir que qualquer pessoa instale o modelo em uma placa de vídeo de consumo. Mesmo quantizado, um sistema com trilhões de parâmetros exige armazenamento, memória e capacidade de inferência muito acima de um computador comum.
O efeito prático aparece na infraestrutura. Empresas especializadas podem baixar os pesos, preparar ambientes compatíveis e oferecer o Kimi K3 por API. A própria Moonshot AI lista mecanismos como vLLM, SGLang e TokenSpeed, enquanto seu programa de verificação registra provedores como Fireworks, Baseten, Together, DigitalOcean, Nebius e Modal.
Isso cria mais opções de hospedagem e reduz a dependência de um único fornecedor. Uma empresa pode comparar preço, latência, região de processamento e condições de privacidade. Também pode usar um gateway para alternar entre provedores, embora gateway e infraestrutura própria não sejam a mesma coisa.
A arquitetura tenta conter o custo do tamanho
O Kimi K3 utiliza Kimi Delta Attention, ou KDA, em 69 das 93 camadas do modelo. A Moonshot AI também publicou o FlashKDA, uma implementação de kernels CUDA baseada em CUTLASS para acelerar esse mecanismo.
Em termos simplificados, a KDA mantém um estado recorrente que resume informações anteriores. Isso reduz parte do custo de trabalhar com sequências longas em comparação com revisar todas as relações entre tokens a cada passo. O ganho real depende do hardware, do tamanho da entrada e da configuração de inferência.
O desenvolvedor afirma que a combinação de KDA, Attention Residuals e Stable LatentMoE melhora a eficiência de escala em relação à geração anterior. Esses números são resultados divulgados pela própria Moonshot AI e devem ser lidos como medições do fornecedor, não como garantia de desempenho em qualquer aplicação.
Benchmarks não encerram a comparação
O relatório compara o Kimi K3 com modelos fechados em tarefas de raciocínio, programação, uso de ferramentas e visão. Os resultados variam: o K3 lidera algumas avaliações e fica atrás em outras.
Além disso, modelos diferentes foram testados com harnesses, limites e ferramentas específicas. A própria documentação detalha essas condições. Por isso, os benchmarks servem como referência inicial, mas não substituem testes com a carga real de uma empresa.
A licença tem condições próprias
Os pesos e o código principal foram publicados sob a Kimi K3 License, não sob Apache 2.0 ou MIT sem alterações. A licença permite uso, modificação e distribuição, mas estabelece condições comerciais.
Uma empresa que opere um serviço de Model as a Service e supere 20 milhões de dólares de receita agregada em qualquer período consecutivo de 12 meses precisa negociar um acordo separado com a Moonshot AI para uso comercial. Produtos ou serviços com mais de 100 milhões de usuários ativos mensais ou mais de 20 milhões de dólares de receita mensal devem exibir “Kimi K3” de forma destacada na interface.
Essas regras não afetam a maioria dos desenvolvedores individuais, mas são relevantes para provedores de infraestrutura e grandes plataformas. Também mostram por que “pesos abertos” e “open source sem restrições” não devem ser tratados como sinônimos.
O lançamento amplia a competição entre modelos e entre empresas que vendem inferência. Para o usuário final, a mudança pode aparecer como mais opções de API. Para quem pretende hospedar o K3, o desafio continua sendo compatibilizar hardware, software e licença com uma arquitetura de escala excepcional.
Este conteúdo tem caráter exclusivamente informativo e não constitui recomendação de investimento ou aconselhamento financeiro.
