O que é o Kimi K3?
O Kimi K3 é o novo modelo multimodal de raciocínio principal da Moonshot AI. Ele foi desenvolvido para tarefas que podem envolver horas de programação, pesquisa, uso de ferramentas e revisão—não apenas para responder a uma única mensagem de chat.
O modelo foi lançado em 16 de julho de 2026 no Kimi.com, no Kimi Work, no Kimi Code e na API do Kimi. Ele tem 2,8 trilhões de parâmetros totais, uma janela de contexto de um milhão de tokens e suporte nativo para entradas de texto, imagem e vídeo. Sua saída continua sendo texto.
Por baixo do capô, o K3 usa uma arquitetura Mixture-of-Experts com 896 especialistas, dos quais 16 são ativados por vez. A Moonshot também introduziu o Kimi Delta Attention, Attention Residuals e Stable LatentMoE para melhorar a forma como as informações percorrem sequências longas e camadas profundas do modelo. A Moonshot afirma que essas mudanças produzem aproximadamente 2,5 vezes a eficiência de escalabilidade do Kimi K2, embora esse número venha do desenvolvedor, e não de um teste independente. O blog técnico do Kimi K3 da Moonshot apresenta os detalhes atuais da arquitetura; um relatório técnico mais completo ainda está pendente.
| Especificação |
Kimi K3 |
| Desenvolvedor |
Moonshot AI |
| Lançamento público |
16 de julho de 2026 |
| Parâmetros totais / ativados |
2,8T / 104B |
| Arquitetura |
Mixture-of-Experts |
| Especialistas |
896 no total, 16 ativos |
| Janela de contexto |
1 milhão de tokens |
| Entradas |
Texto, imagem e vídeo |
| Saída |
Texto |
| String do modelo da API |
kimi-k3 |
| Modo de raciocínio |
Sempre ativado |
| Disponibilidade dos pesos |
Pesos completos disponibilizados em `moonshotai/Kimi-K3 |
Isso faz do K3 um dos maiores modelos de IA anunciados até hoje. O tamanho, porém, não é útil por si só. A verdadeira questão é se a Moonshot transformou esses parâmetros em uma melhor conclusão de tarefas.
O lançamento também elimina uma incerteza da cobertura original do lançamento: o relatório técnico agora é público. Isso não elimina a necessidade de avaliação independente nem transforma um modelo de 2,8T em um projeto simples de hospedagem própria.
O Kimi K3 está realmente próximo do GPT-5.6 e do Claude Fable 5?
Em inteligência geral, ainda não. Em várias tarefas com agentes e de longa duração, sim.
O próprio anúncio da Moonshot é mais moderado do que muitas das manchetes que gerou. A empresa afirma que o desempenho geral do K3 ainda fica atrás do Claude Fable 5 e do GPT-5.6 Sol. Ainda assim, relata resultados de nível de fronteira em programação, trabalho de conhecimento e raciocínio.
Um exemplo é a otimização de kernels de GPU. A Moonshot colocou cada modelo em um sandbox idêntico e deu a ele até 24 horas para otimizar quatro tarefas de GPU. O K3 teve desempenho competitivo com o Fable 5 e superou o GPT-5.6 Sol, o GPT-5.5 e o Opus 4.8 nesse teste. É um resultado substancial para engenharia de desempenho de baixo nível. Não é evidência de que o K3 seja universalmente mais inteligente.
Testes independentes oferecem uma visão mais ampla. A Artificial Analysis atribuiu ao Kimi K3 uma pontuação de 57 em seu Intelligence Index, colocando-o próximo do GPT-5.5 e do Claude Opus 4.8, mas atrás do Fable 5 e do GPT-5.6 Sol. Seus resultados mais fortes apareceram na execução com agentes e na automação, e não em todas as categorias de inteligência. A Artificial Analysis publicou suas conclusões sobre o K3 em 16 de julho.
| Avaliação |
Resultado do Kimi K3 |
O que isso nos diz |
| AA Intelligence Index |
57 |
Próximo do GPT-5.5 e do Opus 4.8; atrás do GPT-5.6 Sol e do Fable 5 |
| GDPval-AA v2 |
1.668 Elo |
Execução forte em tarefas de agentes do mundo real |
| AutomationBench-AA |
53%, classificado em primeiro |
Particularmente eficaz na automação de fluxos de trabalho SaaS |
| AA-Briefcase |
1.547 Elo, classificado em segundo |
Trabalho de conhecimento de longa duração com desempenho forte |
| Precisão de onisciência |
46% |
Acima dos 33% do K2.6 |
| Taxa de alucinação |
51% |
Pior que os 39% do K2.6 |
A última linha foi a que me fez parar. O K3 se tornou mais capaz, mas a Artificial Analysis também mediu mais alucinações. Ele respondeu corretamente a mais perguntas, mas produziu uma proporção maior de afirmações sem sustentação.
Essa troca é importante em produção. Um modelo que conclui um longo fluxo de trabalho com agentes, mas introduz silenciosamente uma suposição incorreta, pode custar mais para verificar do que um modelo mais lento com comportamento factual mais consistente.
Por que um único ranking não resolve a comparação
O K3 já alcançou o topo de pelo menos um ranking de geração de interfaces. Ele também apresenta bom desempenho em otimização de GPU, automação SaaS e trabalho de conhecimento de longa duração. Esses resultados não medem a mesma capacidade.
Uma arena de frontend mede a preferência dos usuários por interfaces geradas. A AutomationBench mede se um agente consegue operar fluxos de trabalho de software. A otimização de kernels de GPU testa engenharia de sistemas de baixo nível. Nenhuma delas responde sozinha se o K3 é melhor em pesquisa, recuperação factual, depuração, design de apresentações ou raciocínio geral.
A conclusão defensável é mais restrita: o Kimi K3 entrou no grupo de fronteira para trabalho com agentes, mas o GPT-5.6 Sol e o Fable 5 ainda lideram a comparação mais ampla. Desenvolvedores que desejam o atual limite dos modelos fechados podem examinar a API do GPT-5.6 Sol, enquanto o Claude Opus 4.8 continua sendo uma opção mais estabelecida para fluxos complexos de programação e pesquisa.
A questão dos pesos abertos está resolvida; a questão da implantação, não
A questão durante a semana do lançamento era se a Moonshot realmente publicaria os pesos. Publicou. O repositório oficial moonshotai/Kimi-K3 agora contém o checkpoint completo, o model card, o relatório técnico, o código de inferência e a licença Kimi K3.
A formulação precisa ainda importa. O Kimi K3 tem pesos abertos, mas não é um lançamento irrestritamente “totalmente open source”. Sua licença personalizada permite amplo uso, modificação, ajuste fino, implantação e redistribuição, mas acrescenta condições para grandes empresas de Model-as-a-Service e produtos comerciais muito grandes. Os dados de treinamento não são públicos.
Disponibilidade também não significa usabilidade. O repositório ocupa cerca de 1,56 TB, e a Moonshot recomenda implantações em supernodes com 64 ou mais aceleradores. Isso torna o K3 relevante para equipes de infraestrutura em nuvem e empresas, não um download rotineiro para uma estação de trabalho.
O lançamento ainda é importante. As organizações agora têm um caminho real para inspecionar o checkpoint, personalizar a inferência, ajustar derivados e operar o modelo sem depender inteiramente de um único endpoint hospedado. O preço é hardware, engenharia de serving e análise da licença.
O que mudou do Kimi K2.7 para o Kimi K3?
O K3 não é simplesmente o Kimi K2.7 com um número de versão maior.
O Kimi K2.7 Code é um modelo com agentes focado em programação, baseado no K2.6. Seu model card enfatiza engenharia de software do mundo real, longas sessões de programação, uso de ferramentas e menor consumo de tokens de raciocínio. O K3 amplia esse papel para um modelo principal geral, abrangendo programação, raciocínio visual, pesquisa e trabalho de conhecimento de ponta a ponta.
A janela de contexto cresce de 256K para um milhão de tokens. Os parâmetros totais aumentam de um trilhão para 2,8 trilhões, enquanto a quantidade de especialistas cresce de 384 para 896. O preço também aumenta.
| Recurso |
Kimi K3 |
Kimi K2.7 Code |
| Posicionamento |
Modelo principal geral |
Modelo focado em programação |
| Parâmetros totais |
2,8T |
1T |
| Especialistas |
896, 16 ativos |
384, 8 ativos |
| Janela de contexto |
1M |
256K |
| Entrada padrão |
$3,00/MTok |
$0,95/MTok |
| Saída |
$15,00/MTok |
$4,00/MTok |
| Entrada em cache |
$0,30/MTok |
$0,19/MTok |
| Pesos |
Disponíveis sob a licença Kimi K3 |
Disponíveis |
A proposta de valor do K3, portanto, não é “inteligência de fronteira por quase nada”. É um desempenho de agentes próximo da fronteira, com dois caminhos de implantação: uma API tarifada para uso imediato e pesos liberados para equipes preparadas para assumir a infraestrutura.
O model card oficial do K2.7 Code contém sua arquitetura, metodologia de benchmark e orientações de implantação.
Como o Kimi K3 lida com um contexto de 1 milhão de tokens
Uma janela de contexto de um milhão de tokens permite que o K3 aceite grandes bases de código, coleções de documentos técnicos, históricos longos de agentes e resultados intermediários de ferramentas em uma única solicitação.
Isso é especialmente relevante para agentes de longa duração. Um modelo de programação pode precisar manter uma especificação inicial, a estrutura do repositório, a saída do terminal, falhas de testes, edições anteriores e comentários de revisores ao longo de dezenas de etapas. Perder uma dessas restrições no meio da tarefa é uma razão comum para um agente parecer produtivo, mas não conseguir concluir o trabalho.
O K3 também aplica o cache automático de contexto. Os desenvolvedores não precisam criar um ID de cache nem definir um valor separado de tempo de expiração. Se um prefixo longo permanecer inalterado entre as solicitações, o sistema tentará automaticamente obter um resultado do cache. A entrada em cache custa US$ 0,30 por milhão de tokens, em vez de US$ 3,00.
Mas capacidade de contexto não é o mesmo que uso perfeito do contexto. Enviar um milhão de tokens a um modelo não garante que ele atribuirá a importância correta a cada linha. Entradas mais longas também podem aumentar o custo, o tempo de processamento e a distração causada por material irrelevante.
A abordagem sensata ainda é recuperar primeiro os arquivos mais relevantes, manter o conteúdo de referência estável no início para aproveitar o cache e evitar enviar toda a base de conhecimento apenas porque o limite permite. O guia da API do Kimi explica seu contexto de um milhão de tokens e o comportamento de cache automático.
O preço da API do Kimi K3 não é mais econômico
A API oficial do Kimi K3 da Moonshot usa preços fixos conforme o uso. A tarifa não muda quando uma solicitação ultrapassa um nível maior de contexto.
| Tipo de token |
Preço por 1 milhão de tokens |
| Entrada em cache |
$0,30 |
| Entrada padrão |
$3,00 |
| Saída |
$15,00 |
Para uma tarefa de agente mais curta, usando 100.000 tokens de entrada sem cache e produzindo 20.000 tokens de saída, o custo estimado do modelo é:
(0,1 × US$ 3) + (0,02 × US$ 15) = US$ 0,60
Agora considere um fluxo de trabalho repetido com contexto longo, contendo 800.000 tokens em cache, 50.000 novos tokens de entrada e 50.000 tokens de saída:
(0,8 × US$ 0,30) + (0,05 × US$ 3) + (0,05 × US$ 15) = US$ 1,14
O cache mantém o segundo exemplo administrável, mas o K3 claramente não segue a antiga fórmula “modelo chinês significa API extremamente barata”.
A Artificial Analysis mediu um custo médio de tarefa do Intelligence Index de US$ 0,94 para o K3, próximo dos US$ 1,04 do GPT-5.6 Sol e aproximadamente metade dos US$ 1,80 do Opus 4.8. O GLM-5.2 concluiu o mesmo conjunto de avaliação por consideravelmente menos.
A comparação também muda dependendo de onde os modelos são acessados. A API do Kimi K3 na GPT Proto atualmente custa US$ 2,70 por milhão de tokens de entrada e US$ 13,50 por milhão de tokens de saída, 10% abaixo do preço de tabela de US$ 3/15 da Moonshot. A GPT Proto também oferece GPT-5.6 Sol e GLM-5.2 pela mesma chave de API e saldo compartilhado, facilitando comparações em nível de tarefa sem contas separadas de provedores.
A proposta de valor do K3, portanto, não é “inteligência de fronteira por quase nada”. É um desempenho de agentes próximo da fronteira, com dois caminhos de implantação: uma API tarifada para uso imediato e pesos liberados para equipes preparadas para assumir a infraestrutura.
API do Kimi K3 versus pesos abertos: qual você deve usar?
O Kimi K3 agora oferece aos desenvolvedores uma escolha real de implantação. A capacidade do modelo é a atração nos dois caminhos; o modelo operacional é completamente diferente.
| API hospedada do Kimi K3 |
Pesos abertos do Kimi K3 |
| Pague por token |
Compre ou alugue capacidade de aceleradores |
| O provedor gerencia escalabilidade, cache, atualizações e falhas |
Sua equipe gerencia serving, escalabilidade, monitoramento, atualizações e falhas |
| Caminho mais rápido para avaliação e produção |
Maior controle sobre dados, inferência e modificação do modelo |
| O serviço hospedado documenta entradas de texto, imagem e vídeo |
Os metadados atuais do repositório público se concentram em texto e imagem; verifique a equivalência do caminho de vídeo antes de prometê-lo |
| Sem download de 1,56 TB |
Cerca de 1,56 TB em 96 fragmentos de pesos |
| Sem projeto de implantação em cluster |
A Moonshot recomenda mais de 64 aceleradores |
Use a API primeiro se ainda estiver validando a adequação do produto ao mercado, se o tráfego for variável ou se a equipe ainda não operar infraestrutura de modelos grandes. A API GPT Proto do Kimi K3 também facilita comparar o K3 com GPT-5.6 Sol, GLM-5.2 e outros modelos usando uma única chave e saldo.
Use os pesos quando a implantação privada, o ajuste fino, a inferência personalizada ou a independência do provedor tiverem valor comercial suficiente para justificar o cluster. Antes da implantação comercial, analise a licença Kimi K3 em vez de presumir que “aberto” significa MIT.
Kimi K3 versus GLM-5.2, GPT-5.6 e Opus 4.8
O vencedor do benchmark não é automaticamente o modelo de produção adequado. A escolha útil depende do que pode falhar, da duração do fluxo de trabalho e da importância de possuir os pesos.
| Modelo |
Escolha-o quando |
| Kimi K3 |
Você precisa de fluxos longos de agentes multimodais e quer uma API hospedada agora ou um caminho de implantação com pesos abertos sob a licença Kimi K3 |
| GPT-5.6 Sol |
A qualidade do raciocínio geral e um desempenho confiável em produção importam mais do que a propriedade |
| Claude Fable 5 |
Você deseja o maior limite medido de trabalho de conhecimento com agentes e tem acesso a ele |
| Claude Opus 4.8 |
Você já depende de fluxos do Claude para programação complexa, pesquisa e seguimento cuidadoso de instruções |
| GLM-5.2 |
Você precisa de programação com agentes a menor custo e de pesos que já estejam disponíveis |
| Kimi K2.7 Code |
Sua carga de trabalho é principalmente programação e o preço mais alto do K3 é difícil de justificar |
O K3 tem o caso de uso mais claro quando três condições aparecem juntas: uma tarefa de longa duração, entradas multimodais e um motivo para controlar a implantação do modelo. Sem esses requisitos, sua escala pode se tornar uma resposta cara para um problema menor.
O GPT-5.6 Sol continua sendo a escolha mais forte quando inteligência ampla e confiabilidade vêm em primeiro lugar. O Opus 4.8 faz sentido para equipes com fluxos maduros de programação ou pesquisa baseados no Claude. O GLM-5.2 é o concorrente mais difícil em termos econômicos porque já oferece contexto de um milhão de tokens e pesos abertos com menor custo por tarefa.
Minha regra prática atual é simples: escolha o K3 quando pesos abertos e agentes multimodais de longa duração forem importantes. Escolha GPT-5.6 ou Opus quando a confiabilidade importar mais do que a propriedade do modelo. Escolha GLM-5.2 quando o custo for a restrição que você não pode negociar.
Já é possível usar o Kimi K3 pela GPT Proto?
Sim. O Kimi K3 já está disponível por meio da API GPT Proto do Kimi K3.
A tarifa atual da GPT Proto é de US$ 2,70 por milhão de tokens de entrada e US$ 13,50 por milhão de tokens de saída, 10% abaixo do preço de tabela atual de US$ 3/15 da Moonshot. Use a string de modelo kimi-k3 com sua chave de API da GPT Proto para acessar os recursos de programação com contexto longo, análise multimodal, chamadas de ferramentas e saída estruturada do K3.
A mesma chave e o saldo compartilhado também abrangem GPT-5.6 Sol, GLM-5.2, Claude Opus 4.8 e mais de 200 modelos de texto, imagem, vídeo e áudio. Isso torna prático testar o K3 contra alternativas no mesmo repositório ou fluxo de trabalho de agente antes de alterar o tráfego de produção.
Você pode experimentar o Kimi K3 na GPT Proto ou navegar pela galeria completa de modelos de IA da GPT Proto. Os pesos e o relatório técnico do modelo agora são públicos, mas o artigo ainda deve ser revisitado à medida que testes independentes de implantação, quantizações, dados de throughput e suporte a frameworks amadurecerem.
Veredito final: próximo, mas o benchmark ainda importa
O Kimi K3 não é apenas um grande modelo chinês atraindo atenção por causa da quantidade de parâmetros. Testes independentes sustentam uma conclusão mais significativa: ele é competitivo com sistemas de fronteira em automação, trabalho de conhecimento de longa duração e execução com agentes.
Isso não o torna melhor que o GPT-5.6 Sol ou o Claude Fable 5 no geral. Também não apaga o aumento medido nas alucinações. O que mudou em 28 de julho foi a implantação: os pesos prometidos, a licença, o model card e o relatório técnico agora são públicos.
O K3 é, portanto, uma das opções com pesos abertos mais capazes em sua categoria, mas essa afirmação precisa de duas notas. Sua licença é personalizada, não MIT, e seu repositório de 1,56 TB, além da recomendação de mais de 64 aceleradores, coloca a hospedagem própria além do alcance de uma equipe comum de desenvolvimento.
Meu veredito: use a API para descobrir se o K3 realmente melhora suas tarefas. Passe para os pesos somente quando controle, personalização ou limites de dados justificarem que você mesmo se torne o provedor da infraestrutura.