Dois lançamentos de ponta chegaram com quatro semanas de diferença, ambos voltados diretamente ao mesmo comprador: o desenvolvedor que executa agentes, não chatbots. A Moonshot AI lançou o Kimi K3 em 16 de julho de 2026. A xAI respondeu em 12 de agosto com o Grok 4.6. Pesquise hoje por "Grok 4.6 vs Kimi K3" e você encontrará a cobertura do lançamento de cada lado, além de uma pilha de fichas técnicas — mas quase ninguém colocou os dois lado a lado sob a perspectiva de quem constrói. É essa lacuna que este artigo preenche.
Aqui está a versão curta, porque você veio em busca de uma decisão, não de uma recapitulação.
O Grok 4.6 vence em eficiência de turnos agênticos e hospedagem sem intervenção. Ele conclui tarefas longas e com várias etapas em menos ciclos e usando menos tokens, e você nunca precisa tocar na infraestrutura. O Kimi K3 vence em contexto, vídeo nativo e controle — uma janela de 1 milhão de tokens, entrada de imagens e vídeo, além de pesos abertos para download caso você precise hospedar por conta própria ou operar em uma rede isolada. No número que todos citam, eles quase empatam: a Artificial Analysis estima o custo por tarefa de ambos em aproximadamente $0.84. Portanto, a diferença de um ponto no índice de inteligência não será o seu fator decisivo. Os dois modelos seguem caminhos opostos para chegar ao mesmo custo, e essa é a bifurcação que você realmente precisa escolher.
Se você executa fluxos de trabalho agênticos de alto volume e sensíveis a custos e quer um endpoint gerenciado, escolha o Grok 4.6. Se precisa inserir um repositório inteiro ou um vídeo em uma única janela de contexto — ou se tem um motivo de conformidade para manter os pesos por conta própria — escolha o Kimi K3. O restante deste artigo mostra o raciocínio por trás dessa decisão.
Especificações e preços, lado a lado
Algumas observações antes da tabela. Os números de benchmark publicados no lançamento vêm dos próprios materiais de cada fornecedor; considere-os 🟡 informados pelo fornecedor até que execuções independentes os confirmem. Os números da Artificial Analysis (índice de inteligência e custo por tarefa) são o mais próximo de uma comparação neutra entre os dois e estão identificados como tal. A tarifa da GPT Proto é o que você realmente paga para testar ambos com uma única chave; a lista oficial é o preço definido pelo próprio fornecedor.
|
Grok 4.6 |
Kimi K3 |
| Fornecedor |
xAI |
Moonshot AI |
| Lançamento |
12 de agosto de 2026 |
16 de julho de 2026 |
| Arquitetura |
Família Grok 4.5, treinamento suplementar estendido + RL agêntico |
MoE com 2,8 trilhões de parâmetros, 16 de 896 especialistas ativos por token |
| Acesso ao modelo |
Somente API hospedada (sem pesos para download) |
Pesos abertos (pesos lançados em 27 de julho de 2026, sob uma licença personalizada do Kimi K3) |
| Janela de contexto |
500.000 tokens |
1.048.576 tokens |
| Entradas |
Texto, imagem |
Texto, imagem, vídeo |
| Saída |
Texto (sem limite fixo de saída) |
Texto; até 1.048.576 dentro do orçamento de contexto, 131.072 por padrão |
| Índice de Inteligência da AA 🟡 |
61 |
~57 (Artificial Analysis); os gráficos do fornecedor o posicionam logo abaixo do Grok |
| Custo por tarefa (Artificial Analysis) |
~$0.84 |
~$0.84 |
| Preço oficial da lista /1 milhão de tokens |
$2 entrada / $6 saída (contexto curto) |
$3 entrada / $15 saída |
| Preço GPT Proto /1 milhão de tokens |
3.60 saída (40% de desconto) |
13.50 saída (10% de desconto) |
As linhas de preços merecem uma segunda análise, porque a afirmação principal de que "o Grok é mais barato" é verdadeira, mas incompleta. A tarifa de lista de $2/$6 do Grok 4.6 só vale para menos de 200 mil tokens. Ultrapasse esse limite — algo que um agente trabalhando em uma grande base de código faz rotineiramente — e a tarifa dobra para $4/$12, aplicada à totalidade da solicitação, não apenas ao excedente. O Kimi K3 cobra mais por token de saída, mas seu contexto completo de 1 milhão não tem sobretaxa. Portanto, o modelo mais barato muda dependendo da duração dos seus prompts. Chamadas curtas e frequentes favorecem o Grok; trabalhos com documentos longos ou em escala de repositório reduzem a diferença e podem invertê-la.
Inteligência e trabalho de conhecimento
No Índice de Inteligência composto da Artificial Analysis — nove benchmarks condensados em um único número — o Grok 4.6 marca 61 e o Kimi K3 fica alguns pontos abaixo. Eu destacaria duas coisas sobre essa diferença. Primeiro, o número exato do Kimi varia conforme a fonte: a Artificial Analysis informa 57, parte da cobertura do lançamento cita 60, e o próprio gráfico da xAI apenas diz "maior que o Kimi". Estou usando o número da Artificial Analysis como referência porque é a única execução neutra, mas uma diferença de um a quatro pontos em um composto de nove benchmarks está bem dentro do ruído causado pela forma como os componentes são ponderados. Segundo — e isso é mais importante — uma pontuação composta mede a qualidade de uma resposta. Ela quase não mede se um modelo consegue manter um objetivo ao longo de quarenta chamadas de ferramentas sem perder o rumo. Esse é o modo de falha que realmente destrói implantações de agentes, e o número do índice de nenhum dos fornecedores o prevê.
Onde eles divergem genuinamente é na eficiência agêntica. Na carga de trabalho privada AA-Briefcase da Artificial Analysis, o Grok 4.6 termina em cerca de 53 turnos e aproximadamente 0,5 bilhão de tokens de entrada. Para ter uma referência: o Claude Opus 5 precisa de cerca de 103 turnos e 2,0 bilhões de tokens na mesma tarefa. Esse é o benefício concreto do "autoteste em trajetórias longas" da xAI — o modelo verifica o próprio trabalho antes de dar o próximo passo e, assim, entra em menos ciclos. O Kimi K3 é competitivo no resultado de trabalhos longos de conhecimento (alcança o nível Fable 5 no Elo do AA-Briefcase, ~1548), mas não divulga a mesma disciplina no número de turnos. Se a sua conta aumenta conforme as chamadas de ferramentas — e, em agentes de produção, aumenta — essa é uma diferença real e mensurável, não uma frase de marketing.
Em termos simples: eles são aproximadamente equivalentes na inteligência das respostas, mas o Grok 4.6 chega lá com menos movimentos.
Programação: depende de qual programação
É aqui que um vencedor absoluto deixa de fazer sentido, então vejamos os detalhes. O Kimi K3 lidera em vários conjuntos de testes de programação: SWE Marathon (42,0 contra pontuações de referência de ponta de 35–40), Program Bench (77,8, superando por pouco os 77,6 do GPT-5.6 Sol) e fica a meio ponto do líder no Terminal-Bench 2.1 com 88,3 (acompanhado no Coding Agent Index da Artificial Analysis). No benchmark de navegação na web BrowseComp, ele lidera o campo com 91,2. Enquanto isso, o Grok 4.6 obteve 88,4% no Terminal-Bench v2.1 e 1753 de Elo no GDPval-AA v2 — e seus ganhos mais expressivos em relação ao Grok 4.5 aparecem no CursorBench 3.2 (69,9% contra 66,7%) e no Terminal-Bench v3.0 (26% contra 15,7%).
Ao olhar além dos números, surge um padrão. A força de programação do Kimi K3 é ampla e orientada a repositórios: ele navega por grandes bases de código, depura a partir de logs e capturas de tela, e sua janela de 1 milhão permite manter um projeto inteiro no contexto. A força de programação do Grok 4.6 é orientada à trajetória: ele foi ajustado dentro do Cursor e do Grok Build com base em sessões reais de desenvolvedores, por isso se destaca em sustentar uma tarefa de programação — transformando uma ideia vaga em uma primeira versão funcional e refinando-a ao longo de várias etapas. O custo, como todo modelo tem aqui: a janela de 500 mil do Grok limita quanto de um monorepositório ele consegue ver de uma vez, e ele não consegue manter feedback em vídeo. A vantagem do Kimi nos benchmarks brutos de programação vem acompanhada de uma conta maior por tokens de saída e, segundo a própria nota de lançamento da Moonshot, de uma taxa de alucinação que aumentou junto com os ganhos de precisão.
Para trabalho de frontend e interativo especificamente — uma variação comum desta pesquisa — o Kimi K3 liderou a Frontend Code Arena da LMArena no lançamento, enquanto o Grok 4.6 ficou próximo do GPT-5.6 Sol e do Claude Fable nas tarefas de desenvolvimento web da Code Arena. Ambos são fortes; hoje, o Kimi tem o sinal independente mais contundente em frontend.
Contexto, multimodalidade e implantação
Aqui, os dois modelos não competem em uma escala — eles foram construídos de maneiras diferentes. O Kimi K3 oferece uma janela de contexto de 1.048.576 tokens e entrada nativa para texto, imagens, e vídeo, a partir de uma única arquitetura. Essa combinação é o motivo para escolhê-lo: um agente de programação que lê capturas de tela para aperfeiçoar uma interface, um fluxo de pesquisa que mantém um corpus completo de documentos residente, um sistema de QA que compara o vídeo da interface com a implementação. O Grok 4.6 oferece 500 mil tokens e entrada de texto e imagem. É suficiente para a maioria dos trabalhos, mas se sua tarefa for "analisar esta gravação de tela de 40 minutos" ou "manter estes 300 arquivos em um único prompt", o Grok não é a ferramenta adequada.
Depois há a questão da propriedade, que é binária. O Grok 4.6 é hospedado exclusivamente; não há nada para baixar, e a xAI pode revisar ou descontinuar o endpoint sem depender de você. O Kimi K3 é distribuído com pesos abertos sob uma Licença personalizada do Kimi K3 — você pode hospedá-lo por conta própria, ajustá-lo e quantizá-lo. Para equipes com regras de residência de dados, requisitos de isolamento de rede ou uma política contra dependência de fornecedor, isso é decisivo. A ressalva honesta: na precisão nativa de 4 bits, os pesos precisam de aproximadamente 1,4 TB de memória residente antes de qualquer cache KV, o que excede um único nó com 8 GPUs. "Aberto" aqui significa legal e tecnicamente disponível para quem possui hardware robusto, não que "rode no seu laptop". Para todos os demais, o caminho prático para usar o Kimi K3 também é uma API hospedada.
Quando escolher cada um
Nada de ficar em cima do muro. Esta é a recomendação por carga de trabalho.
Escolha o Kimi K3 se alguma destas situações descreve você: precisa inserir um repositório inteiro, um conjunto extenso de documentos ou vídeo em uma única janela de contexto; trabalha com programação frontend ou interativa, na qual a liderança do LMArena se destaca; tem um motivo de conformidade ou dependência de fornecedor para manter os pesos; ou quer multimodalidade nativa sem integrar um modelo de visão separado. Você pagará mais por token de saída — leve isso em conta no orçamento para geração de texto em alto volume.
Escolha o Grok 4.6 se: executa agentes autônomos de longo horizonte e se importa em concluir tarefas em menos turnos e com menos tokens; seus prompts permanecem abaixo de 200 mil tokens para obter a tarifa de lista limpa de $2/$6; quer um endpoint gerenciado sem infraestrutura; ou é sensível a custos em alta frequência. Fique atento ao nível de contexto longo — ultrapasse 200 mil e a solicitação inteira será cobrada em dobro.
O empate no custo por tarefa é o ponto principal. Você não está escolhendo um modelo mais barato. Está escolhendo entre eficiência de turnos hospedada e multimodalidade de contexto longo com pesos abertos. Combine isso com sua carga de trabalho, não com a diferença de um ponto no índice.
Execute ambos com uma única chave na GPT Proto
A maneira mais rápida de resolver uma discussão sobre "qual é melhor para minha tarefa" é executar sua própria tarefa nos dois. A GPT Proto disponibiliza o Kimi K3 e o Grok 4.6 por meio de um único endpoint compatível com OpenAI e um único saldo, para que você possa testá-los em A/B sem financiar duas contas. Observe o cabeçalho de autenticação: a superfície /v1/ da GPT Proto aceita a chave bruta, sem o prefixo no Bearer.
Python:
import openai
client = openai.OpenAI(
api_key="YOUR_GPTPROTO_API_KEY",
base_url="https://gptproto.com/v1",
)
prompt = "Refactor this function for readability and explain each change:\n\n<paste code>"
for model in ["kimi-k3", "grok-4.6"]:
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
print(f"=== {model} ===")
print(resp.choices[0].message.content)
print("tokens:", resp.usage.total_tokens)
cURL, primeira chamada:
curl https://gptproto.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: YOUR_GPTPROTO_API_KEY" \
-d '{
"model": "kimi-k3",
"messages": [
{"role": "user", "content": "Summarize the tradeoffs between MoE and dense LLMs in 3 bullets."}
]
}'
Há duas coisas específicas do Kimi K3 que uma simples troca do nome do modelo não revela. Ele sempre raciocina — defina reasoning_effort como low, high ou max (padrão max) no nível superior, não na configuração thinking mais antiga. E, em ciclos de várias interações ou ferramentas, retorne a mensagem anterior completa do assistente, incluindo reasoning_content, ou você interromperá a continuidade do raciocínio em sessões longas. Extraia sua resposta final de content, nunca de reasoning_content.
Detalhes completos dos modelos e preços atuais: Kimi K3 na GPT Proto e Grok 4.6 na GPT Proto.