Raciocínio, Ferramentas e JSON
O K3 sempre raciocina e oferece suporte a esforço baixo, alto ou máximo. Ele também oferece suporte a escolha de ferramentas, carregamento dinâmico de ferramentas, modo JSON e saída rigorosa de JSON Schema.
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "kimi-k3",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, agentes de programação e trabalho com documentos. Preço por 1M de tokens — entrada, entrada em cache e saída são cobradas separadamente. GPTProto está 10% abaixo das tarifas oficiais.
| Cenário | Lista de MoonshotAI | OpenRouter | GPTProto | Economia / mês |
|---|---|---|---|---|
| Pessoal10M tokens / mês (4.8M cache) | $41.04 | $43.30 | $36.94 | −$4.10≈ $49.25 / ano |
| Equipe100M tokens / mês (48M cache) | $410.40 | $432.97 | $369.36 | −$41.04≈ $492.48 / ano |
| Empresarial500M tokens / mês (240M cache) | $2052.00 | $2164.86 | $1846.80 | −$205.20≈ $2462.40 / ano |
Execute o principal modelo da Moonshot AI, com 2,8 trilhões de parâmetros, por meio de uma única chave GPTProto. Lide com bases de código extensas, entradas multimodais, chamadas de ferramentas e saída estruturada em uma janela de contexto de 1M de tokens.
Raciocínio, Ferramentas e JSON
O K3 sempre raciocina e oferece suporte a esforço baixo, alto ou máximo. Ele também oferece suporte a escolha de ferramentas, carregamento dinâmico de ferramentas, modo JSON e saída rigorosa de JSON Schema.
Contexto Multimodal de 1M de Tokens
Analise repositórios longos, documentos, imagens e vídeo em uma única janela de contexto. O K3 combina compreensão visual nativa com raciocínio textual para fluxos de trabalho de agentes multimodais.
Codificação de Longo Horizonte
Navegue por grandes repositórios, coordene ferramentas de terminal, depure a partir de logs e capturas de tela e continue trabalhos de engenharia em várias etapas com menos supervisão humana.
Chamadas Compatíveis com o SDK da OpenAI
Use o formato familiar de solicitação do Chat Completions. Para o K3, preserve a mensagem completa do assistente, incluindo reasoning_content, ao continuar conversas ou concluir loops de ferramentas.
A API Kimi K3 dá aos desenvolvedores acesso hospedado ao modelo principal da Moonshot AI para codificação de longo horizonte, análise multimodal, uso de ferramentas e trabalho de conhecimento de ponta a ponta. Lançado em 16 de julho de 2026, o K3 é um modelo Mixture-of-Experts de 2,8 trilhões de parâmetros. Ele ativa 16 dos 896 especialistas por token e combina Kimi Delta Attention, Attention Residuals e Stable LatentMoE para lidar com sequências longas com mais eficiência do que um modelo denso de tamanho total semelhante.
O K3 aceita entrada de texto, imagem e vídeo e retorna texto. Sua janela de contexto de 1M de tokens é destinada a cargas de trabalho que não podem ser reduzidas a um prompt curto: codificação em escala de repositório, análise de múltiplos documentos, longos históricos de ferramentas e ciclos de feedback visual. O modelo sempre raciocina. Os desenvolvedores podem definir reasoning_effort como low, high ou max, com max como padrão, em vez de ativar e desativar o pensamento.
O GPTProto adiciona uma camada de acesso diferente em torno do modelo. Uma mesma chave de API e saldo do Kimi K3 também podem ser usados em mais de 200 modelos de texto, imagem, vídeo e áudio. A tarifa exibida nesta página é de US$ 2,70 por 1M de tokens de entrada e US$ 13,50 por 1M de tokens de saída, 10% abaixo do preço de lista atual 3/15 da Moonshot. Isso torna o K3 mais fácil de testar ao lado de GPT-5.6 Sol, Claude Fable 5, GLM-5.2 ou outros modelos, sem abrir e financiar uma conta de provedor separada para cada experimento.
| Especificação | Kimi K3 |
|---|---|
| Provedor | Moonshot AI |
| Data de lançamento | 16 de julho de 2026 |
| Classe do modelo | Mixture-of-Experts de 2,8 trilhões de parâmetros |
| Especialistas ativos | 16 de 896 por token |
| Arquitetura | Kimi Delta Attention, Attention Residuals, Stable LatentMoE |
| Entrada | Texto, imagem e vídeo |
| Saída | Texto |
| Janela de contexto | 1.048.576 tokens |
| Limite de conclusão | 131.072 tokens por padrão; configurável até 1.048.576 dentro do orçamento total de contexto |
| Raciocínio | Sempre ativo; low, high ou max de esforço |
| Recursos da API | Streaming, chamadas de ferramentas, tool_choice, ferramentas dinâmicas, modo JSON, JSON Schema estrito e Partial Mode |
O K3 é mais útil quando uma tarefa combina um grande conjunto de trabalho com ações repetidas. Um agente de codificação pode inspecionar um repositório, editar vários arquivos, executar testes, ler logs e usar capturas de tela para refinar um frontend ou jogo. Um fluxo de trabalho de pesquisa pode manter um grande corpus de documentos em contexto, chamar ferramentas externas e retornar um resultado que segue um JSON Schema estrito. Um sistema de QA multimodal pode comparar capturas de tela de interface com detalhes de implementação, enquanto um fluxo de trabalho de vídeo pode analisar conteúdo enviado e retornar notas de cena, resumos ou metadados estruturados.
O modelo é menos interessante para classificação de textos curtos, chat simples ou extração em alto volume, quando um modelo menor já atende ao limite de qualidade. O K3 sempre raciocina, então até a sua configuração de esforço mais baixo deve ser avaliada quanto à latência e ao custo de tokens de saída. Comece com um fluxo de trabalho representativo, meça a conclusão da tarefa em vez de uma única resposta e compare o K3 com um modelo menor antes de direcionar todo o tráfego para ele.
O K3 funciona com o SDK da OpenAI e com o formato de solicitação do Chat Completions, mas possui um comportamento específico do modelo que uma simples troca de nome de modelo pode não captar.
Primeiro, o Preserved Thinking está sempre ativado. Em conversas de várias etapas e loops de ferramentas, retorne a mensagem completa do assistente da resposta anterior, incluindo reasoning_content e tool_calls. Manter apenas o content visível pode quebrar a continuidade do raciocínio e tornar sessões longas instáveis. O raciocínio histórico também consome contexto e é cobrado como uso de tokens, portanto compacte o trabalho concluído em vez de carregar todos os turnos para sempre.
Segundo, use o campo reasoning_effort de nível superior em vez da configuração thinking mais antiga do K2.x. O K3 suporta low, high e max. Seus valores de amostragem são fixos, portanto os aplicativos não devem depender de configurações personalizadas de temperatura ou penalidade.
Terceiro, analise os resultados estruturados do campo content final, não de reasoning_content. O K3 suporta o modo JSON e JSON Schema estrito por meio de response_format, o que é útil para pipelines de extração, argumentos de ferramentas e saídas de pesquisa legíveis por máquina.
Por fim, solicitações multimodais precisam de partes de conteúdo estruturadas. A interface nativa da Moonshot aceita imagens em base64 ou referências a arquivos enviados, em vez de URLs públicas de imagens. Confirme a documentação atual do GPTProto para ver os campos exatos de imagem e vídeo expostos por este endpoint antes de lançar um fluxo de trabalho multimodal.
O post de lançamento da própria Moonshot diz que o K3 ainda fica atrás do Claude Fable 5 e do GPT-5.6 Sol no desempenho geral. A razão para escolher o K3 não é a afirmação de que ele vence todos os benchmarks. Seu ponto mais forte é a combinação de uma janela de contexto de 1M, compreensão nativa de vídeo, codificação de longo horizonte e um preço do token substancialmente menor.
| Fator de decisão | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Preço de tabela oficial da API por 1M de tokens | US$ 3 de entrada / US$ 15 de saída | US$ 5 de entrada / US$ 30 de saída | US$ 10 de entrada / US$ 50 de saída |
| Janela de contexto | 1.048.576 | 1.050.000 | 1.000.000 |
| Saída máxima | Até 1.048.576 dentro do contexto; 131.072 padrão | 128.000 | 128.000 |
| Entradas nativas | Texto, imagem, vídeo | Texto, imagem | Texto, imagem |
| Acesso ao modelo |
API hospedada; pesos oficiais do modelo lançados separadamente pela Moonshot AI |
API fechada | API fechada |
| Melhor uso | Codificação com foco em custo, agentes multimodais, grandes conjuntos de trabalho | Codificação de alto nível, uso de computador e fluxos de trabalho de ferramentas da OpenAI | Agentes de longa duração, visão complexa e trabalho de conhecimento premium |
Escolha o K3 quando seu menor custo de API, entrada nativa de vídeo ou janela de contexto de 1M de tokens for mais importante do que vencer o conjunto mais amplo de avaliações de fronteira. Escolha o GPT-5.6 Sol ou o Claude Fable 5 quando sua própria avaliação no nível da tarefa mostrar que a maior taxa de conclusão compensa o preço mais alto dos tokens. Para uma discussão benchmark por benchmark, leia O que é o Kimi K3—e ele está realmente perto do GPT-5.6 e do Fable 5?.
Obtenha respostas concisas sobre preços, limites de contexto, entrada multimodal, comportamento de raciocínio e seleção de modelos da API Kimi K3.
Guias, comparações e atualizações relacionadas a este modelo.
Todos os artigos
Compare GLM-5.2 vs Kimi K3 para programação, revisão de código, desenvolvimento de jogos, benchmarks e custos de API para descobrir o melhor modelo para desenvolvedores em 2026.

Execute o GLM-5.2 como um agente de codificação com o Claude Code ou uma API compatível com OpenAI. Inclui configuração real, prompts em nível de repositório, requisitos locais e exemplos de custo.

O Kimi K3 é open source—e está realmente próximo do GPT-5.6 e do Fable 5? Explore o contexto de 1M, preços de API, benchmarks independentes e a reação no Reddit.

Compare OpenAI, Claude, Gemini, OpenRouter, fal.ai, Replicate e GPTProto em relação a preços reais, cobertura de modelos, latência, SDKs e adequação para produção.