DeepSeek V4 Pro 0813 vs Kimi K3 em resumo
| Categoria |
DeepSeek V4 Pro 0813 |
Kimi K3 |
Melhor opção |
| Índice de Inteligência independente atual |
53 |
60 |
Kimi K3 |
| Velocidade de saída |
83.2 tokens/s |
40.8 tokens/s |
DeepSeek V4 Pro |
| Tempo até o primeiro token |
1.63 segundos |
2.97 segundos |
DeepSeek V4 Pro |
| Janela de contexto |
Cerca de 1M de tokens |
Cerca de 1M de tokens |
Empate |
| Preço de entrada no GPT Proto |
$1.044 por 1M de tokens |
$2.70 por 1M de tokens |
DeepSeek V4 Pro |
| Preço de saída no GPT Proto |
$2.088 por 1M de tokens |
$13.50 por 1M de tokens |
DeepSeek V4 Pro |
| Entrada disponível no GPT Proto |
Texto |
Texto, imagem, documento |
Kimi K3 |
| Controle de raciocínio |
Sem pensamento, Alto, Máximo |
Raciocínio sempre ativo com controles de esforço |
Depende do fluxo de trabalho |
| Licença de pesos abertos |
MIT |
Licença Kimi K3 |
DeepSeek para self-hosting comercial mais simples |
| Mais indicado para |
Codificação de texto em alto volume e agentes |
Tarefas complexas de agentes multimodais e visuais |
Depende da tarefa |
Os números de benchmark, velocidade e latência acima vêm da atual avaliação frente a frente da Artificial Analysis. O Índice de Inteligência usa o mesmo framework de avaliação para ambos os modelos, o que o torna mais útil do que colocar os gráficos de lançamento de dois fornecedores lado a lado.
O que mudou no DeepSeek V4 Pro 0813?
O DeepSeek V4 Pro 0813 é a versão de produção atual do V4 Pro, não um produto de API separado. A documentação da DeepSeek afirma que o alias deepseek-v4-pro agora aponta para DeepSeek-V4-Pro-0813 e que o método de chamada permanece inalterado. A mesma documentação lista uma janela de contexto de um milhão de tokens, até 384K de saída, modos de raciocínio e não raciocínio, saída JSON e chamada de ferramentas.
Essa decisão de nomenclatura importa porque nomes de modelo com data frequentemente forçam os desenvolvedores a alterar arquivos de configuração, regras de roteamento e registros de avaliação. Aqui, a atualização acontece por trás do alias estável. No GPT Proto, o mesmo princípio se aplica: mantenha deepseek-v4-pro na sua requisição.
O resultado independente atual também é diferente dos números encontrados em muitos artigos de comparação de julho. A Artificial Analysis agora dá ao modelo 0813 uma pontuação de 53 no Índice de Inteligência com esforço máximo de raciocínio. O Kimi K3 pontua 60 na avaliação atual.
Eu não descreveria isso como uma melhoria limpa de nove pontos em relação à pontuação anterior de 44. O modelo mudou, mas os conjuntos de benchmarks e as versões de avaliação também podem mudar. A conclusão defensável é mais restrita: comparações baseadas na prévia não descrevem mais o modelo servido hoje, e novos testes independentes colocam o 0813 mais próximo do Kimi K3 do que a cobertura da era da prévia sugeria.
A DeepSeek não mudou o formato básico do produto do modelo. Ele continua sendo um modelo Mixture-of-Experts de 1.6 trilhão de parâmetros, com 49 bilhões de parâmetros ativos por token, entrada de texto, uma grande cota de saída e esforço de raciocínio selecionável. A versão 0813 é, portanto, melhor entendida como uma atualização de produção e pós-treinamento do que como um novo ramo multimodal.
Benchmarks: Kimi K3 ainda lidera, mas não em tudo
O Kimi K3 lidera a comparação independente ampla por 60 a 53. Essa diferença de sete pontos importa quando um fluxo de trabalho combina raciocínio, conhecimento, codificação e planejamento de longo horizonte. Isso não significa que o Kimi produzirá um resultado melhor em todos os repositórios ou em todos os prompts.
Os dois modelos fazem diferentes concessões. A Moonshot descreve o Kimi K3 como um modelo de agente multimodal nativo de 2.8 trilhões de parâmetros, projetado para codificação de longo horizonte e trabalho com conhecimento. Seu cartão de modelo oficial documenta compreensão de texto, imagem e vídeo no modelo upstream, além de uma janela de contexto de um milhão de tokens. A rota atual do Kimi K3 no GPT Proto lista entradas de texto, imagem e documento.
O DeepSeek V4 Pro 0813 é somente texto, mas produz tokens a 83.2 tokens por segundo nos testes da Artificial Analysis. O Kimi K3 chega a 40.8 tokens por segundo. A DeepSeek também começa a responder mais cedo, com um tempo até o primeiro token de 1.63 segundo contra 2.97 segundos do Kimi.
Em termos simples: o Kimi tem a pontuação geral de capacidade mais alta. A DeepSeek retorna texto aproximadamente duas vezes mais rápido e custa muito menos ao fazer isso.
Há outra armadilha de benchmark aqui. As pontuações de codificação dos fornecedores frequentemente usam configurações de agente, ajustes de raciocínio, snapshots de repositório ou critérios de aprovação diferentes. Uma pontuação do Kimi produzida com Kimi Code não pode ser automaticamente comparada com uma pontuação da DeepSeek produzida com outra configuração de avaliação. Para seleção de modelo, use avaliações independentes pareadas como base compartilhada e depois teste a tarefa que afeta o seu produto.
Este artigo não afirma ter feito um teste privado de codificação com o mesmo prompt. Sem um, declarar qualquer um dos modelos vencedor universal de codificação seria mais forte do que as evidências permitem.
Qual é melhor para codificação e fluxos de trabalho de agentes?
Para codificação de texto em alto volume, eu começaria com o DeepSeek V4 Pro 0813.
A razão não é que ele supera o Kimi em todas as medidas. Não supera. A razão é que agentes de codificação em produção consomem contexto repetidamente e geram raciocínio, patches, planos de teste e instruções de ferramentas. O preço de saída se acumula a cada loop. Os modos de raciocínio selecionáveis da DeepSeek também permitem que os desenvolvedores reservem o esforço máximo para tarefas difíceis, em vez de pagar pelo mesmo comportamento de raciocínio em todas as requisições.
Isso torna a DeepSeek uma forte opção padrão para:
Leitura de repositório e Q&A sobre a base de código
Revisão de pull requests
Identificação de bugs
Planos de refatoração
Geração de testes
Chamada de ferramentas baseada em texto
Agentes em segundo plano de alto volume
Respostas JSON estruturadas
O Kimi K3 se torna mais atraente quando o custo de uma tentativa falha é maior do que a conta de tokens. Sua pontuação independente de inteligência mais alta o torna um modelo de escalada razoável para tarefas longas e difíceis que a DeepSeek não consegue concluir. Ele também é a opção clara quando a requisição contém evidências visuais.
Um padrão prático de produção, portanto, não é “escolher um para sempre”. Roteie tarefas rotineiras de texto para a DeepSeek e depois tente novamente falhas selecionadas ou tarefas multimodais com o Kimi. Como ambos estão disponíveis com uma chave de API GPT Proto e saldo compartilhado, a mudança pode ser limitada ao campo model.
DeepSeek V4 Pro vs Kimi K3 para codificação frontend
“Codificação frontend” abrange dois tipos diferentes de carga de trabalho, e eles não devem ser resumidos em um único veredito.
O primeiro é de texto para código: gerar componentes React, CSS, estrutura de página, correções de acessibilidade ou lógica TypeScript a partir de uma especificação escrita. Ainda não há evidência pública pareada suficiente para afirmar que o Kimi K3 ou o DeepSeek V4 Pro 0813 vence esta categoria universalmente. O menor custo e a saída mais rápida da DeepSeek fazem dela a primeira tentativa mais econômica.
O segundo é a iteração visual de frontend: mostrar ao modelo uma captura de tela, pedir que ele identifique problemas de espaçamento ou layout e revisar a interface a partir do feedback visual. O Kimi K3 é mais adequado a esse fluxo de trabalho porque aceita entrada de imagem. O DeepSeek V4 Pro é somente texto, então um desenvolvedor precisaria traduzir a captura de tela em texto ou usar um modelo de visão separado primeiro.
Use a DeepSeek para implementação de UI descrita por texto em escala. Use o Kimi quando o modelo precisar ver a interface.
Preços da API: a DeepSeek vence por mais do que o título sugere
Atualmente, o GPT Proto precifica o DeepSeek V4 Pro em $1.044 por milhão de tokens de entrada e $2.088 por milhão de tokens de saída. O Kimi K3 custa $2.70 para entrada e $13.50 para saída.
| Preço GPT Proto por 1M de tokens |
DeepSeek V4 Pro |
Kimi K3 |
Múltiplo do preço do Kimi |
| Entrada |
$1.044 |
$2.70 |
2.59× |
| Saída |
$2.088 |
$13.50 |
6.47× |
A DeepSeek é 61.3% mais barata na entrada e 84.5% mais barata na saída. A diferença na saída é a mais importante para agentes com uso intenso de raciocínio, porque o trabalho interno e as respostas finais podem se tornar longos.
Os preços por token ainda são abstratos, então considere duas cargas de trabalho hipotéticas.
| Carga de trabalho |
Premissa de tokens |
DeepSeek V4 Pro |
Kimi K3 |
| Revisão de código grande |
100K entrada + 20K saída |
$0.146 |
$0.540 |
| Tarefa de agente em escala de repositório |
1M entrada + 250K saída |
$1.566 |
$6.075 |
No exemplo em escala de repositório, o Kimi custa cerca de 3.88 vezes mais. Isso não faz do Kimi um mau custo-benefício por definição. Se ele concluir uma tarefa difícil em uma única tentativa enquanto um modelo mais barato precisa de repetidas tentativas e correção humana, a chamada cara ainda pode custar menos no total.
A métrica certa de produção é o custo do resultado aceito, não apenas o custo por token. Registre o modelo, os tokens, as tentativas, a latência, o resultado do teste e a aceitação do revisor para cada categoria de tarefa. Uma taxa baixa por token só se torna uma economia real quando a saída é aprovada.
Velocidade e latência
A Artificial Analysis atualmente mede o DeepSeek V4 Pro 0813 em 83.2 tokens de saída por segundo e o Kimi K3 em 40.8. O tempo até o primeiro token é de 1.63 segundos para a DeepSeek e 2.97 segundos para o Kimi.
Esses números favorecem a DeepSeek para assistentes de codificação interativos e workers de agentes paralelos. Um modelo que retorna tokens duas vezes mais rápido pode encurtar a espera visível mesmo quando ambos os modelos eventualmente chegam a uma resposta aceitável.
No entanto, a velocidade do provedor não é uma propriedade permanente dos pesos. Ela também depende da carga do servidor, quantização, agrupamento (batching), tamanho do prompt, esforço de raciocínio e de onde a requisição é atendida. Trate as medições atuais como um retrato comparável, não como garantia de latência para toda chamada.
Contexto, raciocínio e diferenças de implantação
Ambos os modelos suportam cerca de um milhão de tokens de contexto, então o tamanho do contexto sozinho não decide esta comparação. Como eles usam esse contexto importa mais.
O DeepSeek suporta modos sem pensamento e com pensamento, com controles de esforço de raciocínio para tarefas mais difíceis. Ele também permite até 384K de saída de acordo com a especificação atual da API DeepSeek. Essa flexibilidade atende sistemas de roteamento que usam respostas rápidas para tarefas simples e raciocínio mais profundo apenas quando necessário.
O Kimi K3 usa raciocínio sempre ativo com esforço configurável. Sua arquitetura maior de 2.8T e design multimodal visam trabalhos de longo horizonte envolvendo documentos, código, imagens e uso de ferramentas. O trade-off é um custo de saída mais alto e uma geração medida mais lenta.
Ambos os modelos têm pesos para download, mas “open weight” não significa licenciamento idêntico. O DeepSeek V4 Pro usa a licença MIT. O Kimi K3 usa sua própria Licença Kimi K3. Equipes que planejam self-hosting comercial devem revisar os termos exatos do Kimi em vez de presumir que são iguais aos da MIT.
O requisito de hardware também está muito além de uma estação de trabalho local comum. Para a maioria das equipes de desenvolvimento, a avaliação por API hospedada é o ponto de partida realista mesmo quando os pesos estão disponíveis.
Como acessar o DeepSeek V4 Pro 0813 e o Kimi K3 com uma chave de API
O GPT Proto expõe ambos os modelos por meio de um endpoint de chat completions compatível com OpenAI. Comece com a DeepSeek definindo MODEL_ID como deepseek-v4-pro:
export GPTPROTO_API_KEY="your_api_key"
export MODEL_ID="deepseek-v4-pro"
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data "{
\"model\": \"$MODEL_ID\",
\"messages\": [
{
\"role\": \"user\",
\"content\": \"Revise esta função quanto à correção e retorne a resposta em Markdown conciso.\"
}
]
}"
Para enviar a mesma solicitação de texto para o Kimi K3, mude uma linha:
export MODEL_ID="kimi-k3"
Depois, execute novamente a mesma requisição curl. Você não precisa de uma conta Moonshot separada, de um segundo saldo ou de um sufixo de versão DeepSeek.
Para uma comparação controlada, mantenha o prompt, o contexto, a configuração de raciocínio e o limite de saída iguais. Registre os campos de uso retornados junto com a latência, as tentativas e se o resultado passou nos seus testes. Comparar uma resposta atraente de cada modelo não é suficiente para uma decisão de roteamento em produção.
Qual modelo você deve escolher?
Escolha o DeepSeek V4 Pro 0813 quando:
Sua carga de trabalho é principalmente texto e código
O volume de saída torna o custo por token importante
Baixa latência melhora a experiência do usuário
Você quer modos sem pensamento e raciocínio mais profundo sob um único ID de modelo
Você precisa de um caminho de self-hosting com licença MIT
Você está selecionando um modelo padrão para agentes de alto volume
Escolha o Kimi K3 quando:
O modelo precisa inspecionar capturas de tela, imagens ou documentos
A pontuação independente de inteligência mais alta no momento importa mais que o preço
Uma tarefa falha custa mais do que uma chamada de API premium
Você está criando agentes multimodais de longo horizonte
Você quer escalar as requisições mais difíceis depois que um modelo mais barato falha
Para a maioria dos desenvolvedores, a melhor política de roteamento é DeepSeek primeiro e Kimi quando necessário. Ela captura a maior parte da vantagem de custo e velocidade da DeepSeek sem abrir mão do acesso ao teto multimodal e de maior capacidade do Kimi.
Veredito final
O DeepSeek V4 Pro 0813 é a melhor opção padrão para a maioria das cargas de trabalho de codificação baseada em texto e agentes. Ele fica sete pontos atrás do Kimi K3 no Índice de Inteligência atual da Artificial Analysis, mas produz saída com aproximadamente o dobro da velocidade e custa muito menos no GPT Proto—especialmente para loops de agentes com muita saída.
O Kimi K3 é o melhor especialista. Escolha-o quando a tarefa incluir entrada visual, quando o raciocínio mais difícil possível importar mais que a conta, ou quando a DeepSeek já tiver falhado e outra tentativa for mais barata do que a recuperação manual.
A atualização 0813 não torna o Kimi obsoleto. Ela torna a decisão de roteamento mais nítida: DeepSeek para volume, velocidade e texto; Kimi para multimodalidade e o teto de capacidade medido mais alto.