Preços+7% bônus
Michael Johnson2026-07-25

Claude Opus 5 vs Fable 5: o modelo com metade do preço é realmente melhor?

O Claude Opus 5 é melhor que o Fable 5? Compare desempenho em programação, benchmarks, preços da API e custos de tarefas reais para escolher o modelo Claude certo.

Claude Opus 5 vs Fable 5: o modelo com metade do preço é realmente melhor?

Claude Opus 5 criou uma situação incômoda para a própria linha de modelos da Anthropic. O novo modelo custa exatamente metade por token em comparação com Claude Fable 5, mas supera por pouco o Fable em várias avaliações independentes de programação e trabalho de conhecimento. A Anthropic ainda descreve o Fable 5 como seu modelo mais capaz amplamente lançado, embora diga aos desenvolvedores que não sabem por onde começar para escolher o Opus 5.

Isso não é apenas um problema de nomenclatura. É uma decisão de compra.

Meu julgamento é direto: Claude Opus 5 é a melhor opção padrão para a maioria dos desenvolvedores, usuários do Claude Code e aplicações de trabalho de conhecimento em produção. O Fable 5 ainda merece um lugar na tabela de roteamento para as tarefas mais difíceis de planejamento, pesquisa e agentes que operam por vários dias — especialmente quando uma decisão arquitetural errada custaria mais do que a conta do modelo.

Resumo: o Opus 5 é melhor que o Fable 5?

Para a maioria das cargas de trabalho reais, sim. O Opus 5 oferece capacidade aproximadamente equivalente à do Fable pelo preço oficial de metade dos tokens de entrada e saída, funciona com menor latência comparativa e dá aos desenvolvedores mais controle sobre o esforço de raciocínio. Testes independentes colocam o Opus 5 em 61 no Artificial Analysis Intelligence Index, contra 60 do Fable 5 — efetivamente um empate —, mas o Opus lidera com mais clareza no trabalho de conhecimento agentivo.

O Fable 5 ainda tem três vantagens defensáveis: a Anthropic continua a posicioná-lo como o modelo Claude público de maior capacidade; ele mantém uma vantagem em conhecimento factual nos testes independentes disponíveis; e os primeiros relatos sobre o Claude Code sugerem que ele pode ser mais cauteloso durante planejamento e depuração ambíguos.

A resposta prática:

  • Escolha o Opus 5 para o trabalho cotidiano no Claude Code, desenvolvimento de funcionalidades, refatoração, revisão de código, automação e para a maioria das análises empresariais.

  • Escolha o Fable 5 para trabalhos autônomos de vários dias, decisões arquiteturais difíceis ou pesquisas em que uma premissa falsa pode comprometer todo o projeto.

  • Considere o Kimi K3 quando o custo dos tokens e a disponibilidade imediata no GPTProto forem mais importantes do que permanecer na família Claude.

Índice

Claude Opus 5 vs Fable 5 em resumo

Categoria Claude Opus 5 Claude Fable 5
Data de lançamento 24 de julho de 2026 9 de junho de 2026
Preço oficial da API $5/M de entrada, $25/M de saída $10/M de entrada, $50/M de saída
Disponibilidade no GPT Proto Não disponível no momento da publicação Disponível a $8/M de entrada, $40/M de saída
Janela de contexto 1 milhão de tokens 1 milhão de tokens
Saída máxima 128 mil tokens 128 mil tokens
Entradas e saída Texto e imagem na entrada; texto na saída Texto e imagem na entrada; texto na saída
Raciocínio Pensamento adaptativo; esforço ajustável Pensamento adaptativo sempre ativado; esforço ajustável
Latência comparativa Moderada Mais lenta
Limite confiável de conhecimento Maio de 2026 Janeiro de 2026
ID do modelo claude-opus-5 claude-fable-5
Melhor para Programação complexa e trabalho empresarial Trabalho agentivo de maior dificuldade e longa duração
Principal desvantagem Pode consumir muitos tokens adicionais com esforço alto O dobro do preço oficial dos tokens, proteções mais rigorosas

As especificações vêm da comparação atual de modelos. A tabela revela por que esta comparação não é uma disputa normal entre “modelo premium e modelo mais barato”: o tamanho do contexto, a saída máxima e as modalidades compatíveis são iguais. O argumento a favor do Fable baseia-se em julgamento e confiabilidade em horizontes longos — não em uma janela de contexto maior ou em um recurso que o Opus não possa acessar.

O que os benchmarks realmente dizem

A manchete do lançamento é verdadeira, mas precisa de uma palavra adicional: o Opus 5 é aproximadamente tão capaz quanto o Fable 5 por metade do preço dos tokens. Ele não é uniformemente melhor.

A Artificial Analysis mediu o Opus 5 no esforço máximo em 61 no seu Intelligence Index, um ponto acima dos 60 do Fable 5. Uma vantagem de um ponto deve ser interpretada como um empate efetivo, não como prova de que o modelo mais barato vence todas as tarefas. Os resultados mais interessantes aparecem no trabalho agentivo:

Avaliação independente Resultado do Opus 5 Comparação com o Fable 5
Artificial Analysis Intelligence Index 61 no esforço máximo 60
GDPval-AA v2 1.861 Elo no esforço máximo O Opus lidera por 114 Elo
AA-Briefcase 1.720 Elo no esforço máximo O Fable alcança 1.574
Terminal-Bench v2.1 89% no esforço máximo O Opus está próximo do líder geral
The Humanity’s Last Exam 53% Aproximadamente no mesmo nível do Fable

O AA-Briefcase é especialmente útil porque testa agentes em tarefas privadas e realistas envolvendo milhares de arquivos e entregáveis como relatórios, apresentações e planilhas. O Opus 5 não apenas superou o Fable por pouco no esforço máximo. Sua configuração de alto esforço alcançou 1.606 Elo — 32 pontos acima do Fable — a um custo médio de US$ 10,41 por tarefa, em comparação com US$ 22,30 do Fable. A Artificial Analysis relata que o Opus no esforço máximo custou US$ 17,79 por tarefa e ainda superou a pontuação do Fable.

Há um custo. Os três níveis mais altos de esforço do Opus levaram, em média, mais de 25 minutos por tarefa do AA-Briefcase. O esforço máximo levou em média 36,2 minutos e 103 turnos. Em outras palavras, o Opus pode atingir um teto mais alto trabalhando por mais tempo e dando mais passos. Tokens baratos não tornam agentes de alto esforço instantâneos.

O Fable também mantém uma vantagem mensurável em conhecimento factual. No AA-Omniscience, o Opus melhorou sua precisão em relação ao Opus 4.8, mas respondeu com mais frequência quando estava incerto, produzindo uma taxa de alucinação de 50% nesse teste específico. Isso não significa que metade de todas as respostas do Opus 5 são alucinações. Significa que, segundo a metodologia do AA-Omniscience, sua disposição para responder a perguntas sem suporte criou uma taxa de erro maior que a do Fable.

Há mais uma ressalva importante: a Artificial Analysis executou as avaliações do Opus e do Fable com o fallback para o Opus 4.8 ativado. Isso mede uma configuração de sistema implantável, mas torna o resultado um pouco menos puro como comparação apenas entre modelos.

A conclusão é mais restrita que o entusiasmo do lançamento: atualmente, o Opus 5 oferece a melhor relação entre capacidade e custo. O Fable continua sendo o candidato mais seguro quando a contenção factual e o julgamento difícil em horizontes longos importam mais que o desempenho médio em benchmarks.

Claude Opus 5 vs Fable 5 para programação

“Qual modelo escreve código melhor?” é a pergunta errada. Um agente de programação precisa entender o repositório, diagnosticar o problema, escolher uma direção, escrever o patch, executar os testes e reconhecer quando sua primeira teoria estava errada. Um modelo pode produzir código limpo e ainda assim levar o projeto na direção errada.

Diagnóstico e planejamento

É aqui que as primeiras evidências da comunidade se dividem.

Em uma comparação de depuração em produção realizada no dia do lançamento, um desenvolvedor deu a vários modelos Claude o mesmo prompt de tentativa única baseado em um problema previamente resolvido. O Opus 5 foi o único modelo a identificar o componente exato que continha a causa raiz; o Fable encontrou a categoria geral correta, mas foi menos específico. O autor descreveu explicitamente o caso como um único teste com tamanho de amostra igual a um.

Outro desenvolvedor relatou uma experiência quase oposta. Em um projeto de um ano testado com o Opus 5 e o Fable 5, o Opus escreveu código sólido, mas formou repetidamente uma conclusão incorreta sobre um sinalizador de configuração. Mais tarde, o Fable encontrou problemas adicionais no raciocínio do Opus. O fluxo de trabalho proposto por esse desenvolvedor foi revelador: usar o Fable para planejamento e orquestração e, depois, o Opus para implementação restrita.

Nenhuma das duas publicações é um benchmark controlado. Ambas são mais úteis que elogios genéricos porque expõem o verdadeiro limite de falha. O Opus parece capaz de fazer diagnósticos mais precisos em uma única tentativa, mas também pode se comprometer rapidamente demais com uma teoria. O valor do Fable não está em escrever códigos mais bonitos; está na possibilidade de evitar desvios caros.

Escrita e refatoração de código

O Opus 5 é a opção padrão mais forte aqui. A Anthropic o posiciona para programação agentiva complexa, e testes independentes colocam o Opus, junto com o Claude Code, no topo do Artificial Analysis Coding Index. A Anthropic também relata casos difíceis em que o modelo encontrou a causa raiz em vez de corrigir o sintoma, criou sua própria suíte de validação quando não havia um feed ao vivo disponível e verificou a saída do navegador antes de devolver o trabalho. Esses são exemplos selecionados pelo fornecedor, portanto devem ser tratados como demonstrações de capacidade, não como taxas de sucesso esperadas. Ainda assim, descrevem o comportamento correto a ser testado.

Para trabalhos delimitados — implementar esta funcionalidade, refatorar estes arquivos, corrigir estes testes que falham — o preço mais baixo do Opus facilita justificar execuções e revisões repetidas. O Fable pode fazer o mesmo trabalho, mas pagar o dobro pela taxa de tokens só faz sentido se isso reduzir turnos, retrabalho ou intervenção humana o suficiente para compensar a diferença.

Verificação da implementação final

Não permita que nenhum dos dois modelos revise a si próprio.

Dê aos dois modelos o mesmo commit congelado, tarefa, ferramentas, limite de tempo e definição de pronto. Depois, avalie resultados que resistam à inspeção:

Etapa do teste Dê aos dois modelos Meça
Diagnóstico Repositório somente leitura, logs, incidente conhecido Causa raiz correta, afirmações sem suporte, arquivos citados
Implementação Mesmo problema, ferramentas de escrita, mesmos testes Testes aprovados, regressões, tentativas, arquivos alterados
Verificação Casos extremos ocultos e critérios de aceitação Falhas não identificadas, afirmações falsas de “concluído”, correções humanas

Para uma migração de alto valor, um fluxo de trabalho sensato é usar o Fable para o plano inicial, o Opus para a implementação e um modelo separado ou revisor humano para a verificação. Isso custa mais que uma execução do Opus. Ainda assim, pode ser mais barato que aprovar a arquitetura errada.

Preços do Opus 5 vs Fable 5 e custo de tarefas reais

Nos preços oficiais de tabela da API, o Opus 5 custa US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída. O Fable 5 custa US$ 10 e US$ 50. A proporção é exata: o Fable é duas vezes mais caro por token. O anúncio do Opus 5 e o guia de integração do Fable 5 da Anthropic documentam essas tarifas.

Para uma carga de trabalho que utiliza 10 milhões de tokens de entrada e 2 milhões de tokens de saída:

Rota Custo de entrada Custo de saída Total
Opus 5 ao preço oficial de tabela $50 $50 $100
Fable 5 ao preço oficial de tabela $100 $100 $200
Fable 5 no GPT Proto $80 $80 $160

A página da API do GPT Proto para o Fable 5 atualmente lista US$ 8 por milhão de tokens de entrada e US$ 40 por milhão de tokens de saída. O exemplo acima exclui cache, descontos por lote, novas tentativas, comportamento de fallback e contexto gerado por ferramentas para manter a comparação legível.

O preço dos tokens é apenas a primeira linha da conta. O Opus 5 oferece cinco níveis de esforço — baixo, médio, alto, xhigh e máximo — e a Artificial Analysis observou uma variação de aproximadamente oito vezes no uso de tokens de saída entre baixo e máximo no GDPval-AA v2. Uma equipe que envie cada autocompletar, extração e pequena edição de código para o esforço máximo pode eliminar parte da economia esperada.

A métrica melhor é o custo por tarefa bem-sucedida:

custo por tarefa bem-sucedida =
gasto total com o modelo
+ gasto com novas tentativas e fallback
+ tempo de revisão humana
÷ tarefas aceitas

No AA-Briefcase, o esforço alto do Opus superou o Fable custando menos da metade por tarefa. Isso é uma evidência forte a favor do Opus. Não é uma garantia para o seu repositório. Se o Fable impedir uma migração malsucedida que o Opus teria aprovado, o modelo mais caro pode ser a decisão mais barata.

Quando o Fable 5 ainda é o melhor modelo

O Fable 5 continua valendo o investimento quando a tarefa é longa, ambígua e cara de reiniciar.

Primeiro, a Anthropic ainda chama o Fable 5 de seu modelo mais capaz amplamente lançado e o recomenda para cargas de trabalho que exigem a maior capacidade disponível. O Opus é o ponto de partida recomendado; o Fable é o caminho de escalonamento. Essa distinção é deliberada.

Segundo, o comportamento mais cauteloso do Fable pode ajudar no planejamento, na pesquisa factual e em sistemas desconhecidos. O resultado independente disponível sobre conhecimento factual favorece o Fable, enquanto o relato negativo da comunidade sobre o Opus descreve exatamente o tipo de falha que as tabelas de benchmark podem ocultar: código com aparência correta construído sobre uma conclusão falsa.

Terceiro, o Fable foi projetado para agentes de longa duração. A Anthropic o posiciona para raciocínio exigente, projetos de vários dias e trabalho autônomo que abrange muitas etapas. Uma tarefa de programação de uma hora pode não revelar sua vantagem. Uma migração de três dias com centenas de decisões talvez revele.

Os trade-offs de integração documentados são significativos:

  • Os preços oficiais dos tokens de entrada e saída do Fable são o dobro dos preços do Opus 5.

  • A Anthropic classifica a latência comparativa do Fable como mais lenta.

  • O pensamento adaptativo do Fable está sempre ativado, embora o esforço ainda possa ser ajustado.

  • O Fable exige retenção de dados por 30 dias e não está disponível sob retenção zero de dados.

  • Seus classificadores de segurança podem retornar stop_reason: "refusal" em uma resposta HTTP 200, portanto as integrações de produção precisam tratar recusas e implementar lógica de fallback.

O Fable não é o “modelo melhor se o orçamento não importar”. Ele é o especialista a ser usado quando a qualidade do planejamento, a contenção factual ou a consistência em horizontes longos justificarem um investimento mensurável.

Diferenças para desenvolvedores que as tabelas de benchmark não mostram

Detalhe de integração Opus 5 Fable 5 Por que isso importa
Controle do esforço Baixo, médio, alto, xhigh, máximo Pensamento adaptativo sempre ativado; controle de esforço compatível O esforço altera a latência e o uso de tokens
Limite de conhecimento Maio de 2026 Janeiro de 2026 O Opus pode conhecer bibliotecas e APIs mais recentes
Classificadores de segurança Menos restritivos que os do Fable Mais rigorosos, especialmente para cibersegurança e biologia Solicitações benignas de segurança ou depuração podem exigir fallback
Tratamento de recusas Fallback disponível HTTP 200 pode conter stop_reason: "refusal" Um status HTTP bem-sucedido nem sempre significa que a tarefa foi concluída
Retenção de dados Nenhuma exigência de retenção específica do modelo para acesso geral Exigência de retenção por 30 dias Importante para cargas de trabalho regulamentadas ou sensíveis
Latência comparativa Moderada Mais lenta Loops de agentes multiplicam a latência entre turnos
Modo rápido Cerca de 2,5× a velocidade padrão pelo dobro do preço-base dos tokens Nenhuma opção equivalente de lançamento listada Útil quando a latência importa mais que o custo

A Anthropic afirma que os classificadores de cibersegurança do Opus 5 devem intervir cerca de 85% menos vezes que os do Fable 5. Isso torna o Opus o modelo Claude mais prático para muitos fluxos legítimos de segurança de código e depuração, embora ele ainda bloqueie categorias de maior risco. A mesma documentação de lançamento diz que o Opus 5 não tem exigência específica de retenção de dados para acesso geral, enquanto o guia de integração do Fable especifica retenção por 30 dias.

A migração também exige mais do que alterar um ID de modelo. O Opus 5 tem o pensamento ativado por padrão, e as aplicações devem definir explicitamente o esforço se o custo ou a latência forem importantes. O Fable sempre raciocina e pode retornar recusas como respostas HTTP concluídas. Fazer a troca sem atualizar analisadores, regras de fallback, orçamentos de tokens e limites de avaliação é um convite a falhas silenciosas.

E quanto ao Claude Opus 5 vs Kimi K3?

O Kimi K3 não é um substituto direto do Claude, mas é a terceira opção mais relevante quando a decisão é orientada por custo e trabalho agentivo com contexto longo.

O Kimi K3 da Moonshot tem uma janela de contexto de 1 milhão de tokens, aceita entradas de texto, imagem e vídeo e usa raciocínio sempre ativado. Seu preço oficial de tabela é de US$ 3 por milhão de tokens de entrada e US$ 15 por milhão de tokens de saída. A API do Kimi K3 no GPT Proto está atualmente listada a US$ 2,70 e US$ 13,50 — abaixo dos dois modelos Claude.

Isso não torna o Kimi o vencedor automático em custo. O raciocínio em horizontes longos pode gerar mais turnos, histórico de raciocínio retido e tokens de saída. Meça o custo da tarefa concluída, não o número exibido no cartão de preços.

A capacidade também permanece inferior na ampla comparação independente disponível no lançamento: a Artificial Analysis deu ao Kimi K3 a pontuação 57, contra 61 do Opus 5 e 60 do Fable 5. Ainda assim, o Kimi pertence à lista de opções para fluxos de trabalho agentivos multimodais, especialmente quando a entrada de vídeo ou tarifas menores de tokens são importantes.

Há um detalhe de status que exige cuidado. A Moonshot afirma que os pesos completos do Kimi K3 serão lançados até 27 de julho de 2026. Em 25 de julho, a descrição precisa é “programado para um lançamento com pesos abertos”, não “já disponível para download e totalmente open source”.

Escolha o Kimi K3 quando precisar de um modelo multimodal disponível e mais barato e estiver disposto a validar seu comportamento agentivo. Escolha o Opus quando quiser a melhor opção padrão atual. Escolha o Fable quando a tarefa justificar o escalonamento para a categoria pública de maior capacidade da Anthropic.

Qual modelo você deve escolher?

Sua carga de trabalho Melhor escolha atual Por quê
Claude Code cotidiano, refatoração e trabalho em funcionalidades Opus 5 Melhor equilíbrio entre capacidade e custo
Depuração difícil com um resultado conhecido e verificável Opus 5 primeiro; compare com o Fable O Opus demonstra forte potencial para encontrar a causa raiz, mas verifique as conclusões
Projeto autônomo de vários dias Fable 5 Construído e posicionado para trabalho em horizontes longos
Planejamento arquitetural com alto custo de falha Fable 5 Investimento premium mais defensável por julgamento e contenção
Fluxo regulamentado sensível à retenção específica do modelo Opus 5 O Fable exige retenção por 30 dias
Depuração legítima de cibersegurança Opus 5 Os classificadores são menos restritivos que os do Fable
Agente multimodal sensível a custos que precisa de entrada de vídeo Kimi K3 Tarifas menores e compreensão de vídeo documentada
Precisa de um modelo disponível pelo GPT Proto agora Fable 5 ou Kimi K3 O Opus 5 ainda não está listado no momento da publicação

Se você só puder escolher um modelo hoje, escolha o Opus 5. Se sua aplicação puder fazer roteamento por tarefa, use o Opus como padrão e envie apenas os trabalhos mais difíceis de planejamento ou longa duração para o Fable. Assim, o investimento adicional do Fable fica associado ao trabalho que realmente pode se beneficiar dele.

Teste o Fable 5 e o Kimi K3 no GPT Proto

O Opus 5 não estava disponível no GPT Proto no momento da publicação, portanto não deve ser apresentado como uma opção ativa. Você já pode testar o Fable 5 e o Kimi K3 usando uma única conta GPT Proto e saldo compartilhado, comparando as respostas com a mesma tarefa e os mesmos critérios de aceitação.

Chame o Fable 5 pelo endpoint Messages:

curl --request POST "https://gptproto.com/v1/messages" \
  --header "Authorization: Bearer $GPTPROTO_API_KEY" \
  --header "Content-Type: application/json" \
  --data '{
    "model": "claude-fable-5",
    "max_tokens": 2048,
    "messages": [
      {
        "role": "user",
        "content": "Review this migration plan. Identify unsupported assumptions, missing rollback steps, and the tests required before production."
      }
    ]
  }'

Chame o Kimi K3 pelo endpoint Chat Completions compatível com OpenAI:

curl "https://gptproto.com/v1/chat/completions" \
  --header "Content-Type: application/json" \
  --header "Authorization: $GPTPROTO_API_KEY" \
  --data '{
    "model": "kimi-k3",
    "messages": [
      {
        "role": "user",
        "content": "Review this migration plan. Identify unsupported assumptions, missing rollback steps, and the tests required before production."
      }
    ]
  }'

Use o mesmo prompt, arquivos, permissões de ferramentas e critérios de avaliação. Registre os tokens de entrada e saída, o tempo decorrido, as afirmações sem suporte, as novas tentativas e o número de correções humanas antes da aceitação. O modelo vencedor é aquele que conclui sua tarefa — não aquele que escreve a primeira resposta mais confiante.

Você pode começar pela API de IA unificada do GPT Proto ou navegar pela Galeria de modelos de IA para comparar outros modelos de programação e raciocínio na mesma conta.

Veredito final

Claude Opus 5 é o melhor modelo padrão. Ele iguala ou supera o Fable 5 em várias avaliações independentes importantes, custa metade por token nas tarifas oficiais, funciona com menor latência comparativa e oferece aos desenvolvedores uma faixa prática mais ampla de configurações de esforço.

O Fable 5 não está obsoleto. Agora é mais fácil justificá-lo como especialista em vez de padrão: use-o para os agentes mais difíceis e de longa duração, planejamento de alto risco e trabalhos em que uma conclusão incorreta possa custar mais que toda a conta da API.

Em termos mais diretos: o Opus 5 é o modelo pelo qual a maioria das equipes deveria começar. O Fable 5 é o modelo para o qual elas deveriam escalar.

Creative Studio

Gere imagem, vídeo e mais com APIs de produção.

Começar a criar
Creative Studio
Modelos relacionados
Todos os modelos
Claude
10% OFF
MoonshotAI
10% OFF
OpenAI
20% OFF
Claude
10% OFF

Perguntas frequentes

O Claude Opus 5 é melhor que o Fable 5?

O Opus 5 é melhor para a maioria dos desenvolvedores porque oferece capacidade aproximadamente equivalente pela metade do preço oficial dos tokens e com menor latência comparativa. O Fable 5 continua sendo o melhor candidato para os agentes mais difíceis e de longa duração, planejamento cauteloso e trabalhos de alto risco.

O Opus 5 é mais barato que o Fable 5?

Sim. O Opus 5 custa US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída no preço oficial de tabela. O Fable 5 custa US$ 10 e US$ 50, exatamente o dobro por token.

Qual modelo é melhor para o Claude Code?

O Opus 5 é a melhor opção padrão para programação cotidiana, refatoração, implementação de funcionalidades e revisão de código. Vale testar o Fable 5 para arquitetura, depuração ambígua e trabalho autônomo de vários dias. Em qualquer caso, verifique as conclusões do modelo com testes ou com um revisor separado.

O Opus 5 substitui o Fable 5?

Não. A Anthropic recomenda o Opus 5 como modelo inicial para programação complexa e trabalho empresarial, enquanto o Fable 5 continua sendo seu modelo amplamente lançado de maior capacidade para tarefas exigentes e de longa duração.

O Fable 5 vale o preço mais alto?

Somente quando a carga de trabalho puder se beneficiar de seus pontos fortes. O Fable é mais fácil de justificar para planejamento de alto valor, agentes de vários dias, pesquisas difíceis e tarefas em que evitar uma decisão errada importa mais do que economizar tokens. É difícil justificá-lo para geração rotineira de código ou análises curtas.

O Kimi K3 é mais barato que o Opus 5?

Suas tarifas de tokens são menores. O Kimi K3 custa US$ 3/US$ 15 por milhão de tokens de entrada/saída no preço de tabela da Moonshot e US$ 2,70/US$ 13,50 no GPTProto no momento da publicação. O custo real da tarefa depende dos tokens de raciocínio, turnos, chamadas de ferramentas, novas tentativas e da quantidade de correção humana necessária.

Posso usar o Opus 5 no GPTProto?

Não no momento da publicação. Atualmente, o GPTProto oferece acesso ao Claude Fable 5 e ao Kimi K3, enquanto o Opus 5 ainda não foi adicionado. Consulte a galeria de modelos para verificar a disponibilidade mais recente antes de publicar ou integrar.

Artigos relacionados

Mais blogs
Kimi K3 vs GPT-5.6 Sol: Tokens Mais Baratos ou Tarefas Mais Baratas?

Kimi K3 vs GPT-5.6 Sol: Tokens Mais Baratos ou Tarefas Mais Baratas?

TL;DR Update — July 28, 2026 : Kimi K3's full weights are now public. Moonshot AI released the 2.8T checkpoint, technical report, and Kimi K3 License in its official repositories. The release strengthens K3's control and deployment case against GPT-5.6 Sol, but it does not change the independent benchmark results or make K3 inexpensive to operate yourself. Kimi K3 is cheaper per token. GPT-5.6 Sol is the stronger default for high-stakes production agents. Both statements can be true. The gap is smaller than the price cards suggest. In Artificial Analysis testing, GPT-5.6 Sol max scores 59 on the Intelligence Index versus Kimi K3 at 57. Yet the measured cost per task is about $1.04 for Sol and $0.95 for K3—not the two-to-one gap implied by their official output prices. My short answer: choose GPT-5.6 Sol when broad reliability, coding-agent performance, and OpenAI's hosted tool stack matter most. Choose Kimi K3 when video input, long-context work, lower list pricing, or access to released open weights changes the decision.

Schuyler Stacy | 2026-07-28

GPT-5.6 Sol vs Claude Fable 5: Mais barato por token ou mais barato de confiar? (2026)

GPT-5.6 Sol vs Claude Fable 5: Mais barato por token ou mais barato de confiar? (2026)

Há duas semanas, esta comparação tinha uma resposta entediante: escolha o Claude Fable 5, porque não era possível obter o GPT-5.6 Sol. O Sol estava trancado em uma prévia avaliada pelo governo, aberta a cerca de vinte organizações. Essa restrição acabou. A OpenAI transferiu a família GPT-5.6 — Sol, Terra e Luna — para disponibilidade geral em 9 de julho , e o Fable 5 está acessível globalmente desde 1º de julho, depois que o Departamento de Comércio dos EUA suspendeu os controles de exportação que o haviam bloqueado. Portanto, a questão está novamente em aberto, e já não se trata de acesso. Trata-se de qual modo de falha você pode se permitir observar. Vou dizer logo de início a que conclusão cheguei e, depois, mostrar o trabalho. Resumo O Sol é mais barato em todos os aspectos relevantes para uma equipe financeira. No GPTProto, ele custa US$ 4 / US$ 24 por milhão de tokens de entrada/saída, contra US$ 8 / US$ 40 do Fable 5, e a diferença aumenta quando você mede por tarefa concluída, em vez de por token. Por outro lado, toda a aposta de design do Fable 5 é um comportamento previsível: prompts sinalizados retornam para um modelo mais seguro, e ele não adquiriu o hábito que deveria preocupar qualquer pessoa que conecte o Sol a um pipeline não supervisionado. O avaliador independente METR sinalizou o Sol por apresentar a maior taxa de manipulação de recompensas entre todos os modelos públicos que testou. Portanto, “mais barato por token” é o Sol, sem dúvida. “Mais barato para confiar quando ninguém está olhando” é o Fable. A maior parte deste artigo explica por que essas duas frases não se anulam. Ambos os modelos usam uma única chave e um único saldo do GPTProto, então você pode encaminhá-los por tarefa em vez de comprometer toda a sua stack com uma única resposta. Mais sobre isso no final.

Michael Johnson | 2026-07-10

Qwen 3.8 Max vs Kimi K3: qual está pronto para trabalho de programação real?

Qwen 3.8 Max vs Kimi K3: qual está pronto para trabalho de programação real?

Atualização — 28 de julho de 2026: a Moonshot AI publicou agora os pesos completos do Kimi K3, o cartão do modelo, a licença personalizada e o relatório técnico. O lançamento resolve a questão da disponibilidade do lado do Kimi. Isso não torna fácil hospedar um modelo com 2,8 trilhões de parâmetros por conta própria: o repositório oficial tem cerca de 1,56 TB, e a Moonshot recomenda implantações em supernós com 64 ou mais aceleradores. Qwen 3.8 Max vs Kimi K3 parece uma disputa direta entre dois enormes modelos chineses de IA: a prévia de 2,4 trilhões de parâmetros da Alibaba contra o modelo principal de 2,8 trilhões de parâmetros da Moonshot AI. Os números sugerem uma conclusão simples. O modelo maior deveria vencer. Não é isso que as evidências disponíveis mostram, e essa não é a comparação mais útil para desenvolvedores. Em 23 de julho de 2026, o Qwen 3.8 Max ainda é uma prévia em evolução distribuída pelo Token Plan da Alibaba. O Kimi K3 já tem uma API documentada, preços de tokens publicados, uma janela de contexto de 1 milhão de tokens e um plano datado para o lançamento de seus pesos completos. A diferença de capacidade pode ser pequena. A diferença de prontidão do produto não é. Meu julgamento é direto: o Kimi K3 é a escolha mais segura se você precisa criar e orçar uma aplicação real hoje. O Qwen 3.8 Max Preview vale ser testado em um fluxo de trabalho de programação, especialmente enquanto os Créditos promocionais da Alibaba tornam a experimentação barata, mas ainda não forneceu informações estáveis suficientes para vencer uma decisão de produção. Resumo: Kimi K3 é a escolha mais segura para produção hoje Escolha o Kimi K3 se precisar de uma API convencional, custos previsíveis por token, compreensão nativa de imagens e vídeos ou um modelo que possa colocar agora por trás de um produto voltado ao cliente. Escolha o Qwen 3.8 Max Preview se já usa o ecossistema de programação da Alibaba e quer testar um novo modelo promissor a baixo custo promocional. O único teste detalhado de programação comparativo disponível no momento da publicação deu ao Kimi K3 uma pontuação de 83 e ao Qwen 3.8 Max uma pontuação de 80. Essa diferença de três pontos é uma evidência útil, não uma classificação universal. O Qwen mostrou limites de sistema mais claros e execução impecável de ferramentas no teste; o Kimi lidou de forma mais completa com o histórico de revisões e a regeneração. Ambos também fizeram inferências sem suporte que exigiram correção factual. Em termos simples: o Kimi atualmente vence a decisão de implantação. O Qwen não perdeu a disputa de capacidade; simplesmente é cedo demais para declarar que venceu.

Schuyler Stacy | 2026-07-28

GLM-5.2 vs Kimi K3 para programação: qual é melhor para desenvolvedores em 2026?

GLM-5.2 vs Kimi K3 para programação: qual é melhor para desenvolvedores em 2026?

TL;DR: Kimi K3 é o modelo de programação mais forte quando a tarefa é difícil, longa ou visual. Ele supera o GLM-5.2 na comparação de programação publicada pela Moonshot e aceita imagens e vídeos por meio de seu serviço hospedado. O GLM-5.2 continua sendo a melhor opção padrão para o trabalho rotineiro em repositórios: custa muito menos, é menor para operar e usa a licença permissiva MIT. O Kimi K3 também passou a disponibilizar seus pesos, mas seu repositório de 1,56 TB, a implantação recomendada com mais de 64 aceleradores e a licença personalizada tornam a hospedagem própria um compromisso consideravelmente maior. Escolha o Kimi quando a capacidade for o gargalo; escolha o GLM quando o custo e a simplicidade operacional forem importantes todos os dias. A parte interessante da comparação de código entre GLM-5.2 e Kimi K3 não é que ambos os modelos conseguem escrever um componente React ou resolver um algoritmo curto. Modelos desse nível já superam esse requisito. A pergunta útil é o que acontece quando a tarefa fica complicada: uma auditoria de repositório, uma migração com vários arquivos, um bug que só aparece em uma captura de tela ou um protótipo jogável em Three.js que precisa manter vários sistemas coerentes. É também nesse ponto que a diferença de preço começa a importar. O Kimi K3 parece melhor nos testes públicos mais difíceis, mas seu preço oficial de saída é mais de três vezes maior que o do GLM-5.2. Uma equipe que executa milhares de revisões comuns pode realizar mais trabalho por dólar com o GLM. Um desenvolvedor tentando salvar um projeto visual difícil pode pagar pelo K3 sem hesitar.

Tiffany Layne | 2026-07-28