Claude Opus 5 vs Fable 5 em resumo
| Categoria |
Claude Opus 5 |
Claude Fable 5 |
| Data de lançamento |
24 de julho de 2026 |
9 de junho de 2026 |
| Preço oficial da API |
$5/M de entrada, $25/M de saída |
$10/M de entrada, $50/M de saída |
| Disponibilidade no GPT Proto |
Não disponível no momento da publicação |
Disponível a $8/M de entrada, $40/M de saída |
| Janela de contexto |
1 milhão de tokens |
1 milhão de tokens |
| Saída máxima |
128 mil tokens |
128 mil tokens |
| Entradas e saída |
Texto e imagem na entrada; texto na saída |
Texto e imagem na entrada; texto na saída |
| Raciocínio |
Pensamento adaptativo; esforço ajustável |
Pensamento adaptativo sempre ativado; esforço ajustável |
| Latência comparativa |
Moderada |
Mais lenta |
| Limite confiável de conhecimento |
Maio de 2026 |
Janeiro de 2026 |
| ID do modelo |
claude-opus-5 |
claude-fable-5 |
| Melhor para |
Programação complexa e trabalho empresarial |
Trabalho agentivo de maior dificuldade e longa duração |
| Principal desvantagem |
Pode consumir muitos tokens adicionais com esforço alto |
O dobro do preço oficial dos tokens, proteções mais rigorosas |
As especificações vêm da comparação atual de modelos. A tabela revela por que esta comparação não é uma disputa normal entre “modelo premium e modelo mais barato”: o tamanho do contexto, a saída máxima e as modalidades compatíveis são iguais. O argumento a favor do Fable baseia-se em julgamento e confiabilidade em horizontes longos — não em uma janela de contexto maior ou em um recurso que o Opus não possa acessar.
O que os benchmarks realmente dizem
A manchete do lançamento é verdadeira, mas precisa de uma palavra adicional: o Opus 5 é aproximadamente tão capaz quanto o Fable 5 por metade do preço dos tokens. Ele não é uniformemente melhor.
A Artificial Analysis mediu o Opus 5 no esforço máximo em 61 no seu Intelligence Index, um ponto acima dos 60 do Fable 5. Uma vantagem de um ponto deve ser interpretada como um empate efetivo, não como prova de que o modelo mais barato vence todas as tarefas. Os resultados mais interessantes aparecem no trabalho agentivo:
| Avaliação independente |
Resultado do Opus 5 |
Comparação com o Fable 5 |
| Artificial Analysis Intelligence Index |
61 no esforço máximo |
60 |
| GDPval-AA v2 |
1.861 Elo no esforço máximo |
O Opus lidera por 114 Elo |
| AA-Briefcase |
1.720 Elo no esforço máximo |
O Fable alcança 1.574 |
| Terminal-Bench v2.1 |
89% no esforço máximo |
O Opus está próximo do líder geral |
| The Humanity’s Last Exam |
53% |
Aproximadamente no mesmo nível do Fable |
O AA-Briefcase é especialmente útil porque testa agentes em tarefas privadas e realistas envolvendo milhares de arquivos e entregáveis como relatórios, apresentações e planilhas. O Opus 5 não apenas superou o Fable por pouco no esforço máximo. Sua configuração de alto esforço alcançou 1.606 Elo — 32 pontos acima do Fable — a um custo médio de US$ 10,41 por tarefa, em comparação com US$ 22,30 do Fable. A Artificial Analysis relata que o Opus no esforço máximo custou US$ 17,79 por tarefa e ainda superou a pontuação do Fable.
Há um custo. Os três níveis mais altos de esforço do Opus levaram, em média, mais de 25 minutos por tarefa do AA-Briefcase. O esforço máximo levou em média 36,2 minutos e 103 turnos. Em outras palavras, o Opus pode atingir um teto mais alto trabalhando por mais tempo e dando mais passos. Tokens baratos não tornam agentes de alto esforço instantâneos.
O Fable também mantém uma vantagem mensurável em conhecimento factual. No AA-Omniscience, o Opus melhorou sua precisão em relação ao Opus 4.8, mas respondeu com mais frequência quando estava incerto, produzindo uma taxa de alucinação de 50% nesse teste específico. Isso não significa que metade de todas as respostas do Opus 5 são alucinações. Significa que, segundo a metodologia do AA-Omniscience, sua disposição para responder a perguntas sem suporte criou uma taxa de erro maior que a do Fable.
Há mais uma ressalva importante: a Artificial Analysis executou as avaliações do Opus e do Fable com o fallback para o Opus 4.8 ativado. Isso mede uma configuração de sistema implantável, mas torna o resultado um pouco menos puro como comparação apenas entre modelos.
A conclusão é mais restrita que o entusiasmo do lançamento: atualmente, o Opus 5 oferece a melhor relação entre capacidade e custo. O Fable continua sendo o candidato mais seguro quando a contenção factual e o julgamento difícil em horizontes longos importam mais que o desempenho médio em benchmarks.
Claude Opus 5 vs Fable 5 para programação
“Qual modelo escreve código melhor?” é a pergunta errada. Um agente de programação precisa entender o repositório, diagnosticar o problema, escolher uma direção, escrever o patch, executar os testes e reconhecer quando sua primeira teoria estava errada. Um modelo pode produzir código limpo e ainda assim levar o projeto na direção errada.
Diagnóstico e planejamento
É aqui que as primeiras evidências da comunidade se dividem.
Em uma comparação de depuração em produção realizada no dia do lançamento, um desenvolvedor deu a vários modelos Claude o mesmo prompt de tentativa única baseado em um problema previamente resolvido. O Opus 5 foi o único modelo a identificar o componente exato que continha a causa raiz; o Fable encontrou a categoria geral correta, mas foi menos específico. O autor descreveu explicitamente o caso como um único teste com tamanho de amostra igual a um.
Outro desenvolvedor relatou uma experiência quase oposta. Em um projeto de um ano testado com o Opus 5 e o Fable 5, o Opus escreveu código sólido, mas formou repetidamente uma conclusão incorreta sobre um sinalizador de configuração. Mais tarde, o Fable encontrou problemas adicionais no raciocínio do Opus. O fluxo de trabalho proposto por esse desenvolvedor foi revelador: usar o Fable para planejamento e orquestração e, depois, o Opus para implementação restrita.
Nenhuma das duas publicações é um benchmark controlado. Ambas são mais úteis que elogios genéricos porque expõem o verdadeiro limite de falha. O Opus parece capaz de fazer diagnósticos mais precisos em uma única tentativa, mas também pode se comprometer rapidamente demais com uma teoria. O valor do Fable não está em escrever códigos mais bonitos; está na possibilidade de evitar desvios caros.
Escrita e refatoração de código
O Opus 5 é a opção padrão mais forte aqui. A Anthropic o posiciona para programação agentiva complexa, e testes independentes colocam o Opus, junto com o Claude Code, no topo do Artificial Analysis Coding Index. A Anthropic também relata casos difíceis em que o modelo encontrou a causa raiz em vez de corrigir o sintoma, criou sua própria suíte de validação quando não havia um feed ao vivo disponível e verificou a saída do navegador antes de devolver o trabalho. Esses são exemplos selecionados pelo fornecedor, portanto devem ser tratados como demonstrações de capacidade, não como taxas de sucesso esperadas. Ainda assim, descrevem o comportamento correto a ser testado.
Para trabalhos delimitados — implementar esta funcionalidade, refatorar estes arquivos, corrigir estes testes que falham — o preço mais baixo do Opus facilita justificar execuções e revisões repetidas. O Fable pode fazer o mesmo trabalho, mas pagar o dobro pela taxa de tokens só faz sentido se isso reduzir turnos, retrabalho ou intervenção humana o suficiente para compensar a diferença.
Verificação da implementação final
Não permita que nenhum dos dois modelos revise a si próprio.
Dê aos dois modelos o mesmo commit congelado, tarefa, ferramentas, limite de tempo e definição de pronto. Depois, avalie resultados que resistam à inspeção:
| Etapa do teste |
Dê aos dois modelos |
Meça |
| Diagnóstico |
Repositório somente leitura, logs, incidente conhecido |
Causa raiz correta, afirmações sem suporte, arquivos citados |
| Implementação |
Mesmo problema, ferramentas de escrita, mesmos testes |
Testes aprovados, regressões, tentativas, arquivos alterados |
| Verificação |
Casos extremos ocultos e critérios de aceitação |
Falhas não identificadas, afirmações falsas de “concluído”, correções humanas |
Para uma migração de alto valor, um fluxo de trabalho sensato é usar o Fable para o plano inicial, o Opus para a implementação e um modelo separado ou revisor humano para a verificação. Isso custa mais que uma execução do Opus. Ainda assim, pode ser mais barato que aprovar a arquitetura errada.
Preços do Opus 5 vs Fable 5 e custo de tarefas reais
Nos preços oficiais de tabela da API, o Opus 5 custa US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída. O Fable 5 custa US$ 10 e US$ 50. A proporção é exata: o Fable é duas vezes mais caro por token. O anúncio do Opus 5 e o guia de integração do Fable 5 da Anthropic documentam essas tarifas.
Para uma carga de trabalho que utiliza 10 milhões de tokens de entrada e 2 milhões de tokens de saída:
| Rota |
Custo de entrada |
Custo de saída |
Total |
| Opus 5 ao preço oficial de tabela |
$50 |
$50 |
$100 |
| Fable 5 ao preço oficial de tabela |
$100 |
$100 |
$200 |
| Fable 5 no GPT Proto |
$80 |
$80 |
$160 |
A página da API do GPT Proto para o Fable 5 atualmente lista US$ 8 por milhão de tokens de entrada e US$ 40 por milhão de tokens de saída. O exemplo acima exclui cache, descontos por lote, novas tentativas, comportamento de fallback e contexto gerado por ferramentas para manter a comparação legível.
O preço dos tokens é apenas a primeira linha da conta. O Opus 5 oferece cinco níveis de esforço — baixo, médio, alto, xhigh e máximo — e a Artificial Analysis observou uma variação de aproximadamente oito vezes no uso de tokens de saída entre baixo e máximo no GDPval-AA v2. Uma equipe que envie cada autocompletar, extração e pequena edição de código para o esforço máximo pode eliminar parte da economia esperada.
A métrica melhor é o custo por tarefa bem-sucedida:
custo por tarefa bem-sucedida =
gasto total com o modelo
+ gasto com novas tentativas e fallback
+ tempo de revisão humana
÷ tarefas aceitas
No AA-Briefcase, o esforço alto do Opus superou o Fable custando menos da metade por tarefa. Isso é uma evidência forte a favor do Opus. Não é uma garantia para o seu repositório. Se o Fable impedir uma migração malsucedida que o Opus teria aprovado, o modelo mais caro pode ser a decisão mais barata.
Quando o Fable 5 ainda é o melhor modelo
O Fable 5 continua valendo o investimento quando a tarefa é longa, ambígua e cara de reiniciar.
Primeiro, a Anthropic ainda chama o Fable 5 de seu modelo mais capaz amplamente lançado e o recomenda para cargas de trabalho que exigem a maior capacidade disponível. O Opus é o ponto de partida recomendado; o Fable é o caminho de escalonamento. Essa distinção é deliberada.
Segundo, o comportamento mais cauteloso do Fable pode ajudar no planejamento, na pesquisa factual e em sistemas desconhecidos. O resultado independente disponível sobre conhecimento factual favorece o Fable, enquanto o relato negativo da comunidade sobre o Opus descreve exatamente o tipo de falha que as tabelas de benchmark podem ocultar: código com aparência correta construído sobre uma conclusão falsa.
Terceiro, o Fable foi projetado para agentes de longa duração. A Anthropic o posiciona para raciocínio exigente, projetos de vários dias e trabalho autônomo que abrange muitas etapas. Uma tarefa de programação de uma hora pode não revelar sua vantagem. Uma migração de três dias com centenas de decisões talvez revele.
Os trade-offs de integração documentados são significativos:
-
Os preços oficiais dos tokens de entrada e saída do Fable são o dobro dos preços do Opus 5.
-
A Anthropic classifica a latência comparativa do Fable como mais lenta.
-
O pensamento adaptativo do Fable está sempre ativado, embora o esforço ainda possa ser ajustado.
-
O Fable exige retenção de dados por 30 dias e não está disponível sob retenção zero de dados.
-
Seus classificadores de segurança podem retornar stop_reason: "refusal" em uma resposta HTTP 200, portanto as integrações de produção precisam tratar recusas e implementar lógica de fallback.
O Fable não é o “modelo melhor se o orçamento não importar”. Ele é o especialista a ser usado quando a qualidade do planejamento, a contenção factual ou a consistência em horizontes longos justificarem um investimento mensurável.
Diferenças para desenvolvedores que as tabelas de benchmark não mostram
| Detalhe de integração |
Opus 5 |
Fable 5 |
Por que isso importa |
| Controle do esforço |
Baixo, médio, alto, xhigh, máximo |
Pensamento adaptativo sempre ativado; controle de esforço compatível |
O esforço altera a latência e o uso de tokens |
| Limite de conhecimento |
Maio de 2026 |
Janeiro de 2026 |
O Opus pode conhecer bibliotecas e APIs mais recentes |
| Classificadores de segurança |
Menos restritivos que os do Fable |
Mais rigorosos, especialmente para cibersegurança e biologia |
Solicitações benignas de segurança ou depuração podem exigir fallback |
| Tratamento de recusas |
Fallback disponível |
HTTP 200 pode conter stop_reason: "refusal" |
Um status HTTP bem-sucedido nem sempre significa que a tarefa foi concluída |
| Retenção de dados |
Nenhuma exigência de retenção específica do modelo para acesso geral |
Exigência de retenção por 30 dias |
Importante para cargas de trabalho regulamentadas ou sensíveis |
| Latência comparativa |
Moderada |
Mais lenta |
Loops de agentes multiplicam a latência entre turnos |
| Modo rápido |
Cerca de 2,5× a velocidade padrão pelo dobro do preço-base dos tokens |
Nenhuma opção equivalente de lançamento listada |
Útil quando a latência importa mais que o custo |
A Anthropic afirma que os classificadores de cibersegurança do Opus 5 devem intervir cerca de 85% menos vezes que os do Fable 5. Isso torna o Opus o modelo Claude mais prático para muitos fluxos legítimos de segurança de código e depuração, embora ele ainda bloqueie categorias de maior risco. A mesma documentação de lançamento diz que o Opus 5 não tem exigência específica de retenção de dados para acesso geral, enquanto o guia de integração do Fable especifica retenção por 30 dias.
A migração também exige mais do que alterar um ID de modelo. O Opus 5 tem o pensamento ativado por padrão, e as aplicações devem definir explicitamente o esforço se o custo ou a latência forem importantes. O Fable sempre raciocina e pode retornar recusas como respostas HTTP concluídas. Fazer a troca sem atualizar analisadores, regras de fallback, orçamentos de tokens e limites de avaliação é um convite a falhas silenciosas.
E quanto ao Claude Opus 5 vs Kimi K3?
O Kimi K3 não é um substituto direto do Claude, mas é a terceira opção mais relevante quando a decisão é orientada por custo e trabalho agentivo com contexto longo.
O Kimi K3 da Moonshot tem uma janela de contexto de 1 milhão de tokens, aceita entradas de texto, imagem e vídeo e usa raciocínio sempre ativado. Seu preço oficial de tabela é de US$ 3 por milhão de tokens de entrada e US$ 15 por milhão de tokens de saída. A API do Kimi K3 no GPT Proto está atualmente listada a US$ 2,70 e US$ 13,50 — abaixo dos dois modelos Claude.
Isso não torna o Kimi o vencedor automático em custo. O raciocínio em horizontes longos pode gerar mais turnos, histórico de raciocínio retido e tokens de saída. Meça o custo da tarefa concluída, não o número exibido no cartão de preços.
A capacidade também permanece inferior na ampla comparação independente disponível no lançamento: a Artificial Analysis deu ao Kimi K3 a pontuação 57, contra 61 do Opus 5 e 60 do Fable 5. Ainda assim, o Kimi pertence à lista de opções para fluxos de trabalho agentivos multimodais, especialmente quando a entrada de vídeo ou tarifas menores de tokens são importantes.
Há um detalhe de status que exige cuidado. A Moonshot afirma que os pesos completos do Kimi K3 serão lançados até 27 de julho de 2026. Em 25 de julho, a descrição precisa é “programado para um lançamento com pesos abertos”, não “já disponível para download e totalmente open source”.
Escolha o Kimi K3 quando precisar de um modelo multimodal disponível e mais barato e estiver disposto a validar seu comportamento agentivo. Escolha o Opus quando quiser a melhor opção padrão atual. Escolha o Fable quando a tarefa justificar o escalonamento para a categoria pública de maior capacidade da Anthropic.
Qual modelo você deve escolher?
| Sua carga de trabalho |
Melhor escolha atual |
Por quê |
| Claude Code cotidiano, refatoração e trabalho em funcionalidades |
Opus 5 |
Melhor equilíbrio entre capacidade e custo |
| Depuração difícil com um resultado conhecido e verificável |
Opus 5 primeiro; compare com o Fable |
O Opus demonstra forte potencial para encontrar a causa raiz, mas verifique as conclusões |
| Projeto autônomo de vários dias |
Fable 5 |
Construído e posicionado para trabalho em horizontes longos |
| Planejamento arquitetural com alto custo de falha |
Fable 5 |
Investimento premium mais defensável por julgamento e contenção |
| Fluxo regulamentado sensível à retenção específica do modelo |
Opus 5 |
O Fable exige retenção por 30 dias |
| Depuração legítima de cibersegurança |
Opus 5 |
Os classificadores são menos restritivos que os do Fable |
| Agente multimodal sensível a custos que precisa de entrada de vídeo |
Kimi K3 |
Tarifas menores e compreensão de vídeo documentada |
| Precisa de um modelo disponível pelo GPT Proto agora |
Fable 5 ou Kimi K3 |
O Opus 5 ainda não está listado no momento da publicação |
Se você só puder escolher um modelo hoje, escolha o Opus 5. Se sua aplicação puder fazer roteamento por tarefa, use o Opus como padrão e envie apenas os trabalhos mais difíceis de planejamento ou longa duração para o Fable. Assim, o investimento adicional do Fable fica associado ao trabalho que realmente pode se beneficiar dele.
Teste o Fable 5 e o Kimi K3 no GPT Proto
O Opus 5 não estava disponível no GPT Proto no momento da publicação, portanto não deve ser apresentado como uma opção ativa. Você já pode testar o Fable 5 e o Kimi K3 usando uma única conta GPT Proto e saldo compartilhado, comparando as respostas com a mesma tarefa e os mesmos critérios de aceitação.
Chame o Fable 5 pelo endpoint Messages:
curl --request POST "https://gptproto.com/v1/messages" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "claude-fable-5",
"max_tokens": 2048,
"messages": [
{
"role": "user",
"content": "Review this migration plan. Identify unsupported assumptions, missing rollback steps, and the tests required before production."
}
]
}'
Chame o Kimi K3 pelo endpoint Chat Completions compatível com OpenAI:
curl "https://gptproto.com/v1/chat/completions" \
--header "Content-Type: application/json" \
--header "Authorization: $GPTPROTO_API_KEY" \
--data '{
"model": "kimi-k3",
"messages": [
{
"role": "user",
"content": "Review this migration plan. Identify unsupported assumptions, missing rollback steps, and the tests required before production."
}
]
}'
Use o mesmo prompt, arquivos, permissões de ferramentas e critérios de avaliação. Registre os tokens de entrada e saída, o tempo decorrido, as afirmações sem suporte, as novas tentativas e o número de correções humanas antes da aceitação. O modelo vencedor é aquele que conclui sua tarefa — não aquele que escreve a primeira resposta mais confiante.
Você pode começar pela API de IA unificada do GPT Proto ou navegar pela Galeria de modelos de IA para comparar outros modelos de programação e raciocínio na mesma conta.
Veredito final
Claude Opus 5 é o melhor modelo padrão. Ele iguala ou supera o Fable 5 em várias avaliações independentes importantes, custa metade por token nas tarifas oficiais, funciona com menor latência comparativa e oferece aos desenvolvedores uma faixa prática mais ampla de configurações de esforço.
O Fable 5 não está obsoleto. Agora é mais fácil justificá-lo como especialista em vez de padrão: use-o para os agentes mais difíceis e de longa duração, planejamento de alto risco e trabalhos em que uma conclusão incorreta possa custar mais que toda a conta da API.
Em termos mais diretos: o Opus 5 é o modelo pelo qual a maioria das equipes deveria começar. O Fable 5 é o modelo para o qual elas deveriam escalar.