Qwen3.8-Max-0902 vs Claude Fable 5.1 em resumo
| Categoria |
Qwen3.8-Max-0902 |
Claude Fable 5.1 |
| Fornecedor |
Alibaba Qwen |
Anthropic |
| Melhor para |
Codificação sensível a custos, trabalho de frontend, agentes de alto volume |
Depuração difícil, agentes de longa duração, cenários de falha de alto custo |
| Janela de contexto |
1M tokens |
1M tokens |
| Saída máxima |
131K tokens |
128K tokens |
| Preço oficial de entrada nova |
$2 por milhão de tokens |
$10 por milhão de tokens |
| Preço oficial de saída |
$6 por milhão de tokens |
$50 por milhão de tokens |
| Preço de entrada nova no GPT Proto |
$1.80 por milhão de tokens |
$9 por milhão de tokens |
| Preço de saída no GPT Proto |
$5.40 por milhão de tokens |
$45 por milhão de tokens |
| Modalidades oficiais de entrada |
Texto, imagem e vídeo |
Texto e imagem |
| Comportamento de pensamento |
O pensamento pode ser ativado via API |
O pensamento adaptativo está sempre ativado |
| Comportamento relevante da API |
Chamada de funções e saídas estruturadas |
A seleção forçada de ferramentas não é suportada |
| Principal limitação de evidências |
Evidência independente limitada para o snapshot 0902 exato |
Comparações públicas atuais raramente incluem o Qwen 0902 |
A diferença de preço anunciada é grande: a entrada nova do Fable custa cinco vezes mais que a do Qwen, enquanto sua saída custa cerca de 8.3 vezes mais. No entanto, a entrada em cache é outra história. Nas listagens atuais de modelos do GPT Proto, ambos têm uma taxa de leitura de cache de $0.225 por milhão. Os custos reais de agentes, portanto, dependem da mistura de entrada nova, saída gerada, contexto em cache, tentativas e tempo de correção humana.
O que são Qwen3.8-Max-0902 e Claude Fable 5.1?
Qwen3.8-Max-0902
Qwen3.8-Max-0902 é um snapshot aprimorado da família Qwen3.8-Max da Alibaba. Sua página oficial do modelo descreve foco adicional em codificação, trabalho com agentes multi-ferramenta, desenvolvimento autônomo de longo horizonte e compreensão visual.
O modelo aceita texto, imagens e vídeo de acordo com a documentação da Qwen. Ele oferece uma janela de contexto de 1M tokens, até 131K tokens de saída, chamada de funções, saídas estruturadas, preenchimento de prefixo, cache e processamento em lote. Desenvolvedores também podem ativar o pensamento via API quando uma tarefa precisa de mais raciocínio.
Um detalhe de nomenclatura importa. Embora outros lançamentos da Qwen tenham checkpoints abertos, não conseguimos encontrar um checkpoint oficial publicado separadamente para o snapshot exato qwen3.8-max-0902. Trate o 0902 como uma versão de modelo de API, a menos que a Alibaba publique pesos correspondentes. Chamar esse snapshot exato de “open weight” atualmente iria além das evidências disponíveis.
Para contexto sobre a atualização da família, veja Qwen 3.8 Max vs Qwen 3.7 Max.
Claude Fable 5.1
Claude Fable 5.1 é o modelo de ponta da Anthropic para codificação complexa, trabalho de conhecimento e execução de agentes. Foi lançado em 1º de setembro de 2026. A documentação oficial do modelo lista uma janela de contexto de 1M tokens, saída máxima de 128K, entrada de texto e imagem e corte de conhecimento de junho de 2026.
Fable 5.1 usa pensamento adaptativo em todas as solicitações. Desenvolvedores podem ajustar o esforço, mas não podem desativar o pensamento ou definir um orçamento manual de tokens de pensamento. A Anthropic descreve sua latência comparativa como “mais lenta”, o que é relevante quando um fluxo de trabalho valoriza respostas rápidas e repetidas em vez de uma primeira tentativa mais cara.
A Anthropic afirma que o Fable 5.1 pode reduzir custos em relação ao Fable 5 em algumas cargas de trabalho, especialmente cargas de agentes que reutilizam contexto em cache. Essa é uma comparação com a versão anterior do Fable, não com o Qwen. Também não garante uma conta menor para cada prompt, porque o uso real de tokens e o comportamento de tentativas variam.
Para o resumo do lançamento, veja Claude Fable 5.1 e Mythos 5.1.
Desempenho de codificação: frontend, trabalho em repositório e depuração
“Melhor para codificação” é amplo demais para responder com um único benchmark. Um modelo que produz uma interface atraente pode não ser o melhor em rastrear uma condição de corrida. Um modelo que conclui uma migração difícil de repositório em uma única passada pode ser caro demais para milhares de pequenas transformações de código. A comparação útil começa dividindo a codificação em trabalhos separados.
Codificação de frontend e geração de UI
Qwen3.8-Max-0902 tem o sinal público mais claro para geração de frontend. A Alibaba relatou um 1691 Code Arena WebDev Elo para o snapshot 0902. Uma demo pública de painel financeiro também mostra o modelo transformando um pedido visual em uma interface refinada.

Esses são exemplos úteis, mas nenhum deles é um teste controlado de Qwen versus Fable 5.1. Um vídeo social mostra um resultado bem-sucedido, não a confiabilidade média do modelo em prompts repetidos. A pontuação da Alibaba também é relatada pelo fornecedor.
Testes públicos do Fable 5.1 mostram que ele consegue concluir construções substanciais em uma única tentativa. Na análise prática da Every, os testadores gostaram de sua capacidade de sustentar trabalhos de codificação mais longos, mas também descobriram que algumas saídas visuais pareciam genéricas e que o modelo ocasionalmente ignorava restrições explícitas. O artigo revelou acesso pré-lançamento da Anthropic e afirmou que a Anthropic não teve participação editorial.
Veredito de frontend: Qwen3.8-Max-0902 recebe uma leve recomendação quando custo de iteração, geração visual e volume de saída importam. A confiança é média porque não há um teste de frontend compartilhado atual para ambas as versões exatas do modelo.
Compreensão de repositório e alterações em vários arquivos
A Alibaba relata resultados encorajadores do Qwen3.8-Max-0902 em testes voltados a repositórios, incluindo 69.3 no DeepSWE 1.1, 64.9 no NL2Repo e 44.8 no SWE-Marathon. Esses números sugerem que a atualização 0902 não se limita a gerar trechos isolados.
Claude Fable 5.1 tem um tipo diferente de evidência. A Anthropic relata 73.4 no CursorBench 3.2.0, enquanto seu material de lançamento inclui observações de clientes de organizações que usam Claude para tarefas de engenharia em formato de produção. Esses relatos apoiam a relevância do Fable para bases de código complexas, mas são selecionados pelo fornecedor e não devem ser tratados como avaliações neutras.
Os dois conjuntos de evidências não podem ser subtraídos nem calculados em média. Eles usam repositórios, definições de tarefas, ferramentas, ambientes de execução e regras de pontuação diferentes.
Veredito de repositório: Nenhum vencedor decisivo. Execute ambos os modelos em um repositório privado representativo com a mesma tarefa, permissões de ferramentas, suíte de testes e critérios de conclusão.
Depuração, revisão de código e análise de causa raiz
Claude Fable 5.1 tem o caso público atual mais forte para trabalhos difíceis e de cadeia longa. As próprias avaliações da Anthropic e vários relatos práticos enfatizam execução sustentada, planejamento e conclusão de trabalhos complicados sem intervenção frequente. Uma análise de desenvolvedor do Fable 5.1 separada relata trabalho bem-sucedido em uma única tentativa em um codec de imagem e um projeto de portfólio, mas também observa que o modelo é caro e que a velocidade percebida não foi medida com um cronômetro controlado.
A vantagem do Qwen é econômica. Uma equipe pode pagar por mais patches candidatos, testes e ciclos de reparo dentro do mesmo orçamento de API. Isso importa para tarefas em que testes automatizados rejeitam rapidamente respostas ruins. Importa menos quando cada tentativa fracassada consome tempo de engenharia ou arrisca um erro de produção custoso.
Veredito de depuração: Escolha o Fable 5.1 para análise difícil de causa raiz na primeira passada quando a falha é cara. Escolha o Qwen3.8-Max-0902 para correção iterativa com restrição de orçamento e forte verificação automatizada.
Por que os benchmarks publicados não são uma comparação direta
O erro mais fácil em uma comparação entre Alibaba Qwen3.8-Max-0902 e Anthropic Claude Fable 5.1 é colocar números de benchmarks não relacionados em colunas adjacentes e declarar um vencedor.
A tabela pública do 0902 da Alibaba compara o Qwen com o Claude Fable 5, não com o Fable 5.1. Os resultados de lançamento do Fable 5.1 da Anthropic incluem Terminal-Bench, OSWorld, CursorBench, AutomationBench e outras avaliações, mas não foram executados como um teste direto contra o Qwen 0902 em configurações idênticas.
Até benchmarks com nomes semelhantes podem diferir por versão, configuração de ferramentas, esforço de inferência, política de pontuação ou tempo permitido. Por exemplo, a Alibaba rotula um resultado do AutomationBench como versão 1.0.6, enquanto a tabela de lançamento da Anthropic faz parte de um pacote de avaliação separado. Tratar as pontuações exibidas como uma comparação direta limpa seria enganoso.
| Sinal publicado |
Resultado relatado |
O que ele sustenta |
O que ele não prova |
| Qwen Code Arena WebDev |
1691 Elo |
Sinal de frontend e desenvolvimento web |
Superioridade sobre o Fable 5.1 |
| Qwen DeepSWE 1.1 |
69.3 |
Sinal de codificação em nível de repositório |
Desempenho igual em outra avaliação SWE |
| Qwen CoWorkBench |
76.1 |
Sinal de trabalho em várias etapas |
Validação neutra de terceiros |
| Fable Terminal-Bench 4.0 |
55.8% |
Sinal de agente de terminal |
Vantagem direta sobre o teste do Qwen com versão diferente |
| Fable CursorBench 3.2.0 |
73.4% |
Sinal de agente de codificação |
Resultados iguais em um benchmark do Qwen |
| Fable OSWorld 2.0 |
77.9% parcial / 41.7% estrito |
Sinal de uso de computador |
Liderança geral de agentes em todos os ambientes |
Todos os valores nesta tabela são relatados pelo fornecedor. A conclusão responsável não é “benchmarks são inúteis”. É que a relevância do benchmark depende da tarefa e que as pontuações só sustentam comparações quando as versões dos modelos e as condições de teste correspondem.
Desempenho de agentes e comportamento da API
Para um agente de IA, a qualidade do modelo é apenas uma parte do sistema. Seleção de ferramentas, estado da conversa, cache, lógica de tentativas e latência podem mudar o resultado mesmo quando o prompt permanece o mesmo.
Chamada de ferramentas e saídas estruturadas
Qwen3.8-Max-0902 suporta chamada de funções e saídas estruturadas, tornando-o adequado para agentes que precisam retornar dados válidos conforme o esquema ou chamar ferramentas externas. Sua página oficial também lista preenchimento de prefixo, processamento em lote e suporte a pesquisa na web.
Fable 5.1 suporta uso de ferramentas, mas seus controles de API são mais rígidos. De acordo com o guia de migração da Anthropic, tool_choice: "any" e a seleção forçada de uma ferramenta nomeada não são suportados. Essas configurações retornam um erro 400. Desenvolvedores podem usar seleção automática de ferramentas ou desativar ferramentas, mas um fluxo de trabalho existente que exige uma ferramenta específica em cada etapa pode precisar ser redesenhado.
A Anthropic também observa que o Fable 5.1 pode emitir uma chamada de ferramenta em um turno em que o Fable 5 anteriormente agrupava várias. Dependendo do loop do agente, isso pode adicionar idas e voltas e aumentar a latência ponta a ponta.
Veredito de controle de ferramentas: O Qwen é mais fácil de recomendar para fluxos de trabalho que exigem seleção de ferramentas estrita e controlada pela aplicação. O Fable continua adequado quando o agente pode decidir se e quando chamar ferramentas.
Pensamento e estado da conversa
O Qwen permite que a aplicação ative o pensamento para tarefas que precisam dele. Fable 5.1 usa pensamento adaptativo em todas as solicitações; tentativas de desativar o pensamento ou fornecer um orçamento manual de tokens de pensamento retornam um erro.
A diferença afeta mais do que o uso de tokens. A Anthropic documenta várias regras de gerenciamento de estado:
Modelos Claude anteriores não conseguem ler blocos de pensamento do Fable 5.1.
Editar mensagens anteriores, instruções de sistema ou definições de ferramentas pode invalidar blocos de pensamento existentes.
Aplicações que reescrevem o histórico da conversa podem precisar remover dados de pensamento inválidos antes de tentar novamente.
Atualizações de progresso para longas sequências de pensamento exigem uma opção beta.
Essas regras são gerenciáveis, mas importam para agentes duráveis, tarefas retomáveis e sistemas que trocam de modelo durante uma conversa. Um roteador multi-modelo deve preservar mensagens comuns e resultados de ferramentas em um formato portátil, em vez de assumir que dados ocultos de raciocínio podem migrar entre fornecedores.
Tarefas de agentes de longa duração
Claude Fable 5.1 atualmente tem evidência pública mais forte para tarefas longas e difíceis. A Anthropic relata 52.6% no Terminal-Bench-Science 0.1, 55.8% no Terminal-Bench 4.0 e 31.4% no AutomationBench. Esses continuam sendo resultados executados pelo fornecedor, mas cobrem tarefas relevantes em formato de agente.
O feedback prático também revela modos de falha úteis. Os testadores da Every relataram casos em que o Fable ignorou limites de saída solicitados, criou mais subagentes do que o necessário em esforço alto ou continuou depois que deveria ter parado. Em uma tarefa de pesquisa, o modelo retornou 43 citações quando solicitado a retornar 8–12; os testadores também relataram que várias citações verificadas não estavam presentes na fonte fornecida. Essas observações não invalidam o modelo, mas mostram por que agentes de longa duração ainda precisam de limites, verificação de fontes e condições explícitas de parada.
Os sinais de agente relatados pelo fornecedor do Qwen incluem 50.8 no AutomationBench v1.0.6, 73.3 no Toolathlon Verified e 1468 WorkArena Elo. Seu preço de tokens de entrada nova muito mais baixo o torna atraente para fluxos de trabalho compostos por muitas etapas curtas ou médias.
Veredito de agente: O Fable tem o caso mais forte para execução de alto valor e longo horizonte. O Qwen é a escolha prática para agentes de alto volume e sistemas que podem verificar cada etapa automaticamente.
Preços do Qwen3.8-Max-0902 vs Claude Fable 5.1
Preço por milhão de tokens é direto. Custo por tarefa concluída não é.
Preços oficiais e da API GPT Proto
| Categoria de token |
Qwen oficial |
Qwen no GPT Proto |
Fable oficial |
Fable no GPT Proto |
| Entrada nova |
$2.00 |
$1.80 |
$10.00 |
$9.00 |
| Saída |
$6.00 |
$5.40 |
$50.00 |
$45.00 |
| Leitura de cache listada |
$0.25 implícito / $0.17 explícito |
$0.225 |
$0.25 |
$0.225 |
| Escrita de cache listada |
$2.50 criação explícita |
$2.25 |
$12.50 por 5 minutos / $20 por 1 hora |
$11.25 |
Os preços são por milhão de tokens e foram verificados em 11 de setembro de 2026. O Qwen distingue entrada em cache implícita de leituras de cache explícitas, enquanto a Anthropic altera o preço de escrita de cache conforme o período de retenção. Confirme a página do modelo relevante antes de estimar um orçamento de produção.
Um exemplo de custo por tarefa
Suponha que uma execução de agente use:
100,000 tokens de entrada nova
20,000 tokens de saída
300,000 tokens de leitura de cache
Usando as tarifas atuais do GPT Proto:
| Componente de custo |
Qwen3.8-Max-0902 |
Claude Fable 5.1 |
| Entrada nova |
$0.1800 |
$0.9000 |
| Saída |
$0.1080 |
$0.9000 |
| Leitura de cache |
$0.0675 |
$0.0675 |
| Total por tentativa |
$0.3555 |
$1.8675 |
Com essa mistura de tokens, uma tentativa do Fable custa cerca de 5.25 vezes uma tentativa do Qwen. Três tentativas do Qwen de mesmo tamanho custariam cerca de $1.07; seis custariam cerca de $2.13. Neste exemplo simplificado, o Fable se torna mais barato em gasto de API apenas se uma execução bem-sucedida do Fable substituir mais de cinco tentativas do Qwen de mesmo tamanho.
Isso é um cálculo, não uma afirmação medida de taxa de sucesso. Os modelos podem gerar contagens de tokens diferentes, usar números diferentes de turnos de ferramentas ou exigir prompts diferentes. A revisão humana também muda a decisão. Economizar $1.50 em gasto de API não vale a pena se um patch malsucedido consumir uma hora de tempo de desenvolvedor.
Uma métrica de produção melhor é:
Custo por resultado aceito = gasto total de API + custo estimado de revisão ou reparo, dividido pelo número de saídas que passam nas suas verificações de aceitação.
Veredito de custo-benefício: O Qwen é a opção claramente focada em preço para codificação em lote e etapas frequentes de agentes. O Fable pode justificar seu preço premium quando reduz materialmente tentativas ou reparos humanos em tarefas difíceis, mas isso deve ser demonstrado com sua carga de trabalho.
O que os desenvolvedores estão relatando
Relatos da comunidade são úteis para encontrar atritos que tabelas de benchmark deixam passar. Eles não são testes controlados, e a versão exata do modelo deve permanecer visível.
Feedback da comunidade sobre o Qwen
Um teste prático inicial do Qwen3.8-Max Preview usou os mesmos quatro prompts de tentativa única em vários modelos. O avaliador encontrou saídas fortes, mas conclusão muito lenta: tarefas de site levaram mais de 30 minutos e uma simulação de pôquer em Go levou cerca de 80 minutos. Esse teste é anterior ao snapshot 0902, então descreve a experiência inicial da família em vez de provar a latência atual do 0902.
Uma discussão da comunidade Qwen foi mista. Alguns usuários elogiaram a precisão do código e as baixas taxas de erro de sintaxe, enquanto criticaram verbosidade e velocidade. Outros relataram desvio de tarefa, alucinação ou qualidade inconsistente da interface. Novamente, esses comentários dizem respeito à versão Preview e não devem ser silenciosamente reclassificados como resultados do 0902.
A demonstração mais recente de painel financeiro do 0902 é mais relevante para a versão, mas muito mais restrita. Juntas, essas fontes sugerem que as equipes devem testar tanto a qualidade da saída quanto o tempo real, em vez de assumir que uma pontuação alta de codificação garante um ciclo de desenvolvimento rápido.
Feedback prático do Claude Fable 5.1
Os relatos disponíveis sobre o Fable 5.1 são mais atuais. O teste da Every elogiou codificação sustentada e execução em uma única tentativa em várias tarefas, enquanto documentou problemas de seguir instruções e de parada em outras. A análise de Thomas Wiegold também encontrou resultados fortes em uma única tentativa, mas destacou o alto custo e evitou fazer uma afirmação precisa de velocidade sem medição controlada.
Essa combinação é mais informativa do que repetir depoimentos isolados. O Fable parece adequado para trabalhos difíceis que se beneficiam de raciocínio sustentado, mas um agente ainda precisa de limites máximos de etapas, portões de teste, validação de fontes e controles de orçamento.
Qual modelo é melhor para cada caso de uso?
| Caso de uso |
Modelo recomendado |
Confiança |
Por quê |
| API de codificação sensível a custos |
Qwen3.8-Max-0902 |
Alta |
Preços de entrada nova e saída muito mais baixos |
| Codificação de frontend |
Qwen3.8-Max-0902 |
Média |
Sinal forte de WebDev e menor custo de iteração, mas nenhum teste direto atual |
| Alterações em todo o repositório |
Teste ambos |
Baixa–Média |
Evidências públicas usam repositórios e configurações de avaliação diferentes |
| Depuração difícil |
Claude Fable 5.1 |
Média |
Evidência atual mais forte para trabalho sustentado e complexo |
| Chamadas de agentes em alto volume |
Qwen3.8-Max-0902 |
Alta |
Menor custo para etapas repetidas com tokens de entrada nova |
| Agentes de longa duração sem supervisão |
Claude Fable 5.1 |
Média |
Melhor evidência atual de longo horizonte, com proteções ainda necessárias |
| Fluxos de trabalho com ferramentas forçadas |
Qwen ou redesenhe o fluxo de trabalho |
Alta |
Fable 5.1 rejeita escolha forçada de ferramenta |
| Compreensão de imagem e vídeo |
Qwen3.8-Max-0902 |
Alta |
Qwen lista oficialmente entrada de imagem e vídeo |
A linha mais importante pode ser “teste ambos”. Um benchmark público não consegue reproduzir suas convenções de repositório, definições de ferramentas, padrões de revisão ou custo de falha. Para decisões de produção caras, execute um pequeno conjunto de avaliação extraído de trabalhos internos concluídos.
Uma estratégia prática de roteamento com dois modelos
As equipes não precisam enviar todas as tarefas para o mesmo modelo. Um sistema simples de escalonamento pode capturar a vantagem de preço do Qwen enquanto reserva o Fable para o trabalho com maior probabilidade de se beneficiar dele.
1. Encaminhe trabalho rotineiro para o Qwen3.8-Max-0902
Boas tarefas iniciais incluem:
Código boilerplate e transformações repetitivas
Rascunhos de frontend e variantes de componentes
Geração de testes unitários
Documentação e explicação de código
Etapas curtas de chamada de ferramentas
Tarefas em lote com verificações de aceitação automatizadas
2. Escalone falhas difíceis para o Claude Fable 5.1
Gatilhos de escalonamento podem incluir:
Duas ou três tentativas malsucedidas do Qwen
Uma causa raiz ambígua abrangendo vários serviços
Um plano de implementação longo com muitas dependências
Uma mudança de alto valor com verificação automatizada fraca
Uma tarefa em que a revisão do desenvolvedor custa mais que o prêmio da API
3. Avalie trabalho aceito, não respostas atraentes
Acompanhe pelo menos:
Testes aprovados
Contagem de tentativas
Tempo de correção humana
Tokens de entrada nova, cache e saída
Contagem de chamadas de ferramentas
Latência ponta a ponta
Se a saída seguiu instruções de formatação e parada
Essa estratégia de roteamento geralmente é mais defensável do que nomear um modelo como vencedor permanente. Ela também torna futuras atualizações de modelo mais fáceis de avaliar, porque cada modelo tem um papel definido e critérios mensuráveis de promoção.
Como testar ambos os modelos com uma única chave de API do GPT Proto
O GPT Proto fornece ambos os modelos por meio de uma API compatível com OpenAI. O exemplo em Python a seguir envia a mesma solicitação para cada modelo, alterando apenas o ID do modelo:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GPTPROTO_API_KEY"],
base_url="https://gptproto.com/v1",
)
models = [
"qwen3.8-max-0902",
"claude-fable-5-1",
]
prompt = """
Review the following function and identify the root cause of the failing test.
Return:
1. The root cause
2. A minimal patch
3. One regression test
"""
for model in models:
response = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
print(f"\n--- {model} ---")
print(response.choices[0].message.content)
Instale o pacote oficial Python da OpenAI com pip install openai, defina sua variável de ambiente GPTPROTO_API_KEY e substitua o prompt de exemplo por uma tarefa real. Mantenha a entrada, o estado do repositório, as ferramentas disponíveis e os testes de aceitação idênticos.
Não escolha o vencedor lendo duas saídas e selecionando a que parece mais confiante. Execute o patch proposto, rode os testes, conte as tentativas e registre o total de tokens e o tempo de revisão.
Veredito final
Qwen3.8-Max-0902 é o melhor padrão para desenvolvedores que se importam com custo de API, geração de frontend, codificação em lote e chamadas de agentes em alto volume. Seu preço oficial de entrada nova é um quinto do Fable 5.1, e seu preço de saída é menos de um oitavo. Ele também oferece modalidades de entrada oficiais mais amplas e menos restrições documentadas em torno da seleção forçada de ferramentas.
Claude Fable 5.1 é o modelo de escalonamento mais bem respaldado para depuração difícil e trabalho de longa duração, em que uma tentativa malsucedida custa mais que os tokens. Seu preço premium é mais fácil de justificar quando reduz tentativas, reparos humanos ou risco operacional — não simplesmente porque tem um preço mais alto.
Não há um campeão de benchmark atual confiável em uma comparação direta. Para muitos sistemas de produção, a melhor resposta, portanto, não é Qwen ou Fable isoladamente. É Qwen primeiro, Fable quando a tarefa ultrapassa um limiar mensurável de dificuldade ou falha.