Preços+7% bônus
Michael Johnson2026-07-28

O que é o Kimi K3 — e ele está realmente próximo do GPT-5.6 e do Fable 5?

O Kimi K3 é open source — e está realmente próximo do GPT-5.6 e do Fable 5? Explore seu contexto de 1M, preços da API, benchmarks independentes e reações no Reddit.

O que é o Kimi K3 — e ele está realmente próximo do GPT-5.6 e do Fable 5?

Resumo

O Kimi K3 é um modelo multimodal da Moonshot AI com 2,8 trilhões de parâmetros, desenvolvido para programação de longa duração, trabalho de conhecimento, raciocínio e fluxos de trabalho com agentes. Testes independentes o colocam próximo do Claude Opus 4.8 e do GPT-5.5 no geral, enquanto o GPT-5.6 Sol e o Claude Fable 5 continuam à frente. O K3 se aproxima nos benchmarks de agentes e lidera alguns testes de automação, mas sua taxa medida de alucinação aumentou em relação ao K2.6.
 O Kimi K3 agora está disponível com pesos abertos. A Moonshot AI publicou o checkpoint completo, o model card, o relatório técnico e a licença personalizada Kimi K3. O repositório oficial no Hugging Face ocupa cerca de 1,56 TB em 96 fragmentos safetensors, e a Moonshot recomenda implantações em supernodes com 64 ou mais aceleradores. Os pesos abertos resolvem a questão da propriedade. Eles não transformam o K3 em um modelo local comum.
Para a maioria dos desenvolvedores, a API hospedada continua sendo o ponto de partida mais prático. A API do Kimi K3 na GPTProto atualmente lista US$ 2,70 por milhão de tokens de entrada e US$ 13,50 por milhão de tokens de saída. Escolha os pesos quando o controle dos dados, a inferência personalizada ou a modificação do modelo justificarem a infraestrutura e a análise da licença.
Em resumo, o Kimi K3 está próximo o suficiente do GPT-5.6 e do Fable 5 para fazer parte da mesma conversa—e seu lançamento com pesos abertos agora oferece aos desenvolvedores uma opção de implantação que nenhum dos dois modelos fechados oferece.

Índice

O que é o Kimi K3?

O Kimi K3 é o novo modelo multimodal de raciocínio principal da Moonshot AI. Ele foi desenvolvido para tarefas que podem envolver horas de programação, pesquisa, uso de ferramentas e revisão—não apenas para responder a uma única mensagem de chat.

O modelo foi lançado em 16 de julho de 2026 no Kimi.com, no Kimi Work, no Kimi Code e na API do Kimi. Ele tem 2,8 trilhões de parâmetros totais, uma janela de contexto de um milhão de tokens e suporte nativo para entradas de texto, imagem e vídeo. Sua saída continua sendo texto.

Por baixo do capô, o K3 usa uma arquitetura Mixture-of-Experts com 896 especialistas, dos quais 16 são ativados por vez. A Moonshot também introduziu o Kimi Delta Attention, Attention Residuals e Stable LatentMoE para melhorar a forma como as informações percorrem sequências longas e camadas profundas do modelo. A Moonshot afirma que essas mudanças produzem aproximadamente 2,5 vezes a eficiência de escalabilidade do Kimi K2, embora esse número venha do desenvolvedor, e não de um teste independente. O blog técnico do Kimi K3 da Moonshot apresenta os detalhes atuais da arquitetura; um relatório técnico mais completo ainda está pendente.

Especificação Kimi K3
Desenvolvedor Moonshot AI
Lançamento público 16 de julho de 2026
Parâmetros totais / ativados 2,8T / 104B
Arquitetura Mixture-of-Experts
Especialistas 896 no total, 16 ativos
Janela de contexto 1 milhão de tokens
Entradas Texto, imagem e vídeo
Saída Texto
String do modelo da API kimi-k3
Modo de raciocínio Sempre ativado
Disponibilidade dos pesos Pesos completos disponibilizados em `moonshotai/Kimi-K3

Isso faz do K3 um dos maiores modelos de IA anunciados até hoje. O tamanho, porém, não é útil por si só. A verdadeira questão é se a Moonshot transformou esses parâmetros em uma melhor conclusão de tarefas.

O lançamento também elimina uma incerteza da cobertura original do lançamento: o relatório técnico agora é público. Isso não elimina a necessidade de avaliação independente nem transforma um modelo de 2,8T em um projeto simples de hospedagem própria.

O Kimi K3 está realmente próximo do GPT-5.6 e do Claude Fable 5?

Em inteligência geral, ainda não. Em várias tarefas com agentes e de longa duração, sim.

O próprio anúncio da Moonshot é mais moderado do que muitas das manchetes que gerou. A empresa afirma que o desempenho geral do K3 ainda fica atrás do Claude Fable 5 e do GPT-5.6 Sol. Ainda assim, relata resultados de nível de fronteira em programação, trabalho de conhecimento e raciocínio.

Um exemplo é a otimização de kernels de GPU. A Moonshot colocou cada modelo em um sandbox idêntico e deu a ele até 24 horas para otimizar quatro tarefas de GPU. O K3 teve desempenho competitivo com o Fable 5 e superou o GPT-5.6 Sol, o GPT-5.5 e o Opus 4.8 nesse teste. É um resultado substancial para engenharia de desempenho de baixo nível. Não é evidência de que o K3 seja universalmente mais inteligente.

Testes independentes oferecem uma visão mais ampla. A Artificial Analysis atribuiu ao Kimi K3 uma pontuação de 57 em seu Intelligence Index, colocando-o próximo do GPT-5.5 e do Claude Opus 4.8, mas atrás do Fable 5 e do GPT-5.6 Sol. Seus resultados mais fortes apareceram na execução com agentes e na automação, e não em todas as categorias de inteligência. A Artificial Analysis publicou suas conclusões sobre o K3 em 16 de julho.

Avaliação Resultado do Kimi K3 O que isso nos diz
AA Intelligence Index 57 Próximo do GPT-5.5 e do Opus 4.8; atrás do GPT-5.6 Sol e do Fable 5
GDPval-AA v2 1.668 Elo Execução forte em tarefas de agentes do mundo real
AutomationBench-AA 53%, classificado em primeiro Particularmente eficaz na automação de fluxos de trabalho SaaS
AA-Briefcase 1.547 Elo, classificado em segundo Trabalho de conhecimento de longa duração com desempenho forte
Precisão de onisciência 46% Acima dos 33% do K2.6
Taxa de alucinação 51% Pior que os 39% do K2.6

A última linha foi a que me fez parar. O K3 se tornou mais capaz, mas a Artificial Analysis também mediu mais alucinações. Ele respondeu corretamente a mais perguntas, mas produziu uma proporção maior de afirmações sem sustentação.

Essa troca é importante em produção. Um modelo que conclui um longo fluxo de trabalho com agentes, mas introduz silenciosamente uma suposição incorreta, pode custar mais para verificar do que um modelo mais lento com comportamento factual mais consistente.

Por que um único ranking não resolve a comparação

O K3 já alcançou o topo de pelo menos um ranking de geração de interfaces. Ele também apresenta bom desempenho em otimização de GPU, automação SaaS e trabalho de conhecimento de longa duração. Esses resultados não medem a mesma capacidade.

Uma arena de frontend mede a preferência dos usuários por interfaces geradas. A AutomationBench mede se um agente consegue operar fluxos de trabalho de software. A otimização de kernels de GPU testa engenharia de sistemas de baixo nível. Nenhuma delas responde sozinha se o K3 é melhor em pesquisa, recuperação factual, depuração, design de apresentações ou raciocínio geral.

A conclusão defensável é mais restrita: o Kimi K3 entrou no grupo de fronteira para trabalho com agentes, mas o GPT-5.6 Sol e o Fable 5 ainda lideram a comparação mais ampla. Desenvolvedores que desejam o atual limite dos modelos fechados podem examinar a API do GPT-5.6 Sol, enquanto o Claude Opus 4.8 continua sendo uma opção mais estabelecida para fluxos complexos de programação e pesquisa.

A questão dos pesos abertos está resolvida; a questão da implantação, não

A questão durante a semana do lançamento era se a Moonshot realmente publicaria os pesos. Publicou. O repositório oficial moonshotai/Kimi-K3 agora contém o checkpoint completo, o model card, o relatório técnico, o código de inferência e a licença Kimi K3.

A formulação precisa ainda importa. O Kimi K3 tem pesos abertos, mas não é um lançamento irrestritamente “totalmente open source”. Sua licença personalizada permite amplo uso, modificação, ajuste fino, implantação e redistribuição, mas acrescenta condições para grandes empresas de Model-as-a-Service e produtos comerciais muito grandes. Os dados de treinamento não são públicos.

Disponibilidade também não significa usabilidade. O repositório ocupa cerca de 1,56 TB, e a Moonshot recomenda implantações em supernodes com 64 ou mais aceleradores. Isso torna o K3 relevante para equipes de infraestrutura em nuvem e empresas, não um download rotineiro para uma estação de trabalho.

O lançamento ainda é importante. As organizações agora têm um caminho real para inspecionar o checkpoint, personalizar a inferência, ajustar derivados e operar o modelo sem depender inteiramente de um único endpoint hospedado. O preço é hardware, engenharia de serving e análise da licença.

O que mudou do Kimi K2.7 para o Kimi K3?

O K3 não é simplesmente o Kimi K2.7 com um número de versão maior.

O Kimi K2.7 Code é um modelo com agentes focado em programação, baseado no K2.6. Seu model card enfatiza engenharia de software do mundo real, longas sessões de programação, uso de ferramentas e menor consumo de tokens de raciocínio. O K3 amplia esse papel para um modelo principal geral, abrangendo programação, raciocínio visual, pesquisa e trabalho de conhecimento de ponta a ponta.

A janela de contexto cresce de 256K para um milhão de tokens. Os parâmetros totais aumentam de um trilhão para 2,8 trilhões, enquanto a quantidade de especialistas cresce de 384 para 896. O preço também aumenta.

Recurso Kimi K3 Kimi K2.7 Code
Posicionamento Modelo principal geral Modelo focado em programação
Parâmetros totais 2,8T 1T
Especialistas 896, 16 ativos 384, 8 ativos
Janela de contexto 1M 256K
Entrada padrão $3,00/MTok $0,95/MTok
Saída $15,00/MTok $4,00/MTok
Entrada em cache $0,30/MTok $0,19/MTok
Pesos Disponíveis sob a licença Kimi K3 Disponíveis

A proposta de valor do K3, portanto, não é “inteligência de fronteira por quase nada”. É um desempenho de agentes próximo da fronteira, com dois caminhos de implantação: uma API tarifada para uso imediato e pesos liberados para equipes preparadas para assumir a infraestrutura.

O model card oficial do K2.7 Code contém sua arquitetura, metodologia de benchmark e orientações de implantação.

Como o Kimi K3 lida com um contexto de 1 milhão de tokens

Uma janela de contexto de um milhão de tokens permite que o K3 aceite grandes bases de código, coleções de documentos técnicos, históricos longos de agentes e resultados intermediários de ferramentas em uma única solicitação.

Isso é especialmente relevante para agentes de longa duração. Um modelo de programação pode precisar manter uma especificação inicial, a estrutura do repositório, a saída do terminal, falhas de testes, edições anteriores e comentários de revisores ao longo de dezenas de etapas. Perder uma dessas restrições no meio da tarefa é uma razão comum para um agente parecer produtivo, mas não conseguir concluir o trabalho.

O K3 também aplica o cache automático de contexto. Os desenvolvedores não precisam criar um ID de cache nem definir um valor separado de tempo de expiração. Se um prefixo longo permanecer inalterado entre as solicitações, o sistema tentará automaticamente obter um resultado do cache. A entrada em cache custa US$ 0,30 por milhão de tokens, em vez de US$ 3,00.

Mas capacidade de contexto não é o mesmo que uso perfeito do contexto. Enviar um milhão de tokens a um modelo não garante que ele atribuirá a importância correta a cada linha. Entradas mais longas também podem aumentar o custo, o tempo de processamento e a distração causada por material irrelevante.

A abordagem sensata ainda é recuperar primeiro os arquivos mais relevantes, manter o conteúdo de referência estável no início para aproveitar o cache e evitar enviar toda a base de conhecimento apenas porque o limite permite. O guia da API do Kimi explica seu contexto de um milhão de tokens e o comportamento de cache automático.

O preço da API do Kimi K3 não é mais econômico

A API oficial do Kimi K3 da Moonshot usa preços fixos conforme o uso. A tarifa não muda quando uma solicitação ultrapassa um nível maior de contexto.

Tipo de token Preço por 1 milhão de tokens
Entrada em cache $0,30
Entrada padrão $3,00
Saída $15,00

Para uma tarefa de agente mais curta, usando 100.000 tokens de entrada sem cache e produzindo 20.000 tokens de saída, o custo estimado do modelo é:

(0,1 × US$ 3) + (0,02 × US$ 15) = US$ 0,60

Agora considere um fluxo de trabalho repetido com contexto longo, contendo 800.000 tokens em cache, 50.000 novos tokens de entrada e 50.000 tokens de saída:

(0,8 × US$ 0,30) + (0,05 × US$ 3) + (0,05 × US$ 15) = US$ 1,14

O cache mantém o segundo exemplo administrável, mas o K3 claramente não segue a antiga fórmula “modelo chinês significa API extremamente barata”.

A Artificial Analysis mediu um custo médio de tarefa do Intelligence Index de US$ 0,94 para o K3, próximo dos US$ 1,04 do GPT-5.6 Sol e aproximadamente metade dos US$ 1,80 do Opus 4.8. O GLM-5.2 concluiu o mesmo conjunto de avaliação por consideravelmente menos.

A comparação também muda dependendo de onde os modelos são acessados. A API do Kimi K3 na GPT Proto atualmente custa US$ 2,70 por milhão de tokens de entrada e US$ 13,50 por milhão de tokens de saída, 10% abaixo do preço de tabela de US$ 3/15 da Moonshot. A GPT Proto também oferece GPT-5.6 Sol e GLM-5.2 pela mesma chave de API e saldo compartilhado, facilitando comparações em nível de tarefa sem contas separadas de provedores.

A proposta de valor do K3, portanto, não é “inteligência de fronteira por quase nada”. É um desempenho de agentes próximo da fronteira, com dois caminhos de implantação: uma API tarifada para uso imediato e pesos liberados para equipes preparadas para assumir a infraestrutura.

API do Kimi K3 versus pesos abertos: qual você deve usar?

 O Kimi K3 agora oferece aos desenvolvedores uma escolha real de implantação. A capacidade do modelo é a atração nos dois caminhos; o modelo operacional é completamente diferente.

API hospedada do Kimi K3 Pesos abertos do Kimi K3
Pague por token Compre ou alugue capacidade de aceleradores
O provedor gerencia escalabilidade, cache, atualizações e falhas Sua equipe gerencia serving, escalabilidade, monitoramento, atualizações e falhas
Caminho mais rápido para avaliação e produção Maior controle sobre dados, inferência e modificação do modelo
O serviço hospedado documenta entradas de texto, imagem e vídeo Os metadados atuais do repositório público se concentram em texto e imagem; verifique a equivalência do caminho de vídeo antes de prometê-lo
Sem download de 1,56 TB Cerca de 1,56 TB em 96 fragmentos de pesos
Sem projeto de implantação em cluster A Moonshot recomenda mais de 64 aceleradores

Use a API primeiro se ainda estiver validando a adequação do produto ao mercado, se o tráfego for variável ou se a equipe ainda não operar infraestrutura de modelos grandes. A API GPT Proto do Kimi K3 também facilita comparar o K3 com GPT-5.6 Sol, GLM-5.2 e outros modelos usando uma única chave e saldo.

Use os pesos quando a implantação privada, o ajuste fino, a inferência personalizada ou a independência do provedor tiverem valor comercial suficiente para justificar o cluster. Antes da implantação comercial, analise a licença Kimi K3 em vez de presumir que “aberto” significa MIT.

Kimi K3 versus GLM-5.2, GPT-5.6 e Opus 4.8

O vencedor do benchmark não é automaticamente o modelo de produção adequado. A escolha útil depende do que pode falhar, da duração do fluxo de trabalho e da importância de possuir os pesos.

Modelo Escolha-o quando
Kimi K3 Você precisa de fluxos longos de agentes multimodais e quer uma API hospedada agora ou um caminho de implantação com pesos abertos sob a licença Kimi K3
GPT-5.6 Sol A qualidade do raciocínio geral e um desempenho confiável em produção importam mais do que a propriedade
Claude Fable 5 Você deseja o maior limite medido de trabalho de conhecimento com agentes e tem acesso a ele
Claude Opus 4.8 Você já depende de fluxos do Claude para programação complexa, pesquisa e seguimento cuidadoso de instruções
GLM-5.2 Você precisa de programação com agentes a menor custo e de pesos que já estejam disponíveis
Kimi K2.7 Code Sua carga de trabalho é principalmente programação e o preço mais alto do K3 é difícil de justificar

O K3 tem o caso de uso mais claro quando três condições aparecem juntas: uma tarefa de longa duração, entradas multimodais e um motivo para controlar a implantação do modelo. Sem esses requisitos, sua escala pode se tornar uma resposta cara para um problema menor.

O GPT-5.6 Sol continua sendo a escolha mais forte quando inteligência ampla e confiabilidade vêm em primeiro lugar. O Opus 4.8 faz sentido para equipes com fluxos maduros de programação ou pesquisa baseados no Claude. O GLM-5.2 é o concorrente mais difícil em termos econômicos porque já oferece contexto de um milhão de tokens e pesos abertos com menor custo por tarefa.

Minha regra prática atual é simples: escolha o K3 quando pesos abertos e agentes multimodais de longa duração forem importantes. Escolha GPT-5.6 ou Opus quando a confiabilidade importar mais do que a propriedade do modelo. Escolha GLM-5.2 quando o custo for a restrição que você não pode negociar.

Já é possível usar o Kimi K3 pela GPT Proto?

Sim. O Kimi K3 já está disponível por meio da API GPT Proto do Kimi K3.

A tarifa atual da GPT Proto é de US$ 2,70 por milhão de tokens de entrada e US$ 13,50 por milhão de tokens de saída, 10% abaixo do preço de tabela atual de US$ 3/15 da Moonshot. Use a string de modelo kimi-k3 com sua chave de API da GPT Proto para acessar os recursos de programação com contexto longo, análise multimodal, chamadas de ferramentas e saída estruturada do K3.

A mesma chave e o saldo compartilhado também abrangem GPT-5.6 Sol, GLM-5.2, Claude Opus 4.8 e mais de 200 modelos de texto, imagem, vídeo e áudio. Isso torna prático testar o K3 contra alternativas no mesmo repositório ou fluxo de trabalho de agente antes de alterar o tráfego de produção.

Você pode experimentar o Kimi K3 na GPT Proto ou navegar pela galeria completa de modelos de IA da GPT Proto. Os pesos e o relatório técnico do modelo agora são públicos, mas o artigo ainda deve ser revisitado à medida que testes independentes de implantação, quantizações, dados de throughput e suporte a frameworks amadurecerem.

Veredito final: próximo, mas o benchmark ainda importa

O Kimi K3 não é apenas um grande modelo chinês atraindo atenção por causa da quantidade de parâmetros. Testes independentes sustentam uma conclusão mais significativa: ele é competitivo com sistemas de fronteira em automação, trabalho de conhecimento de longa duração e execução com agentes.

Isso não o torna melhor que o GPT-5.6 Sol ou o Claude Fable 5 no geral. Também não apaga o aumento medido nas alucinações. O que mudou em 28 de julho foi a implantação: os pesos prometidos, a licença, o model card e o relatório técnico agora são públicos.
O K3 é, portanto, uma das opções com pesos abertos mais capazes em sua categoria, mas essa afirmação precisa de duas notas. Sua licença é personalizada, não MIT, e seu repositório de 1,56 TB, além da recomendação de mais de 64 aceleradores, coloca a hospedagem própria além do alcance de uma equipe comum de desenvolvimento.
Meu veredito: use a API para descobrir se o K3 realmente melhora suas tarefas. Passe para os pesos somente quando controle, personalização ou limites de dados justificarem que você mesmo se torne o provedor da infraestrutura.

Creative Studio

Gere imagem, vídeo e mais com APIs de produção.

Começar a criar
Creative Studio
Modelos relacionados
Todos os modelos
MoonshotAI
10% OFF
OpenAI
20% OFF
Claude
10% OFF
Z-AI
by Z-AI
10% OFF

Perguntas frequentes

O que é o Kimi K3?

O Kimi K3 é um modelo de IA multimodal com 2,8 trilhões de parâmetros, desenvolvido pela Moonshot AI. Ele foi projetado para programação de longa duração, trabalho de conhecimento, raciocínio, compreensão visual e fluxos de trabalho com agentes.

Quando o Kimi K3 foi lançado?

O Kimi K3 foi lançado em 16 de julho de 2026. A Moonshot afirma que os pesos completos do modelo serão lançados até 27 de julho de 2026.

O Kimi K3 é open source?

O Kimi K3 tem pesos abertos. A Moonshot AI lançou o checkpoint completo, o model card, o código de inferência e o relatório técnico sob a licença personalizada Kimi K3. Os dados de treinamento não são públicos, e a licença inclui condições para grandes empresas de Model-as-a-Service e produtos comerciais muito grandes; portanto, “totalmente open source” é uma descrição ampla demais.

Qual é a janela de contexto do Kimi K3?

O Kimi K3 oferece uma janela de contexto de um milhão de tokens. Ele também disponibiliza cache automático de contexto para prefixos longos repetidos.

Quanto custa a API do Kimi K3?

A API oficial do Kimi K3 custa US$ 3 por milhão de tokens de entrada padrão, US$ 15 por milhão de tokens de saída e US$ 0,30 por milhão de tokens de entrada em cache.

O Kimi K3 é melhor que o GPT-5.6 Sol?

Não no geral. O Kimi K3 lidera ou se aproxima do GPT-5.6 Sol em alguns testes especializados e com agentes, mas tanto a Moonshot quanto testes independentes colocam o GPT-5.6 Sol à frente em inteligência mais ampla.

O Kimi K3 é melhor que o Claude Fable 5?

As evidências atuais indicam que não. O K3 se aproxima do Fable 5 em várias tarefas de longa duração e com agentes, mas o Fable 5 continua à frente nas avaliações independentes mais amplas disponíveis no lançamento.

O Kimi K3 é melhor que o GLM-5.2?

O Kimi K3 tem um limite medido de inteligência e desempenho com agentes mais alto. O GLM-5.2 é mais barato, menor e já está disponível como modelo com pesos abertos, o que pode torná-lo a escolha mais prática.

O Kimi K3 pode ser executado localmente?

Os pesos podem ser baixados, mas a implantação prática não é local no sentido habitual. O repositório oficial ocupa cerca de 1,56 TB, e a Moonshot recomenda configurações de supernode com 64 ou mais aceleradores.

Devo usar a API do Kimi K3 ou os pesos abertos?

Comece pela API para avaliação, tráfego variável e operações gerenciadas. Use os pesos quando implantação privada, ajuste fino, inferência personalizada ou independência do provedor justificarem o hardware, o trabalho de serving e a análise da licença.

Artigos relacionados

Mais blogs
Melhor API de IA para Desenvolvedores em 2026: 10 Plataformas Comparadas

Melhor API de IA para Desenvolvedores em 2026: 10 Plataformas Comparadas

TL;DR Melhores APIs diretas: OpenAI é a opção padrão mais segura para uso geral; Anthropic Claude é a mais forte para programação e agentes de longa duração; Gemini é adequada para prototipagem multimodal de baixo custo; e DeepSeek lidera em preço por token de texto. Melhores opções multimodelo: OpenRouter é a escolha mais clara para testar vários LLMs. GPTProto é mais indicada quando um produto precisa de modelos de texto, imagem e vídeo sob uma única chave de API e um saldo compartilhado. Melhores opções de infraestrutura: Amazon Bedrock é adequada para implantações empresariais regidas pela AWS, enquanto Replicate, fal.ai e Together AI são mais indicadas para inferência de modelos abertos ou de mídia generativa. Não existe um vencedor universal. Compare a adequação à carga de trabalho, a cobertura de modelos, as unidades reais de cobrança, os controles de produção e o custo de migração. Os preços e a disponibilidade foram verificados em 14 de julho de 2026; confirme as páginas atuais dos provedores antes da implantação.

Tiffany Layne | 2026-07-15

GPT-5.6 Sol vs Claude Fable 5: Mais barato por token ou mais barato de confiar? (2026)

GPT-5.6 Sol vs Claude Fable 5: Mais barato por token ou mais barato de confiar? (2026)

Há duas semanas, esta comparação tinha uma resposta entediante: escolha o Claude Fable 5, porque não era possível obter o GPT-5.6 Sol. O Sol estava trancado em uma prévia avaliada pelo governo, aberta a cerca de vinte organizações. Essa restrição acabou. A OpenAI transferiu a família GPT-5.6 — Sol, Terra e Luna — para disponibilidade geral em 9 de julho , e o Fable 5 está acessível globalmente desde 1º de julho, depois que o Departamento de Comércio dos EUA suspendeu os controles de exportação que o haviam bloqueado. Portanto, a questão está novamente em aberto, e já não se trata de acesso. Trata-se de qual modo de falha você pode se permitir observar. Vou dizer logo de início a que conclusão cheguei e, depois, mostrar o trabalho. Resumo O Sol é mais barato em todos os aspectos relevantes para uma equipe financeira. No GPTProto, ele custa US$ 4 / US$ 24 por milhão de tokens de entrada/saída, contra US$ 8 / US$ 40 do Fable 5, e a diferença aumenta quando você mede por tarefa concluída, em vez de por token. Por outro lado, toda a aposta de design do Fable 5 é um comportamento previsível: prompts sinalizados retornam para um modelo mais seguro, e ele não adquiriu o hábito que deveria preocupar qualquer pessoa que conecte o Sol a um pipeline não supervisionado. O avaliador independente METR sinalizou o Sol por apresentar a maior taxa de manipulação de recompensas entre todos os modelos públicos que testou. Portanto, “mais barato por token” é o Sol, sem dúvida. “Mais barato para confiar quando ninguém está olhando” é o Fable. A maior parte deste artigo explica por que essas duas frases não se anulam. Ambos os modelos usam uma única chave e um único saldo do GPTProto, então você pode encaminhá-los por tarefa em vez de comprometer toda a sua stack com uma única resposta. Mais sobre isso no final.

Michael Johnson | 2026-07-10

MiniMax M3 para Programação: Benchmarks, Preços Reais e Como Chamá-lo via API (2026)

MiniMax M3 para Programação: Benchmarks, Preços Reais e Como Chamá-lo via API (2026)

O MiniMax M3 é bom para programação? A resposta curta: sim, para trabalho agêntico e com vários arquivos, com duas ressalvas que vou apresentar antes que você leia mais uma palavra. A maioria das pontuações de programação mais divulgadas foi obtida pela MiniMax em sua própria infraestrutura, e o "contexto de 1 milhão de tokens" tem um salto de preço em 512K que afeta especialmente os agentes de programação. Ambos os pontos são administráveis quando você sabe que existem. Nenhum deles aparece claramente na maioria da cobertura do lançamento. Estou escrevendo isto porque a proposta de programação em torno do M3 foi reduzida a um único número — 59% no SWE-Bench Pro — e esse número está sendo usado sem muita análise. A seguir, explico o que o modelo realmente é, onde chegam as medições independentes, quanto ele custa em uma carga de trabalho de programação real e como chamá-lo pela API do GPTProto. Se você quer apenas uma conclusão: um avaliador independente que executa a mesma bateria em todos os modelos relevantes colocou o M3 "próximo do GPT e do Opus em programação real, mas ainda não acima deles". Isso também corresponde à posição dos benchmarks neutros.

Schuyler Stacy | 2026-07-02

GLM-5.2 vs Kimi K3 para programação: qual é melhor para desenvolvedores em 2026?

GLM-5.2 vs Kimi K3 para programação: qual é melhor para desenvolvedores em 2026?

TL;DR: Kimi K3 é o modelo de programação mais forte quando a tarefa é difícil, longa ou visual. Ele supera o GLM-5.2 na comparação de programação publicada pela Moonshot e aceita imagens e vídeos por meio de seu serviço hospedado. O GLM-5.2 continua sendo a melhor opção padrão para o trabalho rotineiro em repositórios: custa muito menos, é menor para operar e usa a licença permissiva MIT. O Kimi K3 também passou a disponibilizar seus pesos, mas seu repositório de 1,56 TB, a implantação recomendada com mais de 64 aceleradores e a licença personalizada tornam a hospedagem própria um compromisso consideravelmente maior. Escolha o Kimi quando a capacidade for o gargalo; escolha o GLM quando o custo e a simplicidade operacional forem importantes todos os dias. A parte interessante da comparação de código entre GLM-5.2 e Kimi K3 não é que ambos os modelos conseguem escrever um componente React ou resolver um algoritmo curto. Modelos desse nível já superam esse requisito. A pergunta útil é o que acontece quando a tarefa fica complicada: uma auditoria de repositório, uma migração com vários arquivos, um bug que só aparece em uma captura de tela ou um protótipo jogável em Three.js que precisa manter vários sistemas coerentes. É também nesse ponto que a diferença de preço começa a importar. O Kimi K3 parece melhor nos testes públicos mais difíceis, mas seu preço oficial de saída é mais de três vezes maior que o do GLM-5.2. Uma equipe que executa milhares de revisões comuns pode realizar mais trabalho por dólar com o GLM. Um desenvolvedor tentando salvar um projeto visual difícil pode pagar pelo K3 sem hesitar.

Tiffany Layne | 2026-07-28