Preços+7% bônus
Schuyler Stacy2026-07-02

MiniMax M3 para Programação: Benchmarks, Preços Reais e Como Chamá-lo via API (2026)

O MiniMax M3 é bom para programação? Benchmarks independentes versus alegações do fornecedor, o custo real da API com o salto de preço em 512K explicado e código GPTProto executável.

MiniMax M3 para Programação: Benchmarks, Preços Reais e Como Chamá-lo via API (2026)

O MiniMax M3 é bom para programação? A resposta curta: sim, para trabalho agêntico e com vários arquivos, com duas ressalvas que vou apresentar antes que você leia mais uma palavra. A maioria das pontuações de programação mais divulgadas foi obtida pela MiniMax em sua própria infraestrutura, e o "contexto de 1 milhão de tokens" tem um salto de preço em 512K que afeta especialmente os agentes de programação. Ambos os pontos são administráveis quando você sabe que existem. Nenhum deles aparece claramente na maioria da cobertura do lançamento.

Estou escrevendo isto porque a proposta de programação em torno do M3 foi reduzida a um único número — 59% no SWE-Bench Pro — e esse número está sendo usado sem muita análise. A seguir, explico o que o modelo realmente é, onde chegam as medições independentes, quanto ele custa em uma carga de trabalho de programação real e como chamá-lo pela API do GPTProto. Se você quer apenas uma conclusão: um avaliador independente que executa a mesma bateria em todos os modelos relevantes colocou o M3 "próximo do GPT e do Opus em programação real, mas ainda não acima deles". Isso também corresponde à posição dos benchmarks neutros.

Índice

O que MiniMax M3 é, sob a perspectiva da programação

O M3 foi lançado em 1º de junho de 2026. É um modelo Mixture-of-Experts — rastreadores da comunidade que analisaram o checkpoint divulgado estimam cerca de 428 bilhões de parâmetros no total, com aproximadamente 23 bilhões ativos por token, embora a MiniMax não tenha publicado uma decomposição completa dos parâmetros, portanto trate esses números exatos como secundários. Ele é nativamente multimodal (recebe texto, imagem e vídeo; gera texto) e é um modelo de raciocínio com um modo de pensamento que pode ser alternado por solicitação.

Antes do mecanismo, a motivação: por que um modelo de programação se importa com o tamanho do contexto? Porque o trabalho de engenharia real não envolve um único arquivo. Envolve um repositório, um stack trace, a saída dos testes e os três arquivos que você precisaria alterar para corrigir o problema — tudo mantido em um só lugar por tempo suficiente para raciocinar entre eles. A resposta do M3 é uma janela de contexto de 1 milhão de tokens, com um limite utilizável garantido de 512 mil tokens. O mecanismo subjacente é o MiniMax Sparse Attention (MSA), que seleciona blocos do cache de chave-valor em vez de prestar atenção a todos os pares de tokens. A MiniMax relata que, com 1 milhão de tokens, isso reduz o processamento por token para aproximadamente um vigésimo do da geração anterior, com prefill cerca de 9 vezes mais rápido e decodificação 15 vezes mais rápida. Esses são números do fornecedor sobre a arquitetura, não medições independentes, mas a direção é consistente com o que a atenção esparsa deveria proporcionar.

Também existe uma interface de programação própria — o MiniMax Code, seu próprio agente desenvolvido sobre o modelo. É útil saber que ele existe; mas não é disso que este artigo trata, já que você está aqui para chamar o modelo a partir do seu próprio código.

Uma frase para guardar: o M3 foi desenvolvido para trabalho contínuo e em várias etapas, percorrendo um contexto amplo, não para snippets de uma única rodada. Essa perspectiva explica quase todos os compromissos apresentados abaixo.

Os benchmarks de programação: o que a MiniMax relata versus o que é medido de forma independente

Esta é a divisão que a maioria dos textos deixa de lado. À esquerda, as pontuações de programação e tarefas agênticas relatadas pela própria MiniMax. À direita, o que foi medido por uma terceira parte neutra.

Fonte Métrica Pontuação
MiniMax (executado pelo fornecedor, em sua própria infraestrutura, com estrutura do Claude Code) SWE-Bench Pro 59.0%
MiniMax SWE-Bench Verified 80.5%
MiniMax Terminal-Bench 2.1 66.0%
MiniMax SWE-fficiency 34.8%
MiniMax KernelBench Hard 28.8%
MiniMax MCP Atlas (orquestração de ferramentas) 74.2%
Artificial Analysis (independente) Intelligence Index (composto) 55 — nº 1 em sua classe de modelos com pesos abertos

Há duas coisas que a tabela do fornecedor não informa. Primeiro, o fato de esses resultados serem executados pelo fornecedor importa mais do que o normal neste caso: o número do SWE-Bench Pro foi produzido na configuração própria da MiniMax, usando o Claude Code como ferramenta de execução, e a replicação independente ainda está se atualizando. Considere os 59% um forte sinal do nível em que o M3 compete, não um resultado definitivo. Segundo — e este é o detalhe que não vi em nenhum artigo focado em programação — quando a Artificial Analysis comparou o M3 com seu antecessor, a maioria das avaliações melhorou (Humanity's Last Exam 28→37, GPQA Diamond 87→93, raciocínio em contexto longo 69→74), mas o SciCode, a avaliação de programação desse conjunto, caiu ligeiramente de 47 para 45. É uma pequena regressão, e eu não tiraria conclusões exageradas dela. Mas é o único dado que complica a narrativa simples de que ele é "muito melhor em programação", e é revelador que isso não tenha sido mencionado em lugar algum.

Minha leitura: o M3 está genuinamente próximo da fronteira em engenharia de software aplicada — escrever patches, editar vários arquivos e trabalhar no terminal — e o respaldo do índice independente (55, o topo de sua classe) é real, não marketing. Ele não representa uma mudança radical em relação à geração anterior em todos os aspectos da programação, e a diferença em raciocínio abstrato é real (mais sobre isso abaixo). Conclusão: confie no nível geral, mas verifique o número exato com suas próprias tarefas.

Quanto ele realmente custa em uma carga de trabalho de programação

Primeiro, o preço de tabela, porque a comparação honesta não é a que você verá na maioria dos textos. Pela página do modelo GPT Proto, o M3 custa US$ 0,48 por milhão de tokens de entrada e US$ 0,96 por milhão de tokens de saída no nível padrão.

Para referência, a taxa efetiva da própria MiniMax — após o desconto permanente de 50% aplicado ao preço de tabela — é de cerca de US$ 0,30 para entrada e US$ 1,20 para saída. Portanto, seja preciso na comparação em vez de simplesmente dizer que é "mais barato": encaminhado pelo GPT Proto, o custo de entrada é maior do que chamando a MiniMax diretamente, enquanto o de saída é menor. Qual opção vence depende inteiramente da proporção entre leitura e escrita da sua carga de trabalho. Um agente de programação que ingere um repositório grande e produz um diff pequeno é dominado pela entrada, portanto a taxa de entrada prevalece; uma tarefa pesada em geração pende para o outro lado. O motivo para encaminhar o M3 por um agregador não é um desconto chamativo — é operacional: uma única chave e uma interface compatível com OpenAI para o M3 junto com o restante do catálogo, em vez de configurar uma conta MiniMax separada, um endpoint regional e uma chave de assinatura.

Agora vem a parte que realmente determina as contas de programação e o motivo pelo qual o "contexto de 1M" merece um asterisco. O preço é fixo apenas até 512 mil tokens de entrada. Passe desse limite e toda a solicitação — entrada, saída e leituras do cache — será cobrada em dobro. É uma função em degrau, não uma progressão gradual. Imagine um ciclo normal de agente: você começa com 400 mil tokens de entrada e 100 mil de saída, confortavelmente abaixo do limite. Mas os ciclos do agente acumulam conteúdo. Na décima ou décima quinta rodada, nada foi removido, e uma rodada ultrapassa silenciosamente 512 mil — nesse ponto, toda a rodada paga o dobro, por tudo, não apenas pelos tokens acima do limite. Um aumento de 20% na entrada pode mais que dobrar o custo de uma chamada.

A alavanca que atua no sentido contrário é o cache: entradas repetidas (seu prompt de sistema, as partes estáveis do código-base) são lidas por uma fração da taxa padrão. Em ciclos de agentes, uma grande parte da entrada pode ser armazenada em cache, então vale a pena configurar isso desde cedo. Conclusão: no M3, sua conta de programação é determinada pela quantidade de contexto que você mantém e pela eficiência do cache, não pelo número por token no cartão de preços. Faça o orçamento da carga de trabalho, não do preço de tabela.

Como chamar o M3 pela API do GPT Proto

O endpoint é a interface de chat compatível com OpenAI. A autenticação usa uma chave de API bruta no cabeçalho Authorization — sem o prefixo Bearer, o que costuma causar confusão para quem vem de outros provedores. Troque a string do modelo para MiniMax-M3 e pronto.

import requests, json, glob
 
# Carrega alguns arquivos de origem em um único prompt de contexto longo.
# O limite do M3 é de 512 mil tokens, então uma dúzia de arquivos cabe sem atingir o salto de preço.
files = glob.glob("src/**/*.py", recursive=True)[:20]
codebase = "\n\n".join(f"# ---- {p} ----\n{open(p).read()}" for p in files)
 
prompt = (
    "Aqui está parte de um serviço Python. Encontre todos os lugares onde uma conexão de banco de dados pode vazar em um caminho de exceção e retorne a correção como um diff unificado.\n\n"
    + codebase
)
 
resp = requests.post(
    "https://gptproto.com/v1/chat/completions",
    headers={
        "Authorization": "sk-your-gptproto-key",  # chave bruta, SEM o prefixo "Bearer"
        "Content-Type": "application/json",
    },
    data=json.dumps({
        "model": "MiniMax-M3",
        "messages": [{"role": "user", "content": prompt}],
        "temperature": 0.2,   # o padrão é 0.95 — reduza-o para edições de código determinísticas
        "stream": False,
    }),
    timeout=120,
)
 
print(resp.json()["choices"][0]["message"]["content"])

Duas observações práticas. A temperature padrão nesta interface é 0,95, o que é alto para código — eu a reduziria para 0,2 ou menos quando você quiser diffs reproduzíveis em vez de variações criativas. E uma informação importante: este endpoint e o padrão de autenticação com chave bruta foram confirmados na documentação ativa do GPT Proto sobre o modelo MiniMax, com a string do modelo alterada para MiniMax-M3; eu não testei esta chamada exata contra o M3, portanto execute uma solicitação real e confirme o formato da resposta antes de integrá-la ao CI.

"Suporta 1M" não significa "deve ser executado em 1M"

Vale separar duas afirmações que costumam ser confundidas. O M3 suporta uma janela de 1 milhão de tokens. Se você deve preenchê-la é outra questão e, para programação, a resposta geralmente é não. Modelos de contexto longo têm uma tendência documentada de prestar atenção ao início e ao fim de um prompt e perder elementos enterrados no meio; a MiniMax afirma que o M3 foi treinado especificamente contra isso, e os primeiros relatos sugerem que a recuperação se mantém na maior parte da janela, mas "na maior parte" é uma expressão importante nessa frase, e eu verificaria a extremidade final em suas próprias tarefas sensíveis à recuperação. Some isso ao salto de preço em 512K e a orientação fica clara: use o contexto longo de forma deliberada — para raciocínio sobre o repositório inteiro quando você realmente precisar de consciência entre arquivos — e não como um depósito padrão para todos os arquivos que estiverem disponíveis.

M3 vs. DeepSeek V4 Pro para programação

Se você está escolhendo entre os dois modelos chineses de pesos abertos, de classe de fronteira, para programação, o critério é claro. O M3 oferece multimodalidade nativa e uma janela de 1M — pode receber uma captura de tela de uma interface com problemas junto com o código. DeepSeek V4 Pro aceita apenas texto, tem preço menor e é forte nos conjuntos verificados de engenharia de software. Minha forma resumida de decidir: escolha o M3 quando a entrada multimodal ou o contexto muito longo fizerem diferença, e o DeepSeek quando quiser o programador de texto puro capaz mais barato e não precisar de visão. Os números de uma comparação direta merecem um tratamento próprio, então mantive aqui apenas o critério de decisão e coloquei a comparação detalhada em MiniMax M3 vs. DeepSeek V4 Pro.

Quem deve usar o M3 para programação — e quem não deve

Use-o se seu trabalho for agêntico e envolver vários arquivos: patches em um código-base, tarefas conduzidas pelo terminal, sessões longas de depuração em que o histórico importa ou fluxos nos quais enviar uma captura de tela da interface de volta ao modelo seja realmente útil. Esse é o perfil para o qual o M3 foi treinado, e isso fica evidente.

Evite-o, ou pelo menos faça testes rigorosos antes, em três casos. Se você precisa do programador de texto puro absolutamente mais barato e nunca trabalha com imagens ou contextos enormes, um modelo de texto mais enxuto custará menos por token. Se o seu problema exigir raciocínio abstrato genuinamente novo, em vez de execução competente — o avaliador independente que elogiou a programação aplicada do M3 também observou que ele fica atrás nos benchmarks de raciocínio abstrato — esse não é o ponto forte do M3. E se seu plano for hospedar os pesos por conta própria para uso comercial, leia a licença antes de se comprometer: o M3 é distribuído sob a MiniMax Community License, mais restritiva que os termos MIT ou Apache usados por alguns concorrentes, e o status de pesos abertos tem mudado desde o lançamento. Para uso da API por meio de da página do modelo, nenhuma dessas restrições de licenciamento se aplica — você está alugando acesso, não redistribuindo pesos.

Creative Studio

Gere imagem, vídeo e mais com APIs de produção.

Começar a criar
Creative Studio
Modelos relacionados
Todos os modelos
MiniMax
20% OFF
DeepSeek
15% OFF
OpenAI
20% OFF
Claude
10% OFF

FAQ

O MiniMax M3 é bom para programação?

Para programação agêntica, com vários arquivos e contexto longo, sim — ele está no topo de sua classe de pesos abertos no índice independente da Artificial Analysis e próximo da fronteira fechada em tarefas aplicadas de engenharia de software. É menos adequado para problemas de raciocínio abstrato e para cargas de trabalho de texto puro que buscam o menor custo possível.

Quanto custa o M3 via API?

Por meio do GPTProto, US$ 0,48 por milhão de tokens de entrada e US$ 0,96 por milhão de tokens de saída no nível padrão. Fique atento ao limite de 512K — solicitações acima dele são cobradas em dobro em toda a chamada. Consulte as taxas atuais na página do modelo.

Existe uma forma gratuita de testar o M3?

A MiniMax ofereceu créditos de teste diretamente; a disponibilidade e qualquer acesso promocional mudam com frequência, portanto consulte os termos atuais do provedor que você pretende usar em vez de confiar em um número de uma publicação de blog.

O MiniMax M3 tem pesos abertos?

A MiniMax anunciou pesos abertos no lançamento e os disponibilizou sob a MiniMax Community License, mas os rastreadores de terceiros não listaram uniformemente os pesos como públicos, e a situação mudou desde junho. Se hospedar o modelo por conta própria é seu plano, verifique diretamente a disponibilidade atual dos pesos e os termos da licença antes de desenvolver com base neles.

M3 ou DeepSeek V4 Pro para programação?

M3 para entrada multimodal e contexto muito longo; DeepSeek para a programação de texto puro capaz mais barata. Análise completa: MiniMax M3 vs. DeepSeek V4 Pro.

Artigos relacionados

Mais blogs
MiniMax M3 vs DeepSeek V4 Pro: Preço, benchmarks e qual usar de verdade

MiniMax M3 vs DeepSeek V4 Pro: Preço, benchmarks e qual usar de verdade

TL;DR — Estes são os dois modelos chineses de pesos abertos que todos estão comparando agora, e a resposta honesta é que eles mal competem. O DeepSeek V4 Pro é um especialista algorítmico puramente textual: alcança a maior pontuação no SWE-bench Verified entre todos os modelos de pesos abertos (80,6%) e sua economia nativa de tokens é difícil de superar, especialmente em acertos de cache. O MiniMax M3 é um generalista nativamente multimodal: lê imagens e vídeos, não apenas texto, e ocupa o segundo lugar no índice de inteligência entre modelos da Artificial Analysis. Se sua carga de trabalho envolve texto, código e logs, e você se importa com o custo por token, escolha o DeepSeek V4 Pro. Se seu agente precisa analisar uma captura de tela, um mockup de design ou uma gravação de tela, escolha o M3 — o DeepSeek não consegue fazer isso a nenhum preço. Ambos agora disponibilizam pesos abertos e ambos executam com uma janela de contexto de 1 milhão de tokens, então esta não é a disputa de “um precisa perder” que a maioria das páginas de comparação apresenta.

Tiffany Layne | 2026-07-01

O que é o GLM 5.2? Codificação com pesos abertos por 1/6 do preço

O que é o GLM 5.2? Codificação com pesos abertos por 1/6 do preço

Um laboratório chinês lançou um modelo que você pode baixar gratuitamente, executar no seu próprio hardware e usar por aproximadamente um sexto do que os modelos de fronteira fechados cobram — e que fica alguns pontos atrás do Claude Opus 4.8 em benchmarks reais de codificação. Depois, lançou o modelo sem publicar um único benchmark oficial próprio. Esse é o GLM 5.2, e a distância entre "nenhum número de marketing" e "perto do topo de todas as tabelas de classificação independentes em uma semana" é justamente o que torna esse modelo tão interessante de entender. Escrevo muitos desses artigos explicativos, e a maioria das publicações sobre novos modelos é esquecível porque apenas repete uma ficha técnica. Este é diferente em um aspecto que realmente importa para desenvolvedores: os pesos são abertos sob uma licença MIT, então a pergunta habitual — "o benchmark é real ou é marketing?" — tem uma resposta particularmente clara. As pessoas baixaram o modelo e o testaram por conta própria. Veja o que é o GLM 5.2, como ele funciona e quais são seus limites.

Michael Johnson | 2026-07-15

Claude Fable 5: O Guia Completo e Análise Honesta (2026)

Claude Fable 5: O Guia Completo e Análise Honesta (2026)

A Anthropic passou meses alertando que seus modelos mais capazes estavam ficando perigosos demais para serem lançados amplamente. Então, em 9 de junho de 2026, lançou um mesmo assim — mais ou menos. Claude Fable 5 é o primeiro modelo do nível superior “Mythos” da Anthropic que o público pode realmente acessar, e está um nível completo acima da família Opus. A ressalva é incomum: em uma parcela de perguntas sensíveis, a versão pela qual você está pagando encaminhará silenciosamente sua solicitação para um modelo diferente e mais fraco, que responderá a partir daí. Essa única decisão de design revela grande parte do que torna o Fable 5 diferente, por isso é por onde este guia começa. Este é um guia prático para desenvolvedores, não um resumo do dia do lançamento. Reunimos as especificações e o comportamento a partir da própria documentação da Anthropic, de benchmarks independentes e dos primeiros testes práticos publicados desde o lançamento — e deixamos de fora os números que não pudemos verificar.

Schuyler Stacy | 2026-06-11

Claude Sonnet 5: O Que Há de Novo, Quanto Custa e Como se Compara ao Sonnet 4.6 (Guia de 2026)

Claude Sonnet 5: O Que Há de Novo, Quanto Custa e Como se Compara ao Sonnet 4.6 (Guia de 2026)

A Anthropic lançou o Claude Sonnet 5 em 30 de junho de 2026 e, em menos de uma hora, meus feeds estavam cheios das mesmas duas perguntas: devo deixar o Sonnet 4.6 e a afirmação de que ele tem o "mesmo preço de lista do 4.6" é realmente verdadeira quando você coloca tráfego real para rodar? Essas também são as perguntas que me interessam, então este guia foi construído em torno delas, e não do resumo dos destaques da publicação de lançamento. Tudo o que é técnico aqui vem da própria publicação de lançamento e da documentação da Anthropic; quando um número vem de reportagens, e não de uma página que eu pude consultar diretamente, eu aviso. Uma observação inicial, porque muitos textos publicados no começo entendem isso errado: o antecessor do Sonnet 5 é o Sonnet 4.6 (lançado em fevereiro de 2026), não o Sonnet 4.5. Se você estiver comparando com o 4.5 ou com um 3.5 ainda mais antigo, estará comparando duas atualizações, e os números abaixo não vão coincidir. Voltarei a esse ponto.

Schuyler Stacy | 2026-07-01