O MiniMax M3 é bom para programação? A resposta curta: sim, para trabalho agêntico e com vários arquivos, com duas ressalvas que vou apresentar antes que você leia mais uma palavra. A maioria das pontuações de programação mais divulgadas foi obtida pela MiniMax em sua própria infraestrutura, e o "contexto de 1 milhão de tokens" tem um salto de preço em 512K que afeta especialmente os agentes de programação. Ambos os pontos são administráveis quando você sabe que existem. Nenhum deles aparece claramente na maioria da cobertura do lançamento.
Estou escrevendo isto porque a proposta de programação em torno do M3 foi reduzida a um único número — 59% no SWE-Bench Pro — e esse número está sendo usado sem muita análise. A seguir, explico o que o modelo realmente é, onde chegam as medições independentes, quanto ele custa em uma carga de trabalho de programação real e como chamá-lo pela API do GPTProto. Se você quer apenas uma conclusão: um avaliador independente que executa a mesma bateria em todos os modelos relevantes colocou o M3 "próximo do GPT e do Opus em programação real, mas ainda não acima deles". Isso também corresponde à posição dos benchmarks neutros.
O que MiniMax M3 é, sob a perspectiva da programação
O M3 foi lançado em 1º de junho de 2026. É um modelo Mixture-of-Experts — rastreadores da comunidade que analisaram o checkpoint divulgado estimam cerca de 428 bilhões de parâmetros no total, com aproximadamente 23 bilhões ativos por token, embora a MiniMax não tenha publicado uma decomposição completa dos parâmetros, portanto trate esses números exatos como secundários. Ele é nativamente multimodal (recebe texto, imagem e vídeo; gera texto) e é um modelo de raciocínio com um modo de pensamento que pode ser alternado por solicitação.
Antes do mecanismo, a motivação: por que um modelo de programação se importa com o tamanho do contexto? Porque o trabalho de engenharia real não envolve um único arquivo. Envolve um repositório, um stack trace, a saída dos testes e os três arquivos que você precisaria alterar para corrigir o problema — tudo mantido em um só lugar por tempo suficiente para raciocinar entre eles. A resposta do M3 é uma janela de contexto de 1 milhão de tokens, com um limite utilizável garantido de 512 mil tokens. O mecanismo subjacente é o MiniMax Sparse Attention (MSA), que seleciona blocos do cache de chave-valor em vez de prestar atenção a todos os pares de tokens. A MiniMax relata que, com 1 milhão de tokens, isso reduz o processamento por token para aproximadamente um vigésimo do da geração anterior, com prefill cerca de 9 vezes mais rápido e decodificação 15 vezes mais rápida. Esses são números do fornecedor sobre a arquitetura, não medições independentes, mas a direção é consistente com o que a atenção esparsa deveria proporcionar.
Também existe uma interface de programação própria — o MiniMax Code, seu próprio agente desenvolvido sobre o modelo. É útil saber que ele existe; mas não é disso que este artigo trata, já que você está aqui para chamar o modelo a partir do seu próprio código.
Uma frase para guardar: o M3 foi desenvolvido para trabalho contínuo e em várias etapas, percorrendo um contexto amplo, não para snippets de uma única rodada. Essa perspectiva explica quase todos os compromissos apresentados abaixo.
Os benchmarks de programação: o que a MiniMax relata versus o que é medido de forma independente
Esta é a divisão que a maioria dos textos deixa de lado. À esquerda, as pontuações de programação e tarefas agênticas relatadas pela própria MiniMax. À direita, o que foi medido por uma terceira parte neutra.
| Fonte |
Métrica |
Pontuação |
| MiniMax (executado pelo fornecedor, em sua própria infraestrutura, com estrutura do Claude Code) |
SWE-Bench Pro |
59.0% |
| MiniMax |
SWE-Bench Verified |
80.5% |
| MiniMax |
Terminal-Bench 2.1 |
66.0% |
| MiniMax |
SWE-fficiency |
34.8% |
| MiniMax |
KernelBench Hard |
28.8% |
| MiniMax |
MCP Atlas (orquestração de ferramentas) |
74.2% |
| Artificial Analysis (independente) |
Intelligence Index (composto) |
55 — nº 1 em sua classe de modelos com pesos abertos |
Há duas coisas que a tabela do fornecedor não informa. Primeiro, o fato de esses resultados serem executados pelo fornecedor importa mais do que o normal neste caso: o número do SWE-Bench Pro foi produzido na configuração própria da MiniMax, usando o Claude Code como ferramenta de execução, e a replicação independente ainda está se atualizando. Considere os 59% um forte sinal do nível em que o M3 compete, não um resultado definitivo. Segundo — e este é o detalhe que não vi em nenhum artigo focado em programação — quando a Artificial Analysis comparou o M3 com seu antecessor, a maioria das avaliações melhorou (Humanity's Last Exam 28→37, GPQA Diamond 87→93, raciocínio em contexto longo 69→74), mas o SciCode, a avaliação de programação desse conjunto, caiu ligeiramente de 47 para 45. É uma pequena regressão, e eu não tiraria conclusões exageradas dela. Mas é o único dado que complica a narrativa simples de que ele é "muito melhor em programação", e é revelador que isso não tenha sido mencionado em lugar algum.
Minha leitura: o M3 está genuinamente próximo da fronteira em engenharia de software aplicada — escrever patches, editar vários arquivos e trabalhar no terminal — e o respaldo do índice independente (55, o topo de sua classe) é real, não marketing. Ele não representa uma mudança radical em relação à geração anterior em todos os aspectos da programação, e a diferença em raciocínio abstrato é real (mais sobre isso abaixo). Conclusão: confie no nível geral, mas verifique o número exato com suas próprias tarefas.
Quanto ele realmente custa em uma carga de trabalho de programação
Primeiro, o preço de tabela, porque a comparação honesta não é a que você verá na maioria dos textos. Pela página do modelo GPT Proto, o M3 custa US$ 0,48 por milhão de tokens de entrada e US$ 0,96 por milhão de tokens de saída no nível padrão.
Para referência, a taxa efetiva da própria MiniMax — após o desconto permanente de 50% aplicado ao preço de tabela — é de cerca de US$ 0,30 para entrada e US$ 1,20 para saída. Portanto, seja preciso na comparação em vez de simplesmente dizer que é "mais barato": encaminhado pelo GPT Proto, o custo de entrada é maior do que chamando a MiniMax diretamente, enquanto o de saída é menor. Qual opção vence depende inteiramente da proporção entre leitura e escrita da sua carga de trabalho. Um agente de programação que ingere um repositório grande e produz um diff pequeno é dominado pela entrada, portanto a taxa de entrada prevalece; uma tarefa pesada em geração pende para o outro lado. O motivo para encaminhar o M3 por um agregador não é um desconto chamativo — é operacional: uma única chave e uma interface compatível com OpenAI para o M3 junto com o restante do catálogo, em vez de configurar uma conta MiniMax separada, um endpoint regional e uma chave de assinatura.
Agora vem a parte que realmente determina as contas de programação e o motivo pelo qual o "contexto de 1M" merece um asterisco. O preço é fixo apenas até 512 mil tokens de entrada. Passe desse limite e toda a solicitação — entrada, saída e leituras do cache — será cobrada em dobro. É uma função em degrau, não uma progressão gradual. Imagine um ciclo normal de agente: você começa com 400 mil tokens de entrada e 100 mil de saída, confortavelmente abaixo do limite. Mas os ciclos do agente acumulam conteúdo. Na décima ou décima quinta rodada, nada foi removido, e uma rodada ultrapassa silenciosamente 512 mil — nesse ponto, toda a rodada paga o dobro, por tudo, não apenas pelos tokens acima do limite. Um aumento de 20% na entrada pode mais que dobrar o custo de uma chamada.
A alavanca que atua no sentido contrário é o cache: entradas repetidas (seu prompt de sistema, as partes estáveis do código-base) são lidas por uma fração da taxa padrão. Em ciclos de agentes, uma grande parte da entrada pode ser armazenada em cache, então vale a pena configurar isso desde cedo. Conclusão: no M3, sua conta de programação é determinada pela quantidade de contexto que você mantém e pela eficiência do cache, não pelo número por token no cartão de preços. Faça o orçamento da carga de trabalho, não do preço de tabela.
Como chamar o M3 pela API do GPT Proto
O endpoint é a interface de chat compatível com OpenAI. A autenticação usa uma chave de API bruta no cabeçalho Authorization — sem o prefixo Bearer, o que costuma causar confusão para quem vem de outros provedores. Troque a string do modelo para MiniMax-M3 e pronto.
import requests, json, glob
# Carrega alguns arquivos de origem em um único prompt de contexto longo.
# O limite do M3 é de 512 mil tokens, então uma dúzia de arquivos cabe sem atingir o salto de preço.
files = glob.glob("src/**/*.py", recursive=True)[:20]
codebase = "\n\n".join(f"# ---- {p} ----\n{open(p).read()}" for p in files)
prompt = (
"Aqui está parte de um serviço Python. Encontre todos os lugares onde uma conexão de banco de dados pode vazar em um caminho de exceção e retorne a correção como um diff unificado.\n\n"
+ codebase
)
resp = requests.post(
"https://gptproto.com/v1/chat/completions",
headers={
"Authorization": "sk-your-gptproto-key", # chave bruta, SEM o prefixo "Bearer"
"Content-Type": "application/json",
},
data=json.dumps({
"model": "MiniMax-M3",
"messages": [{"role": "user", "content": prompt}],
"temperature": 0.2, # o padrão é 0.95 — reduza-o para edições de código determinísticas
"stream": False,
}),
timeout=120,
)
print(resp.json()["choices"][0]["message"]["content"])
Duas observações práticas. A temperature padrão nesta interface é 0,95, o que é alto para código — eu a reduziria para 0,2 ou menos quando você quiser diffs reproduzíveis em vez de variações criativas. E uma informação importante: este endpoint e o padrão de autenticação com chave bruta foram confirmados na documentação ativa do GPT Proto sobre o modelo MiniMax, com a string do modelo alterada para MiniMax-M3; eu não testei esta chamada exata contra o M3, portanto execute uma solicitação real e confirme o formato da resposta antes de integrá-la ao CI.
"Suporta 1M" não significa "deve ser executado em 1M"
Vale separar duas afirmações que costumam ser confundidas. O M3 suporta uma janela de 1 milhão de tokens. Se você deve preenchê-la é outra questão e, para programação, a resposta geralmente é não. Modelos de contexto longo têm uma tendência documentada de prestar atenção ao início e ao fim de um prompt e perder elementos enterrados no meio; a MiniMax afirma que o M3 foi treinado especificamente contra isso, e os primeiros relatos sugerem que a recuperação se mantém na maior parte da janela, mas "na maior parte" é uma expressão importante nessa frase, e eu verificaria a extremidade final em suas próprias tarefas sensíveis à recuperação. Some isso ao salto de preço em 512K e a orientação fica clara: use o contexto longo de forma deliberada — para raciocínio sobre o repositório inteiro quando você realmente precisar de consciência entre arquivos — e não como um depósito padrão para todos os arquivos que estiverem disponíveis.
M3 vs. DeepSeek V4 Pro para programação
Se você está escolhendo entre os dois modelos chineses de pesos abertos, de classe de fronteira, para programação, o critério é claro. O M3 oferece multimodalidade nativa e uma janela de 1M — pode receber uma captura de tela de uma interface com problemas junto com o código. DeepSeek V4 Pro aceita apenas texto, tem preço menor e é forte nos conjuntos verificados de engenharia de software. Minha forma resumida de decidir: escolha o M3 quando a entrada multimodal ou o contexto muito longo fizerem diferença, e o DeepSeek quando quiser o programador de texto puro capaz mais barato e não precisar de visão. Os números de uma comparação direta merecem um tratamento próprio, então mantive aqui apenas o critério de decisão e coloquei a comparação detalhada em MiniMax M3 vs. DeepSeek V4 Pro.
Quem deve usar o M3 para programação — e quem não deve
Use-o se seu trabalho for agêntico e envolver vários arquivos: patches em um código-base, tarefas conduzidas pelo terminal, sessões longas de depuração em que o histórico importa ou fluxos nos quais enviar uma captura de tela da interface de volta ao modelo seja realmente útil. Esse é o perfil para o qual o M3 foi treinado, e isso fica evidente.
Evite-o, ou pelo menos faça testes rigorosos antes, em três casos. Se você precisa do programador de texto puro absolutamente mais barato e nunca trabalha com imagens ou contextos enormes, um modelo de texto mais enxuto custará menos por token. Se o seu problema exigir raciocínio abstrato genuinamente novo, em vez de execução competente — o avaliador independente que elogiou a programação aplicada do M3 também observou que ele fica atrás nos benchmarks de raciocínio abstrato — esse não é o ponto forte do M3. E se seu plano for hospedar os pesos por conta própria para uso comercial, leia a licença antes de se comprometer: o M3 é distribuído sob a MiniMax Community License, mais restritiva que os termos MIT ou Apache usados por alguns concorrentes, e o status de pesos abertos tem mudado desde o lançamento. Para uso da API por meio de da página do modelo, nenhuma dessas restrições de licenciamento se aplica — você está alugando acesso, não redistribuindo pesos.