O número que todos estão repetindo é 2,7 trilhões. O número que realmente decidirá se o MiniMax M3 Pro será importante para sua equipe não é esse — é uma cláusula em um arquivo LICENSE que ninguém leu ainda, porque ninguém o publicou.
Na semana passada, procurei uma análise técnica do M3 Pro e encontrei cerca de vinte artigos. Todos eram republicações da mesma notícia exclusiva. Nenhum respondeu à única pergunta que um desenvolvedor atuante tem: então, o que faço na segunda-feira? Este artigo é minha tentativa de responder.
Uma observação antes de começarmos, porque aqui ela importa mais do que o normal. Vou marcar três tipos diferentes de afirmação ao longo do texto: o que foi relatado (fontes escassas, trate com cautela), o que eu acho (minha interpretação, sinta-se à vontade para discordar) e o que é especulação (direi isso claramente). Quase tudo o que foi publicado sobre o M3 Pro até agora mistura os três em uma única voz confiante. É assim que um rumor se transforma em um roteiro.
O que é o MiniMax M3 Pro? (O que está realmente confirmado)
O MiniMax M3 Pro é um modelo de linguagem grande que ainda não existe — pelo menos não publicamente.
Esta é a versão divulgada. A MiniMax, laboratório de Xangai responsável pela série M, está trabalhando em um modelo com aproximadamente 2,7 trilhões de parâmetros. Funcionários envolvidos no projeto referem-se internamente a ele como M3 Pro, embora o nome final possa mudar antes do lançamento. A empresa planeja lançá-lo como código aberto, possivelmente já no terceiro trimestre de 2026. Se for lançado conforme descrito, será o maior modelo aberto já publicado por um laboratório chinês.
Agora, as fontes — a parte que as republicações costumam ignorar. Tudo o que foi mencionado acima remonta a uma única reportagem exclusiva do The Information, datada de 8 de julho de 2026 e atribuída a duas pessoas com conhecimento do plano. Todas as matérias posteriores — e são muitas — derivam dessa única reportagem. A própria MiniMax não disse nada. Verifiquei o site da empresa, seu blog de pesquisa, sua documentação de API e sua organização no Hugging Face no dia em que escrevi. Não há nenhuma menção ao M3 Pro em nenhum deles.
| |
Status |
| 2,7T de parâmetros totais |
Relatado (fonte única) |
| Chamado de "M3 Pro" |
Relatado — codinome interno, pode mudar |
| Lançamento de código aberto |
Relatado como o plano |
| Cronograma do terceiro trimestre de 2026 |
Relatado como "já no" terceiro trimestre — não é um compromisso |
| Quantidade de parâmetros ativos |
Desconhecida |
| Termos da licença |
Desconhecidos |
| Janela de contexto |
Desconhecida |
| Resultados de benchmarks |
Nenhum existe |
| Disponível em alguma API |
Não |
Essa tabela representa o estado honesto do conhecimento. Tudo o mais que você ler agora sobre o M3 Pro, incluindo tudo abaixo desta linha, é uma inferência construída a partir dela.
MiniMax M3 Pro vs. MiniMax M3: o que o salto de 6× realmente proporciona
Para entender por que um modelo de 2,7T é interessante, é preciso saber o que a MiniMax já lançou.
O MiniMax M3 foi lançado em 1º de junho de 2026. É um modelo Mixture-of-Experts com aproximadamente 428 bilhões de parâmetros totais e cerca de 23 bilhões ativados por token. Sua principal inovação de engenharia é a MSA — MiniMax Sparse Attention — que seleciona os blocos de chave-valor relevantes em vez de aplicar atenção a todos os tokens da janela. Essa é a razão pela qual seu contexto de um milhão de tokens é um recurso funcional, e não apenas um troféu na ficha técnica: com contexto de 1M, a MSA reduz o processamento por token para aproximadamente um vigésimo do da geração anterior, com o prefill cerca de 9× mais rápido e o decode cerca de 15× mais rápido. O relatório técnico está no arXiv (2606.13392) e os pesos estão no Hugging Face.
Portanto, com os 2,7T divulgados, o M3 Pro seria cerca de 6,3× maior que o M3 em parâmetros totais. Isso parece decisivo. Não é, e eis o motivo.
| |
MiniMax M3 (lançado) |
M3 Pro (divulgado) |
| Parâmetros totais |
~428B |
~2,7T |
| Parâmetros ativos por token |
~23B |
Desconhecidos |
| Arquitetura |
MoE + atenção esparsa MSA |
Desconhecida |
| Janela de contexto |
1M (mínimo garantido de 512K) |
Desconhecida |
| Lançamento |
1º de junho de 2026 |
Previsto para o terceiro trimestre de 2026 |
| Pesos |
Publicados |
Planejados |
Em um modelo Mixture-of-Experts, a quantidade total de parâmetros informa quanta memória você precisa possuir. A quantidade de parâmetros ativos informa quanto você paga por token. O M3 ativa 23B de 428B — cerca de 5%. Se o M3 Pro mantiver uma proporção semelhante, serão aproximadamente 135B ativos, o que representaria uma classe de custo realmente diferente. Se ativar muito menos, poderá ser barato de servir e caro de armazenar. Se ativar muito mais, ocorrerá o contrário.
Ninguém divulgou esse número. Isso significa que a informação mais importante para qualquer pessoa que esteja planejando o orçamento em torno desse modelo é justamente a única que não vazou.
Em termos simples: os parâmetros totais informam quanto hardware você precisaria comprar. Os parâmetros ativos informam como será a conta. Apenas o primeiro número foi divulgado, e ele é o menos útil dos dois.
A palavra "código aberto" está fazendo muito trabalho aqui
É aqui que quero diminuir o ritmo, porque acho que essa é a parte que a cobertura jornalística errou de forma significativa.
Toda manchete diz "código aberto". Essa expressão traz uma implicação — que você pode baixar o modelo, criar um produto com ele e lançá-lo. Nos lançamentos recentes da MiniMax, essa implicação não foi verdadeira.
Veja o que realmente aconteceu com o M3. Seus pesos estão no Hugging Face sob uma licença identificada como minimax-community. Não Apache 2.0. Não MIT. Uma licença personalizada com condições. Até que ponto essas condições são vinculantes na prática? Considere que a NVIDIA publicou sua própria versão do M3 quantizada em NVFP4, e o model card dessa versão afirma claramente que o checkpoint está pronto para uso não comercial, com os termos aplicáveis remetendo à MiniMax Community License e exigindo a exibição de "Built with MiniMax M3."
Essa é a NVIDIA — uma empresa com um grande departamento jurídico — lendo a licença e escolhendo esse texto.
E a licença do M3 era a versão melhorada. O lançamento anterior, o M2.7, foi distribuído sob termos que proibiam qualquer uso comercial sem autorização prévia por escrito da MiniMax. As discussões no Hugging Face sobre esse lançamento valem a leitura se você gosta de acompanhar uma comunidade e uma equipe jurídica negociando publicamente. A MiniMax flexibilizou os termos para o M3 em resposta. Não os tornou permissivos.
Não vou citar limites específicos de receita da licença do M3, porque as fontes secundárias que encontrei se contradizem, e esse é o tipo de detalhe em que estar aproximadamente certo é pior do que ficar em silêncio. Leia você mesmo o arquivo LICENSE antes de criar qualquer coisa comercial com base nele. Isso não é uma ressalva; é o conselho de fato.
Eis meu julgamento, identificado como tal. Se o M3 Pro for lançado sob a mesma família de licenças, "maior modelo de código aberto já lançado" será uma manchete para pesquisadores e uma nota de rodapé para qualquer pessoa que esteja lançando um produto. O fato de os pesos poderem ser baixados garante auditabilidade e o direito de hospedar o modelo por conta própria. Não garante automaticamente o direito de construir um negócio sobre ele. São coisas diferentes, e a distância entre elas é onde muitas equipes terão problemas nos próximos seis meses.
Mesmo que seja lançado, provavelmente você não conseguirá executá-lo
Suponha que a licença seja adequada. Suponha que seja Apache 2.0 e todos comemorem. Ainda há uma barreira.
O M3 — o modelo de 428B — não é algo que você execute em uma estação de trabalho. Implantações documentadas em precisão total rodam em sistemas da classe B200 da NVIDIA com oito GPUs. Esse é o modelo atual, aquele que as pessoas já chamam de "o grande".
O M3 Pro seria mais de seis vezes maior.
Baixável e executável são palavras diferentes. Acho que, para a esmagadora maioria das equipes — inclusive as bem financiadas —, os pesos abertos do M3 Pro serão algo sobre o qual você lerá, e não algo que hospedará. A quantização ajudará. Ela não fechará uma diferença de 6× para ninguém que não tenha um data center.
Isso leva a uma conclusão um pouco incômoda, mas que considero correta: para a maioria dos desenvolvedores, o fato de o M3 Pro ser de código aberto ou fechado muda muito pouco a decisão. De qualquer forma, você chegará até ele por uma API. Os pesos abertos são extremamente importantes para pesquisadores, para a estratégia nacional de IA e para os laboratórios que fazem benchmarks com ele. Para a pessoa que lançará um agente de programação no próximo trimestre, é uma manchete, não um plano.
Se você vai chamar modelos por HTTP de qualquer maneira, a pergunta útil passa a ser quais modelos você consegue acessar com uma única chave e um único saldo — que é a essência do problema do catálogo completo de modelos, não do problema dos pesos abertos.
O cronograma do terceiro trimestre tem um risco que ninguém está considerando
Agora vem a parte que não vi ninguém relacionar, e quero ter cuidado com a intensidade da afirmação.
Em 7 de julho de 2026, a Reuters informou que o Ministério do Comércio da China vinha se reunindo com os principais participantes domésticos de IA — Alibaba, ByteDance e Z.ai, entre eles — para discutir a restrição do acesso estrangeiro aos modelos de IA mais avançados do país. Segundo a reportagem, as discussões abrangiam modelos fechados e de código aberto, um regime de licenciamento em níveis e penalidades criminais mais severas relacionadas à destilação de modelos.
O The Information publicou a matéria sobre o M3 Pro em 8 de julho de 2026. No dia seguinte.
Isso é especulação, e vou identificá-la como tal: eu trataria "terceiro trimestre, código aberto" como um plano elaborado antes de uma mudança no cenário, e não como um compromisso sobre o qual seja possível construir um roteiro. Um modelo aberto de fronteira com 2,7 trilhões de parâmetros é precisamente a categoria de artefato à qual essas discussões ministeriais parecem se referir. Não tenho informações de que alguém tenha dito à MiniMax para desacelerar. Estou apenas observando que as duas notícias foram publicadas com menos de vinte e quatro horas de diferença e que nenhum dos vinte artigos que li mencionou ambas.
Para fazer justiça a essa observação: nada disso significa que os modelos chineses sejam uma aposta ruim. O M3 está ativo agora, foi avaliado por terceiros independentes e está atendendo tráfego de produção. O ponto mais específico é que apostar sua arquitetura em um modelo não lançado acrescenta um risco de política ao risco normal de cronograma. Isso vale para qualquer laboratório. Aqui, porém, é mais evidente.
O que você pode realmente criar hoje: MiniMax M3 via API
Portanto: esperar pelo M3 Pro é um plano ruim. Em parte por tudo o que foi dito acima e em parte porque o M3 já é muito bom.
No Intelligence Index (v4.1) da Artificial Analysis — um índice composto independente que abrange GDPval-AA, Terminal-Bench, SciCode, Humanity's Last Exam, GPQA Diamond e outros — a variante de raciocínio do M3 alcança 55 pontos. Isso a coloca no topo do campo de pesos abertos, no mesmo nível do GPT-5.5 e atrás do Claude Opus 4.8. Suas pontuações em componentes incluem 37% no Humanity's Last Exam e 93% no GPQA Diamond. Observe a distinção entre variantes: a Artificial Analysis lista um valor menor para a configuração sem raciocínio, portanto verifique qual delas uma comparação está citando antes de mencioná-la.
Os próprios números da MiniMax — 59,0% no SWE-Bench Pro, 66,0% no Terminal-Bench 2.1 e 83,5 no BrowseComp — são informados pelo fornecedor e executados na infraestrutura do próprio laboratório. Trate-os como úteis para indicar uma direção, mas não verificados de forma independente.
Para chamar o M3 no GPT Proto, o endpoint segue o formato de chat da OpenAI. Um detalhe que custará vinte minutos se você não perceber: a chave da API vai diretamente no cabeçalho Authorization sem o prefixo Bearer. A maioria dos SDKs adiciona esse prefixo automaticamente.
Primeira chamada, cURL:
curl --location 'https://gptproto.com/v1/chat/completions' \
--header 'Authorization: YOUR_GPTPROTO_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"model": "MiniMax-M3",
"messages": [
{"role": "user", "content": "Summarize what MSA changes about attention at 1M context, in three sentences."}
],
"stream": false
}'
Python, usando requests para que o cabeçalho de autenticação seja inequívoco:
import os
import requests
API_KEY = os.environ["GPTPROTO_API_KEY"]
response = requests.post(
"https://gptproto.com/v1/chat/completions",
headers={
"Authorization": API_KEY, # no "Bearer " prefix
"Content-Type": "application/json",
},
json={
"model": "MiniMax-M3",
"messages": [
{"role": "user", "content": "Refactor this function for readability:\n\n" + open("main.py").read()}
],
"stream": False,
},
timeout=600, # long-context prefill is slow; don't use the default
)
response.raise_for_status()
print(response.json()["choices"][0]["message"]["content"])
Se preferir o SDK da OpenAI, aponte base_url para https://gptproto.com/v1 e substitua o cabeçalho em vez de passar a chave por api_key, ou o cliente adicionará Bearer automaticamente.
Quanto ao custo, a página do modelo MiniMax M3 lista US$ 0,48 por 1 milhão de tokens de entrada e US$ 0,96 por 1 milhão de tokens de saída. Esses são os números; deliberadamente não os transformarei em uma porcentagem de economia, porque a comparação honesta depende da proporção entre entrada e saída, e há configurações em que a aritmética pode favorecer qualquer um dos lados.
O detalhe de custo que realmente surpreenderá você não é a tarifa por token. É o limite de contexto. A janela do M3 é de 1 milhão de tokens, mas o mínimo garantido é de 512K — e, na precificação própria da MiniMax, ultrapassar 512K de entrada faz com que toda a solicitação seja cobrada pelo dobro da tarifa padrão. Não apenas o excedente. Toda a chamada. Uma solicitação de 600K tokens não custa um pouco mais do que uma de 500K; ela custa aproximadamente o dobro por token em toda a extensão.
Isso é mais importante em ciclos de agentes, nos quais o contexto se acumula a cada turno e nada é removido. No décimo quinto turno, você pode estar pagando a tarifa de contexto longo não porque uma única etapa precisou de um milhão de tokens, mas porque nunca reduziu o contexto. Reduza seu contexto. Isso tem mais impacto na sua conta do que o modelo escolhido. (Se você está avaliando especificamente o M3 para cargas de trabalho de programação, aprofundamos a matemática de benchmarks e preços em um artigo separado.)
Se o M3 Pro for lançado, o que muda para você?
Menos do que você imagina, se configurar tudo corretamente agora.
Na camada de agregação, trocar de modelo é uma mudança de string:
MODEL = os.environ.get("LLM_MODEL", "MiniMax-M3") # not hardcoded
Essa é toda a migração, presumindo que o formato da solicitação continue compatível com o da OpenAI — o que ocorreu em todos os lançamentos da série M até agora.
Portanto, este é o custo do conselho, declarado honestamente: não reestruture nada para um modelo que não tem especificações anunciadas, licença, benchmarks nem data de lançamento confirmada. A preparação adequada para o M3 Pro é uma linha — retirar o ID do modelo do código e colocá-lo na configuração. Qualquer coisa além disso é planejar em torno de um rumor.
Em uma frase: o M3 Pro é um plano divulgado que vale a pena acompanhar e uma péssima razão para esperar; o M3 é um modelo lançado, no topo do ranking de pesos abertos, que você pode chamar hoje.