Preços+7% bônus
Michael Johnson2026-07-29

GLM 5.2 vs MiniMax M3: qual é melhor para programação e trabalho de frontend?

GLM 5.2 vs MiniMax M3: o GLM é mais rápido; o M3 custa US$ 3 a menos por milhão de tokens de saída. Compare programação, trabalho de frontend, velocidade, preços e licenciamento.

GLM 5.2 vs MiniMax M3: qual é melhor para programação e trabalho de frontend?

Dois números resolvem a maior parte da decisão entre GLM 5.2 e MiniMax M3. O GLM-5.2 pontua 51, contra 44 do MiniMax M3, no índice independente Artificial Analysis Intelligence Index, e produz 189 tokens por segundo, contra 76 do M3. O MiniMax M3, por sua vez, custa US$ 0,96 por milhão de tokens de saída no GPTProto; o GLM-5.2 custa US$ 3,96.

Minha resposta curta: escolha o GLM-5.2 como padrão para trabalhar em repositórios, depuração, agentes de terminal e alterações de código difíceis. Escolha o MiniMax M3 quando o custo dos tokens for a principal restrição ou quando um fluxo de frontend precisar inspecionar capturas de tela em vez de apenas escrever JSX a partir de uma descrição textual.

Essa segunda distinção é importante. “Melhor para programação de frontend” pode significar gerar um primeiro rascunho refinado ou observar a página renderizada, identificar um erro de espaçamento e corrigi-lo em várias rodadas. O GLM-5.2 consegue fazer a primeira tarefa. Como modelo exclusivamente textual, ele não consegue realizar nativamente a segunda.

Índice

GLM 5.2 vs MiniMax M3 em resumo

  GLM-5.2 MiniMax M3
Desenvolvedor Z.ai MiniMax
Parâmetros 753B no total / 40B ativos 428B no total / 23B ativos
Janela de contexto 1M tokens 1M tokens
Entrada nativa Texto Texto, imagem e vídeo
Índice de inteligência 51 44
Velocidade de saída 189 tokens/s 76 tokens/s
Tempo até o primeiro token 1.37s 1.46s
Preço de entrada no GPT Proto US$ 1,26 / 1M tokens US$ 0,48 / 1M tokens
Preço de saída no GPT Proto US$ 3,96 / 1M tokens US$ 0,96 / 1M tokens
Licença dos pesos MIT Licença comunitária da MiniMax
Melhor uso padrão Programação complexa e coordenação Execução de baixo custo e trabalho visual

As medições de inteligência, velocidade e latência vêm da comparação atual da Artificial Analysis. O desempenho hospedado muda conforme os provedores atualizam sua infraestrutura; portanto, trate esses números como uma medição datada, não como uma propriedade permanente dos pesos.

GLM-5.2 em 60 segundos

GLM-5.2 é o modelo de código aberto e exclusivamente textual da Z.ai para tarefas de engenharia de longa duração. Sua arquitetura de mistura de especialistas com 753 bilhões de parâmetros ativa cerca de 40 bilhões de parâmetros por token. O modelo oferece um contexto de 1 milhão de tokens e permite que os usuários escolham entre os níveis de raciocínio High ou Max.

A parte interessante não é apenas o número do contexto. A Z.ai treinou o GLM-5.2 para trajetórias longas de agentes de programação e introduziu o IndexShare, que reutiliza um indexador a cada quatro camadas de atenção esparsa. De acordo com o lançamento oficial, isso reduz as FLOPs por token em 2,9 vezes no comprimento de contexto de 1M. A Z.ai também informa que alterações na decodificação especulativa aumentaram o comprimento da sequência aceita em até 20%.

Essas são medições do fornecedor, não resultados independentes. Ainda assim, elas explicam o objetivo de design do modelo: manter uma sessão de engenharia longa em andamento sem fazer com que cada token atenda a todo o histórico ao custo total.

A outra vantagem prática é a licença MIT. Uma equipe pode inspecionar, modificar, hospedar por conta própria e implantar comercialmente os pesos sem um limite de receita ou uma exigência de atribuição ao modelo. O custo dessa liberdade é a infraestrutura: 753B de parâmetros no total não são uma implantação casual em uma estação de trabalho.

MiniMax M3 em 60 segundos

MiniMax M3 é um modelo de mistura de especialistas com 428B de parâmetros, dos quais cerca de 23B estão ativos. Ele também oferece um contexto de 1M, mas seu recurso definidor é a multimodalidade nativa. O modelo foi treinado desde o início com dados mistos de texto, imagem e vídeo, em vez de depender de uma etapa separada de conversão de captura de tela em texto antes do raciocínio.

A MiniMax Sparse Attention, ou MSA, torna o processamento do contexto longo menos dispendioso. A MiniMax informa uma aceleração de prefill superior a 9 vezes e uma aceleração de decodificação de 15 vezes em relação ao M2 em um contexto de 1M, com o processamento por token reduzido a um vigésimo do da geração anterior. Essas comparações são com o M2, não com o GLM-5.2. Elas não devem ser usadas para afirmar que a API hospedada do M3 é mais rápida que a do GLM; a medição independente da API atualmente mostra o oposto.

O M3 oferece modos de raciocínio ativado, adaptativo e desativado em seu cartão oficial do modelo. Isso facilita reservar um raciocínio mais profundo para o planejamento, usando um modo de menor latência para conclusão ou execução repetitiva.

Seus pesos estão disponíveis, mas “pesos abertos” não significa “MIT”. A Licença comunitária da MiniMax adiciona condições comerciais importantes para equipes que planejam hospedar o modelo por conta própria. Falaremos mais sobre isso em breve.

Qualidade de programação: GLM vence, mas a margem depende da tarefa

O resumo independente mais claro é o Artificial Analysis Intelligence Index: o GLM-5.2 pontua 51 e o MiniMax M3 pontua 44. Esse índice combina programação, trabalho de terminal, uso de ferramentas, raciocínio em contexto longo, raciocínio científico e confiabilidade do conhecimento. Ele é mais amplo que um único benchmark de issues do GitHub.

Os fornecedores dos modelos também relatam 62,1 para o GLM-5.2 e 59,0 para o M3 no SWE-bench Pro. No Terminal-Bench 2.1, a Z.ai relata 81,0 para o GLM, enquanto a MiniMax relata 66,0 para o M3. Esses resultados apontam na mesma direção: o GLM é a escolha mais segura para engenharia com uso intenso de terminal.

Mas eles não constituem uma comparação direta de nível laboratorial. Os fornecedores usaram configurações de avaliação, limites de tempo, prompts e softwares de agentes diferentes. Uma diferença de três pontos no SWE-bench é uma evidência útil; não é uma promessa de que o GLM resolverá exatamente três issues a mais a cada cem no seu repositório.

Os resultados da comunidade fazem a diferença parecer menor. Um teste de agente de programação compartilhado no Reddit cobriu quase 1.000 cenários e relatou pontuações gerais de 91,9 para o GLM e 91,4 para o M3, com custos de US$ 0,289 e US$ 0,207 por tarefa. O autor declarou trabalhar para a organização que realizou a avaliação; por isso, considero isso uma evidência secundária útil, não a base da conclusão.

Minha leitura é direta. O GLM tem um teto mais alto e é o melhor coordenador. O M3 é mais próximo do que a diferença do benchmark amplo sugere quando o trabalho é bem especificado e focado em execução.

Velocidade: não confunda atenção esparsa com uma API mais rápida

A Artificial Analysis mediu o GLM-5.2 a 189 tokens de saída por segundo e o M3 a 76. Isso representa uma diferença de 113 tokens por segundo, ou aproximadamente 2,5 vezes a taxa de saída. O tempo até o primeiro token é praticamente igual: 1,37 segundo para o GLM e 1,46 segundo para o M3.

Para uma resposta de chat, a diferença de latência de 0,09 segundo é imperceptível. Para um patch longo, uma suíte de testes ou um plano de migração, a diferença na taxa de decodificação não é. O GLM pode concluir uma resposta longa consideravelmente mais cedo, embora o design de atenção esparsa do M3 seja mais eficiente que o de seu antecessor.

Este é um bom exemplo de por que arquitetura e serviço entregue devem ser mantidos separados. A MSA mostra como a MiniMax aprimorou o M3. Ela não informa quanta capacidade um determinado endpoint hospedado atribui a uma solicitação.

GLM 5.2 vs MiniMax M3 para programação de frontend

As comparações de frontend frequentemente condensam geração de código e julgamento visual em uma única pontuação. São tarefas diferentes.

Para uma solicitação exclusivamente textual, como “crie um dashboard de análise responsivo em React”, o GLM é o padrão mais forte. Sua vantagem em programação e seguimento de instruções deve ajudar com a estrutura dos componentes, o gerenciamento de estado, a acessibilidade e as restrições distribuídas por vários arquivos. Ele também consegue produzir uma primeira versão atraente.

Quando a página é renderizada, o M3 ganha uma capacidade que falta ao GLM: ele pode inspecionar diretamente a captura de tela. Isso torna o M3 mais adequado para converter captura de tela em código, reproduzir um layout de referência, verificar se um modal é cortado em uma largura móvel ou iterar sobre a hierarquia visual após cada build.

Uma longa discussão de desenvolvedores sobre GLM e trabalho de UI capturou bem essa troca. Alguns desenvolvedores relataram bons designs produzidos de uma só vez pelo GLM. Outros argumentaram que um modelo exclusivamente textual não consegue corrigir de forma confiável aquilo que não pode ver. As soluções sugeridas incluíram OCR ou o envio de imagens para um modelo de visão separado. Essas abordagens podem funcionar, mas adicionam outro modelo, outro ponto de falha e uma descrição com perdas entre os pixels e o modelo de programação.

A resposta mais confiável para frontend é, portanto, condicional:

  • Para lógica de aplicação, alterações em React em vários arquivos e uma primeira implementação limpa, use o GLM-5.2.
  • Para implementação orientada por capturas de tela e correções visuais repetidas, use o MiniMax M3.
  • Em um fluxo de trabalho com dois modelos, deixe o GLM planejar e implementar a alteração difícil; depois, deixe o M3 inspecionar o resultado renderizado e retornar uma lista concreta de correções visuais.

Painel de teste controlado de frontend

A comparação publicada deve incluir estas três execuções do GPT Proto. Imagens de demonstração dos fornecedores não substituem a execução dos dois modelos sob as mesmas restrições.

Teste 1 — dashboard responsivo de uma só tentativa: use o mesmo prompt de React, dependências, limite de tokens e repositório inicial vazio. Avalie a cobertura dos requisitos, o comportamento responsivo, a acessibilidade, a estrutura dos componentes e o acabamento visual.

Teste 2 — edição de componente com restrições: forneça aos dois modelos o mesmo componente existente e peça uma alteração de comportamento sem modificar a API pública. Avalie a correção, a quantidade de regressões, as edições desnecessárias e a cobertura de testes.

Teste 3 — refinamento por captura de tela: renderize cada primeira tentativa, devolva a captura de tela e peça três correções visuais precisas. O M3 pode aceitar a imagem nativamente. Registre a etapa extra de visão necessária para fornecer ao GLM informações equivalentes, em vez de fingir que o teste é simétrico.

Preços: o MiniMax M3 vence por US$ 3 por milhão de tokens de saída

Atualmente, o GPT Proto lista o GLM-5.2 a US$ 1,26 por milhão de tokens de entrada e US$ 3,96 por milhão de tokens de saída. O MiniMax M3 custa US$ 0,48 na entrada e US$ 0,96 na saída. Portanto, o M3 economiza US$ 0,78 por milhão de tokens de entrada e US$ 3 por milhão de tokens de saída.

Considere uma carga mensal de programação com 50 milhões de tokens de entrada e 20 milhões de tokens de saída:

  Custo de entrada Custo de saída Total
GLM-5.2 US$ 63,00 US$ 79,20 US$ 142,20
MiniMax M3 US$ 24,00 US$ 19,20 US$ 43,20

A diferença é de US$ 99 para essa carga de trabalho. Ao ampliar a mesma combinação para um bilhão de tokens de entrada e 400 milhões de tokens de saída, a diferença absoluta passa a ser de US$ 1.980.

O preço tem uma contrapartida. Se o GLM evitar uma execução malsucedida, produzir um patch correto mais rapidamente ou precisar de menos rodadas de coordenação, sua taxa de tokens mais alta ainda poderá resultar em um custo menor por tarefa concluída. Use o preço por token para o orçamento; use o custo por alteração aceita para o roteamento em produção.

A diferença de licença é maior do que a maioria das comparações admite

A licença MIT do GLM-5.2 é a opção mais simples para hospedagem comercial própria. O MiniMax M3 usa a Licença comunitária da MiniMax. Para uso comercial do software ou de seus derivados, ela exige um aviso visível “Built with MiniMax M3”. Organizações com receita anual inferior a US$ 20 milhões devem enviar um aviso único; as que ultrapassam US$ 20 milhões precisam obter autorização prévia por escrito.

Essas condições importam se você implantar os pesos ou distribuir um derivado. Ao usar uma API hospedada, seu acordo com o provedor da API também rege o serviço. De qualquer forma, “ambos os modelos têm pesos disponíveis para download” não é informação suficiente para uma decisão de implantação comercial.

Qual modelo seu projeto deve usar?

Necessidade do projeto Escolha Por quê
Refatoração em todo o repositório GLM-5.2 Maior pontuação em programação e saída longa mais rápida
Agente de terminal ou DevOps GLM-5.2 Vantagem clara nas avaliações de terminal
Planejamento e coordenação difíceis GLM-5.2 Maior capacidade geral e agêntica
Trabalhador de implementação em grande volume MiniMax M3 US$ 3 a menos por milhão de tokens de saída
Conversão de captura de tela em código MiniMax M3 Entrada nativa de imagens
Revisão visual repetida de frontend MiniMax M3 Pode inspecionar cada resultado renderizado
Hospedagem comercial própria com condições mínimas de licença GLM-5.2 Licença MIT
Menor fatura de API hospedada MiniMax M3 Preços menores de entrada e saída

A conversa da comunidade acrescenta um padrão operacional útil. Em uma discussão no Hacker News, alguns desenvolvedores descreveram o M3 como um trabalhador barato depois que um modelo mais forte produziu um plano; outros relataram que ele ficou confuso durante execuções mais longas de agentes. Essa discordância não é ruído. Ela sugere direcionar o M3 de forma restrita, com tarefas explícitas e verificação, em vez de presumir que um preço baixo por token o torna o melhor agente de nível superior.

Execute GLM-5.2 e MiniMax M3 por meio de uma única API

Ambos os modelos estão disponíveis pelo endpoint compatível com OpenAI do GPT Proto. Comece na página do modelo GLM-5.2 ou na página do modelo MiniMax M3, crie uma chave de API e exporte-a como uma variável de ambiente.

A menor solicitação cURL é semelhante a esta:

export GPTPROTO_API_KEY="your_api_key"

curl https://gptproto.com/v1/chat/completions \
  -H "Authorization: Bearer ${GPTPROTO_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [
      {"role": "user", "content": "Find the bug in this Python function: def total(xs): return sum(xs[:-1])"}
    ],
    "stream": false
  }'

Altere a string do modelo para MiniMax-M3 para executar a mesma solicitação no M3.

Para uma comparação reproduzível, use o cliente Python da OpenAI:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["GPTPROTO_API_KEY"],
    base_url="https://gptproto.com/v1",
)

prompt = """Refactor this function without changing its public behavior.
Add type hints and tests, then explain any edge cases:

def unique(items):
    return list(set(items))
"""

models = {
    "GLM-5.2": "glm-5.2",
    "MiniMax M3": "MiniMax-M3",
}

for label, model in models.items():
    response = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
    )
    print(f"\n--- {label} ---")
    print(response.choices[0].message.content)

Usar um único endpoint remove as diferenças de integração da avaliação. Isso não elimina a variância de amostragem; portanto, execute cada teste mais de uma vez antes de alterar um roteador de produção.

Veredito final

Se tivesse de escolher um único modelo para uma equipe de engenharia, começaria com o GLM-5.2. Ele é mais capaz no índice independente atual, produz tokens cerca de 2,5 vezes mais rápido na comparação de APIs medida e possui uma licença MIT simples.

O MiniMax M3 não é apenas o segundo colocado mais barato. Sua visão nativa transforma o fluxo de frontend, e seu preço de US$ 0,96 por saída o torna um modelo de execução viável para tarefas de alto volume. Use-o onde essas vantagens forem reais. Não peça por padrão a um trabalhador de baixo custo que se torne o coordenador.

A resposta útil não é “GLM para tudo” nem “M3 porque é mais barato”. É GLM para raciocínio difícil e responsabilidade pelo código; M3 para feedback visual e execução bem delimitada.

Creative Studio

Gere imagem, vídeo e mais com APIs de produção.

Começar a criar
Creative Studio
Modelos relacionados
Todos os modelos
Z-AI
by Z-AI
10% OFF
MiniMax
20% OFF
OpenAI
20% OFF
Claude
10% OFF

Perguntas frequentes

GLM 5.2 vs MiniMax M3: qual é melhor?

O GLM-5.2 é o melhor modelo geral para programação com base nas medições atuais de inteligência independente e velocidade da API. O MiniMax M3 é melhor quando o custo ou a entrada visual nativa são mais importantes que a maior pontuação em programação.

Qual modelo é melhor para desenvolvedores?

Para refatorações de repositórios, trabalho de terminal, depuração e coordenação de agentes de nível superior, escolha o GLM-5.2. Para grandes volumes de trabalho de implementação claramente delimitado, o M3 oferece uma fatura de tokens menor.

Qual modelo é melhor para programação de frontend?

O GLM-5.2 é o melhor padrão para conversão de texto em código. O MiniMax M3 é a melhor escolha para conversão de captura de tela em código e iteração visual, pois consegue inspecionar imagens diretamente. Um fluxo combinado pode usar o GLM para implementação e o M3 para revisar a página renderizada.

Como se comparam os preços do GLM 5.2 e do MiniMax M3?

No GPTProto, o GLM-5.2 custa US$ 1,26 por milhão de tokens de entrada e US$ 3,96 por milhão de tokens de saída. O MiniMax M3 custa US$ 0,48 na entrada e US$ 0,96 na saída. O M3 economiza US$ 0,78 na entrada e US$ 3 na saída a cada milhão de tokens.

O MiniMax M3 é mais rápido que o GLM-5.2?

Não de acordo com a medição independente atual da API hospedada. A Artificial Analysis informa 76 tokens de saída por segundo para o M3 e 189 para o GLM-5.2. Os ganhos de velocidade da atenção esparsa do M3 são comparações com a arquitetura anterior MiniMax M2, não com o GLM.

O GLM-5.2 e o MiniMax M3 são ambos de código aberto?

O GLM-5.2 usa a licença MIT. O MiniMax M3 publica seus pesos sob uma Licença comunitária separada, com condições de uso comercial. É mais preciso chamar o M3 de modelo com pesos abertos do que tratar as duas licenças como equivalentes.

Posso alternar entre o Z.ai GLM-5.2 e o MiniMax M3 sem reescrever minha aplicação?

Sim. Pelo endpoint compatível com OpenAI do GPTProto, o formato da solicitação permanece o mesmo. Altere `glm-5.2` para `MiniMax-M3` e avalie a qualidade da resposta, o uso de tokens e a latência para sua carga de trabalho.

Artigos relacionados

Mais blogs
Como usar o GLM-5.2 para seu agente de programação sem desperdiçar o contexto de 1M

Como usar o GLM-5.2 para seu agente de programação sem desperdiçar o contexto de 1M

Conectar o GLM-5.2 a um agente de programação leva alguns minutos. Dar a ele contexto suficiente para corrigir um repositório sem deixá-lo se perder é a parte mais difícil. Essa distinção é importante. Um modelo pode escrever uma função limpa em uma janela de chat e ainda assim falhar em uma tarefa real de engenharia porque edita a camada errada, quebra um contrato de API, ignora a suíte de testes ou passa metade do contexto lendo arquivos gerados. O GLM-5.2 foi projetado para trabalhos de programação mais longos e orientados por ferramentas, mas o modelo ainda precisa de um fluxo de trabalho disciplinado ao seu redor. Este guia aborda três caminhos práticos: usar o GLM-5.2 com o Claude Code, chamar a API do GLM-5.2 no GPTProto a partir de um agente compatível com OpenAI e executar os pesos abertos localmente. Em seguida, mostra como delimitar uma tarefa no nível do repositório, gerenciar o contexto de 1M de tokens, verificar alterações e estimar o custo real de tokens. Resumo Use o Claude Code com o endpoint compatível com Anthropic da Z.ai se você já trabalha com esse agente no terminal. Use o endpoint compatível com OpenAI do GPTProto para Cline, OpenCode, um agente personalizado ou uma aplicação que já use o SDK da OpenAI. Por padrão, não envie um monorepo inteiro só porque o GLM-5.2 aceita até 1M de tokens. Comece com um mapa do repositório, os arquivos relevantes, as restrições e os comandos de teste. Use o raciocínio High para investigações rotineiras e Max para trabalhos ambíguos com vários arquivos, nos quais um plano errado seria caro. Considere a alteração do agente não confiável até que ela passe pelo build, lint, verificações de tipos e testes do repositório. Execute localmente apenas quando privacidade, controle ou uso contínuo justificarem uma infraestrutura robusta. “Pesos abertos” não significa “do tamanho de um laptop”.

Schuyler Stacy | 2026-07-17

MiniMax M3 para Programação: Benchmarks, Preços Reais e Como Chamá-lo via API (2026)

MiniMax M3 para Programação: Benchmarks, Preços Reais e Como Chamá-lo via API (2026)

O MiniMax M3 é bom para programação? A resposta curta: sim, para trabalho agêntico e com vários arquivos, com duas ressalvas que vou apresentar antes que você leia mais uma palavra. A maioria das pontuações de programação mais divulgadas foi obtida pela MiniMax em sua própria infraestrutura, e o "contexto de 1 milhão de tokens" tem um salto de preço em 512K que afeta especialmente os agentes de programação. Ambos os pontos são administráveis quando você sabe que existem. Nenhum deles aparece claramente na maioria da cobertura do lançamento. Estou escrevendo isto porque a proposta de programação em torno do M3 foi reduzida a um único número — 59% no SWE-Bench Pro — e esse número está sendo usado sem muita análise. A seguir, explico o que o modelo realmente é, onde chegam as medições independentes, quanto ele custa em uma carga de trabalho de programação real e como chamá-lo pela API do GPTProto. Se você quer apenas uma conclusão: um avaliador independente que executa a mesma bateria em todos os modelos relevantes colocou o M3 "próximo do GPT e do Opus em programação real, mas ainda não acima deles". Isso também corresponde à posição dos benchmarks neutros.

Schuyler Stacy | 2026-07-02

GLM-5.2 vs Kimi K3 para programação: qual é melhor para desenvolvedores em 2026?

GLM-5.2 vs Kimi K3 para programação: qual é melhor para desenvolvedores em 2026?

TL;DR: Kimi K3 é o modelo de programação mais forte quando a tarefa é difícil, longa ou visual. Ele supera o GLM-5.2 na comparação de programação publicada pela Moonshot e aceita imagens e vídeos por meio de seu serviço hospedado. O GLM-5.2 continua sendo a melhor opção padrão para o trabalho rotineiro em repositórios: custa muito menos, é menor para operar e usa a licença permissiva MIT. O Kimi K3 também passou a disponibilizar seus pesos, mas seu repositório de 1,56 TB, a implantação recomendada com mais de 64 aceleradores e a licença personalizada tornam a hospedagem própria um compromisso consideravelmente maior. Escolha o Kimi quando a capacidade for o gargalo; escolha o GLM quando o custo e a simplicidade operacional forem importantes todos os dias. A parte interessante da comparação de código entre GLM-5.2 e Kimi K3 não é que ambos os modelos conseguem escrever um componente React ou resolver um algoritmo curto. Modelos desse nível já superam esse requisito. A pergunta útil é o que acontece quando a tarefa fica complicada: uma auditoria de repositório, uma migração com vários arquivos, um bug que só aparece em uma captura de tela ou um protótipo jogável em Three.js que precisa manter vários sistemas coerentes. É também nesse ponto que a diferença de preço começa a importar. O Kimi K3 parece melhor nos testes públicos mais difíceis, mas seu preço oficial de saída é mais de três vezes maior que o do GLM-5.2. Uma equipe que executa milhares de revisões comuns pode realizar mais trabalho por dólar com o GLM. Um desenvolvedor tentando salvar um projeto visual difícil pode pagar pelo K3 sem hesitar.

Tiffany Layne | 2026-07-28

O que é o MiniMax M3 Pro? Tudo o que sabemos sobre o modelo de 2,7 trilhões de parâmetros da China

O que é o MiniMax M3 Pro? Tudo o que sabemos sobre o modelo de 2,7 trilhões de parâmetros da China

Resumo O MiniMax M3 Pro ainda não foi lançado — é um plano divulgado, não um produto, e nenhum provedor de API pode oferecê-lo hoje. Toda afirmação sobre ele remonta a uma única reportagem exclusiva (The Information, 8 de julho de 2026): aproximadamente 2,7 trilhões de parâmetros, apenas um codinome interno e lançamento de código aberto previsto "já no" terceiro trimestre de 2026. A MiniMax não publicou nada. A quantidade de parâmetros é a coisa errada a observar. A quantidade de parâmetros ativos e a licença são o que determinarão se o M3 Pro será utilizável — e nenhum dos dois foi divulgado. Os dois últimos lançamentos "abertos" da MiniMax foram distribuídos sob uma licença comunitária personalizada com restrições comerciais, não sob Apache 2.0 ou MIT. Com 2,7T, hospedar o modelo por conta própria está fora do alcance de quase todo mundo — o modelo atual de 428B já precisa de uma máquina da classe B200 com oito GPUs. Para a maioria das equipes, com pesos abertos ou não, o caminho até esse modelo será uma API. O que fazer agora: não espere. O MiniMax M3 foi lançado em 1º de junho de 2026, lidera o campo de pesos abertos no Intelligence Index da Artificial Analysis (55, na variante de raciocínio) e pode ser chamado hoje. A preparação adequada para o M3 Pro é uma linha de código — mova o ID do modelo para a configuração.

Tiffany Layne | 2026-07-13