Dois modelos, duas filosofias
A maioria das análises frente a frente apresenta os dois como se fossem o mesmo produto em faixas de preço diferentes. Não são. O DeepSeek lançou o V4 Pro em 24 de abril de 2026 sob uma licença MIT, e é o especialista especialista mais profundo — um modelo de mistura de especialistas exclusivamente textual, fortemente ajustado para programação agêntica e raciocínio em STEM. A MiniMax lançou o M3 em 1º de junho de 2026, e ele é o generalista mais abrangente — o primeiro modelo de pesos abertos a combinar programação de ponta, contexto de um milhão de tokens e entrada nativa de imagens e vídeos em um único sistema.
Essa única diferença — multimodalidade versus somente texto — determina mais a escolha do que qualquer benchmark. Por isso, vale dizer claramente antes de começarmos a analisar os números: você não está escolhendo o “melhor modelo”. Está escolhendo qual formato de modelo se adapta ao trabalho. O restante desta comparação trata de tomar essa decisão com base em dados reais, e não em uma captura de tela de leaderboard.
Lado a lado: especificações e preço
Aqui está a realidade no papel, usando as tarifas reais da GPT Proto por milhão de tokens, em vez de um número chamativo da publicação de lançamento de alguém.
| |
MiniMax M3 |
DeepSeek V4 Pro |
| Lançamento |
1º de junho de 2026 |
24 de abril de 2026 |
| Arquitetura |
MoE, 428B no total / 23B ativos |
MoE, 1,6T no total / 49B ativos |
| Design de atenção |
MiniMax Sparse Attention (MSA) |
DeepSeek Sparse Attention (DSA) |
| Janela de contexto |
1M tokens |
1M tokens (saída máxima de 384K) |
| Modalidades de entrada |
texto, imagem, vídeo |
somente texto |
| Saída |
texto |
texto |
| Licença / pesos |
Pesos abertos (Hugging Face) |
MIT, pesos abertos (Hugging Face) |
| Preço de entrada da GPT Proto |
$0.48 / 1M tokens |
$1.3914 / 1M tokens |
| Preço de saída da GPT Proto |
$0.96 / 1M tokens |
$2.7838 / 1M tokens |
Duas coisas nessa tabela importam mais do que o restante. O M3 aceita entrada de imagens e vídeos; o DeepSeek não. E o DeepSeek ativa aproximadamente o dobro de parâmetros por token (49B contra 23B) a partir de um conjunto total quase quatro vezes maior — é o modelo mais pesado e denso, que realiza mais computação em cada token, algo que aparece em suas pontuações de raciocínio profundo e, na maioria dos hosts, em seu preço.
Desempenho em programação e tarefas agênticas
É aqui que a comparação geralmente dá errado, então leia os números com atenção.
O DeepSeek V4 Pro, em seu modo máximo de raciocínio, alcança 80,6% no SWE-bench Verified — a maior pontuação entre todos os modelos de pesos abertos, empatado com o Gemini 3.1 Pro. Ele também obtém 93,5 no LiveCodeBench e uma classificação de 3206 no Codeforces. Esses são pontos fortes algorítmicos e de programação competitiva, e as pontuações do DeepSeek foram reproduzidas em novas execuções independentes, o que é importante para a confiabilidade.
Os números oficiais de programação do MiniMax M3 são 59,0% no SWE-Bench Pro, 66,0% no Terminal-Bench 2.1, 34,8% no SWE-fficiency, 28,8% no KernelBench Hard e 74,2% no MCP Atlas. No Intelligence Index independente da Artificial Analysis — uma pontuação entre modelos, não um benchmark de fornecedor — o M3 chega a 44, ficando em segundo lugar no grupo de pares acompanhado, contra uma mediana de categoria próxima de 25.
Agora vem a armadilha. Você verá uma dúzia de páginas colocando os “59%” do M3 ao lado dos “80,6%” do DeepSeek e declarando o DeepSeek o vencedor disparado em programação. Essa comparação é inválida. SWE-bench Pro e SWE-bench Verified são dois benchmarks diferentes, com conjuntos de problemas e níveis de dificuldade diferentes — o Pro é a variante mais difícil e recente. Comparar uma pontuação Pro com uma pontuação Verified não informa nada sobre qual modelo é melhor; é um erro de unidades disfarçado de conclusão. Os dois laboratórios simplesmente relataram benchmarks diferentes, e nenhum publicou uma comparação direta limpa usando o mesmo benchmark. Minha leitura: em inteligência geral medida de forma independente, eles estão próximos; em pontuações publicadas de raciocínio profundo e programação competitiva, as do DeepSeek são maiores e mais bem verificadas; em qualquer tarefa que envolva ver algo, a comparação nem começa, porque o M3 é o único capaz de fazer isso.
A única capacidade que não está empatada
O DeepSeek V4 Pro é somente texto. O MiniMax M3 foi criado como multimodal desde o primeiro passo de treinamento e aceita imagens e vídeos junto com texto no mesmo endpoint. Isso não é uma observação secundária da ficha técnica — é uma diferença de categoria.
Se você está criando um agente que depura a partir de uma captura de tela, transforma um mockup do Figma em um componente, lê um gráfico ou assiste a uma gravação de tela para encontrar um bug, o M3 consegue fazer isso e o DeepSeek não. Não existe prompt, preço ou fine-tuning que dê olhos a um modelo somente textual. Portanto, em qualquer fluxo de trabalho em que o modelo faça parte do que o usuário vê e com que interage — trabalho de UI, QA visual, análise de documentos com diagramas — a escolha está feita antes mesmo de você consultar um único benchmark. Por outro lado, se nada no seu pipeline é uma imagem, você está pagando por uma capacidade que nunca usará, e a especialização textual do DeepSeek é a compra mais bem direcionada.
Custo, sem rodeios
Na GPT Proto, usando os dois modelos a partir de um único saldo, o MiniMax M3 é o mais barato — US$ 0,48 de entrada e US$ 0,96 de saída por milhão de tokens, contra US$ 1,3914 e US$ 2,7838 do DeepSeek V4 Pro. Nas tarifas da GPT Proto, o M3 custa aproximadamente um terço do V4 Pro por token, em ambas as direções.
Mas eu estaria induzindo você ao erro se parasse por aí, porque “qual é mais barato” depende muito de onde você executa cada modelo. A economia nativa do próprio DeepSeek para o V4 Pro é agressiva de uma maneira que nem sempre se mantém quando ele é hospedado em outro lugar: na API própria do DeepSeek, o modelo custa cerca de US$ 0,435 de entrada e US$ 0,87 de saída por milhão de tokens e — a parte que realmente reduz as contas — um acerto de cache custa aproximadamente US$ 0,003625 por milhão, mais de cem vezes menos que uma falha de cache. Loops de programação agêntica reenviam o mesmo prompt de sistema e o contexto dos arquivos a cada turno, então a maior parte da entrada fica em cache. Se você processa grandes volumes de texto puro e está disposto a executar o DeepSeek nativamente, esse preço de cache é realmente difícil de superar e constitui o argumento individual mais forte a favor do V4 Pro.
Portanto, a leitura honesta sobre custo tem duas camadas. Em uma chave agregada pela GPT Proto, o M3 apresenta o menor custo por token. Para processamento bruto de alto volume de texto, otimizado em torno da tarifa nativa de cache do DeepSeek, a economia do V4 Pro leva vantagem. E, acima de tudo: preço por token não é preço por tarefa. Um modelo que custa menos por token, mas precisa de três tentativas para produzir um patch funcional, não é a opção barata — ele apenas transferiu o custo para seu tempo de depuração. Faça um benchmark dos dois em suas próprias tarefas antes de deixar uma tabela de preços decidir.
Contexto e eficiência
Ambos os modelos trabalham com uma janela de contexto de 1 milhão de tokens, e ambos chegaram lá substituindo a atenção densa padrão por um design esparso — mas por caminhos diferentes, e a diferença é real, não apenas cosmética.
O DSA do DeepSeek aposta em uma compressão pesada: na configuração de 1 milhão de tokens, o V4 Pro precisa de apenas cerca de 27% da computação de inferência de token único e 10% do cache KV de seu antecessor V3.2. Já o MSA da MiniMax faz seleção em nível de bloco sobre valores-chave não comprimidos; segundo a MiniMax, isso evita o custo de precisão que esquemas baseados em compressão pagam em longas distâncias. Com contexto de 1 milhão, ele reduz a computação por token para aproximadamente 1/20 da do modelo M2 anterior, com prefill mais de 9× mais rápido e decodificação mais de 15× mais rápida. Este é um ponto em que eu trataria as alegações de ambos os lados como apresentadas pelos próprios fornecedores — cada laboratório descreve sua abordagem como aquela sem desvantagens. O que se pode afirmar com segurança é que ambos foram projetados especificamente para trabalhos com contexto longo, e ambos são baratos o suficiente por token em grandes contextos para tornar prática, e não apenas aspiracional, uma carga de trabalho envolvendo um repositório inteiro ou um documento extenso.
O que a comunidade está realmente analisando
Se você procurar reações a esses dois modelos — a busca “MiniMax M3 vs DeepSeek V4 Pro reddit” que muitas pessoas fazem antes de decidir — dois temas aparecem mais do que qualquer discussão sobre benchmarks, e ambos merecem ser levados a sério.
O primeiro é a verificação. As pontuações de lançamento do M3 foram obtidas na infraestrutura própria da MiniMax e com seu próprio sistema de agentes, algo normal em um lançamento, mas exatamente o tipo de coisa que os desenvolvedores desconsideram até surgirem números independentes. Esses números começaram a aparecer: os pesos abertos do M3 foram disponibilizados no Hugging Face em 7 de junho, e o índice independente da Artificial Analysis agora corrobora que ele é genuinamente um modelo de nível superior, e não um artefato do dia do benchmark. O DeepSeek começou com vantagem nesse aspecto — suas pontuações foram reproduzidas por avaliadores independentes desde cedo, e seus pesos licenciados sob MIT estavam disponíveis desde o primeiro dia para qualquer pessoa verificar. Se o desempenho verificado de forma independente é um requisito inegociável, o DeepSeek ainda tem o histórico mais longo, embora o M3 tenha fechado a maior parte dessa lacuna.
O segundo é o fato de que “mais barato por token” e “mais barato para concluir o trabalho” são números diferentes. Um modelo que escreve código plausível, mas não detecta um teste que falha, não tem baixo custo; é um modelo que empurrou o custo para a etapa de revisão. É por isso que o consenso entre profissionais continua chegando ao mesmo conselho: escolha pela adequação de capacidade e pela confiabilidade na sua carga de trabalho, e deixe o preço por token desempatar em vez de tomar a decisão.
Execute qualquer um dos dois com a mesma chave
A vantagem prática de chamar os dois pela GPT Proto é que trocar de modelo exige uma alteração de uma linha — mesma chave, mesmo formato de requisição compatível com OpenAI, string de modelo diferente. Aqui está uma conclusão de chat contra o M3, com uma troca comentada para o V4 Pro:
from openai import OpenAI
client = OpenAI(
api_key="sk-your-key-here", # one key reaches both models
base_url="https://gptproto.com/v1", # OpenAI-compatible gateway
)
def ask(model, prompt):
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
return resp.choices[0].message.content
# Text-only reasoning — either model handles this.
print(ask("deepseek-v4-pro", "Refactor this function for readability:\n<paste code>"))
# Image input — only M3 can take this; DeepSeek is text-only.
def ask_with_image(image_url, prompt):
resp = client.chat.completions.create(
model="MiniMax-M3",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": prompt},
{"type": "image_url", "image_url": {"url": image_url}},
],
}],
)
return resp.choices[0].message.content
print(ask_with_image(
"https://example.com/ui-bug-screenshot.png",
"This screen renders wrong on mobile. What's the likely CSS cause?",
))
A mesma primeira chamada em cURL:
curl https://gptproto.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-your-key-here" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "Refactor this function for readability."}
]
}'
Para transferir um trabalho de texto de um modelo para o outro, você altera uma string — MiniMax-M3 ou deepseek-v4-pro — e a mesma chave dá acesso aos dois, além de mais de 200 outros modelos, usando um único saldo. Se você ainda não tem uma chave, crie uma no painel da GPT Proto e consulte a página de preços para verificar a tarifa atual exata de cada modelo antes de executar um lote.
Qual você deve usar?
Se sua carga de trabalho envolve texto, código, logs e saída estruturada — agentes de back-end, extração de alto volume, problemas algorítmicos de nível competitivo — use o DeepSeek V4 Pro. Ele tem pontuações verificadas mais altas em raciocínio profundo, um histórico independente mais sólido e uma economia nativa que favorece grandes volumes de texto por meio de sua tarifa de cache.
Se qualquer parte do seu pipeline for uma imagem ou vídeo — depuração de UI, conversão de design em código, QA visual, documentos repletos de diagramas — use o MiniMax M3, porque ele é o único dos dois que consegue enxergar e, na GPT Proto, também é a opção mais barata por token.
E, se você está criando algo real, a resposta muitas vezes é usar ambos: encaminhe os turnos de texto e raciocínio puro para o V4 Pro, direcione os turnos visuais ao M3 e execute os dois com uma única chave, sem precisar manter uma segunda integração. “MiniMax M3 ou DeepSeek V4 Pro” é a forma errada de apresentar a escolha para a maioria das equipes — eles são especialistas em coisas diferentes, e a configuração mais forte usa cada um onde ele se destaca.