Preços+7% bônus
Tiffany Layne2026-07-01

MiniMax M3 vs DeepSeek V4 Pro: Preço, benchmarks e qual usar de verdade

MiniMax M3 vs DeepSeek V4 Pro comparados em preço, benchmarks e multimodalidade. Qual modelo chinês de pesos abertos usar de verdade — e a armadilha do SWE-bench que a maioria dos guias ignora.

MiniMax M3 vs DeepSeek V4 Pro: Preço, benchmarks e qual usar de verdade

TL;DR — Estes são os dois modelos chineses de pesos abertos que todos estão comparando agora, e a resposta honesta é que eles mal competem. O DeepSeek V4 Pro é um especialista algorítmico puramente textual: alcança a maior pontuação no SWE-bench Verified entre todos os modelos de pesos abertos (80,6%) e sua economia nativa de tokens é difícil de superar, especialmente em acertos de cache. O MiniMax M3 é um generalista nativamente multimodal: lê imagens e vídeos, não apenas texto, e ocupa o segundo lugar no índice de inteligência entre modelos da Artificial Analysis. Se sua carga de trabalho envolve texto, código e logs, e você se importa com o custo por token, escolha o DeepSeek V4 Pro.

Se seu agente precisa analisar uma captura de tela, um mockup de design ou uma gravação de tela, escolha o M3 — o DeepSeek não consegue fazer isso a nenhum preço. Ambos agora disponibilizam pesos abertos e ambos executam com uma janela de contexto de 1 milhão de tokens, então esta não é a disputa de “um precisa perder” que a maioria das páginas de comparação apresenta.

 

Índice

Dois modelos, duas filosofias

A maioria das análises frente a frente apresenta os dois como se fossem o mesmo produto em faixas de preço diferentes. Não são. O DeepSeek lançou o V4 Pro em 24 de abril de 2026 sob uma licença MIT, e é o especialista especialista mais profundo — um modelo de mistura de especialistas exclusivamente textual, fortemente ajustado para programação agêntica e raciocínio em STEM. A MiniMax lançou o M3 em 1º de junho de 2026, e ele é o generalista mais abrangente — o primeiro modelo de pesos abertos a combinar programação de ponta, contexto de um milhão de tokens e entrada nativa de imagens e vídeos em um único sistema.

Essa única diferença — multimodalidade versus somente texto — determina mais a escolha do que qualquer benchmark. Por isso, vale dizer claramente antes de começarmos a analisar os números: você não está escolhendo o “melhor modelo”. Está escolhendo qual formato de modelo se adapta ao trabalho. O restante desta comparação trata de tomar essa decisão com base em dados reais, e não em uma captura de tela de leaderboard.

Lado a lado: especificações e preço

Aqui está a realidade no papel, usando as tarifas reais da GPT Proto por milhão de tokens, em vez de um número chamativo da publicação de lançamento de alguém.

  MiniMax M3 DeepSeek V4 Pro
Lançamento 1º de junho de 2026 24 de abril de 2026
Arquitetura MoE, 428B no total / 23B ativos MoE, 1,6T no total / 49B ativos
Design de atenção MiniMax Sparse Attention (MSA) DeepSeek Sparse Attention (DSA)
Janela de contexto 1M tokens 1M tokens (saída máxima de 384K)
Modalidades de entrada texto, imagem, vídeo somente texto
Saída texto texto
Licença / pesos Pesos abertos (Hugging Face) MIT, pesos abertos (Hugging Face)
Preço de entrada da GPT Proto $0.48 / 1M tokens $1.3914 / 1M tokens
Preço de saída da GPT Proto $0.96 / 1M tokens $2.7838 / 1M tokens

Duas coisas nessa tabela importam mais do que o restante. O M3 aceita entrada de imagens e vídeos; o DeepSeek não. E o DeepSeek ativa aproximadamente o dobro de parâmetros por token (49B contra 23B) a partir de um conjunto total quase quatro vezes maior — é o modelo mais pesado e denso, que realiza mais computação em cada token, algo que aparece em suas pontuações de raciocínio profundo e, na maioria dos hosts, em seu preço.

Desempenho em programação e tarefas agênticas

É aqui que a comparação geralmente dá errado, então leia os números com atenção.

O DeepSeek V4 Pro, em seu modo máximo de raciocínio, alcança 80,6% no SWE-bench Verified — a maior pontuação entre todos os modelos de pesos abertos, empatado com o Gemini 3.1 Pro. Ele também obtém 93,5 no LiveCodeBench e uma classificação de 3206 no Codeforces. Esses são pontos fortes algorítmicos e de programação competitiva, e as pontuações do DeepSeek foram reproduzidas em novas execuções independentes, o que é importante para a confiabilidade.

Os números oficiais de programação do MiniMax M3 são 59,0% no SWE-Bench Pro, 66,0% no Terminal-Bench 2.1, 34,8% no SWE-fficiency, 28,8% no KernelBench Hard e 74,2% no MCP Atlas. No Intelligence Index independente da Artificial Analysis — uma pontuação entre modelos, não um benchmark de fornecedor — o M3 chega a 44, ficando em segundo lugar no grupo de pares acompanhado, contra uma mediana de categoria próxima de 25.

Agora vem a armadilha. Você verá uma dúzia de páginas colocando os “59%” do M3 ao lado dos “80,6%” do DeepSeek e declarando o DeepSeek o vencedor disparado em programação. Essa comparação é inválida. SWE-bench Pro e SWE-bench Verified são dois benchmarks diferentes, com conjuntos de problemas e níveis de dificuldade diferentes — o Pro é a variante mais difícil e recente. Comparar uma pontuação Pro com uma pontuação Verified não informa nada sobre qual modelo é melhor; é um erro de unidades disfarçado de conclusão. Os dois laboratórios simplesmente relataram benchmarks diferentes, e nenhum publicou uma comparação direta limpa usando o mesmo benchmark. Minha leitura: em inteligência geral medida de forma independente, eles estão próximos; em pontuações publicadas de raciocínio profundo e programação competitiva, as do DeepSeek são maiores e mais bem verificadas; em qualquer tarefa que envolva ver algo, a comparação nem começa, porque o M3 é o único capaz de fazer isso.

A única capacidade que não está empatada

O DeepSeek V4 Pro é somente texto. O MiniMax M3 foi criado como multimodal desde o primeiro passo de treinamento e aceita imagens e vídeos junto com texto no mesmo endpoint. Isso não é uma observação secundária da ficha técnica — é uma diferença de categoria.

Se você está criando um agente que depura a partir de uma captura de tela, transforma um mockup do Figma em um componente, lê um gráfico ou assiste a uma gravação de tela para encontrar um bug, o M3 consegue fazer isso e o DeepSeek não. Não existe prompt, preço ou fine-tuning que dê olhos a um modelo somente textual. Portanto, em qualquer fluxo de trabalho em que o modelo faça parte do que o usuário vê e com que interage — trabalho de UI, QA visual, análise de documentos com diagramas — a escolha está feita antes mesmo de você consultar um único benchmark. Por outro lado, se nada no seu pipeline é uma imagem, você está pagando por uma capacidade que nunca usará, e a especialização textual do DeepSeek é a compra mais bem direcionada.

Custo, sem rodeios

Na GPT Proto, usando os dois modelos a partir de um único saldo, o MiniMax M3 é o mais barato — US$ 0,48 de entrada e US$ 0,96 de saída por milhão de tokens, contra US$ 1,3914 e US$ 2,7838 do DeepSeek V4 Pro. Nas tarifas da GPT Proto, o M3 custa aproximadamente um terço do V4 Pro por token, em ambas as direções.

Mas eu estaria induzindo você ao erro se parasse por aí, porque “qual é mais barato” depende muito de onde você executa cada modelo. A economia nativa do próprio DeepSeek para o V4 Pro é agressiva de uma maneira que nem sempre se mantém quando ele é hospedado em outro lugar: na API própria do DeepSeek, o modelo custa cerca de US$ 0,435 de entrada e US$ 0,87 de saída por milhão de tokens e — a parte que realmente reduz as contas — um acerto de cache custa aproximadamente US$ 0,003625 por milhão, mais de cem vezes menos que uma falha de cache. Loops de programação agêntica reenviam o mesmo prompt de sistema e o contexto dos arquivos a cada turno, então a maior parte da entrada fica em cache. Se você processa grandes volumes de texto puro e está disposto a executar o DeepSeek nativamente, esse preço de cache é realmente difícil de superar e constitui o argumento individual mais forte a favor do V4 Pro.

Portanto, a leitura honesta sobre custo tem duas camadas. Em uma chave agregada pela GPT Proto, o M3 apresenta o menor custo por token. Para processamento bruto de alto volume de texto, otimizado em torno da tarifa nativa de cache do DeepSeek, a economia do V4 Pro leva vantagem. E, acima de tudo: preço por token não é preço por tarefa. Um modelo que custa menos por token, mas precisa de três tentativas para produzir um patch funcional, não é a opção barata — ele apenas transferiu o custo para seu tempo de depuração. Faça um benchmark dos dois em suas próprias tarefas antes de deixar uma tabela de preços decidir.

Contexto e eficiência

Ambos os modelos trabalham com uma janela de contexto de 1 milhão de tokens, e ambos chegaram lá substituindo a atenção densa padrão por um design esparso — mas por caminhos diferentes, e a diferença é real, não apenas cosmética.

O DSA do DeepSeek aposta em uma compressão pesada: na configuração de 1 milhão de tokens, o V4 Pro precisa de apenas cerca de 27% da computação de inferência de token único e 10% do cache KV de seu antecessor V3.2. Já o MSA da MiniMax faz seleção em nível de bloco sobre valores-chave não comprimidos; segundo a MiniMax, isso evita o custo de precisão que esquemas baseados em compressão pagam em longas distâncias. Com contexto de 1 milhão, ele reduz a computação por token para aproximadamente 1/20 da do modelo M2 anterior, com prefill mais de 9× mais rápido e decodificação mais de 15× mais rápida. Este é um ponto em que eu trataria as alegações de ambos os lados como apresentadas pelos próprios fornecedores — cada laboratório descreve sua abordagem como aquela sem desvantagens. O que se pode afirmar com segurança é que ambos foram projetados especificamente para trabalhos com contexto longo, e ambos são baratos o suficiente por token em grandes contextos para tornar prática, e não apenas aspiracional, uma carga de trabalho envolvendo um repositório inteiro ou um documento extenso.

O que a comunidade está realmente analisando

Se você procurar reações a esses dois modelos — a busca “MiniMax M3 vs DeepSeek V4 Pro reddit” que muitas pessoas fazem antes de decidir — dois temas aparecem mais do que qualquer discussão sobre benchmarks, e ambos merecem ser levados a sério.

O primeiro é a verificação. As pontuações de lançamento do M3 foram obtidas na infraestrutura própria da MiniMax e com seu próprio sistema de agentes, algo normal em um lançamento, mas exatamente o tipo de coisa que os desenvolvedores desconsideram até surgirem números independentes. Esses números começaram a aparecer: os pesos abertos do M3 foram disponibilizados no Hugging Face em 7 de junho, e o índice independente da Artificial Analysis agora corrobora que ele é genuinamente um modelo de nível superior, e não um artefato do dia do benchmark. O DeepSeek começou com vantagem nesse aspecto — suas pontuações foram reproduzidas por avaliadores independentes desde cedo, e seus pesos licenciados sob MIT estavam disponíveis desde o primeiro dia para qualquer pessoa verificar. Se o desempenho verificado de forma independente é um requisito inegociável, o DeepSeek ainda tem o histórico mais longo, embora o M3 tenha fechado a maior parte dessa lacuna.

O segundo é o fato de que “mais barato por token” e “mais barato para concluir o trabalho” são números diferentes. Um modelo que escreve código plausível, mas não detecta um teste que falha, não tem baixo custo; é um modelo que empurrou o custo para a etapa de revisão. É por isso que o consenso entre profissionais continua chegando ao mesmo conselho: escolha pela adequação de capacidade e pela confiabilidade na sua carga de trabalho, e deixe o preço por token desempatar em vez de tomar a decisão.

Execute qualquer um dos dois com a mesma chave

A vantagem prática de chamar os dois pela GPT Proto é que trocar de modelo exige uma alteração de uma linha — mesma chave, mesmo formato de requisição compatível com OpenAI, string de modelo diferente. Aqui está uma conclusão de chat contra o M3, com uma troca comentada para o V4 Pro:

from openai import OpenAI

client = OpenAI(
    api_key="sk-your-key-here",           # one key reaches both models
    base_url="https://gptproto.com/v1",   # OpenAI-compatible gateway
)

def ask(model, prompt):
    resp = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
    )
    return resp.choices[0].message.content

# Text-only reasoning — either model handles this.
print(ask("deepseek-v4-pro", "Refactor this function for readability:\n<paste code>"))

# Image input — only M3 can take this; DeepSeek is text-only.
def ask_with_image(image_url, prompt):
    resp = client.chat.completions.create(
        model="MiniMax-M3",
        messages=[{
            "role": "user",
            "content": [
                {"type": "text", "text": prompt},
                {"type": "image_url", "image_url": {"url": image_url}},
            ],
        }],
    )
    return resp.choices[0].message.content

print(ask_with_image(
    "https://example.com/ui-bug-screenshot.png",
    "This screen renders wrong on mobile. What's the likely CSS cause?",
))

A mesma primeira chamada em cURL:

curl https://gptproto.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-your-key-here" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "Refactor this function for readability."}
    ]
  }'

Para transferir um trabalho de texto de um modelo para o outro, você altera uma string — MiniMax-M3 ou deepseek-v4-pro — e a mesma chave dá acesso aos dois, além de mais de 200 outros modelos, usando um único saldo. Se você ainda não tem uma chave, crie uma no painel da GPT Proto e consulte a página de preços para verificar a tarifa atual exata de cada modelo antes de executar um lote.

Qual você deve usar?

Se sua carga de trabalho envolve texto, código, logs e saída estruturada — agentes de back-end, extração de alto volume, problemas algorítmicos de nível competitivo — use o DeepSeek V4 Pro. Ele tem pontuações verificadas mais altas em raciocínio profundo, um histórico independente mais sólido e uma economia nativa que favorece grandes volumes de texto por meio de sua tarifa de cache.

Se qualquer parte do seu pipeline for uma imagem ou vídeo — depuração de UI, conversão de design em código, QA visual, documentos repletos de diagramas — use o MiniMax M3, porque ele é o único dos dois que consegue enxergar e, na GPT Proto, também é a opção mais barata por token.

E, se você está criando algo real, a resposta muitas vezes é usar ambos: encaminhe os turnos de texto e raciocínio puro para o V4 Pro, direcione os turnos visuais ao M3 e execute os dois com uma única chave, sem precisar manter uma segunda integração. “MiniMax M3 ou DeepSeek V4 Pro” é a forma errada de apresentar a escolha para a maioria das equipes — eles são especialistas em coisas diferentes, e a configuração mais forte usa cada um onde ele se destaca.

 

Creative Studio

Gere imagem, vídeo e mais com APIs de produção.

Começar a criar
Creative Studio
Modelos relacionados
Todos os modelos
MiniMax
20% OFF
DeepSeek
15% OFF
OpenAI
20% OFF
Claude
10% OFF

Perguntas frequentes

Qual é a principal diferença entre o MiniMax M3 e o DeepSeek V4 Pro?

Formato das capacidades. O M3 é nativamente multimodal — aceita texto, imagem e vídeo — enquanto o DeepSeek V4 Pro é somente textual, mas um especialista algorítmico e de raciocínio mais profundo. Ambos são modelos chineses MoE de pesos abertos, com janelas de contexto de 1 milhão de tokens.

O DeepSeek V4 Pro é melhor que o MiniMax M3 para programação?

Nas pontuações publicadas e verificadas de forma independente, como SWE-bench Verified (80,6%) e LiveCodeBench (93,5), o DeepSeek V4 Pro lidera em programação baseada em texto e algorítmica. Porém, a comparação repetida entre os 59% do M3 no SWE-bench Pro e os 80,6% do DeepSeek no Verified é inválida — são benchmarks diferentes. Para programação que envolve capturas de tela ou UI, o M3 vence por padrão, já que o DeepSeek não consegue processar imagens.

Qual é mais barato?

Na GPTProto, o MiniMax M3 (US$ 0,48 de entrada / US$ 0,96 de saída por 1 milhão de tokens) é mais barato que o DeepSeek V4 Pro (US$ 1,3914 / US$ 2,7838). Na API nativa do próprio DeepSeek, os preços de lista e de acertos de cache do V4 Pro são menores, o que favorece o uso de alto volume e somente texto. Preço por token não é custo por tarefa — teste os dois em sua própria carga de trabalho.

Como esses modelos chineses se comparam a modelos fechados como GPT-5.5 ou Claude Opus?

Ambos são apresentados como alternativas de pesos abertos a uma fração do custo por token dos modelos fechados. A pontuação do DeepSeek V4 Pro no SWE-bench Verified empata com a do Gemini 3.1 Pro entre os modelos de primeira linha, e o MiniMax M3 ocupa o segundo lugar no índice independente de inteligência da Artificial Analysis em seu grupo de pares. Os pesos abertos e o preço mais baixo são a contrapartida do suporte mais amplo ao ecossistema oferecido pelos modelos fechados.

Posso executar os dois sem contas separadas?

Sim. Pela GPTProto, uma única chave de API e um único endpoint compatível com OpenAI dão acesso ao MiniMax M3 e ao DeepSeek V4 Pro usando um único saldo — trocar de modelo exige uma alteração de uma linha.

Artigos relacionados

Mais blogs
API do Doubao: O guia completo (2026) — qual modelo chamar e como

API do Doubao: O guia completo (2026) — qual modelo chamar e como

Pesquise por “doubao api” e você rapidamente encontra um obstáculo. O console oficial é o Volcano Engine, as páginas vêm configuradas em chinês e o cadastro exige uma verificação de identidade que a maioria dos desenvolvedores fora da China não consegue concluir em uma tarde. Depois há a questão dos nomes. Doubao, Dola, Cici, Seed, Seedream, Seedance, Volcengine — todos pertencem à ByteDance, e nenhum deles é obviamente aquilo que você digitou na caixa de pesquisa. Escrevo guias de integração para o GPTProto, e Doubao é a família de modelos sobre a qual mais me perguntam. Portanto, este é o guia que eu gostaria que existisse: qual modelo Doubao serve para cada tarefa, quanto cada um realmente custa e código pronto para copiar e colar que os chama — texto, imagem e vídeo — a partir de um único endpoint, sem precisar de um número de telefone chinês. Este é um quadro produzido pelo modelo de vídeo Seedance 2.0 a partir de um prompt de texto, chamado pela API exatamente da maneira que o código mais abaixo faz. Vamos chegar até ele.

Schuyler Stacy | 2026-06-23

Como usar o Kling 3.0 Motion Control: um guia para desenvolvedores (Web + API)

Como usar o Kling 3.0 Motion Control: um guia para desenvolvedores (Web + API)

Kling 3.0 Motion Control animates a static character image with the movement from a reference video. You give it two inputs — a picture of your character and a video of someone moving — and it returns a new clip where your character performs that exact choreography while keeping their own face, outfit, and look. This is motion transfer, not text-to-motion. Instead of describing an action in a prompt and hoping the model interprets it, you show it the action frame by frame. That makes it far more reliable for repeatable character animation, dance, and gesture work. This guide covers both paths: the Kling web app for one-off clips, and the GPTProto API for wiring Motion Control into a pipeline. We'll cover inputs and limits, the `pro` vs `std` tiers, prompt technique, full runnable code, pricing, and the failure modes worth knowing before you spend credits.

Michael Johnson | 2026-06-30

O que é o GLM 5.2? Codificação com pesos abertos por 1/6 do preço

O que é o GLM 5.2? Codificação com pesos abertos por 1/6 do preço

Um laboratório chinês lançou um modelo que você pode baixar gratuitamente, executar no seu próprio hardware e usar por aproximadamente um sexto do que os modelos de fronteira fechados cobram — e que fica alguns pontos atrás do Claude Opus 4.8 em benchmarks reais de codificação. Depois, lançou o modelo sem publicar um único benchmark oficial próprio. Esse é o GLM 5.2, e a distância entre "nenhum número de marketing" e "perto do topo de todas as tabelas de classificação independentes em uma semana" é justamente o que torna esse modelo tão interessante de entender. Escrevo muitos desses artigos explicativos, e a maioria das publicações sobre novos modelos é esquecível porque apenas repete uma ficha técnica. Este é diferente em um aspecto que realmente importa para desenvolvedores: os pesos são abertos sob uma licença MIT, então a pergunta habitual — "o benchmark é real ou é marketing?" — tem uma resposta particularmente clara. As pessoas baixaram o modelo e o testaram por conta própria. Veja o que é o GLM 5.2, como ele funciona e quais são seus limites.

Michael Johnson | 2026-07-15

Claude Fable 5: O Guia Completo e Análise Honesta (2026)

Claude Fable 5: O Guia Completo e Análise Honesta (2026)

A Anthropic passou meses alertando que seus modelos mais capazes estavam ficando perigosos demais para serem lançados amplamente. Então, em 9 de junho de 2026, lançou um mesmo assim — mais ou menos. Claude Fable 5 é o primeiro modelo do nível superior “Mythos” da Anthropic que o público pode realmente acessar, e está um nível completo acima da família Opus. A ressalva é incomum: em uma parcela de perguntas sensíveis, a versão pela qual você está pagando encaminhará silenciosamente sua solicitação para um modelo diferente e mais fraco, que responderá a partir daí. Essa única decisão de design revela grande parte do que torna o Fable 5 diferente, por isso é por onde este guia começa. Este é um guia prático para desenvolvedores, não um resumo do dia do lançamento. Reunimos as especificações e o comportamento a partir da própria documentação da Anthropic, de benchmarks independentes e dos primeiros testes práticos publicados desde o lançamento — e deixamos de fora os números que não pudemos verificar.

Schuyler Stacy | 2026-06-11