Tiffany Layne2026-07-01

MiniMax M3 vs DeepSeek V4 Pro: precios, benchmarks y cuál usar realmente

MiniMax M3 y DeepSeek V4 Pro comparados en precio, benchmarks y multimodalidad. Qué modelo chino de pesos abiertos usar realmente y la trampa de SWE-bench en la que caen la mayoría de las guías.

MiniMax M3 vs DeepSeek V4 Pro: precios, benchmarks y cuál usar realmente

TL;DR — Estos son los dos modelos chinos de pesos abiertos que todo el mundo está comparando ahora mismo, y la respuesta honesta es que apenas compiten. DeepSeek V4 Pro es un especialista algorítmico de texto puro: obtiene la puntuación más alta de cualquier modelo de pesos abiertos en SWE-bench Verified (80,6 %) y su economía nativa de tokens es difícil de superar, especialmente con aciertos de caché. MiniMax M3 es un generalista nativamente multimodal: lee imágenes y vídeo, no solo texto, y ocupa el segundo puesto en el índice de inteligencia entre modelos de Artificial Analysis. Si tu carga de trabajo es texto, código y registros, y te importa el coste por token, elige DeepSeek V4 Pro.

Si tu agente necesita mirar una captura de pantalla, un diseño o una grabación de pantalla, elige M3: DeepSeek no puede hacerlo a ningún precio. Ambos se ofrecen ahora con pesos abiertos y ambos funcionan con una ventana de contexto de 1 millón de tokens, así que esta no es la lucha de «uno tiene que perder» que presentan la mayoría de las páginas comparativas.

 

Tabla de contenido

Dos modelos, dos filosofías

La mayoría de los análisis comparativos presentan estos dos modelos como si fueran el mismo producto con distintos precios. No lo son. DeepSeek lanzó V4 Pro el 24 de abril de 2026 bajo una licencia MIT, y es el especialista más profundo: un modelo de mezcla de expertos exclusivamente de texto, optimizado para programación agéntica y razonamiento STEM. MiniMax lanzó M3 el 1 de junio de 2026, y es el generalista más amplio: el primer modelo de pesos abiertos que combina programación de vanguardia, un contexto de un millón de tokens y entrada nativa de imágenes y vídeo en un mismo sistema.

Esa única diferencia —multimodal frente a solo texto— determina la elección más que cualquier benchmark. Por eso conviene decirlo claramente antes de empezar con las cifras: no estás eligiendo el «mejor modelo». Estás eligiendo qué tipo de modelo se adapta al trabajo. El resto de esta comparación trata de ayudarte a tomar esa decisión con datos reales, no con una captura de pantalla de una clasificación.

Comparativa: especificaciones y precio

Estos son los datos reales sobre el papel, usando las tarifas reales de GPT Proto por millón de tokens en lugar de una cifra llamativa de la publicación de lanzamiento de alguien.

  MiniMax M3 DeepSeek V4 Pro
Lanzamiento 1 de junio de 2026 24 de abril de 2026
Arquitectura MoE, 428B en total / 23B activos MoE, 1,6T en total / 49B activos
Diseño de atención MiniMax Sparse Attention (MSA) DeepSeek Sparse Attention (DSA)
Ventana de contexto 1M tokens 1M tokens (384K de salida máxima)
Modalidades de entrada texto, imagen, vídeo solo texto
Salida texto texto
Licencia / pesos Pesos abiertos (Hugging Face) MIT, pesos abiertos (Hugging Face)
Precio de entrada de GPT Proto $0.48 / 1M tokens $1.3914 / 1M tokens
Precio de salida de GPT Proto $0.96 / 1M tokens $2.7838 / 1M tokens

Hay dos aspectos de esa tabla que importan más que el resto. M3 acepta entradas de imagen y vídeo; DeepSeek no. Y DeepSeek activa aproximadamente el doble de parámetros por token (49B frente a 23B) a partir de un conjunto total casi cuatro veces mayor: es el modelo más pesado y denso, que realiza más cómputo en cada token, algo que se refleja en sus puntuaciones de razonamiento profundo y, en la mayoría de los proveedores, en su precio.

Rendimiento en programación y tareas agénticas

Aquí es donde la comparación suele equivocarse, así que lee las cifras con atención.

DeepSeek V4 Pro, en su modo de razonamiento máximo, obtiene un 80,6 % en SWE-bench Verified —la cifra más alta de cualquier modelo de pesos abiertos, empatado con Gemini 3.1 Pro—. También consigue 93,5 en LiveCodeBench y una clasificación de 3206 en Codeforces. Son fortalezas algorítmicas y de programación competitiva, y las puntuaciones de DeepSeek han sido reproducidas en ejecuciones independientes, algo importante para la confianza.

Las cifras oficiales de programación de MiniMax M3 son 59,0 % en SWE-Bench Pro, 66,0 % en Terminal-Bench 2.1, 34,8 % en SWE-fficiency, 28,8 % en KernelBench Hard y 74,2 % en MCP Atlas. En el Intelligence Index independiente de Artificial Analysis —una puntuación entre modelos, no un benchmark del proveedor—, M3 alcanza 44, el segundo puesto del grupo de referencia que analiza, frente a una mediana de la categoría de aproximadamente 25.

Ahora viene la trampa. Verás una docena de páginas que colocan el «59 %» de M3 junto al «80,6 %» de DeepSeek y declaran a DeepSeek ganador indiscutible en programación. Esa comparación no es válida. SWE-bench Pro y SWE-bench Verified son dos benchmarks diferentes, con conjuntos de problemas y niveles de dificultad distintos; Pro es la variante más nueva y difícil. Comparar una puntuación Pro con una Verified no te dice nada sobre qué modelo es mejor: es un error de unidades disfrazado de conclusión. Los dos laboratorios simplemente informaron de benchmarks diferentes, y ninguno publicó una comparación directa limpia usando el mismo benchmark. Mi conclusión: en inteligencia general medida de forma independiente, están cerca; en las puntuaciones publicadas de razonamiento profundo y programación competitiva, las de DeepSeek son más altas y están mejor verificadas; en cualquier tarea que implique ver algo, la comparación ni siquiera empieza, porque M3 es el único que puede hacerlo.

La única capacidad en la que no hay empate

DeepSeek V4 Pro es exclusivamente de texto. MiniMax M3 se diseñó como multimodal desde el primer paso de entrenamiento y acepta imágenes y vídeo junto con texto en el mismo endpoint. No es una nota al pie de la ficha técnica: es una diferencia de categoría.

Si estás creando un agente que depura a partir de una captura de pantalla, convierte un diseño de Figma en un componente, lee un gráfico o observa una grabación de pantalla para encontrar un error, M3 puede hacerlo y DeepSeek no. No existe ningún prompt, precio ni ajuste fino que proporcione ojos a un modelo de solo texto. Por tanto, para cualquier flujo de trabajo en el que el modelo forme parte de lo que el usuario ve y con lo que interactúa —trabajo de UI, control de calidad visual, análisis de documentos con diagramas—, la elección está hecha antes de mirar un solo benchmark. Por el contrario, si nada de tu flujo de trabajo es una imagen, estás pagando por una capacidad que nunca utilizarás, y la especialización textual de DeepSeek es una compra mejor orientada.

El coste, sin rodeos

En GPT Proto, ejecutando ambos modelos con un mismo saldo, MiniMax M3 es el más barato: $0.48 de entrada y $0.96 de salida por millón de tokens, frente a $1.3914 y $2.7838 de DeepSeek V4 Pro. Con las tarifas de GPT Proto, M3 cuesta aproximadamente un tercio de V4 Pro por token, tanto en entrada como en salida.

Pero te estaría dando una impresión engañosa si terminara ahí, porque «cuál es más barato» depende mucho de dónde ejecutes cada modelo. La economía nativa de DeepSeek para V4 Pro es agresiva de una forma que no siempre se conserva al alojarlo en otro lugar: en la API propia de DeepSeek, el modelo aparece con unos $0.435 de entrada y $0.87 de salida por millón de tokens y —la parte que realmente reduce las facturas— un acierto de caché cuesta aproximadamente $0.003625 por millón, más de cien veces menos que un fallo de caché. Los bucles de programación agéntica vuelven a enviar el mismo prompt del sistema y el contexto de archivos en cada turno, por lo que la mayor parte de su entrada termina en la caché. Si procesas grandes volúmenes de texto puro y estás dispuesto a ejecutar DeepSeek de forma nativa, ese precio de caché es realmente difícil de superar y constituye el argumento individual más sólido a favor de V4 Pro.

Así que la lectura honesta del coste tiene dos capas. Con una única clave agregada a través de GPT Proto, M3 es el concepto de coste por token más bajo. Para un procesamiento de texto masivo y de gran volumen, optimizado en torno a la tarifa de caché nativa de DeepSeek, la economía de V4 Pro sale ganando. Y, por debajo de todo esto: el precio por token no es el precio por tarea. Un modelo que cuesta menos por token pero necesita tres intentos para producir un parche funcional no es la opción barata; simplemente ha trasladado el coste a tu tiempo de depuración. Evalúa ambos modelos con tus propias tareas antes de dejar que una tabla de precios tome la decisión.

Contexto y eficiencia

Ambos modelos funcionan con una ventana de contexto de 1 millón de tokens, y ambos lo consiguieron sustituyendo la atención densa estándar por un diseño disperso, aunque mediante rutas diferentes; la diferencia es real, no meramente estética.

La DSA de DeepSeek se apoya en una compresión intensa: en el contexto de 1 millón de tokens, V4 Pro necesita solo alrededor del 27 % del cómputo de inferencia de un solo token y el 10 % de la caché KV de su predecesor V3.2. La MSA de MiniMax, en cambio, selecciona bloques sobre valores clave sin comprimir; MiniMax sostiene que esto evita el coste de precisión que pagan los esquemas basados en compresión a larga distancia. Con un contexto de 1 millón, reduce el cómputo por token aproximadamente a 1/20 del modelo M2 anterior, con un prellenado más de 9× rápido y una decodificación más de 15× rápida. Este es un punto en el que señalaría que las afirmaciones están formuladas por los proveedores en ambos lados: cada laboratorio describe su propio enfoque como el que no presenta esa desventaja. Lo que sí podemos afirmar con seguridad es que ambos están diseñados específicamente para trabajar con contextos largos y que ambos son suficientemente baratos por token a esa escala como para que trabajar con un repositorio completo o un documento extenso sea práctico, no una aspiración.

Lo que la comunidad está examinando realmente

Si buscas reacciones a estos dos modelos —la búsqueda «MiniMax M3 vs DeepSeek V4 Pro reddit» que mucha gente hace antes de decidirse—, aparecen dos temas más que cualquier discusión sobre benchmarks, y ambos merecen tomarse en serio.

El primero es la verificación. Las puntuaciones de lanzamiento de M3 se obtuvieron en la propia infraestructura de MiniMax y con su propio sistema de agentes, algo normal en un lanzamiento, pero exactamente el tipo de circunstancia que los desarrolladores suelen descontar hasta que llegan cifras independientes. Esas cifras ya han empezado a llegar: los pesos abiertos de M3 se publicaron en Hugging Face el 7 de junio, y el índice independiente de Artificial Analysis corrobora ahora que es un modelo realmente de primer nivel, no un artefacto del día del benchmark. DeepSeek partía con ventaja en este aspecto: sus puntuaciones fueron reproducidas pronto por evaluadores independientes, y sus pesos con licencia MIT estuvieron disponibles desde el primer día para que cualquiera pudiera comprobarlos. Si el rendimiento verificado de forma independiente es un requisito indispensable, DeepSeek sigue teniendo una trayectoria más larga, aunque M3 ya ha cerrado gran parte de esa brecha.

El segundo es que «el más barato por token» y «el más barato para terminar el trabajo» son cifras distintas. Un modelo que escribe código plausible y no supera una prueba fallida no tiene un coste bajo; es un modelo que ha trasladado el coste a tu revisión. Por eso el consenso entre profesionales sigue llegando al mismo consejo: elige según el ajuste de capacidad y la fiabilidad en tu carga de trabajo, y deja que el precio por token deshaga los empates en lugar de tomar la decisión.

Ejecuta cualquiera de los dos con la misma clave

La ventaja práctica de llamar a ambos a través de GPT Proto es que cambiar de modelo requiere modificar una sola línea: la misma clave, el mismo formato de solicitud compatible con OpenAI y un string de modelo diferente. Aquí tienes una finalización de chat contra M3, con un cambio comentado a V4 Pro:

from openai import OpenAI

client = OpenAI(
    api_key="sk-your-key-here",           # one key reaches both models
    base_url="https://gptproto.com/v1",   # OpenAI-compatible gateway
)

def ask(model, prompt):
    resp = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
    )
    return resp.choices[0].message.content

# Text-only reasoning — either model handles this.
print(ask("deepseek-v4-pro", "Refactor this function for readability:\n<paste code>"))

# Image input — only M3 can take this; DeepSeek is text-only.
def ask_with_image(image_url, prompt):
    resp = client.chat.completions.create(
        model="MiniMax-M3",
        messages=[{
            "role": "user",
            "content": [
                {"type": "text", "text": prompt},
                {"type": "image_url", "image_url": {"url": image_url}},
            ],
        }],
    )
    return resp.choices[0].message.content

print(ask_with_image(
    "https://example.com/ui-bug-screenshot.png",
    "This screen renders wrong on mobile. What's the likely CSS cause?",
))

La misma primera llamada en cURL:

curl https://gptproto.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-your-key-here" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "Refactor this function for readability."}
    ]
  }'

Para trasladar un trabajo de texto de un modelo al otro, cambias un solo string: MiniMax-M3 o deepseek-v4-pro: la misma clave permite acceder a ambos y a más de 200 modelos adicionales con un único saldo. Si todavía no tienes una clave, crea una desde el panel de GPT Proto y consulta la página de precios para conocer la tarifa actual exacta de cada uno antes de ejecutar un lote.

¿Cuál deberías usar?

Si tu carga de trabajo es texto, código, registros y salidas estructuradas —agentes de backend, extracción de gran volumen, problemas algorítmicos de nivel competitivo—, utiliza DeepSeek V4 Pro. Tiene puntuaciones más altas de razonamiento profundo verificadas, una trayectoria independiente más sólida y una economía nativa que favorece el texto de gran volumen gracias a sus tarifas de caché.

Si algo de tu flujo de trabajo es una imagen o un vídeo —depuración de UI, conversión de diseño a código, control de calidad visual, documentos con muchos diagramas—, utiliza MiniMax M3, porque es el único de los dos que puede ver y, en GPT Proto, también es la opción más barata por token.

Y si estás construyendo algo real, la respuesta suele ser ambos: dirige los turnos de texto y razonamiento puro a V4 Pro, pasa los turnos visuales a M3 y ejecútalos con una única clave para no tener que mantener una segunda integración. «MiniMax M3 o DeepSeek V4 Pro» es el enfoque equivocado para la mayoría de los equipos: son especialistas en cosas diferentes y la configuración más potente utiliza cada uno donde destaca.

 

Creative Studio

Genera imágenes, videos y más con APIs de producción.

Comenzar a crear
Creative Studio
Modelos relacionados
Todos los modelos
MiniMax
20% OFF
DeepSeek
20% OFF
Claude
20% OFF
Google
40% OFF

Preguntas frecuentes

¿Cuál es la principal diferencia entre MiniMax M3 y DeepSeek V4 Pro?

La forma de sus capacidades. M3 es nativamente multimodal —acepta texto, imagen y vídeo—, mientras que DeepSeek V4 Pro solo admite texto, pero es un especialista algorítmico y de razonamiento más profundo. Ambos son modelos MoE chinos de pesos abiertos con ventanas de contexto de 1 millón de tokens.

¿Es DeepSeek V4 Pro mejor que MiniMax M3 para programar?

En puntuaciones publicadas y verificadas de forma independiente, como SWE-bench Verified (80,6 %) y LiveCodeBench (93,5), DeepSeek V4 Pro lidera en programación basada en texto y algorítmica. Sin embargo, la comparación que se repite con frecuencia entre el 59 % de M3 en SWE-bench Pro y el 80,6 % de DeepSeek en Verified no es válida: son benchmarks diferentes. Para programar con capturas de pantalla o UI, M3 gana por defecto, ya que DeepSeek no puede procesar imágenes.

¿Cuál es más barato?

En GPTProto, MiniMax M3 ($0.48 de entrada / $0.96 de salida por 1M de tokens) es más barato que DeepSeek V4 Pro ($1.3914 / $2.7838). En la API nativa de DeepSeek, las tarifas publicadas y de aciertos de caché de V4 Pro son más bajas, lo que favorece el uso de texto puro de gran volumen. El precio por token no equivale al coste por tarea: prueba ambos con tu propia carga de trabajo.

¿Cómo se comparan estos modelos chinos con modelos cerrados como GPT-5.5 o Claude Opus?

Ambos se presentan como alternativas de pesos abiertos a una fracción del coste por token de los modelos cerrados. La puntuación de DeepSeek V4 Pro en SWE-bench Verified empata con Gemini 3.1 Pro entre los modelos de primer nivel, y MiniMax M3 ocupa el segundo puesto en el índice de inteligencia independiente de Artificial Analysis dentro de su grupo de referencia. Los pesos abiertos y el precio más bajo son el intercambio frente al ecosistema más amplio de los modelos cerrados.

¿Puedo ejecutar ambos sin tener cuentas separadas?

Sí. A través de GPTProto, una única clave de API y un endpoint compatible con OpenAI permiten acceder tanto a MiniMax M3 como a DeepSeek V4 Pro con un único saldo; cambiar de modelo requiere modificar una sola línea.

Artículos relacionados

Más blogs
API de Doubao: la guía completa (2026): qué modelo usar y cómo

API de Doubao: la guía completa (2026): qué modelo usar y cómo

Busca «doubao api» y enseguida te encuentras con un muro. La consola oficial es Volcano Engine, las páginas aparecen en chino por defecto y el registro solicita una verificación de identidad que la mayoría de los desarrolladores fuera de China no puede completar en una tarde. Luego está el problema de los nombres. Doubao, Dola, Cici, Seed, Seedream, Seedance, Volcengine: todos son de ByteDance, y ninguno parece claramente ser aquello que escribiste en el buscador. Escribo guías de integración para GPTProto, y Doubao es la familia de modelos por la que más me preguntan. Así que esta es la guía que me habría gustado encontrar: qué modelo de Doubao sirve para cada tarea, cuánto cuesta realmente cada uno y código listo para copiar y pegar que los invoque —texto, imagen y vídeo— desde un único endpoint, sin necesidad de un número de teléfono chino. Aquí tienes un fotograma producido por el modelo de vídeo Seedance 2.0 a partir de un prompt de texto, invocado mediante la API exactamente como se muestra en el código más adelante. Vamos a llegar hasta él.

Schuyler Stacy | 2026-06-23

Cómo usar Kling 3.0 Motion Control: guía para desarrolladores (Web + API)

Cómo usar Kling 3.0 Motion Control: guía para desarrolladores (Web + API)

Kling 3.0 Motion Control animates a static character image with the movement from a reference video. You give it two inputs — a picture of your character and a video of someone moving — and it returns a new clip where your character performs that exact choreography while keeping their own face, outfit, and look. This is motion transfer, not text-to-motion. Instead of describing an action in a prompt and hoping the model interprets it, you show it the action frame by frame. That makes it far more reliable for repeatable character animation, dance, and gesture work. This guide covers both paths: the Kling web app for one-off clips, and the GPTProto API for wiring Motion Control into a pipeline. We'll cover inputs and limits, the `pro` vs `std` tiers, prompt technique, full runnable code, pricing, and the failure modes worth knowing before you spend credits.

Michael Johnson | 2026-06-30

¿Qué es GLM 5.2? Código con pesos abiertos a 1/6 del precio

¿Qué es GLM 5.2? Código con pesos abiertos a 1/6 del precio

Un laboratorio chino lanzó un modelo que puedes descargar gratis, ejecutar en tu propio hardware y cuyo precio es aproximadamente una sexta parte de lo que cobran los modelos de frontera cerrados; y que queda solo unos puntos por detrás de Claude Opus 4.8 en benchmarks reales de programación. Después lanzó el modelo sin publicar un solo benchmark oficial propio. Eso es GLM 5.2, y la brecha entre «sin cifras de marketing» y «casi en la cima de todas las clasificaciones independientes en una semana» es gran parte de lo que hace que valga la pena entenderlo. Escribo muchos de estos análisis, y la mayoría de las publicaciones sobre modelos nuevos se olvidan rápido porque simplemente repiten una ficha técnica. Esta es diferente en un aspecto que realmente importa a los desarrolladores: los pesos son abiertos bajo una licencia MIT, así que la pregunta habitual —«¿el benchmark es real o es marketing?»— tiene una respuesta inusualmente clara. La gente lo descargó y lo probó por sí misma. Esto es GLM 5.2, así es como funciona y estos son sus límites.

Michael Johnson | 2026-07-15

Claude Fable 5: guía completa y reseña honesta (2026)

Claude Fable 5: guía completa y reseña honesta (2026)

Anthropic pasó meses advirtiendo que sus modelos más capaces se estaban volviendo demasiado peligrosos para lanzarlos de forma generalizada. Después, el 9 de junio de 2026, lanzó uno de todos modos — más o menos. Claude Fable 5 es el primer modelo del nivel superior «Mythos» de Anthropic al que el público realmente puede acceder, y se encuentra un nivel completo por encima de la familia Opus. El detalle inusual es el siguiente: ante una parte de las preguntas delicadas, la versión por la que estás pagando enviará discretamente tu solicitud a un modelo diferente y más débil, que será el encargado de responder. Esa única decisión de diseño explica gran parte de lo que hace diferente a Fable 5, así que es por ahí por donde comienza esta guía. Esta es una guía práctica para desarrolladores, no un resumen del día del lanzamiento. Hemos recopilado las especificaciones y el comportamiento a partir de la documentación de Anthropic, los benchmarks independientes y las primeras pruebas prácticas publicadas desde el lanzamiento — y hemos dejado fuera las cifras que no pudimos verificar.

Schuyler Stacy | 2026-06-11