Dos modelos, dos filosofías
La mayoría de los análisis comparativos presentan estos dos modelos como si fueran el mismo producto con distintos precios. No lo son. DeepSeek lanzó V4 Pro el 24 de abril de 2026 bajo una licencia MIT, y es el especialista más profundo: un modelo de mezcla de expertos exclusivamente de texto, optimizado para programación agéntica y razonamiento STEM. MiniMax lanzó M3 el 1 de junio de 2026, y es el generalista más amplio: el primer modelo de pesos abiertos que combina programación de vanguardia, un contexto de un millón de tokens y entrada nativa de imágenes y vídeo en un mismo sistema.
Esa única diferencia —multimodal frente a solo texto— determina la elección más que cualquier benchmark. Por eso conviene decirlo claramente antes de empezar con las cifras: no estás eligiendo el «mejor modelo». Estás eligiendo qué tipo de modelo se adapta al trabajo. El resto de esta comparación trata de ayudarte a tomar esa decisión con datos reales, no con una captura de pantalla de una clasificación.
Comparativa: especificaciones y precio
Estos son los datos reales sobre el papel, usando las tarifas reales de GPT Proto por millón de tokens en lugar de una cifra llamativa de la publicación de lanzamiento de alguien.
| |
MiniMax M3 |
DeepSeek V4 Pro |
| Lanzamiento |
1 de junio de 2026 |
24 de abril de 2026 |
| Arquitectura |
MoE, 428B en total / 23B activos |
MoE, 1,6T en total / 49B activos |
| Diseño de atención |
MiniMax Sparse Attention (MSA) |
DeepSeek Sparse Attention (DSA) |
| Ventana de contexto |
1M tokens |
1M tokens (384K de salida máxima) |
| Modalidades de entrada |
texto, imagen, vídeo |
solo texto |
| Salida |
texto |
texto |
| Licencia / pesos |
Pesos abiertos (Hugging Face) |
MIT, pesos abiertos (Hugging Face) |
| Precio de entrada de GPT Proto |
$0.48 / 1M tokens |
$1.3914 / 1M tokens |
| Precio de salida de GPT Proto |
$0.96 / 1M tokens |
$2.7838 / 1M tokens |
Hay dos aspectos de esa tabla que importan más que el resto. M3 acepta entradas de imagen y vídeo; DeepSeek no. Y DeepSeek activa aproximadamente el doble de parámetros por token (49B frente a 23B) a partir de un conjunto total casi cuatro veces mayor: es el modelo más pesado y denso, que realiza más cómputo en cada token, algo que se refleja en sus puntuaciones de razonamiento profundo y, en la mayoría de los proveedores, en su precio.
Rendimiento en programación y tareas agénticas
Aquí es donde la comparación suele equivocarse, así que lee las cifras con atención.
DeepSeek V4 Pro, en su modo de razonamiento máximo, obtiene un 80,6 % en SWE-bench Verified —la cifra más alta de cualquier modelo de pesos abiertos, empatado con Gemini 3.1 Pro—. También consigue 93,5 en LiveCodeBench y una clasificación de 3206 en Codeforces. Son fortalezas algorítmicas y de programación competitiva, y las puntuaciones de DeepSeek han sido reproducidas en ejecuciones independientes, algo importante para la confianza.
Las cifras oficiales de programación de MiniMax M3 son 59,0 % en SWE-Bench Pro, 66,0 % en Terminal-Bench 2.1, 34,8 % en SWE-fficiency, 28,8 % en KernelBench Hard y 74,2 % en MCP Atlas. En el Intelligence Index independiente de Artificial Analysis —una puntuación entre modelos, no un benchmark del proveedor—, M3 alcanza 44, el segundo puesto del grupo de referencia que analiza, frente a una mediana de la categoría de aproximadamente 25.
Ahora viene la trampa. Verás una docena de páginas que colocan el «59 %» de M3 junto al «80,6 %» de DeepSeek y declaran a DeepSeek ganador indiscutible en programación. Esa comparación no es válida. SWE-bench Pro y SWE-bench Verified son dos benchmarks diferentes, con conjuntos de problemas y niveles de dificultad distintos; Pro es la variante más nueva y difícil. Comparar una puntuación Pro con una Verified no te dice nada sobre qué modelo es mejor: es un error de unidades disfrazado de conclusión. Los dos laboratorios simplemente informaron de benchmarks diferentes, y ninguno publicó una comparación directa limpia usando el mismo benchmark. Mi conclusión: en inteligencia general medida de forma independiente, están cerca; en las puntuaciones publicadas de razonamiento profundo y programación competitiva, las de DeepSeek son más altas y están mejor verificadas; en cualquier tarea que implique ver algo, la comparación ni siquiera empieza, porque M3 es el único que puede hacerlo.
La única capacidad en la que no hay empate
DeepSeek V4 Pro es exclusivamente de texto. MiniMax M3 se diseñó como multimodal desde el primer paso de entrenamiento y acepta imágenes y vídeo junto con texto en el mismo endpoint. No es una nota al pie de la ficha técnica: es una diferencia de categoría.
Si estás creando un agente que depura a partir de una captura de pantalla, convierte un diseño de Figma en un componente, lee un gráfico o observa una grabación de pantalla para encontrar un error, M3 puede hacerlo y DeepSeek no. No existe ningún prompt, precio ni ajuste fino que proporcione ojos a un modelo de solo texto. Por tanto, para cualquier flujo de trabajo en el que el modelo forme parte de lo que el usuario ve y con lo que interactúa —trabajo de UI, control de calidad visual, análisis de documentos con diagramas—, la elección está hecha antes de mirar un solo benchmark. Por el contrario, si nada de tu flujo de trabajo es una imagen, estás pagando por una capacidad que nunca utilizarás, y la especialización textual de DeepSeek es una compra mejor orientada.
El coste, sin rodeos
En GPT Proto, ejecutando ambos modelos con un mismo saldo, MiniMax M3 es el más barato: $0.48 de entrada y $0.96 de salida por millón de tokens, frente a $1.3914 y $2.7838 de DeepSeek V4 Pro. Con las tarifas de GPT Proto, M3 cuesta aproximadamente un tercio de V4 Pro por token, tanto en entrada como en salida.
Pero te estaría dando una impresión engañosa si terminara ahí, porque «cuál es más barato» depende mucho de dónde ejecutes cada modelo. La economía nativa de DeepSeek para V4 Pro es agresiva de una forma que no siempre se conserva al alojarlo en otro lugar: en la API propia de DeepSeek, el modelo aparece con unos $0.435 de entrada y $0.87 de salida por millón de tokens y —la parte que realmente reduce las facturas— un acierto de caché cuesta aproximadamente $0.003625 por millón, más de cien veces menos que un fallo de caché. Los bucles de programación agéntica vuelven a enviar el mismo prompt del sistema y el contexto de archivos en cada turno, por lo que la mayor parte de su entrada termina en la caché. Si procesas grandes volúmenes de texto puro y estás dispuesto a ejecutar DeepSeek de forma nativa, ese precio de caché es realmente difícil de superar y constituye el argumento individual más sólido a favor de V4 Pro.
Así que la lectura honesta del coste tiene dos capas. Con una única clave agregada a través de GPT Proto, M3 es el concepto de coste por token más bajo. Para un procesamiento de texto masivo y de gran volumen, optimizado en torno a la tarifa de caché nativa de DeepSeek, la economía de V4 Pro sale ganando. Y, por debajo de todo esto: el precio por token no es el precio por tarea. Un modelo que cuesta menos por token pero necesita tres intentos para producir un parche funcional no es la opción barata; simplemente ha trasladado el coste a tu tiempo de depuración. Evalúa ambos modelos con tus propias tareas antes de dejar que una tabla de precios tome la decisión.
Contexto y eficiencia
Ambos modelos funcionan con una ventana de contexto de 1 millón de tokens, y ambos lo consiguieron sustituyendo la atención densa estándar por un diseño disperso, aunque mediante rutas diferentes; la diferencia es real, no meramente estética.
La DSA de DeepSeek se apoya en una compresión intensa: en el contexto de 1 millón de tokens, V4 Pro necesita solo alrededor del 27 % del cómputo de inferencia de un solo token y el 10 % de la caché KV de su predecesor V3.2. La MSA de MiniMax, en cambio, selecciona bloques sobre valores clave sin comprimir; MiniMax sostiene que esto evita el coste de precisión que pagan los esquemas basados en compresión a larga distancia. Con un contexto de 1 millón, reduce el cómputo por token aproximadamente a 1/20 del modelo M2 anterior, con un prellenado más de 9× rápido y una decodificación más de 15× rápida. Este es un punto en el que señalaría que las afirmaciones están formuladas por los proveedores en ambos lados: cada laboratorio describe su propio enfoque como el que no presenta esa desventaja. Lo que sí podemos afirmar con seguridad es que ambos están diseñados específicamente para trabajar con contextos largos y que ambos son suficientemente baratos por token a esa escala como para que trabajar con un repositorio completo o un documento extenso sea práctico, no una aspiración.
Lo que la comunidad está examinando realmente
Si buscas reacciones a estos dos modelos —la búsqueda «MiniMax M3 vs DeepSeek V4 Pro reddit» que mucha gente hace antes de decidirse—, aparecen dos temas más que cualquier discusión sobre benchmarks, y ambos merecen tomarse en serio.
El primero es la verificación. Las puntuaciones de lanzamiento de M3 se obtuvieron en la propia infraestructura de MiniMax y con su propio sistema de agentes, algo normal en un lanzamiento, pero exactamente el tipo de circunstancia que los desarrolladores suelen descontar hasta que llegan cifras independientes. Esas cifras ya han empezado a llegar: los pesos abiertos de M3 se publicaron en Hugging Face el 7 de junio, y el índice independiente de Artificial Analysis corrobora ahora que es un modelo realmente de primer nivel, no un artefacto del día del benchmark. DeepSeek partía con ventaja en este aspecto: sus puntuaciones fueron reproducidas pronto por evaluadores independientes, y sus pesos con licencia MIT estuvieron disponibles desde el primer día para que cualquiera pudiera comprobarlos. Si el rendimiento verificado de forma independiente es un requisito indispensable, DeepSeek sigue teniendo una trayectoria más larga, aunque M3 ya ha cerrado gran parte de esa brecha.
El segundo es que «el más barato por token» y «el más barato para terminar el trabajo» son cifras distintas. Un modelo que escribe código plausible y no supera una prueba fallida no tiene un coste bajo; es un modelo que ha trasladado el coste a tu revisión. Por eso el consenso entre profesionales sigue llegando al mismo consejo: elige según el ajuste de capacidad y la fiabilidad en tu carga de trabajo, y deja que el precio por token deshaga los empates en lugar de tomar la decisión.
Ejecuta cualquiera de los dos con la misma clave
La ventaja práctica de llamar a ambos a través de GPT Proto es que cambiar de modelo requiere modificar una sola línea: la misma clave, el mismo formato de solicitud compatible con OpenAI y un string de modelo diferente. Aquí tienes una finalización de chat contra M3, con un cambio comentado a V4 Pro:
from openai import OpenAI
client = OpenAI(
api_key="sk-your-key-here", # one key reaches both models
base_url="https://gptproto.com/v1", # OpenAI-compatible gateway
)
def ask(model, prompt):
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
return resp.choices[0].message.content
# Text-only reasoning — either model handles this.
print(ask("deepseek-v4-pro", "Refactor this function for readability:\n<paste code>"))
# Image input — only M3 can take this; DeepSeek is text-only.
def ask_with_image(image_url, prompt):
resp = client.chat.completions.create(
model="MiniMax-M3",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": prompt},
{"type": "image_url", "image_url": {"url": image_url}},
],
}],
)
return resp.choices[0].message.content
print(ask_with_image(
"https://example.com/ui-bug-screenshot.png",
"This screen renders wrong on mobile. What's the likely CSS cause?",
))
La misma primera llamada en cURL:
curl https://gptproto.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-your-key-here" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "Refactor this function for readability."}
]
}'
Para trasladar un trabajo de texto de un modelo al otro, cambias un solo string: MiniMax-M3 o deepseek-v4-pro: la misma clave permite acceder a ambos y a más de 200 modelos adicionales con un único saldo. Si todavía no tienes una clave, crea una desde el panel de GPT Proto y consulta la página de precios para conocer la tarifa actual exacta de cada uno antes de ejecutar un lote.
¿Cuál deberías usar?
Si tu carga de trabajo es texto, código, registros y salidas estructuradas —agentes de backend, extracción de gran volumen, problemas algorítmicos de nivel competitivo—, utiliza DeepSeek V4 Pro. Tiene puntuaciones más altas de razonamiento profundo verificadas, una trayectoria independiente más sólida y una economía nativa que favorece el texto de gran volumen gracias a sus tarifas de caché.
Si algo de tu flujo de trabajo es una imagen o un vídeo —depuración de UI, conversión de diseño a código, control de calidad visual, documentos con muchos diagramas—, utiliza MiniMax M3, porque es el único de los dos que puede ver y, en GPT Proto, también es la opción más barata por token.
Y si estás construyendo algo real, la respuesta suele ser ambos: dirige los turnos de texto y razonamiento puro a V4 Pro, pasa los turnos visuales a M3 y ejecútalos con una única clave para no tener que mantener una segunda integración. «MiniMax M3 o DeepSeek V4 Pro» es el enfoque equivocado para la mayoría de los equipos: son especialistas en cosas diferentes y la configuración más potente utiliza cada uno donde destaca.