Schuyler Stacy2026-07-02

MiniMax M3 para programación: benchmarks, precios reales y cómo llamarlo mediante API (2026)

¿Es MiniMax M3 bueno para programar? Benchmarks independientes frente a afirmaciones del proveedor, el coste real de la API con su salto de precio de 512K explicado y código ejecutable de GPTProto.

MiniMax M3 para programación: benchmarks, precios reales y cómo llamarlo mediante API (2026)

¿Es MiniMax M3 bueno para programar? La respuesta corta: sí, para trabajo agéntico y con varios archivos, con dos salvedades que expondré claramente antes de que sigas leyendo. La mayoría de las puntuaciones destacadas de programación fueron obtenidas por MiniMax en su propia infraestructura, y el «contexto de 1 millón de tokens» tiene un salto de precio a partir de 512K que afecta especialmente a los agentes de programación. Ambos aspectos son manejables cuando sabes que existen. Ninguno aparece claramente en la mayoría de la cobertura del lanzamiento.

Escribo esto porque el argumento de programación en torno a M3 se redujo a una sola cifra — 59 % en SWE-Bench Pro — y esa cifra está haciendo mucho trabajo no examinado. A continuación explico qué es realmente el modelo, dónde se sitúan las mediciones independientes, cuánto cuesta en una carga de trabajo de programación real y cómo llamarlo mediante la API de GPTProto. Si solo quieres un veredicto: un evaluador independiente que ejecuta la misma batería en todos los modelos importantes situó a M3 «cerca de GPT y Opus en programación real, pero no por encima de ellos». Eso también coincide con la posición de los benchmarks neutrales.

Tabla de contenido

Qué es MiniMax M3 desde la perspectiva de la programación

M3 se lanzó el 1 de junio de 2026. Es un modelo de mezcla de expertos (Mixture-of-Experts) — los rastreadores de la comunidad que analizaron el checkpoint publicado lo sitúan en aproximadamente 428.000 millones de parámetros totales, con unos 23.000 millones activos por token, aunque MiniMax no ha publicado por sí misma un desglose completo de parámetros, así que considera esas cifras exactas como secundarias. Es multimodal de forma nativa (recibe texto, imágenes y vídeo; genera texto) y es un modelo de razonamiento con un modo de pensamiento que puedes activar o desactivar en cada solicitud.

Antes del mecanismo, la motivación: ¿por qué debería importarle la longitud del contexto a un modelo de programación? Porque el trabajo de ingeniería real no consiste en un solo archivo. Consiste en un repositorio, un rastreo de pila, la salida de las pruebas y los tres archivos que tendrías que modificar para arreglar el problema — todo en un mismo lugar durante el tiempo suficiente para razonar sobre ello. La respuesta de M3 es una ventana de contexto de 1 millón de tokens, con un mínimo utilizable garantizado de 512K tokens. El motor subyacente es MiniMax Sparse Attention (MSA), que selecciona bloques de la caché de clave-valor en lugar de prestar atención a cada par de tokens. MiniMax informa de que, con 1 millón de tokens, esto reduce el cálculo por token a aproximadamente una vigésima parte del de la generación anterior, con un prellenado unas 9 veces más rápido y una decodificación 15 veces más rápida. Son cifras del proveedor sobre la arquitectura, no mediciones independientes, pero la dirección coincide con lo que se espera que proporcione la atención dispersa.

También existe una superficie de programación propia: MiniMax Code, su propio agente basado en el modelo. Es útil saber que existe, pero no es el tema de este artículo, ya que estás aquí para llamar al modelo desde tu propio código.

Quédate con esta idea: M3 está diseñado para trabajo sostenido y de varios pasos a través de un contexto amplio, no para fragmentos de código de una sola acción. Ese enfoque explica prácticamente todas las ventajas y desventajas que aparecen a continuación.

Los benchmarks de programación: lo que informa MiniMax frente a lo que se mide de forma independiente

Esta es la división que la mayoría de los análisis simplifica en exceso. A la izquierda, las puntuaciones de programación y de trabajo agéntico que informa la propia MiniMax. A la derecha, lo que midió un tercero neutral.

Fuente Métrica Puntuación
MiniMax (ejecutado por el proveedor, infraestructura propia, estructura de Claude Code) SWE-Bench Pro 59.0%
MiniMax SWE-Bench Verified 80.5%
MiniMax Terminal-Bench 2.1 66.0%
MiniMax SWE-fficiency 34.8%
MiniMax KernelBench Hard 28.8%
MiniMax MCP Atlas (orquestación de herramientas) 74.2%
Artificial Analysis (independiente) Índice de inteligencia (compuesto) 55 — n.º 1 en su clase de modelos con pesos abiertos

Hay dos cosas que la tabla del proveedor no te contará. Primero, aquí importa más de lo habitual que estas pruebas sean ejecutadas por el proveedor: la cifra de SWE-Bench Pro se obtuvo en la propia configuración de MiniMax usando Claude Code como arnés, y la replicación independiente aún está poniéndose al día. Considera el 59 % una señal sólida del nivel en el que compite M3, no un resultado definitivo. Segundo — y este es el detalle que no he visto en un solo artículo centrado en programación — cuando Artificial Analysis desglosó M3 frente a su predecesor, la mayoría de las evaluaciones mejoraron (Humanity's Last Exam 28→37, GPQA Diamond 87→93, razonamiento con contexto largo 69→74), pero SciCode, la evaluación de programación de ese conjunto, bajó ligeramente de 47 a 45. Es una pequeña regresión y no le daría demasiada importancia. Pero es el único dato que complica la historia sencilla de «mucho mejor programando», y resulta revelador que no se mencionara en ningún sitio.

Mi lectura: M3 está realmente cerca de la frontera en ingeniería de software aplicada — escribir parches, editar varios archivos y trabajar en la terminal — y el respaldo del índice independiente (55, el primero de su clase) es real, no marketing. No supone un salto cualitativo respecto a la generación anterior en todos los ejes de programación, y la brecha en razonamiento abstracto existe (hablaremos de ello más adelante). Conclusión: confía en el nivel, pero verifica la cifra exacta con tus propias tareas.

Lo que cuesta realmente en una carga de trabajo de programación

Primero el precio anunciado, porque la comparación honesta no es la que verás en la mayoría de las publicaciones. A través de la página del modelo de GPT Proto, M3 cuesta 0,48 $ por millón de tokens de entrada y 0,96 $ por millón de tokens de salida en el nivel estándar.

Como referencia, la tarifa efectiva de MiniMax — después del descuento permanente del 50 % que aplica al precio de lista — es de aproximadamente 0,30 $ para la entrada y 1,20 $ para la salida. Así que hay que ser precisos con la comparación en lugar de limitarse a decir «más barato»: mediante GPT Proto, la entrada cuesta más que si llamas directamente a MiniMax, mientras que la salida cuesta menos. Cuál resulta más conveniente depende por completo de la proporción entre lectura y escritura de tu carga de trabajo. Un agente de programación que ingiere un repositorio grande y emite un diff pequeño consume sobre todo entrada, por lo que domina la tarifa de entrada; un trabajo centrado en la generación se inclina en la otra dirección. El motivo para enrutar M3 mediante un agregador no es un descuento llamativo — es operativo: una sola clave y una superficie compatible con OpenAI para M3 junto con el resto del catálogo, en lugar de configurar una cuenta de MiniMax independiente, un endpoint regional y una clave de suscripción aparte.

Ahora viene la parte que realmente determina las facturas de programación y la razón por la que «contexto de 1M» merece un asterisco. El precio es fijo solo hasta 512K tokens de entrada. Si superas ese límite, toda la solicitud — entrada, salida y lecturas de caché — se factura al doble. Es una función escalonada, no gradual. Piensa en un ciclo normal de agente: comienzas con 400K tokens de entrada y 100K de salida, cómodamente por debajo del límite. Pero los ciclos de agente acumulan contenido. En el turno diez o quince no se ha eliminado nada, y un turno supera silenciosamente los 512K; en ese momento, todo ese turno se factura al doble, no solo los tokens que superan el umbral. Un aumento del 20 % en la entrada puede más que duplicar el coste de una llamada.

La palanca que compensa esto es la caché: las entradas repetidas (tu prompt de sistema y las partes estables del código base) se leen a una fracción de la tarifa estándar. En los ciclos de agente, una gran parte de la entrada se puede almacenar en caché, así que conviene configurarlo desde el principio. Conclusión: en M3, tu factura de programación la determina cuánto contexto arrastras y lo bien que lo almacenas en caché, no la cifra por token de la tarjeta de precios. Presupuesta la carga de trabajo, no el precio anunciado.

Cómo llamar a M3 mediante la API de GPT Proto

El endpoint es la superficie de chat compatible con OpenAI. La autenticación utiliza una clave de API sin procesar en el encabezado Authorization — sin el prefijo Bearer, algo que suele confundir a quienes vienen de otros proveedores. Cambia la cadena del modelo a MiniMax-M3 y podrás ejecutarlo.

import requests, json, glob
 
# Reúne algunos archivos fuente en un único prompt de contexto largo.
# El mínimo de M3 es de 512K tokens, por lo que una docena de archivos cabe sin alcanzar el salto de precio.
files = glob.glob("src/**/*.py", recursive=True)[:20]
codebase = "\n\n".join(f"# ---- {p} ----\n{open(p).read()}" for p in files)
 
prompt = (
    "Aquí tienes parte de un servicio de Python. Encuentra todos los lugares donde una conexión a la base de datos "
    "pueda quedar abierta en una ruta de excepción y devuelve la solución como un diff unificado.\n\n"
    + codebase
)
 
resp = requests.post(
    "https://gptproto.com/v1/chat/completions",
    headers={
        "Authorization": "sk-your-gptproto-key",  # clave sin procesar, SIN prefijo "Bearer"
        "Content-Type": "application/json",
    },
    data=json.dumps({
        "model": "MiniMax-M3",
        "messages": [{"role": "user", "content": prompt}],
        "temperature": 0.2,   # el valor predeterminado es 0.95 — redúcelo para obtener ediciones de código deterministas
        "stream": False,
    }),
    timeout=120,
)
 
print(resp.json()["choices"][0]["message"]["content"])

Dos notas prácticas. La temperature predeterminada en esta superficie es 0.95, una cifra alta para código; yo la reduciría a 0.2 o menos cuando quieras diffs reproducibles en lugar de variaciones creativas. Y una aclaración: este endpoint y el patrón de autenticación con clave sin procesar están confirmados en la documentación activa del modelo MiniMax de GPT Proto, con la cadena del modelo cambiada a MiniMax-M3; no he probado personalmente esta llamada exacta contra M3, así que ejecuta una solicitud real y confirma la estructura de la respuesta antes de integrarla en CI.

«Admite 1M» no significa «debería ejecutarse con 1M»

Conviene separar dos afirmaciones que suelen confundirse. M3 admite una ventana de 1 millón de tokens. Si deberías llenarla es otra cuestión y, para programación, la respuesta normalmente es no. Los modelos de contexto largo tienen una tendencia documentada a prestar buena atención al principio y al final de un prompt y a perder elementos enterrados en el centro; MiniMax afirma que M3 se entrenó específicamente para evitar esto, y los primeros informes sugieren que la recuperación se mantiene en la mayor parte de la ventana, pero «la mayor parte» cumple una función importante en esa frase y yo lo verificaría en el extremo final con tus propias tareas sensibles a la recuperación. Si a eso le sumas el salto de precio de 512K, la recomendación resulta evidente: utiliza el contexto largo de forma deliberada — razonar sobre un repositorio completo cuando realmente necesites consciencia entre archivos — y no como un vertedero predeterminado para cada archivo que tengas por ahí.

M3 frente a DeepSeek V4 Pro para programación

Si estás eligiendo entre estos dos modelos chinos de pesos abiertos y clase frontera para programar, el eje de decisión es claro. M3 ofrece multimodalidad nativa y una ventana de 1M — puede recibir una captura de pantalla de una interfaz rota junto con el código. DeepSeek V4 Pro solo admite texto y tiene un precio más bajo, además de destacar en los conjuntos verificados de ingeniería de software. Mi resumen aproximado: elige M3 cuando la entrada multimodal o un contexto muy largo justifiquen su coste, y DeepSeek cuando quieras el programador de texto puro competente más barato y no necesites visión. Las cifras de la comparación directa merecen un tratamiento propio, así que aquí me he limitado al eje de decisión y he incluido la comparación detallada en MiniMax M3 frente a DeepSeek V4 Pro.

Quién debería usar M3 para programar y quién no

Úsalo si tu trabajo es agéntico y con varios archivos: parches en un código base, tareas controladas desde la terminal, sesiones largas de depuración en las que el historial importa o flujos de trabajo en los que devolver una captura de pantalla de la interfaz al modelo resulte realmente útil. Ese es el perfil para el que se entrenó M3, y se nota.

Evítalo, o al menos pruébalo a fondo primero, en tres casos. Si necesitas el programador de texto puro absolutamente más barato y nunca trabajas con imágenes ni con contextos enormes, un modelo de texto más ligero costará menos por token. Si tu problema requiere un razonamiento abstracto genuinamente novedoso en lugar de una ejecución competente — el evaluador independiente al que le gustó la programación aplicada de M3 también señaló que queda por detrás en los benchmarks de razonamiento abstracto — M3 no destaca ahí. Y si tu plan es alojar los pesos por tu cuenta para uso comercial, lee la licencia antes de comprometerte: M3 se distribuye bajo la MiniMax Community License, más restrictiva que las condiciones MIT o Apache que utilizan algunos competidores, y su condición de modelo con pesos abiertos ha cambiado desde el lanzamiento. Para utilizar la API mediante la página del modelo, ninguna de esas restricciones de licencia se aplica: estás alquilando acceso, no redistribuyendo pesos.

Creative Studio

Genera imágenes, videos y más con APIs de producción.

Comenzar a crear
Creative Studio
Modelos relacionados
Todos los modelos
MiniMax
20% OFF
DeepSeek
20% OFF
Claude
20% OFF
Google
40% OFF

Preguntas frecuentes

¿Es MiniMax M3 bueno para programar?

Para programación agéntica, con varios archivos y contexto largo, sí: se sitúa en la cima de su clase de modelos con pesos abiertos en el índice independiente de Artificial Analysis y cerca de la frontera cerrada en tareas aplicadas de ingeniería de software. Es menos adecuado para problemas de razonamiento abstracto y para las cargas de trabajo de texto puro más económicas.

¿Cuánto cuesta M3 mediante la API?

Mediante GPTProto, 0,48 $ por millón de tokens de entrada y 0,96 $ por millón de tokens de salida en el nivel estándar. Vigila el umbral de 512K: las solicitudes que lo superan se facturan al doble en toda la llamada. Consulta las tarifas actuales en la página del modelo.

¿Hay alguna forma gratuita de probar M3?

MiniMax ha ofrecido créditos de prueba directamente; la disponibilidad y cualquier acceso promocional cambian con frecuencia, así que consulta las condiciones actuales del proveedor que pienses utilizar en lugar de confiar en una cifra de una publicación de blog.

¿MiniMax M3 tiene pesos abiertos?

MiniMax anunció pesos abiertos en el lanzamiento y los publicó bajo la MiniMax Community License, pero los rastreadores externos no han incluido uniformemente los pesos como públicos, y la situación ha cambiado desde junio. Si tu plan es alojarlo por tu cuenta, verifica directamente la disponibilidad actual de los pesos y las condiciones de la licencia antes de desarrollar sobre ellos.

¿M3 o DeepSeek V4 Pro para programar?

M3 para entradas multimodales y contextos muy largos; DeepSeek para la programación de texto puro competente más económica. Desglose completo: MiniMax M3 frente a DeepSeek V4 Pro.

Artículos relacionados

Más blogs
MiniMax M3 vs DeepSeek V4 Pro: precios, benchmarks y cuál usar realmente

MiniMax M3 vs DeepSeek V4 Pro: precios, benchmarks y cuál usar realmente

TL;DR — Estos son los dos modelos chinos de pesos abiertos que todo el mundo está comparando ahora mismo, y la respuesta honesta es que apenas compiten. DeepSeek V4 Pro es un especialista algorítmico de texto puro: obtiene la puntuación más alta de cualquier modelo de pesos abiertos en SWE-bench Verified (80,6 %) y su economía nativa de tokens es difícil de superar, especialmente con aciertos de caché. MiniMax M3 es un generalista nativamente multimodal: lee imágenes y vídeo, no solo texto, y ocupa el segundo puesto en el índice de inteligencia entre modelos de Artificial Analysis. Si tu carga de trabajo es texto, código y registros, y te importa el coste por token, elige DeepSeek V4 Pro. Si tu agente necesita mirar una captura de pantalla, un diseño o una grabación de pantalla, elige M3: DeepSeek no puede hacerlo a ningún precio. Ambos se ofrecen ahora con pesos abiertos y ambos funcionan con una ventana de contexto de 1 millón de tokens, así que esta no es la lucha de «uno tiene que perder» que presentan la mayoría de las páginas comparativas.

Tiffany Layne | 2026-07-01

¿Qué es GLM 5.2? Código con pesos abiertos a 1/6 del precio

¿Qué es GLM 5.2? Código con pesos abiertos a 1/6 del precio

Un laboratorio chino lanzó un modelo que puedes descargar gratis, ejecutar en tu propio hardware y cuyo precio es aproximadamente una sexta parte de lo que cobran los modelos de frontera cerrados; y que queda solo unos puntos por detrás de Claude Opus 4.8 en benchmarks reales de programación. Después lanzó el modelo sin publicar un solo benchmark oficial propio. Eso es GLM 5.2, y la brecha entre «sin cifras de marketing» y «casi en la cima de todas las clasificaciones independientes en una semana» es gran parte de lo que hace que valga la pena entenderlo. Escribo muchos de estos análisis, y la mayoría de las publicaciones sobre modelos nuevos se olvidan rápido porque simplemente repiten una ficha técnica. Esta es diferente en un aspecto que realmente importa a los desarrolladores: los pesos son abiertos bajo una licencia MIT, así que la pregunta habitual —«¿el benchmark es real o es marketing?»— tiene una respuesta inusualmente clara. La gente lo descargó y lo probó por sí misma. Esto es GLM 5.2, así es como funciona y estos son sus límites.

Michael Johnson | 2026-07-15

Claude Fable 5: guía completa y reseña honesta (2026)

Claude Fable 5: guía completa y reseña honesta (2026)

Anthropic pasó meses advirtiendo que sus modelos más capaces se estaban volviendo demasiado peligrosos para lanzarlos de forma generalizada. Después, el 9 de junio de 2026, lanzó uno de todos modos — más o menos. Claude Fable 5 es el primer modelo del nivel superior «Mythos» de Anthropic al que el público realmente puede acceder, y se encuentra un nivel completo por encima de la familia Opus. El detalle inusual es el siguiente: ante una parte de las preguntas delicadas, la versión por la que estás pagando enviará discretamente tu solicitud a un modelo diferente y más débil, que será el encargado de responder. Esa única decisión de diseño explica gran parte de lo que hace diferente a Fable 5, así que es por ahí por donde comienza esta guía. Esta es una guía práctica para desarrolladores, no un resumen del día del lanzamiento. Hemos recopilado las especificaciones y el comportamiento a partir de la documentación de Anthropic, los benchmarks independientes y las primeras pruebas prácticas publicadas desde el lanzamiento — y hemos dejado fuera las cifras que no pudimos verificar.

Schuyler Stacy | 2026-06-11

Claude Sonnet 5: Qué hay de nuevo, cuánto cuesta y cómo se compara con Sonnet 4.6 (Guía de 2026)

Claude Sonnet 5: Qué hay de nuevo, cuánto cuesta y cómo se compara con Sonnet 4.6 (Guía de 2026)

Anthropic lanzó Claude Sonnet 5 el 30 de junio de 2026 y, en menos de una hora, mis feeds se llenaron de las mismas dos preguntas: ¿debería dejar Sonnet 4.6 y es realmente cierta la afirmación de que tiene «el mismo precio de lista que 4.6» cuando se ejecuta tráfico real? Esas son también las preguntas que me interesan, así que esta guía gira en torno a ellas, no al resumen de lo más destacado del anuncio. Todo lo técnico aquí se basa en el anuncio y la documentación de Anthropic; cuando una cifra procede de la prensa y no de una página que pude leer directamente, lo indico. Una aclaración inicial, porque muchas de las primeras reseñas se equivocan: el predecesor de Sonnet 5 es Sonnet 4.6 (lanzado en febrero de 2026), no Sonnet 4.5. Si lo comparas con 4.5 o con un 3.5 aún más antiguo, estás comparando dos actualizaciones, y las cifras de abajo no coincidirán. Volveré sobre esto.

Schuyler Stacy | 2026-07-01