¿Es MiniMax M3 bueno para programar? La respuesta corta: sí, para trabajo agéntico y con varios archivos, con dos salvedades que expondré claramente antes de que sigas leyendo. La mayoría de las puntuaciones destacadas de programación fueron obtenidas por MiniMax en su propia infraestructura, y el «contexto de 1 millón de tokens» tiene un salto de precio a partir de 512K que afecta especialmente a los agentes de programación. Ambos aspectos son manejables cuando sabes que existen. Ninguno aparece claramente en la mayoría de la cobertura del lanzamiento.
Escribo esto porque el argumento de programación en torno a M3 se redujo a una sola cifra — 59 % en SWE-Bench Pro — y esa cifra está haciendo mucho trabajo no examinado. A continuación explico qué es realmente el modelo, dónde se sitúan las mediciones independientes, cuánto cuesta en una carga de trabajo de programación real y cómo llamarlo mediante la API de GPTProto. Si solo quieres un veredicto: un evaluador independiente que ejecuta la misma batería en todos los modelos importantes situó a M3 «cerca de GPT y Opus en programación real, pero no por encima de ellos». Eso también coincide con la posición de los benchmarks neutrales.
Qué es MiniMax M3 desde la perspectiva de la programación
M3 se lanzó el 1 de junio de 2026. Es un modelo de mezcla de expertos (Mixture-of-Experts) — los rastreadores de la comunidad que analizaron el checkpoint publicado lo sitúan en aproximadamente 428.000 millones de parámetros totales, con unos 23.000 millones activos por token, aunque MiniMax no ha publicado por sí misma un desglose completo de parámetros, así que considera esas cifras exactas como secundarias. Es multimodal de forma nativa (recibe texto, imágenes y vídeo; genera texto) y es un modelo de razonamiento con un modo de pensamiento que puedes activar o desactivar en cada solicitud.
Antes del mecanismo, la motivación: ¿por qué debería importarle la longitud del contexto a un modelo de programación? Porque el trabajo de ingeniería real no consiste en un solo archivo. Consiste en un repositorio, un rastreo de pila, la salida de las pruebas y los tres archivos que tendrías que modificar para arreglar el problema — todo en un mismo lugar durante el tiempo suficiente para razonar sobre ello. La respuesta de M3 es una ventana de contexto de 1 millón de tokens, con un mínimo utilizable garantizado de 512K tokens. El motor subyacente es MiniMax Sparse Attention (MSA), que selecciona bloques de la caché de clave-valor en lugar de prestar atención a cada par de tokens. MiniMax informa de que, con 1 millón de tokens, esto reduce el cálculo por token a aproximadamente una vigésima parte del de la generación anterior, con un prellenado unas 9 veces más rápido y una decodificación 15 veces más rápida. Son cifras del proveedor sobre la arquitectura, no mediciones independientes, pero la dirección coincide con lo que se espera que proporcione la atención dispersa.
También existe una superficie de programación propia: MiniMax Code, su propio agente basado en el modelo. Es útil saber que existe, pero no es el tema de este artículo, ya que estás aquí para llamar al modelo desde tu propio código.
Quédate con esta idea: M3 está diseñado para trabajo sostenido y de varios pasos a través de un contexto amplio, no para fragmentos de código de una sola acción. Ese enfoque explica prácticamente todas las ventajas y desventajas que aparecen a continuación.
Los benchmarks de programación: lo que informa MiniMax frente a lo que se mide de forma independiente
Esta es la división que la mayoría de los análisis simplifica en exceso. A la izquierda, las puntuaciones de programación y de trabajo agéntico que informa la propia MiniMax. A la derecha, lo que midió un tercero neutral.
| Fuente |
Métrica |
Puntuación |
| MiniMax (ejecutado por el proveedor, infraestructura propia, estructura de Claude Code) |
SWE-Bench Pro |
59.0% |
| MiniMax |
SWE-Bench Verified |
80.5% |
| MiniMax |
Terminal-Bench 2.1 |
66.0% |
| MiniMax |
SWE-fficiency |
34.8% |
| MiniMax |
KernelBench Hard |
28.8% |
| MiniMax |
MCP Atlas (orquestación de herramientas) |
74.2% |
| Artificial Analysis (independiente) |
Índice de inteligencia (compuesto) |
55 — n.º 1 en su clase de modelos con pesos abiertos |
Hay dos cosas que la tabla del proveedor no te contará. Primero, aquí importa más de lo habitual que estas pruebas sean ejecutadas por el proveedor: la cifra de SWE-Bench Pro se obtuvo en la propia configuración de MiniMax usando Claude Code como arnés, y la replicación independiente aún está poniéndose al día. Considera el 59 % una señal sólida del nivel en el que compite M3, no un resultado definitivo. Segundo — y este es el detalle que no he visto en un solo artículo centrado en programación — cuando Artificial Analysis desglosó M3 frente a su predecesor, la mayoría de las evaluaciones mejoraron (Humanity's Last Exam 28→37, GPQA Diamond 87→93, razonamiento con contexto largo 69→74), pero SciCode, la evaluación de programación de ese conjunto, bajó ligeramente de 47 a 45. Es una pequeña regresión y no le daría demasiada importancia. Pero es el único dato que complica la historia sencilla de «mucho mejor programando», y resulta revelador que no se mencionara en ningún sitio.
Mi lectura: M3 está realmente cerca de la frontera en ingeniería de software aplicada — escribir parches, editar varios archivos y trabajar en la terminal — y el respaldo del índice independiente (55, el primero de su clase) es real, no marketing. No supone un salto cualitativo respecto a la generación anterior en todos los ejes de programación, y la brecha en razonamiento abstracto existe (hablaremos de ello más adelante). Conclusión: confía en el nivel, pero verifica la cifra exacta con tus propias tareas.
Lo que cuesta realmente en una carga de trabajo de programación
Primero el precio anunciado, porque la comparación honesta no es la que verás en la mayoría de las publicaciones. A través de la página del modelo de GPT Proto, M3 cuesta 0,48 $ por millón de tokens de entrada y 0,96 $ por millón de tokens de salida en el nivel estándar.
Como referencia, la tarifa efectiva de MiniMax — después del descuento permanente del 50 % que aplica al precio de lista — es de aproximadamente 0,30 $ para la entrada y 1,20 $ para la salida. Así que hay que ser precisos con la comparación en lugar de limitarse a decir «más barato»: mediante GPT Proto, la entrada cuesta más que si llamas directamente a MiniMax, mientras que la salida cuesta menos. Cuál resulta más conveniente depende por completo de la proporción entre lectura y escritura de tu carga de trabajo. Un agente de programación que ingiere un repositorio grande y emite un diff pequeño consume sobre todo entrada, por lo que domina la tarifa de entrada; un trabajo centrado en la generación se inclina en la otra dirección. El motivo para enrutar M3 mediante un agregador no es un descuento llamativo — es operativo: una sola clave y una superficie compatible con OpenAI para M3 junto con el resto del catálogo, en lugar de configurar una cuenta de MiniMax independiente, un endpoint regional y una clave de suscripción aparte.
Ahora viene la parte que realmente determina las facturas de programación y la razón por la que «contexto de 1M» merece un asterisco. El precio es fijo solo hasta 512K tokens de entrada. Si superas ese límite, toda la solicitud — entrada, salida y lecturas de caché — se factura al doble. Es una función escalonada, no gradual. Piensa en un ciclo normal de agente: comienzas con 400K tokens de entrada y 100K de salida, cómodamente por debajo del límite. Pero los ciclos de agente acumulan contenido. En el turno diez o quince no se ha eliminado nada, y un turno supera silenciosamente los 512K; en ese momento, todo ese turno se factura al doble, no solo los tokens que superan el umbral. Un aumento del 20 % en la entrada puede más que duplicar el coste de una llamada.
La palanca que compensa esto es la caché: las entradas repetidas (tu prompt de sistema y las partes estables del código base) se leen a una fracción de la tarifa estándar. En los ciclos de agente, una gran parte de la entrada se puede almacenar en caché, así que conviene configurarlo desde el principio. Conclusión: en M3, tu factura de programación la determina cuánto contexto arrastras y lo bien que lo almacenas en caché, no la cifra por token de la tarjeta de precios. Presupuesta la carga de trabajo, no el precio anunciado.
Cómo llamar a M3 mediante la API de GPT Proto
El endpoint es la superficie de chat compatible con OpenAI. La autenticación utiliza una clave de API sin procesar en el encabezado Authorization — sin el prefijo Bearer, algo que suele confundir a quienes vienen de otros proveedores. Cambia la cadena del modelo a MiniMax-M3 y podrás ejecutarlo.
import requests, json, glob
# Reúne algunos archivos fuente en un único prompt de contexto largo.
# El mínimo de M3 es de 512K tokens, por lo que una docena de archivos cabe sin alcanzar el salto de precio.
files = glob.glob("src/**/*.py", recursive=True)[:20]
codebase = "\n\n".join(f"# ---- {p} ----\n{open(p).read()}" for p in files)
prompt = (
"Aquí tienes parte de un servicio de Python. Encuentra todos los lugares donde una conexión a la base de datos "
"pueda quedar abierta en una ruta de excepción y devuelve la solución como un diff unificado.\n\n"
+ codebase
)
resp = requests.post(
"https://gptproto.com/v1/chat/completions",
headers={
"Authorization": "sk-your-gptproto-key", # clave sin procesar, SIN prefijo "Bearer"
"Content-Type": "application/json",
},
data=json.dumps({
"model": "MiniMax-M3",
"messages": [{"role": "user", "content": prompt}],
"temperature": 0.2, # el valor predeterminado es 0.95 — redúcelo para obtener ediciones de código deterministas
"stream": False,
}),
timeout=120,
)
print(resp.json()["choices"][0]["message"]["content"])
Dos notas prácticas. La temperature predeterminada en esta superficie es 0.95, una cifra alta para código; yo la reduciría a 0.2 o menos cuando quieras diffs reproducibles en lugar de variaciones creativas. Y una aclaración: este endpoint y el patrón de autenticación con clave sin procesar están confirmados en la documentación activa del modelo MiniMax de GPT Proto, con la cadena del modelo cambiada a MiniMax-M3; no he probado personalmente esta llamada exacta contra M3, así que ejecuta una solicitud real y confirma la estructura de la respuesta antes de integrarla en CI.
«Admite 1M» no significa «debería ejecutarse con 1M»
Conviene separar dos afirmaciones que suelen confundirse. M3 admite una ventana de 1 millón de tokens. Si deberías llenarla es otra cuestión y, para programación, la respuesta normalmente es no. Los modelos de contexto largo tienen una tendencia documentada a prestar buena atención al principio y al final de un prompt y a perder elementos enterrados en el centro; MiniMax afirma que M3 se entrenó específicamente para evitar esto, y los primeros informes sugieren que la recuperación se mantiene en la mayor parte de la ventana, pero «la mayor parte» cumple una función importante en esa frase y yo lo verificaría en el extremo final con tus propias tareas sensibles a la recuperación. Si a eso le sumas el salto de precio de 512K, la recomendación resulta evidente: utiliza el contexto largo de forma deliberada — razonar sobre un repositorio completo cuando realmente necesites consciencia entre archivos — y no como un vertedero predeterminado para cada archivo que tengas por ahí.
M3 frente a DeepSeek V4 Pro para programación
Si estás eligiendo entre estos dos modelos chinos de pesos abiertos y clase frontera para programar, el eje de decisión es claro. M3 ofrece multimodalidad nativa y una ventana de 1M — puede recibir una captura de pantalla de una interfaz rota junto con el código. DeepSeek V4 Pro solo admite texto y tiene un precio más bajo, además de destacar en los conjuntos verificados de ingeniería de software. Mi resumen aproximado: elige M3 cuando la entrada multimodal o un contexto muy largo justifiquen su coste, y DeepSeek cuando quieras el programador de texto puro competente más barato y no necesites visión. Las cifras de la comparación directa merecen un tratamiento propio, así que aquí me he limitado al eje de decisión y he incluido la comparación detallada en MiniMax M3 frente a DeepSeek V4 Pro.
Quién debería usar M3 para programar y quién no
Úsalo si tu trabajo es agéntico y con varios archivos: parches en un código base, tareas controladas desde la terminal, sesiones largas de depuración en las que el historial importa o flujos de trabajo en los que devolver una captura de pantalla de la interfaz al modelo resulte realmente útil. Ese es el perfil para el que se entrenó M3, y se nota.
Evítalo, o al menos pruébalo a fondo primero, en tres casos. Si necesitas el programador de texto puro absolutamente más barato y nunca trabajas con imágenes ni con contextos enormes, un modelo de texto más ligero costará menos por token. Si tu problema requiere un razonamiento abstracto genuinamente novedoso en lugar de una ejecución competente — el evaluador independiente al que le gustó la programación aplicada de M3 también señaló que queda por detrás en los benchmarks de razonamiento abstracto — M3 no destaca ahí. Y si tu plan es alojar los pesos por tu cuenta para uso comercial, lee la licencia antes de comprometerte: M3 se distribuye bajo la MiniMax Community License, más restrictiva que las condiciones MIT o Apache que utilizan algunos competidores, y su condición de modelo con pesos abiertos ha cambiado desde el lanzamiento. Para utilizar la API mediante la página del modelo, ninguna de esas restricciones de licencia se aplica: estás alquilando acceso, no redistribuyendo pesos.