Qwen3.8-Max-Preview llegó el 19 de julio de 2026, exactamente dos meses después de Qwen3.7-Max. La lectura obvia es que Alibaba sustituyó su anterior modelo insignia. La evidencia respalda una conclusión más cautelosa.
Ambos modelos ofrecen una ventana de contexto de 1 millón de tokens, modo de razonamiento, llamadas a funciones y herramientas integradas. Qwen afirma que la nueva versión preliminar mejora la programación, el desarrollo full-stack, el análisis de datos y los flujos de trabajo de oficina, pero todavía no ha publicado la tabla de benchmarks necesaria para medir esa mejora. Qwen3.7-Max, por su parte, cuenta con resultados independientes de inteligencia, velocidad y latencia—y un precio normal de API por token.
Respuesta breve: usa Qwen3.7-Max cuando necesites una API estable, costes predecibles o un comportamiento reproducible en producción. Prueba Qwen3.8-Max-Preview cuando tu carga de trabajo se centre en el desarrollo frontend o en tareas de agentes de larga duración y puedas tolerar un modelo que todavía está cambiando. Que sea más reciente no significa que sea más seguro de implementar.
Qwen 3.8 Max frente a Qwen 3.7 Max de un vistazo
La diferencia más importante no es el número de parámetros, sino la calidad de la evidencia. Qwen3.7-Max es un modelo de API publicado con mediciones independientes. Qwen3.8-Max-Preview es un objetivo de evaluación cuyo comportamiento puede cambiar durante la fase preliminar.
| Categoría |
Qwen 3.8 Max |
Qwen 3.7 Max |
| Nombre actual del modelo |
qwen3.8-max-preview |
qwen3.7-max |
| Anunciado |
19 de julio de 2026 |
19 de mayo de 2026 |
| Estado de lanzamiento |
Preliminar; puede sustituirse o retirarse |
Disponible mediante el acceso estándar a la API |
| Parámetros totales |
2.4T |
No divulgados |
| Ventana de contexto |
1 millón de tokens |
1 millón de tokens |
| Modo de razonamiento |
Sí |
Sí |
| Llamadas a funciones |
Sí |
Sí |
| Herramientas integradas |
Sí |
Sí |
| Modalidad pública de entrada/salida |
No completamente definida en la documentación actual en inglés |
Entrada de texto y salida de texto |
| Pesos abiertos |
Prometidos “próximamente”; todavía no publicados |
No; propietario |
| Puntuación compuesta independiente |
No se encontró ninguna al 27 de julio de 2026 |
46 en el Artificial Analysis Intelligence Index |
| Modelo de precios |
Suscripción Token Plan y Credits; sin precio independiente por token |
Precios de API por token disponibles |
| Disponibilidad en GPT Proto |
No disponible |
Disponible a $0.36 de entrada / $1.44 de salida por cada millón de tokens |
La cifra de 1 millón de tokens de contexto para 3.8 es importante porque varios artículos explicativos iniciales todavía la indican como desconocida. La tabla actual de modelos de generación de texto de QwenCloud ya muestra 1 millón para ambos modelos. Esto cierra una laguna de especificaciones, pero no demuestra que 3.8 utilice el contexto largo con mayor precisión.
¿Qué actualizó realmente Qwen 3.8 Max?
En su anuncio del 19 de julio, Qwen confirmó el total de 2.4T parámetros y afirmó que los pesos abiertos llegarían después. La nota de lanzamiento de Qoder de Alibaba presenta 3.8 como una mejora respecto a 3.7 en programación y productividad profesional, especialmente en desarrollo full-stack, análisis de datos, trabajo de oficina y otras tareas de larga duración. Una actualización posterior de Qwen afirma que la versión preliminar dio un paso notable en el trabajo de frontend web.
Son señales útiles, pero se trata de declaraciones del proveedor y no de resultados medidos en una comparación directa. Ninguna tabla pública nos indica cuánto mejor es 3.8 resolviendo problemas de repositorios, completando tareas basadas en herramientas o conservando requisitos durante una sesión larga. El número de parámetros activos tampoco se ha divulgado, por lo que el titular de 2.4T no informa a los desarrolladores sobre el coste de servicio ni la latencia del modelo.
Por tanto, la historia honesta de la actualización es limitada: 3.8 busca una mejor ejecución en las cargas de trabajo a las que 3.7 ya apuntaba, al tiempo que añade un modelo más grande y un ciclo de lanzamientos más rápido. No es una actualización de la ventana de contexto. No es una actualización de las llamadas a funciones. Que sea una mejora de calidad sigue siendo una hipótesis razonable, no un resultado verificado.
Hay otro coste. Qwen afirma que la versión preliminar mejora continuamente. Esto suena atractivo durante la evaluación, pero un modelo cambiante complica las pruebas de regresión. La misma instrucción puede comportarse de forma diferente después de una actualización no anunciada, y una prueba que hoy se supera no garantiza el mismo resultado la próxima semana. Para los equipos de producción, la estabilidad de versión es una funcionalidad.
Qwen 3.8 Max frente a Qwen 3.7 Max para programación
Qwen3.7-Max presenta un caso claro para la programación a escala de repositorio. Acepta hasta 1 millón de tokens, admite razonamiento y herramientas, y ya se puede utilizar mediante una API convencional. Su interfaz basada únicamente en texto no es una limitación cuando el agente recibe archivos fuente, diferencias, registros y resultados de herramientas como texto.
Las mediciones independientes también nos proporcionan una referencia. Artificial Analysis puntúa Qwen3.7-Max con 46 en su Intelligence Index. Midió una velocidad de salida de 202.2 tokens por segundo y un tiempo hasta el primer token de 2.62 segundos mediante la API de Alibaba. Estos resultados variarán según el proveedor y la carga de trabajo, pero siguen siendo más útiles que una afirmación de clasificación sin metodología.
Existe una contrapartida. Qwen3.7-Max generó 100 millones de tokens de salida durante la evaluación del Intelligence Index, frente a una mediana de 63 millones para los modelos de su grupo de comparación. En términos sencillos: puede ser verboso. Una generación rápida de tokens no implica automáticamente una respuesta corta ni una factura total baja, especialmente cuando los tokens de salida cuestan más que los de entrada.
Qwen3.8-Max-Preview resulta más interesante para el frontend experimental y el trabajo de agentes de larga duración. Qwen destacó específicamente las mejoras generales en frontend web, y Qoder lo posiciona para el desarrollo full-stack. Lo probaría en generación de interfaces, depuración en varias etapas y tareas que combinen código con trabajo de oficina o de datos. No trasladaría un agente de programación de producción únicamente por el nombre del modelo.
Una discusión en r/ClaudeCode durante la semana de lanzamiento recibió más de 40 comentarios. Es una señal de demanda, no un resultado de rendimiento. El entusiasmo de la comunidad puede indicarnos qué cargas de trabajo interesan a los desarrolladores; sin instrucciones controladas y resultados publicados, no puede decirnos qué modelo debería gestionar el tráfico de producción.
Para realizar una prueba de programación justa entre Qwen 3.8 Max y Qwen 3.7 Max, mantén idénticos el commit del repositorio, la instrucción del sistema, las herramientas, los permisos y los criterios de éxito. Registra los fallos de las herramientas, las pruebas superadas, las correcciones humanas, el tiempo transcurrido y el uso de tokens. Si alguno de esos elementos cambia, el resultado es una demostración, no una comparación.
Rendimiento: resultados medidos frente a afirmaciones del proveedor
Alibaba describe Qwen3.8-Max-Preview como uno de los principales modelos de frontera y afirma que solo queda por detrás de Fable 5 en su evaluación interna. La primera parte es plausible. La segunda no se puede verificar de forma independiente porque Alibaba no ha publicado los nombres de los benchmarks, las puntuaciones, las instrucciones ni el procedimiento de evaluación en que se basa.
| Evidencia |
Qwen 3.8 Max |
Qwen 3.7 Max |
| Posicionamiento del proveedor |
Programación y Cowork mejorados; clasificación interna solo por detrás de Fable 5 |
Modelo insignia orientado a agentes para programación, productividad y trabajo autónomo prolongado |
| Tabla pública de benchmarks |
No publicada |
Resultados disponibles del proveedor, además de pruebas compuestas independientes |
| Artificial Analysis Intelligence Index |
No se encontró ningún resultado al 27 de julio de 2026 |
46 |
| Velocidad de salida medida de forma independiente |
No disponible |
202.2 tokens/s mediante la API de Alibaba |
| TTFT medido de forma independiente |
No disponible |
2.62 segundos mediante la API de Alibaba |
| Reproducibilidad |
La versión preliminar cambia durante el periodo de evaluación |
Endpoint publicado más estable |
Esta brecha de evidencia no demuestra que 3.8 sea peor. Significa que “cuál es mejor” tiene dos respuestas. En cuanto a capacidad esperada, 3.8 es el probable ganador. En cuanto a rendimiento demostrado y reproducible, 3.7 tiene actualmente el argumento más sólido.
Precios de Qwen 3.8 Max frente a Qwen 3.7 Max
Qwen3.7-Max tiene precios convencionales por token. QwenCloud muestra una tarifa estándar de 2,50 $ por cada millón de tokens de entrada y 7,50 $ por cada millón de tokens de salida. Su página muestra actualmente tarifas promocionales de 1,25 $ y 3,75 $, pero los precios promocionales están sujetos a cambios.
En GPT Proto, Qwen3.7-Max cuesta 0,36 $ por cada millón de tokens de entrada y 1,44 $ por cada millón de tokens de salida. Esta es la cifra útil para un equipo que implementa el modelo mediante GPT Proto: puede estimar el gasto directamente a partir del uso de tokens y dirigir otros modelos mediante el mismo saldo.
Qwen3.8-Max-Preview utiliza una estructura comercial diferente. La documentación de Token Plan de QwenCloud muestra planes personales por tiempo limitado de 6 $, 18 $ y 68 $ al mes. Los planes cubren varios modelos y contabilizan el uso en Credits. Qoder también aplica multiplicadores temporales de Credits durante la fase preliminar. Ninguna de las dos opciones proporciona un precio independiente en dólares por millón de tokens para 3.8.
Esto hace imposible una comparación directa de precios. Una suscripción puede resultar atractiva para un uso interactivo repetido, pero no ofrece a un equipo de ingeniería la misma visibilidad del coste por solicitud que la facturación por tokens. Hasta que 3.8 reciba una tarifa publicada por token, las afirmaciones de que es más barato o más caro que 3.7 son especulaciones.
Por qué no hay aquí una tabla de resultados comparable
Una captura de pantalla comparativa parecería convincente. También sería engañosa en este momento.
Qwen3.8-Max-Preview no está disponible en GPT Proto, y su documentación oficial indica que el modelo puede cambiar durante toda la fase preliminar. Comparar una ejecución reciente de la API de 3.7 con una captura de pantalla sin fecha de 3.8 tomada de otro producto mezclaría versiones del modelo, infraestructura, herramientas y posiblemente instrucciones del sistema. No lo presentaré como una prueba controlada.
La prueba con calidad de publicación es sencilla: ejecuta la misma tarea de repositorio contra ambos modelos el mismo día, conserva la instrucción completa y el registro de herramientas, y publica los resultados sin procesar junto con los criterios de evaluación. Hasta que exista esa ejecución, la ausencia de una muestra es más honesta que una insignia decorativa de ganador.
¿Qué modelo deberías elegir?
| Tu prioridad |
Mejor opción |
Motivo |
| API de producción hoy |
Qwen 3.7 Max |
Acceso estable, nombre de modelo conocido y precios de tokens predecibles |
| Programación de texto a escala de repositorio |
Qwen 3.7 Max |
Contexto de 1 millón de tokens y rendimiento medido de forma independiente |
| Tareas experimentales de frontend o Cowork |
Qwen 3.8 Max Preview |
Estas son las cargas de trabajo que Alibaba afirma que más mejoraron |
| Pruebas de regresión fijas |
Qwen 3.7 Max |
Una versión preliminar actualizada continuamente dificulta la reproducción de los resultados |
| El menor coste conocido en GPT Proto |
Qwen 3.7 Max |
$0.36 de entrada y $1.44 de salida por cada millón de tokens |
| Autoalojamiento con pesos abiertos |
Ninguno por ahora |
3.7 es propietario; los pesos de 3.8 se han prometido, pero todavía no se han publicado |
Mi recomendación es directa: lanza 3.7 y evalúa 3.8. Traslada la carga de trabajo de producción solo después de que 3.8 tenga una versión estable, resultados independientes y precios que puedan traducirse en un coste por tarea.
Cómo usar Qwen 3.7 Max mediante GPT Proto
GPT Proto ofrece Qwen3.7-Max mediante su API compatible con OpenAI. Configura tu clave en una variable de entorno y realiza una solicitud estándar de chat completions con la cadena de modelo qwen3.7-max.
export GPTPROTO_API_KEY="your_api_key_here"
curl https://gptproto.com/v1/chat/completions \
-H "Authorization: Bearer $GPTPROTO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.7-max",
"messages": [
{
"role": "system",
"content": "You are a senior software engineer. Return the smallest safe patch and explain each changed file."
},
{
"role": "user",
"content": "Review this function for correctness and propose a tested fix: def divide_total(total, count): return total / count"
}
]
}'
La versión de Python utiliza el cliente oficial de OpenAI:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GPTPROTO_API_KEY"],
base_url="https://gptproto.com/v1",
)
response = client.chat.completions.create(
model="qwen3.7-max",
messages=[
{
"role": "system",
"content": (
"You are a senior software engineer. Return the smallest "
"safe patch and explain each changed file."
),
},
{
"role": "user",
"content": (
"Review this function for correctness and propose a tested fix: "
"def divide_total(total, count): return total / count"
),
},
],
)
print(response.choices[0].message.content)
El SDK añade el encabezado de autorización Bearer. Cambiar a otro modelo compatible solo requiere modificar la cadena del modelo; mantén un conjunto de evaluación separado para que un cambio sencillo no se convierta en una modificación de producción sin probar.
Lista de comprobación para una actualización segura
Empieza guardando una línea base de 3.7 a partir de tu carga de trabajo real, no de un rompecabezas de programación sintético. Conserva la instrucción, el estado del repositorio, las herramientas, el resultado esperado, la latencia y el uso de tokens. Después, ejecuta el mismo paquete contra 3.8 Preview e inspecciona los fallos, no solo la respuesta más atractiva.
Define el umbral de migración antes de ver el resultado. Por ejemplo, exige que el nuevo modelo supere las mismas pruebas sin aumentar los errores de las herramientas ni generar un cambio de coste inaceptable. Repite la evaluación después de las actualizaciones importantes de la versión preliminar. Por último, espera a que exista un identificador de modelo estable y un precio publicado antes de trasladar tráfico que implique un compromiso de disponibilidad o presupuesto.
Este proceso es menos emocionante que cambiar el día del lanzamiento. También es la forma de evitar que una actualización del modelo se convierta en un incidente.
Veredicto final
Qwen3.8-Max-Preview podría convertirse en el mejor modelo. Hoy es el producto menos probado.
Si tuviera que implementar ahora un flujo de trabajo de programación o desarrollo, utilizaría Qwen3.7-Max mediante GPT Proto y mantendría 3.8 en un canal de evaluación separado. Esa recomendación puede cambiar cuando aparezca la evidencia que falta. No debería cambiar porque 3.8 tenga el número más grande en su nombre.