Schuyler Stacy2026-04-25

Qwen 3.6: El nuevo rey del rendimiento de programación local

Descubre cómo Qwen 3.6 domina los benchmarks de LLM locales para programación. Conoce las velocidades de la RTX 5090, la eficiencia de MoE y consejos de optimización. Leer más.

Qwen 3.6: El nuevo rey del rendimiento de programación local

TL;DR

Qwen 3.6 ofrece una velocidad lista para producción en hardware local, y la variante 35B A3B destaca como una opción de primer nivel para gestionar repositorios de código exigentes y flujos de trabajo técnicos complejos.

Los entusiastas de la IA local normalmente tienen que elegir entre velocidad e inteligencia. Este lanzamiento elimina eficazmente ese compromiso. Tanto si utilizas una configuración consolidada con dos RTX 3090 como la última RTX 5090, estos modelos demuestran que la inteligencia de pesos abiertos puede competir con los grandes proveedores de la nube en tareas técnicas especializadas.

Desde las enormes mejoras de rendimiento mediante vLLM hasta una lógica de programación especializada capaz de gestionar repositorios completos sin perder el hilo, el panorama local está cambiando. Ya no es solo un juego para aficionados; es un espacio de trabajo viable y centrado en la privacidad para desarrolladores profesionales que necesitan interacciones frecuentes con modelos.

Tabla de contenido

Rendimiento de Qwen 3.6 en el mundo real con hardware moderno

El panorama de los LLM locales acaba de recibir un impulso enorme. Con el lanzamiento de Qwen 3.6, concretamente de las variantes 27B y 35B A3B, estamos viendo cifras que realmente tienen sentido para el trabajo diario en producción. Ya no se trata solo de benchmarks brutos.

Si utilizas una RTX 5090, el rendimiento de Qwen 3.6 es francamente sorprendente. Hablamos de 45 tokens por segundo al inicio de una ventana de contexto. Incluso cuando te acercas a los 100.000 tokens, la velocidad se mantiene en torno a los 35 tokens por segundo.

Este tipo de estabilidad es importante cuando trabajas con documentos técnicos extensos. La mayoría de los modelos se desploman en cuanto crece el contexto. Pero la arquitectura de Qwen 3.6 parece gestionar el trabajo pesado sin esfuerzo en hardware de gama alta.

Benchmarks de Qwen 3.6 en distintas GPU

Veamos las cifras reales, porque cuentan una historia concreta. En una configuración con dos RTX 3090 y cuantización FP8, puedes alcanzar 26 tokens por segundo. Es una velocidad muy respetable para un modelo 27B ejecutándose localmente.

La variante 35B A3B es la verdadera estrella para muchos usuarios. Utiliza un enfoque de mezcla de expertos (MoE). En esa misma RTX 5090, usando GPTQ-Int4, los usuarios informan de más de 200 tokens por segundo. Parece el punto óptimo de la eficiencia.

Mejoras de rendimiento optimizado de Qwen 3.6

Los cargadores estándar están bien, pero vLLM lleva las cosas a otro nivel. Al cambiar de llama.cpp a vLLM, los usuarios ven que el procesamiento de prompts alcanza los 3600 tokens por segundo. En flujos de trabajo agénticos, la velocidad de generación llega aproximadamente a 51 tokens por segundo.

Esta optimización hace que el rendimiento del LLM local se sienta más cercano al de un servicio de nube de pago. Obtienes la privacidad del alojamiento local con la velocidad de una API de alta gama. Esto cambia las reglas para los desarrolladores que necesitan interacciones frecuentes con modelos.

Capacidades de programación y gestión de repositorios de Qwen 3.6

La programación es donde realmente destacan las fortalezas de Qwen 3.6. No se trata solo de escribir una función aislada. Este potente modelo de programación gestiona el trabajo con repositorios exigentes que normalmente requeriría un enorme modelo en la nube como Claude 3.5 Sonnet.

Cuando combinas Qwen 3.6 con un agente como PI Coding Agent, los resultados son impresionantes. Comprende el contexto de múltiples archivos. No pierde el hilo cuando le pides cambios en distintos módulos de tu proyecto.

El modelo 35B es especialmente bueno en esto. Como es un MoE, se siente más ágil durante las sesiones largas de depuración. No tienes que quedarte tres minutos esperando una respuesta. La generación comienza casi al instante.

Uso de Qwen 3.6 35B A3B para ingeniería de software

Los ingenieros están descubriendo que este modelo destaca en la refactorización. Sus sugerencias tienen cierta "lógica" que se siente menos robótica que en iteraciones anteriores. Detecta casos límite que los modelos 7B o 14B más pequeños pasan completamente por alto.

Si trabajas intensamente con repositorios, la velocidad del 35B A3B en una RTX 5090 es absurda. Permite mantener un estado de flujo constante. Preguntas, responde y sigues adelante. Ese es el objetivo de cualquier LLM local.

Comparación del rendimiento de Qwen 3.6 en tareas técnicas

Aunque la programación es la protagonista, la escritura creativa y el razonamiento general también son sólidos. Es una herramienta versátil. No parece un modelo de "una sola habilidad" que solo conozca Python. Gestiona tareas de lógica general con gran precisión.

Sin embargo, algunos usuarios siguen prefiriendo la claridad de Gemma 4 para tareas de edición pura. Gemma suele ofrecer una estructura más limpia y un mejor ritmo. Pero en cuanto a potencia técnica bruta, el rendimiento de programación de Qwen 3.6 es difícil de superar ahora mismo.

"El 35B A3B parece el punto óptimo ahora mismo. La velocidad de MoE con una calidad casi densa hace que resulte muy difícil volver a los modelos antiguos."

Requisitos de hardware para ejecutar Qwen 3.6 localmente

Debes ser realista con tu equipo. Aunque Qwen 3.6 es eficiente, sigue exigiendo una cantidad respetable de VRAM. Para el modelo 27B, 24 GB de VRAM es la base ideal. Esto te permite ejecutar cuantizaciones de alta calidad sin una descarga de trabajo considerable.

Si tienes una tarjeta con 16 GB de VRAM, todavía puedes utilizarlo. Solo tendrás que usar niveles de cuantización inferiores o descargar algunas capas en la RAM del sistema. Esto ralentizará el rendimiento de Qwen 3.6, pero seguirá siendo utilizable.

La RAM DDR5 ayuda en este aspecto. Si tienes 32 GB de RAM de sistema rápida, la penalización por descargar capas es menos severa. Los usuarios con 8 GB de VRAM y 32 GB de RAM informan de entre 15 y 30 tokens por segundo, suficiente para un chat básico.

VRAM óptima para los modelos 27B y 35B A3B

Hardware de la GPU Cantidad de VRAM Rendimiento esperado Modelo objetivo
RTX 5090 32 GB 45+ tok/s (TG) 35B A3B / 27B
RTX 4090 / 3090 24 GB 25-35 tok/s (TG) Modelo 27B
RTX 4080 / 4070 Ti 16 GB 10-20 tok/s (TG) 27B (cuantizado)
GPU de portátil + DDR5 8 GB + 32 GB 15-25 tok/s 27B (descargado)

Memoria del sistema y compromisos de optimización

No ignores tu CPU ni la RAM del sistema. Si quieres ejecutar los benchmarks de Qwen 3.6 al máximo, necesitas un sistema equilibrado. Delegarlo todo a una CPU antigua mientras la GPU espera creará un cuello de botella en el rendimiento.

Un LLM local rápido requiere una ruta de datos rápida. Se prefieren ranuras PCIe 4.0 o 5.0 para configuraciones con varias GPU. Si utilizas dos RTX 3090, asegúrate de que tu fuente de alimentación pueda gestionar los picos transitorios durante el procesamiento de prompts.

Optimización avanzada para tu configuración de Qwen 3.6

Para aprovechar al máximo la experiencia de programación con Qwen 3.6, debes prestar atención a los kernels de cuantización. Actualmente, el kernel FP8 supera a NVFP4 en la mayoría de las pruebas. Ofrece un mejor equilibrio entre velocidad e inteligencia.

La decodificación especulativa es otro truco. Al utilizar un modelo mucho más pequeño para predecir tokens, puedes aumentar la velocidad de generación del modelo Qwen 3.6 principal. Configurarlo es algo más complejo, pero las recompensas son tangibles.

Para quienes no quieran gestionar hardware local, utilizar un enfoque de explorar Qwen 3.6 y otros modelos mediante una plataforma unificada puede ahorrar horas de resolución de problemas. A veces, la nube es simplemente más fácil.

Uso de vLLM para mejorar el rendimiento

vLLM cambia las reglas para este modelo específico. Gestiona mucho mejor el batching continuo que llama.cpp. Si ofreces la API de Qwen a varias aplicaciones locales, vLLM es prácticamente obligatorio.

La configuración de vLLM implica establecer correctamente el paralelismo de tensores. En una configuración con dos GPU, establecer TP=2 garantiza que la carga de memoria se divida de forma uniforme. Esto permite ventanas de contexto mucho más grandes sin quedarse sin memoria.

Cuantización FP8 frente a la estándar de 4 bits

La cuantización es la forma de introducir estos modelos enormes en hardware de consumo. Aunque la de 4 bits (GGUF o EXL2) es popular, FP8 está ganando terreno. Parece conservar mejor la "inteligencia" original del modelo durante tareas de programación complejas.

Si tienes VRAM de sobra, prueba siempre primero con una cuantización superior. La diferencia de rendimiento de Qwen 3.6 entre una cuantización Q4 y una Q8 se nota cuando le pides resolver problemas arquitectónicos difíciles en el código.

Comparación del rendimiento de Qwen 3.6 con líderes del sector

Abordemos el tema evidente: ¿es mejor que Claude? La mayoría de los usuarios experimentados dicen que no. Claude 3.5 Sonnet sigue ostentando la corona en matices y en seguir instrucciones complejas de varios pasos sin confundirse.

Pero ese no es el objetivo de un LLM local. El objetivo es que Qwen 3.6 sea "suficientemente bueno" para el 90 % de las tareas y cueste cero dólares por token. Es una herramienta potente y rentable para desarrolladores preocupados por la privacidad.

Cuando revisas los benchmarks de Qwen 3.6, a menudo supera a versiones antiguas de Llama o Mixtral. Representa un avance importante en lo que puede hacer un modelo de tamaño medio. Se siente como una herramienta genuina para profesionales.

Opiniones de la comunidad y comentarios de usuarios reales

La comunidad de Reddit se ha pronunciado sobre este lanzamiento. La mayoría describe Qwen 3.6 como una "bestia" para su tamaño. En particular, el modelo 27B recibe elogios por su escritura creativa, que solía ser un punto débil de las versiones anteriores de Qwen.

Existe cierto debate sobre su "estilo". A algunos les parece un poco demasiado verboso. A otros les encantan las explicaciones detalladas que ofrece. Sin duda es un modelo con personalidad, a diferencia de algunos modelos más estériles de otros laboratorios.

Ventajas del acceso a una API unificada de Qwen

Gestionar varios modelos locales es una tarea tediosa. Si te encuentras cambiando constantemente entre modelos, quizá quieras leer la documentación completa de la API de los servicios unificados. Te permite probar Qwen 3.6 frente a otros modelos al instante.

Plataformas como GPT Proto pueden tender un puente entre ambos mundos. Obtienes la velocidad del 35B A3B sin el calor ni el ruido de una RTX 5090 funcionando en tu oficina. Se trata de encontrar la herramienta adecuada para el trabajo específico que tienes entre manos.

Veredicto final: ¿deberías usar Qwen 3.6?

Si tienes una tarjeta con 24 GB de VRAM, no hay razón para no incluir Qwen 3.6 en tu repertorio. Es uno de los modelos locales más capaces disponibles actualmente. Su rendimiento de programación por sí solo lo convierte en una descarga imprescindible para los desarrolladores.

Para quienes tienen hardware de gama baja, el modelo 27B sigue mereciendo el esfuerzo de descargar capas. Solo debes prepararte para velocidades más lentas. Aun así, supera a un modelo 7B en lógica y seguimiento de instrucciones cualquier día.

La historia del rendimiento de Qwen 3.6 es una historia de eficiencia. Demuestra que no necesitas un billón de parámetros para que un modelo sea útil. A veces, un MoE 35B bien optimizado es todo lo que necesitas para hacer el trabajo de manera eficiente.

Primeros pasos con tu configuración local

Descarga los archivos GGUF o EXL2 desde Hugging Face. Empieza con una cuantización de gama media como Q4_K_M. Comprueba cómo funciona en tu hardware. Si tienes velocidad de sobra, cambia a una cuantización superior para mejorar la lógica.

No olvides actualizar tus controladores. Los modelos más recientes suelen depender de optimizaciones presentes en los kernels CUDA más actuales. Mantener tu stack actualizado garantiza que no estés dejando tokens sin aprovechar durante tus ejecuciones de generación.

Supervisión del uso y los costes

Si decides trasladar tu flujo de trabajo a un entorno alojado, puedes gestionar la facturación de tu API para mantener bajos los costes. El hardware local es excelente, pero la flexibilidad también es una gran ventaja en un campo que evoluciona rápidamente.

Tanto si eliges una solución local como una nube, el modelo de programación Qwen 3.6 es un hito importante. Lleva una inteligencia de alto nivel al escritorio de una forma que realmente funciona. Es un gran momento para trabajar con IA.

Y si el modelo te resulta tan útil como a nosotros, quizá quieras compartir el secreto. Puedes unirte al programa de referidos de GPT Proto y ayudar a otros a descubrir también estas potentes herramientas. La comunidad no deja de crecer.

Escrito por: GPT Proto

"Desbloquea los principales modelos de IA del mundo con la plataforma de API unificada de GPT Proto."

Creative Studio

Genera imágenes, videos y más con APIs de producción.

Comenzar a crear
Creative Studio
Modelos relacionados
Todos los modelos
Claude
20% OFF
Google
40% OFF
Google
40% OFF
MoonshotAI
10% OFF