Michael Johnson2026-07-28

¿Qué es Kimi K3 y está realmente cerca de GPT-5.6 y Fable 5?

¿Es Kimi K3 de código abierto y está realmente cerca de GPT-5.6 y Fable 5? Descubre su contexto de 1M, sus precios de API, benchmarks independientes y la reacción en Reddit.

¿Qué es Kimi K3 y está realmente cerca de GPT-5.6 y Fable 5?

TL;DR

Kimi K3 es el modelo multimodal de Moonshot AI, con 2,8 billones de parámetros, diseñado para programación de largo recorrido, trabajo del conocimiento, razonamiento y flujos de trabajo con agentes. Las pruebas independientes lo sitúan cerca de Claude Opus 4.8 y GPT-5.5 en general, mientras que GPT-5.6 Sol y Claude Fable 5 siguen por delante. K3 se acerca más en los benchmarks agénticos y lidera algunas pruebas de automatización, pero su tasa medida de alucinaciones aumentó frente a K2.6.
 Kimi K3 ahora está disponible con pesos abiertos. Moonshot AI ha publicado el checkpoint completo, la ficha del modelo, el informe técnico y la licencia personalizada Kimi K3. El repositorio oficial de Hugging Face ocupa aproximadamente 1,56 TB distribuidos en 96 fragmentos safetensors, y Moonshot recomienda implementaciones en supernodos con 64 aceleradores o más. Los pesos abiertos resuelven la cuestión de la propiedad. No convierten a K3 en un modelo local convencional.
Para la mayoría de los desarrolladores, la API alojada sigue siendo el punto de partida práctico. La API de Kimi K3 en GPTProto muestra actualmente un precio de 2,70 $ por millón de tokens de entrada y 13,50 $ por millón de tokens de salida. Elige los pesos cuando el control de los datos, la inferencia personalizada o la modificación del modelo justifiquen la infraestructura y la revisión de la licencia.
En resumen, Kimi K3 está lo bastante cerca de GPT-5.6 y Fable 5 como para formar parte de la misma conversación—y su lanzamiento con pesos abiertos ofrece ahora a los desarrolladores una opción de implementación que ninguno de los dos modelos cerrados ofrece.

Tabla de contenido

¿Qué es Kimi K3?

Kimi K3 es el nuevo modelo insignia multimodal de razonamiento de Moonshot AI. Está diseñado para trabajos que pueden requerir horas de programación, investigación, uso de herramientas y revisión, no solo para responder a una pregunta de chat.

El modelo se lanzó el 16 de julio de 2026 en Kimi.com, Kimi Work, Kimi Code y la API de Kimi. Cuenta con 2,8 billones de parámetros totales, una ventana de contexto de un millón de tokens y compatibilidad nativa con entradas de texto, imagen y vídeo. Su salida sigue siendo texto.

En su interior, K3 utiliza una arquitectura de mezcla de expertos con 896 expertos, de los cuales 16 se activan simultáneamente. Moonshot también introdujo Kimi Delta Attention, Attention Residuals y Stable LatentMoE para mejorar el movimiento de la información a través de secuencias largas y capas profundas del modelo. Moonshot afirma que estos cambios producen aproximadamente 2,5 veces la eficiencia de escalado de Kimi K2, aunque esa cifra procede del desarrollador y no de una prueba independiente. El blog técnico de Kimi K3 de Moonshot proporciona los detalles actuales de la arquitectura; todavía está pendiente un informe técnico más completo.

Especificación Kimi K3
Desarrollador Moonshot AI
Lanzamiento público 16 de julio de 2026
Parámetros totales / activados 2,8T / 104B
Arquitectura Mezcla de expertos
Expertos 896 en total, 16 activos
Ventana de contexto 1 millón de tokens
Entradas Texto, imagen y vídeo
Salida Texto
Cadena del modelo de API kimi-k3
Modo de razonamiento Siempre activado
Disponibilidad de los pesos Pesos completos publicados en `moonshotai/Kimi-K3

Esto convierte a K3 en uno de los mayores modelos de IA anunciados hasta la fecha. Sin embargo, el tamaño por sí solo no es lo más útil. La verdadera pregunta es si Moonshot ha convertido esos parámetros en una mejor finalización de tareas.

El lanzamiento también elimina una incertidumbre de la cobertura inicial: el informe técnico ya es público. Esto no elimina la necesidad de una evaluación independiente ni convierte un modelo de 2,8T en un proyecto sencillo de alojar por cuenta propia.

¿Está Kimi K3 realmente cerca de GPT-5.6 y Claude Fable 5?

En inteligencia general, no del todo. En varias tareas agénticas y de largo recorrido, sí.

El anuncio de Moonshot es más moderado que muchos de los titulares que generó. La empresa afirma que el rendimiento general de K3 todavía está por detrás de Claude Fable 5 y GPT-5.6 Sol. Aun así, informa de resultados de nivel frontera en programación, trabajo del conocimiento y razonamiento.

Un ejemplo es la optimización de kernels de GPU. Moonshot colocó cada modelo en un sandbox idéntico y le concedió hasta 24 horas para optimizar cuatro tareas de GPU. K3 compitió con Fable 5 y superó a GPT-5.6 Sol, GPT-5.5 y Opus 4.8 en esta prueba. Es un resultado importante para la ingeniería de rendimiento de bajo nivel, pero no demuestra que K3 sea universalmente más inteligente.

Las pruebas independientes ofrecen una perspectiva más amplia. Artificial Analysis puntuó a Kimi K3 con 57 en su Intelligence Index, situándolo cerca de GPT-5.5 y Claude Opus 4.8, pero por detrás de Fable 5 y GPT-5.6 Sol. Sus mejores resultados aparecieron en ejecución agéntica y automatización, no en todas las categorías de inteligencia. Artificial Analysis publicó sus resultados sobre K3 el 16 de julio.

Evaluación Resultado de Kimi K3 Qué nos indica
Índice de inteligencia de AA 57 Cerca de GPT-5.5 y Opus 4.8; por detrás de GPT-5.6 Sol y Fable 5
GDPval-AA v2 1.668 Elo Ejecución sólida en tareas agénticas del mundo real
AutomationBench-AA 53 %, primer puesto Especialmente eficaz en la automatización de flujos de trabajo SaaS
AA-Briefcase 1.547 Elo, segundo puesto Sólido trabajo del conocimiento de largo recorrido
Precisión de omnisciencia 46 % Por encima del 33 % de K2.6
Tasa de alucinaciones 51 % Peor que el 39 % de K2.6

La última fila fue la que me hizo detenerme. K3 se volvió más capaz, pero Artificial Analysis también midió más alucinaciones. Respondió correctamente a más preguntas, aunque produjo una proporción mayor de afirmaciones sin respaldo.

Ese equilibrio importa en producción. Un modelo que completa un flujo de trabajo agéntico largo, pero introduce silenciosamente una suposición incorrecta, puede costar más de verificar que un modelo más lento con un comportamiento factual más estable.

Por qué un solo ranking no puede resolver la comparación

K3 ya ha alcanzado la parte superior de al menos un ranking de generación de interfaces. También funciona bien en optimización de GPU, automatización SaaS y trabajo del conocimiento de largo recorrido. Esos resultados no miden la misma capacidad.

Un arena de frontend mide qué interfaces generadas prefieren los usuarios. AutomationBench mide si un agente puede operar flujos de software. La optimización de kernels de GPU prueba la ingeniería de sistemas de bajo nivel. Ninguna de estas pruebas puede responder por sí sola si K3 es mejor en investigación, recuperación factual, depuración, diseño de presentaciones o razonamiento general.

La conclusión defendible es más limitada: Kimi K3 ha entrado en el grupo frontera para el trabajo agéntico, pero GPT-5.6 Sol y Fable 5 siguen liderando la comparación general. Los desarrolladores que busquen el techo actual de los modelos cerrados pueden examinar la API de GPT-5.6 Sol, mientras que Claude Opus 4.8 sigue siendo una opción más consolidada para flujos complejos de programación e investigación.

La cuestión de los pesos abiertos está resuelta; la cuestión de la implementación, no

La pregunta durante la semana del lanzamiento era si Moonshot publicaría realmente los pesos. Lo ha hecho. El repositorio oficial moonshotai/Kimi-K3 contiene ahora el checkpoint completo, la ficha del modelo, el informe técnico, el código de inferencia y la licencia Kimi K3.

La formulación exacta sigue siendo importante. Kimi K3 tiene pesos abiertos, no es un lanzamiento sin matices de «código completamente abierto». Su licencia personalizada permite un uso, modificación, ajuste fino, implementación y redistribución amplios, pero añade condiciones para grandes empresas Model-as-a-Service y productos comerciales de gran escala. Los datos de entrenamiento no son públicos.

La disponibilidad tampoco equivale a usabilidad. El repositorio ocupa aproximadamente 1,56 TB y Moonshot recomienda implementaciones en supernodos con 64 aceleradores o más. Esto hace que K3 sea relevante para equipos de infraestructura cloud y empresarial, no una descarga habitual para una estación de trabajo.

El lanzamiento sigue siendo importante. Las organizaciones ahora tienen una vía real para inspeccionar el checkpoint, personalizar la inferencia, ajustar derivados y operar el modelo sin depender completamente de un único endpoint alojado. El precio es hardware, ingeniería de servicio y revisión de la licencia.

¿Qué cambió de Kimi K2.7 a Kimi K3?

K3 no es simplemente Kimi K2.7 con un número de versión mayor.

Kimi K2.7 Code es un modelo agéntico centrado en programación y basado en K2.6. Su ficha destaca la ingeniería de software del mundo real, las sesiones largas de programación, el uso de herramientas y un menor consumo de tokens de razonamiento. K3 amplía ese papel para convertirse en un modelo insignia general que cubre programación, razonamiento visual, investigación y trabajo del conocimiento de principio a fin.

La ventana de contexto crece de 256K a un millón de tokens. Los parámetros totales aumentan de un billón a 2,8 billones, mientras que el número de expertos pasa de 384 a 896. El precio también aumenta.

Característica Kimi K3 Kimi K2.7 Code
Posicionamiento Modelo insignia general Modelo centrado en programación
Parámetros totales 2,8T 1T
Expertos 896, 16 activos 384, 8 activos
Ventana de contexto 1M 256K
Entrada estándar $3.00/MTok $0.95/MTok
Salida $15.00/MTok $4.00/MTok
Entrada almacenada en caché $0.30/MTok $0.19/MTok
Pesos Disponibles bajo la licencia Kimi K3 Disponibles

Por tanto, la propuesta de valor de K3 no es «inteligencia de frontera por casi nada». Es un rendimiento agéntico cercano a la frontera con dos vías de implementación: una API de pago por uso inmediato y pesos publicados para equipos preparados para asumir la infraestructura.

La ficha oficial del modelo K2.7 Code contiene su arquitectura, metodología de benchmarks y orientación para la implementación.

Cómo gestiona Kimi K3 un contexto de 1 millón de tokens

Una ventana de contexto de un millón de tokens permite a K3 aceptar bases de código grandes, colecciones de documentos técnicos, historiales de agentes extensos y resultados intermedios de herramientas en una sola solicitud.

Esto es especialmente relevante para los agentes de larga duración. Un modelo de programación puede necesitar conservar una especificación inicial, la estructura del repositorio, la salida del terminal, los fallos de las pruebas, ediciones anteriores y comentarios de los revisores durante decenas de pasos. Perder una de esas restricciones a mitad de la tarea es una razón habitual por la que un agente parece productivo, pero no consigue terminar.

K3 también aplica almacenamiento automático del contexto en caché. Los desarrolladores no necesitan crear un ID de caché ni establecer un valor independiente de tiempo de vida. Si un prefijo largo permanece sin cambios entre solicitudes, el sistema intenta automáticamente encontrar una coincidencia en caché. La entrada almacenada en caché cuesta 0,30 $ por millón de tokens en lugar de 3,00 $.

Pero la capacidad de contexto no equivale a un uso perfecto del contexto. Introducir un millón de tokens no garantiza que el modelo asigne la importancia correcta a cada línea. Las entradas más largas también pueden aumentar el coste, el tiempo de procesamiento y la distracción causada por material irrelevante.

El enfoque sensato sigue siendo recuperar primero los archivos más relevantes, mantener al principio el contenido de referencia estable para aprovechar la caché y evitar enviar toda la base de conocimientos solo porque el límite lo permite. La guía de API de Kimi explica su contexto de un millón de tokens y el comportamiento de almacenamiento automático en caché.

El precio de la API de Kimi K3 ya no es económico

La API oficial de Kimi K3 de Moonshot utiliza precios fijos de pago por uso. La tarifa no cambia cuando una solicitud cruza un nivel de contexto mayor.

Tipo de token Precio por 1 millón de tokens
Entrada almacenada en caché $0.30
Entrada estándar $3.00
Salida $15.00

Para una tarea agéntica corta que utilice 100.000 tokens de entrada sin caché y produzca 20.000 tokens de salida, el coste estimado del modelo es:

(0.1 × $3) + (0.02 × $15) = $0.60

Ahora considera un flujo de trabajo repetido con contexto largo, 800.000 tokens almacenados en caché, 50.000 tokens nuevos de entrada y 50.000 tokens de salida:

(0.8 × $0.30) + (0.05 × $3) + (0.05 × $15) = $1.14

La caché mantiene manejable el segundo ejemplo, pero K3 claramente ya no sigue la antigua fórmula de «modelo chino equivale a API extremadamente barata».

Artificial Analysis midió un coste medio por tarea del Intelligence Index de 0,94 $ para K3, cercano a los 1,04 $ de GPT-5.6 Sol y aproximadamente la mitad de los 1,80 $ de Opus 4.8. GLM-5.2 completó la misma carga de evaluación por bastante menos.

La comparación también cambia según dónde se acceda a los modelos. La API de Kimi K3 en GPT Proto cuesta actualmente 2,70 $ por millón de tokens de entrada y 13,50 $ por millón de tokens de salida, un 10 % menos que la tarifa publicada de 3/15 $ de Moonshot. GPT Proto también ofrece GPT-5.6 Sol y GLM-5.2 mediante la misma clave de API y saldo compartido, lo que facilita las comparaciones por tarea sin cuentas separadas de proveedores.

La propuesta de valor de K3 no es, por tanto, «inteligencia de frontera por casi nada». Es un rendimiento agéntico cercano a la frontera con dos vías de implementación: una API de pago por uso inmediato y pesos publicados para equipos preparados para asumir la infraestructura.

API de Kimi K3 frente a pesos abiertos: ¿cuál deberías usar?

 Kimi K3 ofrece ahora a los desarrolladores una verdadera elección de implementación. La capacidad del modelo es el atractivo en ambas vías; el modelo operativo es completamente distinto.

API de Kimi K3 alojada Pesos abiertos de Kimi K3
Paga por token Compra o alquila capacidad de aceleración
El proveedor gestiona el escalado, la caché, las actualizaciones y los fallos Tu equipo gestiona el servicio, el escalado, la supervisión, las actualizaciones y los fallos
La vía más rápida para evaluar y poner en producción El mayor control sobre los datos, la inferencia y la modificación del modelo
El servicio alojado documenta entradas de texto, imagen y vídeo Los metadatos actuales del repositorio público se centran en texto e imagen; verifica la paridad de la vía de vídeo antes de prometerla
Sin descarga de 1,56 TB Aproximadamente 1,56 TB en 96 fragmentos de pesos
Sin proyecto de implementación en clúster Moonshot recomienda más de 64 aceleradores

Usa primero la API si todavía estás validando el ajuste producto-mercado, el tráfico es variable o el equipo aún no opera infraestructura de modelos grandes. La API de Kimi K3 de GPT Proto también facilita comparar K3 con GPT-5.6 Sol, GLM-5.2 y otros modelos usando una sola clave y saldo.

Usa los pesos cuando la implementación privada, el ajuste fino, la inferencia personalizada o la independencia del proveedor tengan suficiente valor empresarial para justificar el clúster. Antes de una implementación comercial, revisa la licencia Kimi K3 en lugar de asumir que «abierto» significa MIT.

Kimi K3 frente a GLM-5.2, GPT-5.6 y Opus 4.8

El ganador del benchmark no es automáticamente el modelo de producción adecuado. La elección útil depende de lo que pueda fallar, de la duración del flujo de trabajo y de si importa poseer los pesos.

Modelo Elígelo cuando
Kimi K3 Necesitas flujos agénticos multimodales de largo recorrido y quieres una API alojada ahora o una vía de implementación con pesos abiertos bajo la licencia Kimi K3
GPT-5.6 Sol La calidad del razonamiento general y un rendimiento fiable en producción importan más que la propiedad
Claude Fable 5 Buscas el techo medido más alto en trabajo del conocimiento agéntico y tienes acceso a él
Claude Opus 4.8 Ya dependes de flujos de Claude para programación compleja, investigación y seguimiento cuidadoso de instrucciones
GLM-5.2 Necesitas programación agéntica de menor coste con pesos ya disponibles
Kimi K2.7 Code Tu carga de trabajo es principalmente de programación y el precio más alto de K3 es difícil de justificar

K3 presenta el caso más claro cuando coinciden tres condiciones: una tarea de larga duración, entradas multimodales y una razón para controlar la implementación del modelo. Sin esos requisitos, su escala puede convertirse en una respuesta costosa para un problema menor.

GPT-5.6 Sol sigue siendo la opción más sólida cuando la inteligencia general y la fiabilidad son prioritarias. Opus 4.8 tiene sentido para equipos con flujos maduros de programación o investigación basados en Claude. GLM-5.2 es el competidor más difícil en términos económicos porque ya ofrece un contexto de un millón de tokens y pesos abiertos con un coste por tarea inferior.

Mi regla general actual es sencilla: elige K3 cuando importen los pesos abiertos y los agentes multimodales de largo recorrido. Elige GPT-5.6 u Opus cuando la fiabilidad importe más que la propiedad del modelo. Elige GLM-5.2 cuando el coste sea la restricción que no puedes negociar.

¿Ya puedes usar Kimi K3 a través de GPT Proto?

Sí. Kimi K3 ya está disponible mediante la API de Kimi K3 de GPT Proto.

La tarifa actual de GPT Proto es de 2,70 $ por millón de tokens de entrada y 13,50 $ por millón de tokens de salida, un 10 % menos que el precio publicado actual de 3/15 $ de Moonshot. Usa la cadena de modelo kimi-k3 con tu clave de API de GPT Proto para acceder a las capacidades de programación con contexto largo, análisis multimodal, llamadas a herramientas y salida estructurada de K3.

La misma clave y el mismo saldo compartido también cubren GPT-5.6 Sol, GLM-5.2, Claude Opus 4.8 y más de 200 modelos de texto, imagen, vídeo y audio. Esto facilita probar K3 frente a alternativas en el mismo repositorio o flujo de trabajo agéntico antes de cambiar el tráfico de producción.

Puedes probar Kimi K3 en GPT Proto o explorar la galería completa de modelos de IA de GPT Proto. Los pesos y el informe técnico del modelo ya son públicos, pero el artículo debería revisarse de nuevo a medida que maduren las pruebas independientes de implementación, las cuantizaciones, los datos de rendimiento y la compatibilidad con frameworks.

Veredicto final: está cerca, pero el benchmark sigue importando

Kimi K3 no es simplemente un gran modelo chino que atrae atención por su número de parámetros. Las pruebas independientes respaldan una conclusión más importante: compite con los sistemas frontera en automatización, trabajo del conocimiento de largo recorrido y ejecución agéntica.

Eso no lo hace mejor que GPT-5.6 Sol o Claude Fable 5 en general. Tampoco elimina el aumento medido de las alucinaciones. Lo que cambió el 28 de julio fue la implementación: los pesos prometidos, la licencia, la ficha del modelo y el informe técnico ya son públicos.
K3 es, por tanto, una de las opciones con pesos abiertos más capaces de su clase, pero la frase necesita dos notas al pie. Su licencia es personalizada, no MIT, y su repositorio de 1,56 TB, junto con la recomendación de más de 64 aceleradores, sitúa el alojamiento propio fuera del alcance de un equipo de desarrollo convencional.
Mi veredicto: usa la API para averiguar si K3 mejora realmente tus tareas. Pásate a los pesos solo cuando el control, la personalización o los límites de los datos justifiquen convertirte tú mismo en el proveedor de infraestructura.

Creative Studio

Genera imágenes, videos y más con APIs de producción.

Comenzar a crear
Creative Studio
Modelos relacionados
Todos los modelos
MoonshotAI
10% OFF
OpenAI
20% OFF
Claude
20% OFF
Z-AI
by Z-AI
10% OFF

Preguntas frecuentes

¿Qué es Kimi K3?

Kimi K3 es un modelo de IA multimodal con 2,8 billones de parámetros desarrollado por Moonshot AI. Está diseñado para programación de largo recorrido, trabajo del conocimiento, razonamiento, comprensión visual y flujos de trabajo con agentes.

¿Cuándo se lanzó Kimi K3?

Kimi K3 se lanzó el 16 de julio de 2026. Moonshot afirma que los pesos completos del modelo se publicarán el 27 de julio de 2026.

¿Kimi K3 es de código abierto?

Kimi K3 tiene pesos abiertos. Moonshot AI ha publicado el checkpoint completo, la ficha del modelo, el código de inferencia y el informe técnico bajo la licencia personalizada Kimi K3. Los datos de entrenamiento no son públicos y la licencia incluye condiciones para grandes empresas Model-as-a-Service y productos comerciales de gran escala, por lo que «código completamente abierto» es una descripción demasiado amplia.

¿Cuál es la ventana de contexto de Kimi K3?

Kimi K3 admite una ventana de contexto de un millón de tokens. También ofrece almacenamiento automático en caché del contexto para prefijos largos repetidos.

¿Cuánto cuesta la API de Kimi K3?

La API oficial de Kimi K3 cuesta 3 $ por millón de tokens de entrada estándar, 15 $ por millón de tokens de salida y 0,30 $ por millón de tokens de entrada almacenados en caché.

¿Es Kimi K3 mejor que GPT-5.6 Sol?

No en general. Kimi K3 lidera o se acerca a GPT-5.6 Sol en algunas pruebas agénticas y especializadas, pero tanto Moonshot como las pruebas independientes sitúan a GPT-5.6 Sol por delante en inteligencia general.

¿Es Kimi K3 mejor que Claude Fable 5?

Las pruebas disponibles indican que no. K3 se acerca a Fable 5 en varias tareas agénticas y de largo recorrido, pero Fable 5 sigue por delante en las evaluaciones independientes generales disponibles en el momento del lanzamiento.

¿Es Kimi K3 mejor que GLM-5.2?

Kimi K3 tiene un techo medido más alto en inteligencia y rendimiento agéntico. GLM-5.2 es más barato, pequeño y ya está disponible como modelo con pesos abiertos, lo que puede convertirlo en la opción más práctica.v

¿Puede Kimi K3 ejecutarse localmente?

Los pesos se pueden descargar, pero la implementación práctica no es local en el sentido habitual. El repositorio oficial ocupa aproximadamente 1,56 TB y Moonshot recomienda configuraciones de supernodo con 64 aceleradores o más.

¿Debería usar la API de Kimi K3 o los pesos abiertos?

Empieza con la API para la evaluación, el tráfico variable y las operaciones gestionadas. Usa los pesos cuando la implementación privada, el ajuste fino, la inferencia personalizada o la independencia del proveedor justifiquen el hardware, el trabajo de servicio y la revisión de la licencia.

Artículos relacionados

Más blogs
La mejor API de IA para desarrolladores en 2026: comparación de 10 plataformas

La mejor API de IA para desarrolladores en 2026: comparación de 10 plataformas

TL;DR Mejores API directas: OpenAI es la opción predeterminada más segura para uso general; Anthropic Claude destaca en programación y agentes de larga duración; Gemini es ideal para prototipos multimodales de bajo coste; y DeepSeek lidera en precio por token de texto. Mejores opciones multimodelo: OpenRouter es la opción más clara para probar muchos LLM. GPTProto es más adecuado cuando un producto necesita modelos de texto, imagen y vídeo bajo una sola clave de API y un saldo compartido. Mejores opciones de infraestructura: Amazon Bedrock encaja en implementaciones empresariales gobernadas por AWS, mientras que Replicate, fal.ai y Together AI son más adecuados para inferencia de modelos abiertos o medios generativos. No existe un ganador universal. Compara la adecuación a la carga de trabajo, la cobertura de modelos, las unidades reales de facturación, los controles de producción y el coste de migración. Los precios y la disponibilidad se comprobaron el 14 de julio de 2026; verifica las páginas actuales de los proveedores antes de implementar.

Tiffany Layne | 2026-07-15

GPT-5.6 Sol vs Claude Fable 5: ¿Más barato por token o más barato de confiar? (2026)

GPT-5.6 Sol vs Claude Fable 5: ¿Más barato por token o más barato de confiar? (2026)

Hace dos semanas, esta comparación tenía una respuesta aburrida: elegir Claude Fable 5, porque no se podía obtener GPT-5.6 Sol. Sol estaba bloqueado dentro de una vista previa evaluada por el gobierno, abierta a aproximadamente veinte organizaciones. Esa limitación desapareció. OpenAI trasladó la familia GPT-5.6 —Sol, Terra y Luna— a disponibilidad general el 9 de julio , y Fable 5 está disponible globalmente desde el 1 de julio, después de que el Departamento de Comercio de EE. UU. autorizara los controles de exportación que lo habían suspendido. Así que la pregunta vuelve a estar vigente y ya no se trata del acceso. Se trata de qué modo de fallo de un modelo puedes permitirte observar. Diré de entrada a qué conclusión llego y luego mostraré el análisis. En resumen Sol es más barato en todos los aspectos que le importan a un equipo financiero. En GPTProto funciona a 4 $ / 24 $ por millón de tokens de entrada/salida, frente a los 8 $ / 40 $ de Fable 5, y la diferencia aumenta cuando se mide por tarea terminada en lugar de por token. Por otro lado, toda la apuesta de diseño de Fable 5 se basa en un comportamiento predecible: las solicitudes marcadas se desvían a un modelo más seguro, y no ha adquirido el hábito que debería preocupar a cualquiera que conecte Sol a un flujo de trabajo sin supervisión. El evaluador independiente METR señaló que Sol tenía la tasa más alta de reward hacking de cualquier modelo público que había probado. Así que «más barato por token» es Sol, claramente. «Más barato de confiar cuando nadie está mirando» es Fable. Gran parte de este artículo explica por qué esas dos frases no se anulan entre sí. Ambos modelos funcionan con una sola clave y un solo saldo de GPTProto, así que puedes elegir entre ellos según la tarea en lugar de comprometer toda tu pila con una única respuesta. Más sobre esto al final.

Michael Johnson | 2026-07-10

MiniMax M3 para programación: benchmarks, precios reales y cómo llamarlo mediante API (2026)

MiniMax M3 para programación: benchmarks, precios reales y cómo llamarlo mediante API (2026)

¿Es MiniMax M3 bueno para programar? La respuesta corta: sí, para trabajo agéntico y con varios archivos, con dos salvedades que expondré claramente antes de que sigas leyendo. La mayoría de las puntuaciones destacadas de programación fueron obtenidas por MiniMax en su propia infraestructura, y el «contexto de 1 millón de tokens» tiene un salto de precio a partir de 512K que afecta especialmente a los agentes de programación. Ambos aspectos son manejables cuando sabes que existen. Ninguno aparece claramente en la mayoría de la cobertura del lanzamiento. Escribo esto porque el argumento de programación en torno a M3 se redujo a una sola cifra — 59 % en SWE-Bench Pro — y esa cifra está haciendo mucho trabajo no examinado. A continuación explico qué es realmente el modelo, dónde se sitúan las mediciones independientes, cuánto cuesta en una carga de trabajo de programación real y cómo llamarlo mediante la API de GPTProto. Si solo quieres un veredicto: un evaluador independiente que ejecuta la misma batería en todos los modelos importantes situó a M3 «cerca de GPT y Opus en programación real, pero no por encima de ellos». Eso también coincide con la posición de los benchmarks neutrales.

Schuyler Stacy | 2026-07-02

GLM-5.2 vs Kimi K3 para programar: ¿cuál es mejor para los desarrolladores en 2026?

GLM-5.2 vs Kimi K3 para programar: ¿cuál es mejor para los desarrolladores en 2026?

En resumen: Kimi K3 es el modelo de programación más potente cuando la tarea es difícil, prolongada o visual. Supera a GLM-5.2 en la comparación de programación publicada por Moonshot y acepta imágenes y vídeo mediante su servicio alojado. GLM-5.2 sigue siendo la mejor opción predeterminada para el trabajo rutinario en repositorios: cuesta mucho menos, es más pequeño de operar y utiliza la permisiva licencia MIT. Kimi K3 también ha publicado sus pesos, pero su repositorio de 1,56 TB, la implementación recomendada con más de 64 aceleradores y su licencia personalizada hacen que el autoalojamiento suponga un compromiso considerablemente mayor. Elige Kimi cuando la capacidad sea el factor limitante; elige GLM cuando el coste y la sencillez operativa sean importantes cada día. La parte interesante de la comparación de código GLM-5.2 frente a Kimi K3 no es que ambos modelos puedan escribir un componente de React o resolver un algoritmo corto. Los modelos de este nivel ya superan ese umbral. La pregunta útil es qué ocurre cuando la tarea se complica: una auditoría de un repositorio, una migración de varios archivos, un error que solo aparece en una captura de pantalla o un prototipo jugable de Three.js que debe mantener la coherencia entre varios sistemas. Ahí es también donde la diferencia de precio empieza a importar. Kimi K3 ofrece mejores resultados en las pruebas públicas más difíciles, pero su precio oficial de salida es más de tres veces superior al de GLM-5.2. Un equipo que ejecute miles de revisiones ordinarias puede realizar más trabajo por dólar con GLM. Un desarrollador que intente rescatar un proyecto visual difícil probablemente pagará con gusto por K3.

Tiffany Layne | 2026-07-28