TL;DR
Actualización — 28 de julio de 2026: Los pesos completos de Kimi K3 ya son públicos. Moonshot AI publicó el checkpoint de 2,8 T, el informe técnico y la licencia de Kimi K3 en sus repositorios oficiales. El lanzamiento refuerza el argumento a favor del control y el despliegue de K3 frente a GPT-5.6 Sol, pero no cambia los resultados de las pruebas independientes ni hace que operar K3 por cuenta propia sea barato.
Kimi K3 es más barato por token. GPT-5.6 Sol es la opción predeterminada más sólida para agentes de producción de alto riesgo. Ambas afirmaciones pueden ser ciertas.
La diferencia es menor de lo que sugieren las tarjetas de precios. En las pruebas de Artificial Analysis, GPT-5.6 Sol max obtiene 59 en el Intelligence Index, frente a 57 de Kimi K3. Sin embargo, el coste medido por tarea es de aproximadamente 1,04 $ para Sol y 0,95 $ para K3—no la diferencia de dos a uno que implican sus precios oficiales de salida.
Mi respuesta breve: elige GPT-5.6 Sol cuando la fiabilidad general, el rendimiento de los agentes de programación y el conjunto de herramientas alojadas de OpenAI sean lo más importante. Elige Kimi K3 cuando la entrada de vídeo, el trabajo con contexto extenso, un precio de lista más bajo o el acceso a pesos abiertos publicados cambien la decisión.
Kimi K3 vs GPT-5.6 Sol: veredicto rápido
| Si lo que más te importa es… |
Elige |
Por qué |
| Inteligencia general y agentes de producción |
GPT-5.6 Sol |
Lidera los índices independientes de Inteligencia, Programación y Agentes |
| Programación científica o razonamiento con contexto extenso |
Prueba Kimi K3 |
K3 lidera SciCode y supera ligeramente a Sol en AA-LCR |
| La tarifa por token más baja entre estos dos |
Kimi K3 |
Oficialmente, 3/15 $ por cada millón de tokens frente a 5/30 $ de Sol |
| El coste medido por tarea más bajo |
Kimi K3, por poco |
Aproximadamente 0,95 $ frente a 1,04 $ en la comparación actual de AA |
| Inicio visible más rápido |
Kimi K3 |
4,23 segundos medidos hasta el primer token frente a 136,8 segundos para Sol max |
| Generación más rápida después de comenzar la salida |
GPT-5.6 Sol |
63 tokens de salida por segundo frente a 39 tokens por segundo de K3 |
| Comprensión nativa de vídeo |
Kimi K3 |
K3 acepta texto, imágenes y vídeo; Sol acepta texto e imágenes |
| Herramientas alojadas maduras y uso del ordenador |
GPT-5.6 Sol |
OpenAI documenta búsqueda web, búsqueda de archivos, intérprete de código, uso del ordenador, MCP y mucho más |
| Un modelo cotidiano más barato |
GPT-5.6 Terra |
En GPT Proto, Terra es más barato que K3 tanto en entrada como en salida |
| Tráfico de gran volumen y sensible al coste |
GPT-5.6 Luna |
El modelo con el precio más bajo de este conjunto de cuatro modelos |
Estos son resultados actuales, no clasificaciones permanentes. K3 se lanzó el 16 de julio de 2026 y ambos proveedores siguen cambiando el comportamiento del servicio y los controles de razonamiento.
Especificaciones y precios de la API
| |
|
|
| Especificación |
Kimi K3 |
GPT-5.6 Sol |
| Proveedor |
Moonshot AI |
OpenAI |
| Ventana de contexto |
1.048.576 tokens |
1.050.000 tokens |
| Salida máxima |
131.072 de forma predeterminada; más dentro del presupuesto de contexto total |
128.000 tokens |
| Entrada nativa |
Texto, imagen y vídeo |
Texto e imagen |
| Salida |
Texto |
Texto |
| Precio oficial de entrada / 1 M |
$3.00 |
$5.00 |
| Entrada oficial en caché / 1 M |
$0.30 |
$0.50 |
| Precio oficial de salida / 1 M |
$15.00 |
$30.00 |
| Precio de entrada de GPT Proto / 1 M |
$2.70 |
$4.00 |
| Precio de salida de GPT Proto / 1 M |
$13.50 |
$24.00 |
| Cadena del modelo |
kimi-k3 |
gpt-5.6-sol |
| Disponibilidad de pesos el 28 de julio de 2026 |
Checkpoint completo de 2,8 T publicado bajo la licencia de Kimi K3 |
No |
| Requisitos para alojarlo por cuenta propia |
Aproximadamente 1,56 TB; Moonshot recomienda más de 64 aceleradores |
No aplicable |
Los límites de contexto están prácticamente empatados. Las diferencias importantes son qué hace cada modelo con ese contexto, qué tipos de entrada acepta y qué requiere la infraestructura de servicio.
OpenAI también aplica un recargo por contexto extenso en su API directa: las solicitudes con más de 272.000 tokens de entrada se cobran a 2 veces el precio de entrada y 1,5 veces el de salida para toda la solicitud. Las tarifas publicadas de K3 por parte de Moonshot no añaden un nivel de contexto más grande. Si tu agente envía repetidamente solicitudes de 500.000 tokens, este detalle de precios puede importar más que la cifra principal de contexto.
Para conocer la arquitectura y los detalles del lanzamiento de K3, consulta ¿Qué es Kimi K3?. Esta comparación se centra en la decisión de compra y despliegue.
Benchmarks: Sol lidera en general, pero K3 obtiene victorias reales
Actualmente, Artificial Analysis considera que GPT-5.6 Sol max ofrece el perfil general más sólido. Los márgenes no son enormes:
| |
|
|
|
| Evaluación independiente |
Kimi K3 |
GPT-5.6 Sol max |
Ganador |
| Índice de Inteligencia |
57 |
59 |
Sol |
| Índice de Programación |
76.2 |
77.4 |
Sol |
| Índice de Agentes |
50.1 |
54.0 |
Sol |
| Terminal-Bench v2.1 |
85 % |
88 % |
Sol |
| SciCode |
59 % |
56 % |
K3 |
| El último examen de la humanidad |
44 % |
47 % |
Sol |
| GPQA Diamond |
94 % |
94 % |
Empate |
| Razonamiento con contexto extenso AA-LCR |
75 % |
74 % |
K3 |
| AA-Briefcase |
1.543 Elo |
1.496 Elo |
K3 |
| Razonamiento visual MMMU-Pro |
81 % |
83 % |
Sol |
La conclusión defendible no es «Sol gana en todo». No es así. Sol lidera los índices generales y el trabajo en terminal, mientras que K3 muestra una fortaleza creíble en programación científica, razonamiento con contexto extenso y entregables de trabajo del conocimiento.
Los marcos de evaluación también importan. La propia tabla de benchmarks de Moonshot utiliza KimiCode, Claude Code o Codex según la tarea. Eso convierte las tablas de los proveedores en pruebas útiles, pero no en una comparación de laboratorio limpia. En producción, el juez final deben ser tu agente, tus herramientas y tus condiciones de fallo.
Precios: los tokens más baratos no garantizan una tarea mucho más barata
Al precio de lista oficial, la salida de K3 cuesta la mitad que la de Sol: 15 $ frente a 30 $ por millón de tokens. En GPT Proto, las mismas tarifas son 13,50 $ y 24 $.
Para una solicitud idéntica con 100.000 tokens de entrada y 20.000 de salida, las cuentas de tokens de GPT Proto son sencillas:
Kimi K3: (0,10 × 2,70 $) + (0,02 × 13,50 $) = 0,54 $
GPT-5.6 Sol: (0,10 × 4,00 $) + (0,02 × 24,00 $) = 0,88 $
K3 es un 39 % más barato cuando el uso de tokens es idéntico. Pero los modelos de razonamiento rara vez utilizan el mismo número de tokens. Si K3 produce 40.000 tokens de salida en la misma tarea, su coste sube a 0,81 $—casi los 0,88 $ de Sol.
Por eso el resultado actual de Artificial Analysis sobre el coste por tarea es más útil que la tarjeta de precios. Su comparación ponderada sitúa a K3 en aproximadamente 0,95 $ por tarea del Intelligence Index y a Sol max en 1,04 $. K3 sigue siendo más barato, pero solo alrededor de un 9 % en esa carga de trabajo.
Las primeras discusiones en Reddit llegaron al mismo argumento desde una perspectiva más desordenada. Algunos usuarios afirmaron que el razonamiento extenso de K3 hacía que las ejecuciones exitosas costaran dos o tres veces más en sus pruebas; otros señalaron que esas capturas mezclaban configuraciones de razonamiento o comparaban el coste total del benchmark en lugar del coste por tarea. Ambas objeciones son útiles. Ninguna constituye un benchmark universal.
La regla práctica: registra la entrada total, la entrada en caché, la salida de razonamiento, la salida de respuesta, los reintentos y el tiempo transcurrido. «Precio por millón de tokens» es solo una columna.
Velocidad: K3 comienza antes; Sol escribe más rápido
Artificial Analysis midió 4,23 segundos hasta el primer token para K3 y 136,8 segundos para Sol max. Una vez iniciada la generación, el orden se invirtió: Sol produjo 63 tokens por segundo frente a los 39 de K3.
Entonces, ¿qué modelo parece más rápido?
-
En un chat en streaming o un asistente de programación interactivo, el primer token más temprano de K3 puede dar una sensación de mayor capacidad de respuesta.
-
En un informe largo o una traza de agente, la mayor velocidad de salida de Sol puede compensar parte de su inicio lento.
-
Para un agente en segundo plano, ninguna cifra importa tanto como el tiempo total de la tarea y que esta termine sin un reintento.
Considera estas cifras como una instantánea medida, no como un SLA. La capacidad del proveedor, el almacenamiento en caché de prompts, el esfuerzo de razonamiento y el enrutamiento regional pueden modificarlas.
Experiencia del desarrollador: la diferencia oculta
K3 no es un reemplazo directo para todos los bucles de razonamiento existentes. Moonshot afirma que el modelo es sensible al historial de pensamiento conservado. Un sistema que no devuelva el estado completo del razonamiento anterior—o que cambie a K3 a mitad de una sesión—puede producir resultados inestables. Moonshot recomienda una configuración cuya compatibilidad se haya verificado y advierte contra cambiar de modelo durante una sesión.
Ese comportamiento tiene consecuencias para la infraestructura. Un evaluador temprano de la comunidad informó que el razonamiento de K3 consumía entre el 73 y el 83 % de la salida en su carga de trabajo, y que algunas tareas visuales tardaban entre 50 y 60 minutos. El mismo evaluador necesitó conexiones de streaming de mayor duración y presupuestos de tokens más grandes. Esta es la carga de trabajo de una persona, no una afirmación general sobre la latencia. Aun así, es un buen punto de la lista de comprobación antes de migrar.
Sol ofrece un caso más sencillo cuando ya utilizas la API Responses de OpenAI. OpenAI documenta salidas estructuradas, llamadas a funciones, búsqueda web y de archivos, intérprete de código, shell alojado, uso del ordenador, MCP y otras herramientas en la página del modelo Sol. La desventaja es un precio de lista más alto y la ausencia de una opción basada en pesos descargables.
K3 tiene dos ventajas para desarrolladores que Sol no puede igualar actualmente: entrada de vídeo nativa a través del producto alojado y pesos del modelo publicados. La segunda ventaja ya es concreta. Moonshot AI ha publicado el checkpoint completo, un informe técnico y guías de despliegue para vLLM, SGLang y TokenSpeed.
El control conlleva dos costes. Primero, la licencia de Kimi K3 es personalizada en lugar de MIT y añade condiciones para grandes empresas de Model-as-a-Service y productos comerciales muy grandes. Segundo, el repositorio oficial ocupa aproximadamente 1,56 TB y Moonshot recomienda despliegues supernode con 64 aceleradores o más. Los pesos abiertos hacen posible el alojamiento propio; no lo convierten en la opción económica predeterminada.
Por tanto, Sol conserva la propuesta más sencilla como plataforma alojada. K3 ahora ofrece la propuesta más sólida de despliegue opcional: comenzar con una API y pasar después a inferencia autogestionada si el control de los datos, la personalización o la economía de la infraestructura justifican el trabajo.
API de Kimi K3 frente a pesos abiertos
La API alojada de Kimi K3 y el lanzamiento de pesos abiertos resuelven problemas distintos. La API convierte K3 en un servicio medido: envías una solicitud, pagas por los tokens y dejas que el proveedor gestione el almacenamiento en caché, el enrutamiento, el escalado y los fallos. Los pesos convierten K3 en una infraestructura que tu equipo debe asumir.
| Elige la API alojada cuando... |
Elige los pesos abiertos cuando... |
| Quieres evaluar K3 esta semana |
Los datos deben permanecer en tu propio entorno |
| La facturación por tokens es más sencilla que comprar y operar un clúster |
Necesitas inferencia personalizada, ajuste fino o control del despliegue |
| Necesitas escalado, almacenamiento en caché y disponibilidad gestionados |
El uso es lo bastante grande y estable como para justificar una infraestructura dedicada |
| Necesitas la ruta documentada de entrada de vídeo alojada |
Tus equipos jurídico y de infraestructura han revisado la paridad de funciones y la licencia del checkpoint |
Mi opinión: la mayoría de los equipos debería comenzar con la API. Un checkpoint de 1,56 TB y una recomendación de más de 64 aceleradores establecen un punto de equilibrio alto. Los pesos importan porque crean una vía de salida de un proveedor alojado, no porque descargarlos sea automáticamente más barato que pagar por token.
Kimi K3 frente a GPT-5.6 Sol, Terra y Luna
La comparación más útil no es solo Kimi K3 frente a GPT-5.6 Sol. K3 compite con Sol en capacidad, pero su precio de API está más cerca del de Terra.
| |
|
|
| Modelo en GPT Proto |
Entrada / salida por 1 M |
Mejor función inicial |
| GPT-5.6 Sol |
$4 / $24 |
Techo de calidad, programación difícil, ejecuciones largas de agentes |
| Kimi K3 |
$2.70 / $13.50 |
Agentes multimodales largos, entrada de vídeo y cargas de trabajo que quizá requieran posteriormente un despliegue con pesos abiertos |
| GPT-5.6 Terra |
$2 / $12 |
Tráfico de producción equilibrado |
| GPT-5.6 Luna |
$0.80 / $4.80 |
Tareas de gran volumen que superen una evaluación con un modelo más pequeño |
Mi recomendación de enrutamiento es sencilla. Establece el techo de calidad con Sol. Prueba K3 cuando importen el vídeo, el comportamiento con contexto extenso o la hoja de ruta de los pesos. Después comprueba si Terra conserva suficiente calidad a una tarifa menor. Si la tarea es clasificación, extracción, enrutamiento o asistencia breve de programación, prueba Luna antes de pagar precios de modelo puntero.
Los cuatro están disponibles en la colección de modelos de GPT Proto con una sola clave y un saldo común.
Ejecuta el mismo prompt en ambos modelos
El siguiente script de Python utiliza el endpoint documentado de Chat Completions de GPT Proto y solo cambia la cadena del modelo. Es una prueba de conectividad e inspección de salida, no un benchmark justo; los valores predeterminados y la configuración de razonamiento pueden diferir.
import json
import os
import time
import requests
API_URL = "https://gptproto.com/v1/chat/completions"
API_KEY = os.environ["GPTPROTO_API_KEY"]
HEADERS = {
"Authorization": API_KEY,
"Content-Type": "application/json",
}
PROMPT = """You are reviewing a production Python service.
Identify the three highest-risk failure modes in the code supplied by the user,
propose a minimal patch, and return a short verification plan.
If evidence is missing, say what you would inspect instead of inventing it."""
def run(model: str) -> dict:
payload = {
"model": model,
"messages": [{"role": "user", "content": PROMPT}],
"stream": False,
}
started = time.perf_counter()
response = requests.post(
API_URL,
headers=HEADERS,
json=payload,
timeout=900,
)
response.raise_for_status()
data = response.json()
data["client_wall_time_seconds"] = round(
time.perf_counter() - started,
2,
)
return data
for model_name in ("kimi-k3", "gpt-5.6-sol"):
result = run(model_name)
print(f"\n=== {model_name} ===")
print("wall time:", result["client_wall_time_seconds"])
print("usage:", json.dumps(result.get("usage", {}), indent=2))
print(result["choices"][0]["message"]["content"])
Instala la dependencia con pip install requests, define GPTPROTO_API_KEY y utiliza una tarea privada que probablemente ningún modelo haya visto. Para una evaluación real, ejecuta al menos 20 tareas representativas y puntúa la finalización, las regresiones, los reintentos, el coste total y el tiempo de revisión.
Veredicto final
GPT-5.6 Sol gana esta comparación como recomendación general más segura. Lidera los índices independientes generales, de programación y de agentes, genera más rápido después de su primer token y encaja de forma natural en el ecosistema de herramientas de OpenAI.
Kimi K3 es la opción condicional más interesante. Está lo bastante cerca como para superar a Sol en algunas evaluaciones de programación y contexto extenso, cuesta menos por token, acepta vídeo mediante el servicio alojado y ahora ofrece un checkpoint de pesos abiertos publicado. Las desventajas son un comportamiento de razonamiento más pesado, una licencia personalizada y una infraestructura de alojamiento propio orientada a grandes clústeres de aceleradores, no al hardware habitual de los desarrolladores.
Si estás eligiendo para una aplicación real, no te detengas en Kimi K3 frente a GPT-5.6 Sol. Prueba también Terra y Luna. El mejor modelo de producción es el más barato que supera tu prueba de aceptación a nivel de tarea, no el modelo con la tabla de lanzamiento más llamativa.