DeepSeek V4 Pro 0813 vs Kimi K3 de un vistazo
| Categoría |
DeepSeek V4 Pro 0813 |
Kimi K3 |
Mejor opción |
| Índice de inteligencia independiente actual |
53 |
60 |
Kimi K3 |
| Velocidad de salida |
83.2 tokens/s |
40.8 tokens/s |
DeepSeek V4 Pro |
| Tiempo hasta el primer token |
1.63 segundos |
2.97 segundos |
DeepSeek V4 Pro |
| Ventana de contexto |
Aproximadamente 1 M de tokens |
Aproximadamente 1 M de tokens |
Empate |
| Precio de entrada en GPT Proto |
$1.044 por cada 1 M de tokens |
$2.70 por cada 1 M de tokens |
DeepSeek V4 Pro |
| Precio de salida en GPT Proto |
$2.088 por cada 1 M de tokens |
$13.50 por cada 1 M de tokens |
DeepSeek V4 Pro |
| Entrada disponible en GPT Proto |
Texto |
Texto, imagen y documento |
Kimi K3 |
| Control del razonamiento |
Sin razonamiento, alto, máximo |
Razonamiento siempre activo con controles de esfuerzo |
Depende del flujo de trabajo |
| Licencia de pesos abiertos |
MIT |
Licencia de Kimi K3 |
DeepSeek para un autoalojamiento comercial más sencillo |
| Mejor opción para |
Programación y agentes de texto de alto volumen |
Tareas multimodales y visuales complejas de agentes |
Depende de la tarea |
Las cifras de evaluación comparativa, velocidad y latencia anteriores proceden de la evaluación comparativa directa actual de Artificial Analysis. Su Índice de inteligencia utiliza el mismo marco de evaluación para ambos modelos, lo que resulta más útil que colocar lado a lado los gráficos de lanzamiento de dos proveedores.
¿Qué cambió en DeepSeek V4 Pro 0813?
DeepSeek V4 Pro 0813 es la versión de producción actual de V4 Pro, no un producto de API independiente. La documentación de DeepSeek indica que el alias deepseek-v4-pro ahora apunta a DeepSeek-V4-Pro-0813 y que el método de llamada no ha cambiado. La misma documentación enumera una ventana de contexto de un millón de tokens, hasta 384 K de salida, modos de razonamiento y sin razonamiento, salida JSON y llamadas a herramientas.
Esta decisión de nomenclatura es importante porque los nombres de modelos fechados suelen obligar a los desarrolladores a cambiar archivos de configuración, reglas de enrutamiento y registros de evaluación. Aquí, la actualización ocurre detrás del alias estable. En GPT Proto se aplica el mismo principio: conserva deepseek-v4-pro en tu solicitud.
El resultado independiente actual también difiere de las cifras presentes en muchos artículos comparativos de julio. Artificial Analysis asigna ahora al modelo 0813 una puntuación de 53 en el Índice de inteligencia con el máximo esfuerzo de razonamiento. Kimi K3 obtiene 60 en la evaluación actual.
No describiría esto como una mejora limpia de nueve puntos respecto a la puntuación anterior de 44. El modelo cambió, pero las suites de evaluación y sus versiones también pueden cambiar. La conclusión defendible es más limitada: las comparaciones basadas en la versión preliminar ya no describen el modelo que se ofrece actualmente, y las pruebas independientes recientes sitúan a 0813 más cerca de Kimi K3 de lo que sugería la cobertura de la época de la versión preliminar.
DeepSeek no ha cambiado la forma básica del producto. Sigue siendo un modelo de mezcla de expertos de 1,6 billones de parámetros, con 49.000 millones de parámetros activos por token, entrada de texto, una gran capacidad de salida y un esfuerzo de razonamiento seleccionable. Por tanto, la versión 0813 se entiende mejor como una actualización de producción y posentrenamiento, no como una nueva variante multimodal.
Evaluaciones comparativas: Kimi K3 sigue liderando, pero no en todo
Kimi K3 lidera la comparación independiente general, con 60 frente a 53. Esta diferencia de siete puntos importa cuando un flujo de trabajo combina razonamiento, conocimientos, programación y planificación a largo plazo. No significa que Kimi vaya a producir un mejor resultado en todos los repositorios o todas las solicitudes.
Los dos modelos hacen concesiones diferentes. Moonshot describe Kimi K3 como un modelo de agentes multimodal nativo de 2,8 billones de parámetros, diseñado para programación y trabajo de conocimiento a largo plazo. Su tarjeta oficial del modelo documenta la comprensión de texto, imágenes y vídeo en el modelo ascendente, además de una ventana de contexto de un millón de tokens. La ruta actual de Kimi K3 en GPT Proto enumera entradas de texto, imagen y documento.
DeepSeek V4 Pro 0813 solo admite texto, pero genera tokens a 83.2 tokens por segundo en las pruebas de Artificial Analysis. Kimi K3 alcanza 40.8 tokens por segundo. DeepSeek también empieza a responder antes, con un tiempo hasta el primer token de 1.63 segundos frente a los 2.97 segundos de Kimi.
En términos sencillos: Kimi tiene una puntuación de capacidad general más alta. DeepSeek devuelve texto aproximadamente el doble de rápido y cuesta mucho menos.
Aquí hay otra trampa de las evaluaciones comparativas. Las puntuaciones de programación de los proveedores suelen utilizar configuraciones de agentes, ajustes de razonamiento, instantáneas de repositorios o criterios de aprobación diferentes. Una puntuación de Kimi obtenida con Kimi Code no puede compararse automáticamente con una puntuación de DeepSeek obtenida con otra configuración de evaluación. Para seleccionar un modelo, utiliza evaluaciones independientes equiparadas como referencia común y después prueba la tarea que afecta a tu producto.
Este artículo no afirma haber realizado una prueba privada de programación con la misma solicitud. Sin ella, declarar que cualquiera de los dos modelos es el ganador universal en programación sería una afirmación más contundente de lo que permiten las pruebas.
¿Cuál es mejor para la programación y los flujos de trabajo de agentes?
Para la programación basada en texto de alto volumen, empezaría con DeepSeek V4 Pro 0813.
La razón no es que supere a Kimi en todas las métricas. No lo hace. La razón es que los agentes de programación en producción consumen contexto y generan repetidamente razonamientos, parches, planes de prueba e instrucciones para herramientas. El precio de salida se acumula en cada ciclo. Los modos de razonamiento seleccionables de DeepSeek también permiten reservar el máximo esfuerzo para las tareas difíciles en lugar de pagar por el mismo comportamiento de razonamiento en cada solicitud.
Eso convierte a DeepSeek en una opción predeterminada sólida para:
Lectura de repositorios y preguntas y respuestas sobre bases de código
Revisión de solicitudes de incorporación de cambios
Localización de errores
Planes de refactorización
Generación de pruebas
Llamadas a herramientas basadas en texto
Agentes en segundo plano de alto volumen
Respuestas JSON estructuradas
Kimi K3 resulta más atractivo cuando el costo de un intento fallido es mayor que el precio de los tokens. Su puntuación de inteligencia independiente más alta lo convierte en un modelo de escalamiento razonable para tareas largas y difíciles que DeepSeek no logra completar. También es la opción clara cuando la solicitud contiene evidencia visual.
Por tanto, un patrón práctico de producción no consiste en «elegir uno para siempre». Dirige las tareas de texto rutinarias a DeepSeek y vuelve a intentar los fallos seleccionados o las tareas multimodales con Kimi. Como ambos están disponibles mediante una sola clave de API de GPT Proto y un saldo compartido, el cambio puede limitarse al campo model.
DeepSeek V4 Pro vs Kimi K3 para programación frontend
La «programación frontend» abarca dos cargas de trabajo diferentes y no deberían combinarse en un único veredicto.
La primera es texto a código: generar componentes de React, CSS, estructuras de páginas, correcciones de accesibilidad o lógica de TypeScript a partir de una especificación escrita. Todavía no hay suficientes pruebas públicas equiparadas para afirmar que Kimi K3 o DeepSeek V4 Pro 0813 gane universalmente en esta categoría. El menor costo y la mayor velocidad de salida de DeepSeek lo convierten en el primer intento más económico.
La segunda es la iteración visual de frontend: mostrar al modelo una captura de pantalla, pedirle que identifique problemas de espaciado o diseño y revisar la interfaz a partir de los comentarios visuales. Kimi K3 se adapta mejor a ese flujo de trabajo porque admite entradas de imagen. DeepSeek V4 Pro solo admite texto, por lo que un desarrollador tendría que traducir la captura a texto o utilizar primero un modelo de visión independiente.
Usa DeepSeek para implementar interfaces descritas mediante texto a escala. Usa Kimi cuando el modelo deba ver la interfaz.
Precios de API: DeepSeek gana por más de lo que sugiere el titular
Actualmente, GPT Proto ofrece DeepSeek V4 Pro a $1.044 por millón de tokens de entrada y $2.088 por millón de tokens de salida. Kimi K3 cuesta $2.70 para la entrada y $13.50 para la salida.
| Precio de GPT Proto por 1 M de tokens |
DeepSeek V4 Pro |
Kimi K3 |
Múltiplo del precio de Kimi |
| Entrada |
$1.044 |
$2.70 |
2.59× |
| Salida |
$2.088 |
$13.50 |
6.47× |
DeepSeek es un 61.3 % más barato en la entrada y un 84.5 % más barato en la salida. La diferencia de salida es la más importante para los agentes con mucho razonamiento, porque su trabajo interno y sus respuestas finales pueden ser extensos.
Los precios por token siguen siendo abstractos, así que considera dos cargas de trabajo hipotéticas.
| Carga de trabajo |
Suposición de tokens |
DeepSeek V4 Pro |
Kimi K3 |
| Revisión de código grande |
100 K de entrada + 20 K de salida |
$0.146 |
$0.540 |
| Tarea de agente a escala de repositorio |
1 M de entrada + 250 K de salida |
$1.566 |
$6.075 |
En el ejemplo a escala de repositorio, Kimi cuesta aproximadamente 3.88 veces más. Eso no significa necesariamente que Kimi ofrezca una mala relación calidad-precio. Si completa una tarea difícil en un solo intento mientras un modelo más barato necesita varios reintentos y correcciones humanas, la llamada más cara podría seguir costando menos en total.
La métrica de producción adecuada es el costo del resultado aceptado, no solo el costo de los tokens. Registra el modelo, los tokens, los intentos, la latencia, el resultado de las pruebas y la aceptación del revisor para cada categoría de tarea. Una tarifa baja por token solo se convierte en un ahorro real cuando la salida supera la evaluación.
Velocidad y latencia
Actualmente, Artificial Analysis mide DeepSeek V4 Pro 0813 a 83.2 tokens de salida por segundo y Kimi K3 a 40.8. El tiempo hasta el primer token es de 1.63 segundos para DeepSeek y 2.97 segundos para Kimi.
Estas cifras favorecen a DeepSeek para asistentes de programación interactivos y trabajadores de agentes paralelos. Un modelo que devuelve tokens el doble de rápido puede reducir la espera visible incluso cuando ambos modelos terminan llegando a una respuesta aceptable.
Sin embargo, la velocidad del proveedor no es una propiedad permanente de los pesos. También depende de la carga del servidor, la cuantización, el procesamiento por lotes, la longitud de la solicitud, el esfuerzo de razonamiento y el lugar donde se atiende la solicitud. Considera las mediciones actuales como una instantánea comparable, no como una garantía de latencia para cada llamada.
Diferencias de contexto, razonamiento y despliegue
Ambos modelos admiten aproximadamente un millón de tokens de contexto, por lo que el tamaño del contexto por sí solo no decide esta comparación. Importa más cómo utilizan ese contexto.
DeepSeek admite modos sin razonamiento y de razonamiento, con controles del esfuerzo de razonamiento para tareas más difíciles. También permite hasta 384 K de salida según la especificación actual de la API de DeepSeek. Esta flexibilidad es adecuada para sistemas de enrutamiento que utilizan respuestas rápidas para tareas sencillas y un razonamiento más profundo solo cuando es necesario.
Kimi K3 utiliza un razonamiento siempre activo con un esfuerzo configurable. Su arquitectura más grande de 2,8 T y su diseño multimodal están orientados a trabajos de largo alcance que implican documentos, código, imágenes y uso de herramientas. La contrapartida es un mayor costo de salida y una generación medida más lenta.
Ambos modelos tienen pesos descargables, pero «pesos abiertos» no significa que tengan licencias idénticas. DeepSeek V4 Pro utiliza la licencia MIT. Kimi K3 utiliza su propia licencia de Kimi K3. Los equipos que planeen un autoalojamiento comercial deberían revisar los términos exactos de Kimi en lugar de asumir que coinciden con MIT.
El requisito de hardware también está muy por encima del de una estación de trabajo local común. Para la mayoría de los equipos de desarrollo, la evaluación mediante una API alojada es el punto de partida realista, incluso cuando los pesos están disponibles.
Cómo acceder a DeepSeek V4 Pro 0813 y Kimi K3 con una sola clave de API
GPT Proto ofrece ambos modelos mediante un endpoint de finalización de chats compatible con OpenAI. Comienza con DeepSeek estableciendo MODEL_ID en deepseek-v4-pro:
export GPTPROTO_API_KEY="your_api_key"
export MODEL_ID="deepseek-v4-pro"
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data "{
\"model\": \"$MODEL_ID\",
\"messages\": [
{
\"role\": \"user\",
\"content\": \"Review this function for correctness and return the answer as concise Markdown.\"
}
]
}"
Para enviar la misma solicitud de texto a Kimi K3, cambia una línea:
export MODEL_ID="kimi-k3"
Después, vuelve a ejecutar la misma solicitud de curl. No necesitas una cuenta independiente de Moonshot, un segundo saldo ni un sufijo de versión de DeepSeek.
Para realizar una comparación controlada, mantén iguales la solicitud, el contexto, la configuración de razonamiento y el límite de salida. Registra los campos de uso devueltos junto con la latencia, los intentos y si el resultado superó tus pruebas. Comparar una respuesta atractiva de cada modelo no es suficiente para tomar una decisión de enrutamiento en producción.
¿Qué modelo deberías elegir?
Elige DeepSeek V4 Pro 0813 cuando:
Tu carga de trabajo se basa principalmente en texto y código
El volumen de salida hace que el costo de los tokens sea importante
Una latencia baja mejora la experiencia del usuario
Quieres modos sin razonamiento y un razonamiento más profundo bajo un mismo ID de modelo
Necesitas una vía de autoalojamiento con licencia MIT
Estás seleccionando un modelo predeterminado para agentes de alto volumen
Elige Kimi K3 cuando:
El modelo debe inspeccionar capturas de pantalla, imágenes o documentos
La puntuación de inteligencia independiente actual más alta importa más que el precio
Una tarea fallida cuesta más que una llamada de API premium
Estás creando agentes multimodales de largo alcance
Quieres escalar las solicitudes más difíciles después de que falle un modelo más económico
Para la mayoría de los desarrolladores, la mejor política de enrutamiento es usar DeepSeek primero y Kimi cuando sea necesario. Esto aprovecha la mayor parte de la ventaja de costo y velocidad de DeepSeek sin renunciar al acceso al carácter multimodal y al mayor techo de capacidad de Kimi.
Veredicto final
DeepSeek V4 Pro 0813 es la mejor opción predeterminada para la mayoría de las cargas de trabajo de programación y agentes basadas en texto. Está siete puntos por debajo de Kimi K3 en el Índice de inteligencia de Artificial Analysis actual, pero produce resultados aproximadamente al doble de velocidad y cuesta mucho menos en GPT Proto, especialmente en ciclos de agentes con mucha salida.
Kimi K3 es el mejor especialista. Elígelo cuando la tarea incluya entrada visual, cuando el razonamiento más difícil posible importe más que el costo o cuando DeepSeek ya haya fallado y otro intento sea más económico que la recuperación manual.
La actualización 0813 no vuelve obsoleto a Kimi. Hace que la decisión de enrutamiento sea más clara: DeepSeek para volumen, velocidad y texto; Kimi para multimodalidad y un mayor techo de capacidad medido.