DeepSeek V4 Pro vs Kimi K3: ¿Qué cambió tras la actualización 0813?

Compara DeepSeek V4 Pro 0813 y Kimi K3 en programación, velocidad, entrada multimodal y costo de API, y descubre qué modelo se adapta mejor a tu proyecto.

DeepSeek V4 Pro vs Kimi K3: ¿Qué cambió tras la actualización 0813?

La comparación entre DeepSeek V4 Pro y Kimi K3 cambió el 13 de agosto de 2026. DeepSeek reemplazó la versión preliminar de V4 Pro detrás de su alias de API existente por DeepSeek V4 Pro 0813, manteniendo el nombre del modelo que los desarrolladores ya utilizan.

Esta es la respuesta breve: Kimi K3 sigue liderando en inteligencia general medida y admite entrada visual. DeepSeek V4 Pro 0813 es más rápido y mucho más económico para programación y cargas de trabajo de agentes basadas en texto. Para la mayoría de los equipos que procesan repositorios, realizan revisiones de código u operan agentes de alto volumen, DeepSeek es ahora la mejor opción predeterminada. Kimi justifica su precio más alto cuando la entrada multimodal o el máximo nivel de razonamiento disponible importan más que el costo.

Hay un detalle de implementación fácil de pasar por alto: en GPTProto no necesitas el sufijo 0813. Sigue llamando a deepseek-v4-pro, y la ruta utilizará automáticamente la versión actual.

Tabla de contenido

DeepSeek V4 Pro 0813 vs Kimi K3 de un vistazo

Categoría DeepSeek V4 Pro 0813 Kimi K3 Mejor opción
Índice de inteligencia independiente actual 53 60 Kimi K3
Velocidad de salida 83.2 tokens/s 40.8 tokens/s DeepSeek V4 Pro
Tiempo hasta el primer token 1.63 segundos 2.97 segundos DeepSeek V4 Pro
Ventana de contexto Aproximadamente 1 M de tokens Aproximadamente 1 M de tokens Empate
Precio de entrada en GPT Proto $1.044 por cada 1 M de tokens $2.70 por cada 1 M de tokens DeepSeek V4 Pro
Precio de salida en GPT Proto $2.088 por cada 1 M de tokens $13.50 por cada 1 M de tokens DeepSeek V4 Pro
Entrada disponible en GPT Proto Texto Texto, imagen y documento Kimi K3
Control del razonamiento Sin razonamiento, alto, máximo Razonamiento siempre activo con controles de esfuerzo Depende del flujo de trabajo
Licencia de pesos abiertos MIT Licencia de Kimi K3 DeepSeek para un autoalojamiento comercial más sencillo
Mejor opción para Programación y agentes de texto de alto volumen Tareas multimodales y visuales complejas de agentes Depende de la tarea

Las cifras de evaluación comparativa, velocidad y latencia anteriores proceden de la evaluación comparativa directa actual de Artificial Analysis. Su Índice de inteligencia utiliza el mismo marco de evaluación para ambos modelos, lo que resulta más útil que colocar lado a lado los gráficos de lanzamiento de dos proveedores.

¿Qué cambió en DeepSeek V4 Pro 0813?

DeepSeek V4 Pro 0813 es la versión de producción actual de V4 Pro, no un producto de API independiente. La documentación de DeepSeek indica que el alias deepseek-v4-pro ahora apunta a DeepSeek-V4-Pro-0813 y que el método de llamada no ha cambiado. La misma documentación enumera una ventana de contexto de un millón de tokens, hasta 384 K de salida, modos de razonamiento y sin razonamiento, salida JSON y llamadas a herramientas.

Esta decisión de nomenclatura es importante porque los nombres de modelos fechados suelen obligar a los desarrolladores a cambiar archivos de configuración, reglas de enrutamiento y registros de evaluación. Aquí, la actualización ocurre detrás del alias estable. En GPT Proto se aplica el mismo principio: conserva deepseek-v4-pro en tu solicitud.

El resultado independiente actual también difiere de las cifras presentes en muchos artículos comparativos de julio. Artificial Analysis asigna ahora al modelo 0813 una puntuación de 53 en el Índice de inteligencia con el máximo esfuerzo de razonamiento. Kimi K3 obtiene 60 en la evaluación actual.

No describiría esto como una mejora limpia de nueve puntos respecto a la puntuación anterior de 44. El modelo cambió, pero las suites de evaluación y sus versiones también pueden cambiar. La conclusión defendible es más limitada: las comparaciones basadas en la versión preliminar ya no describen el modelo que se ofrece actualmente, y las pruebas independientes recientes sitúan a 0813 más cerca de Kimi K3 de lo que sugería la cobertura de la época de la versión preliminar.

DeepSeek no ha cambiado la forma básica del producto. Sigue siendo un modelo de mezcla de expertos de 1,6 billones de parámetros, con 49.000 millones de parámetros activos por token, entrada de texto, una gran capacidad de salida y un esfuerzo de razonamiento seleccionable. Por tanto, la versión 0813 se entiende mejor como una actualización de producción y posentrenamiento, no como una nueva variante multimodal.

Evaluaciones comparativas: Kimi K3 sigue liderando, pero no en todo

Kimi K3 lidera la comparación independiente general, con 60 frente a 53. Esta diferencia de siete puntos importa cuando un flujo de trabajo combina razonamiento, conocimientos, programación y planificación a largo plazo. No significa que Kimi vaya a producir un mejor resultado en todos los repositorios o todas las solicitudes.

Los dos modelos hacen concesiones diferentes. Moonshot describe Kimi K3 como un modelo de agentes multimodal nativo de 2,8 billones de parámetros, diseñado para programación y trabajo de conocimiento a largo plazo. Su tarjeta oficial del modelo documenta la comprensión de texto, imágenes y vídeo en el modelo ascendente, además de una ventana de contexto de un millón de tokens. La ruta actual de Kimi K3 en GPT Proto enumera entradas de texto, imagen y documento.

DeepSeek V4 Pro 0813 solo admite texto, pero genera tokens a 83.2 tokens por segundo en las pruebas de Artificial Analysis. Kimi K3 alcanza 40.8 tokens por segundo. DeepSeek también empieza a responder antes, con un tiempo hasta el primer token de 1.63 segundos frente a los 2.97 segundos de Kimi.

En términos sencillos: Kimi tiene una puntuación de capacidad general más alta. DeepSeek devuelve texto aproximadamente el doble de rápido y cuesta mucho menos.

Aquí hay otra trampa de las evaluaciones comparativas. Las puntuaciones de programación de los proveedores suelen utilizar configuraciones de agentes, ajustes de razonamiento, instantáneas de repositorios o criterios de aprobación diferentes. Una puntuación de Kimi obtenida con Kimi Code no puede compararse automáticamente con una puntuación de DeepSeek obtenida con otra configuración de evaluación. Para seleccionar un modelo, utiliza evaluaciones independientes equiparadas como referencia común y después prueba la tarea que afecta a tu producto.

Este artículo no afirma haber realizado una prueba privada de programación con la misma solicitud. Sin ella, declarar que cualquiera de los dos modelos es el ganador universal en programación sería una afirmación más contundente de lo que permiten las pruebas.

¿Cuál es mejor para la programación y los flujos de trabajo de agentes?

Para la programación basada en texto de alto volumen, empezaría con DeepSeek V4 Pro 0813.

La razón no es que supere a Kimi en todas las métricas. No lo hace. La razón es que los agentes de programación en producción consumen contexto y generan repetidamente razonamientos, parches, planes de prueba e instrucciones para herramientas. El precio de salida se acumula en cada ciclo. Los modos de razonamiento seleccionables de DeepSeek también permiten reservar el máximo esfuerzo para las tareas difíciles en lugar de pagar por el mismo comportamiento de razonamiento en cada solicitud.

Eso convierte a DeepSeek en una opción predeterminada sólida para:

  • Lectura de repositorios y preguntas y respuestas sobre bases de código

  • Revisión de solicitudes de incorporación de cambios

  • Localización de errores

  • Planes de refactorización

  • Generación de pruebas

  • Llamadas a herramientas basadas en texto

  • Agentes en segundo plano de alto volumen

  • Respuestas JSON estructuradas

Kimi K3 resulta más atractivo cuando el costo de un intento fallido es mayor que el precio de los tokens. Su puntuación de inteligencia independiente más alta lo convierte en un modelo de escalamiento razonable para tareas largas y difíciles que DeepSeek no logra completar. También es la opción clara cuando la solicitud contiene evidencia visual.

Por tanto, un patrón práctico de producción no consiste en «elegir uno para siempre». Dirige las tareas de texto rutinarias a DeepSeek y vuelve a intentar los fallos seleccionados o las tareas multimodales con Kimi. Como ambos están disponibles mediante una sola clave de API de GPT Proto y un saldo compartido, el cambio puede limitarse al campo model.

DeepSeek V4 Pro vs Kimi K3 para programación frontend

La «programación frontend» abarca dos cargas de trabajo diferentes y no deberían combinarse en un único veredicto.

La primera es texto a código: generar componentes de React, CSS, estructuras de páginas, correcciones de accesibilidad o lógica de TypeScript a partir de una especificación escrita. Todavía no hay suficientes pruebas públicas equiparadas para afirmar que Kimi K3 o DeepSeek V4 Pro 0813 gane universalmente en esta categoría. El menor costo y la mayor velocidad de salida de DeepSeek lo convierten en el primer intento más económico.

La segunda es la iteración visual de frontend: mostrar al modelo una captura de pantalla, pedirle que identifique problemas de espaciado o diseño y revisar la interfaz a partir de los comentarios visuales. Kimi K3 se adapta mejor a ese flujo de trabajo porque admite entradas de imagen. DeepSeek V4 Pro solo admite texto, por lo que un desarrollador tendría que traducir la captura a texto o utilizar primero un modelo de visión independiente.

Usa DeepSeek para implementar interfaces descritas mediante texto a escala. Usa Kimi cuando el modelo deba ver la interfaz.

Precios de API: DeepSeek gana por más de lo que sugiere el titular

Actualmente, GPT Proto ofrece DeepSeek V4 Pro a $1.044 por millón de tokens de entrada y $2.088 por millón de tokens de salida. Kimi K3 cuesta $2.70 para la entrada y $13.50 para la salida.

Precio de GPT Proto por 1 M de tokens DeepSeek V4 Pro Kimi K3 Múltiplo del precio de Kimi
Entrada $1.044 $2.70 2.59×
Salida $2.088 $13.50 6.47×

DeepSeek es un 61.3 % más barato en la entrada y un 84.5 % más barato en la salida. La diferencia de salida es la más importante para los agentes con mucho razonamiento, porque su trabajo interno y sus respuestas finales pueden ser extensos.

Los precios por token siguen siendo abstractos, así que considera dos cargas de trabajo hipotéticas.

Carga de trabajo Suposición de tokens DeepSeek V4 Pro Kimi K3
Revisión de código grande 100 K de entrada + 20 K de salida $0.146 $0.540
Tarea de agente a escala de repositorio 1 M de entrada + 250 K de salida $1.566 $6.075

En el ejemplo a escala de repositorio, Kimi cuesta aproximadamente 3.88 veces más. Eso no significa necesariamente que Kimi ofrezca una mala relación calidad-precio. Si completa una tarea difícil en un solo intento mientras un modelo más barato necesita varios reintentos y correcciones humanas, la llamada más cara podría seguir costando menos en total.

La métrica de producción adecuada es el costo del resultado aceptado, no solo el costo de los tokens. Registra el modelo, los tokens, los intentos, la latencia, el resultado de las pruebas y la aceptación del revisor para cada categoría de tarea. Una tarifa baja por token solo se convierte en un ahorro real cuando la salida supera la evaluación.

Velocidad y latencia

Actualmente, Artificial Analysis mide DeepSeek V4 Pro 0813 a 83.2 tokens de salida por segundo y Kimi K3 a 40.8. El tiempo hasta el primer token es de 1.63 segundos para DeepSeek y 2.97 segundos para Kimi.

Estas cifras favorecen a DeepSeek para asistentes de programación interactivos y trabajadores de agentes paralelos. Un modelo que devuelve tokens el doble de rápido puede reducir la espera visible incluso cuando ambos modelos terminan llegando a una respuesta aceptable.

Sin embargo, la velocidad del proveedor no es una propiedad permanente de los pesos. También depende de la carga del servidor, la cuantización, el procesamiento por lotes, la longitud de la solicitud, el esfuerzo de razonamiento y el lugar donde se atiende la solicitud. Considera las mediciones actuales como una instantánea comparable, no como una garantía de latencia para cada llamada.

Diferencias de contexto, razonamiento y despliegue

Ambos modelos admiten aproximadamente un millón de tokens de contexto, por lo que el tamaño del contexto por sí solo no decide esta comparación. Importa más cómo utilizan ese contexto.

DeepSeek admite modos sin razonamiento y de razonamiento, con controles del esfuerzo de razonamiento para tareas más difíciles. También permite hasta 384 K de salida según la especificación actual de la API de DeepSeek. Esta flexibilidad es adecuada para sistemas de enrutamiento que utilizan respuestas rápidas para tareas sencillas y un razonamiento más profundo solo cuando es necesario.

Kimi K3 utiliza un razonamiento siempre activo con un esfuerzo configurable. Su arquitectura más grande de 2,8 T y su diseño multimodal están orientados a trabajos de largo alcance que implican documentos, código, imágenes y uso de herramientas. La contrapartida es un mayor costo de salida y una generación medida más lenta.

Ambos modelos tienen pesos descargables, pero «pesos abiertos» no significa que tengan licencias idénticas. DeepSeek V4 Pro utiliza la licencia MIT. Kimi K3 utiliza su propia licencia de Kimi K3. Los equipos que planeen un autoalojamiento comercial deberían revisar los términos exactos de Kimi en lugar de asumir que coinciden con MIT.

El requisito de hardware también está muy por encima del de una estación de trabajo local común. Para la mayoría de los equipos de desarrollo, la evaluación mediante una API alojada es el punto de partida realista, incluso cuando los pesos están disponibles.

Cómo acceder a DeepSeek V4 Pro 0813 y Kimi K3 con una sola clave de API

GPT Proto ofrece ambos modelos mediante un endpoint de finalización de chats compatible con OpenAI. Comienza con DeepSeek estableciendo MODEL_ID en deepseek-v4-pro:

export GPTPROTO_API_KEY="your_api_key"
export MODEL_ID="deepseek-v4-pro"

curl --request POST "https://gptproto.com/v1/chat/completions" \
  --header "Authorization: Bearer $GPTPROTO_API_KEY" \
  --header "Content-Type: application/json" \
  --data "{
    \"model\": \"$MODEL_ID\",
    \"messages\": [
      {
        \"role\": \"user\",
        \"content\": \"Review this function for correctness and return the answer as concise Markdown.\"
      }
    ]
  }"

Para enviar la misma solicitud de texto a Kimi K3, cambia una línea:

export MODEL_ID="kimi-k3"

Después, vuelve a ejecutar la misma solicitud de curl. No necesitas una cuenta independiente de Moonshot, un segundo saldo ni un sufijo de versión de DeepSeek.

Para realizar una comparación controlada, mantén iguales la solicitud, el contexto, la configuración de razonamiento y el límite de salida. Registra los campos de uso devueltos junto con la latencia, los intentos y si el resultado superó tus pruebas. Comparar una respuesta atractiva de cada modelo no es suficiente para tomar una decisión de enrutamiento en producción.

¿Qué modelo deberías elegir?

Elige DeepSeek V4 Pro 0813 cuando:

  • Tu carga de trabajo se basa principalmente en texto y código

  • El volumen de salida hace que el costo de los tokens sea importante

  • Una latencia baja mejora la experiencia del usuario

  • Quieres modos sin razonamiento y un razonamiento más profundo bajo un mismo ID de modelo

  • Necesitas una vía de autoalojamiento con licencia MIT

  • Estás seleccionando un modelo predeterminado para agentes de alto volumen

Elige Kimi K3 cuando:

  • El modelo debe inspeccionar capturas de pantalla, imágenes o documentos

  • La puntuación de inteligencia independiente actual más alta importa más que el precio

  • Una tarea fallida cuesta más que una llamada de API premium

  • Estás creando agentes multimodales de largo alcance

  • Quieres escalar las solicitudes más difíciles después de que falle un modelo más económico

Para la mayoría de los desarrolladores, la mejor política de enrutamiento es usar DeepSeek primero y Kimi cuando sea necesario. Esto aprovecha la mayor parte de la ventaja de costo y velocidad de DeepSeek sin renunciar al acceso al carácter multimodal y al mayor techo de capacidad de Kimi.

Veredicto final

DeepSeek V4 Pro 0813 es la mejor opción predeterminada para la mayoría de las cargas de trabajo de programación y agentes basadas en texto. Está siete puntos por debajo de Kimi K3 en el Índice de inteligencia de Artificial Analysis actual, pero produce resultados aproximadamente al doble de velocidad y cuesta mucho menos en GPT Proto, especialmente en ciclos de agentes con mucha salida.

Kimi K3 es el mejor especialista. Elígelo cuando la tarea incluya entrada visual, cuando el razonamiento más difícil posible importe más que el costo o cuando DeepSeek ya haya fallado y otro intento sea más económico que la recuperación manual.

La actualización 0813 no vuelve obsoleto a Kimi. Hace que la decisión de enrutamiento sea más clara: DeepSeek para volumen, velocidad y texto; Kimi para multimodalidad y un mayor techo de capacidad medido.

Artículos relacionados

Más blogs
Grok 4.6 vs DeepSeek V4 Pro: programación, precios y cuál es mejor?

Grok 4.6 vs DeepSeek V4 Pro: programación, precios y cuál es mejor?

rok 4.6 y DeepSeek V4 Pro están diseñados para tareas complejas de razonamiento y programación, pero no son intercambiables. Grok 4.6 es la opción más potente cuando una tarea implica capturas de pantalla, maquetas de interfaces, depuración visual o los problemas de programación agéntica más difíciles. DeepSeek V4 Pro resulta más atractivo cuando lo más importante son el coste, un contexto amplio y la programación basada en texto a gran escala. La respuesta breve es sencilla: Grok 4.6 es el modelo más completo, mientras que DeepSeek V4 Pro es el modelo de programación más rentable. Esta comparativa entre Grok 4.6 y DeepSeek V4 Pro analiza la programación, el desarrollo frontend, las ventanas de contexto, las pruebas públicas de referencia, los precios de la API y la actualización más reciente de DeepSeek V4 Pro. También explica qué modelo tiene más sentido para distintos tipos de cargas de trabajo de los desarrolladores. Veredicto rápido: Elige Grok 4.6 para el trabajo frontend visual, la depuración compleja y las tareas de programación críticas. Elige DeepSeek V4 Pro para repositorios extensos, flujos de trabajo con mucho texto y costes de API más bajos. Para el enrutamiento en producción, DeepSeek V4 Pro puede gestionar la carga de trabajo predeterminada, mientras que Grok 4.6 se ocupa de las escalaciones visuales o complejas.

Tiffany Layne | 2026-08-13

Grok 4.6 vs Kimi K3: ¿Cuál se adapta a tu proyecto?

Grok 4.6 vs Kimi K3: ¿Cuál se adapta a tu proyecto?

Dos lanzamientos de vanguardia llegaron con cuatro semanas de diferencia, ambos dirigidos directamente al mismo comprador: el desarrollador que ejecuta agentes, no chatbots. Moonshot AI lanzó Kimi K3 el 16 de julio de 2026. xAI respondió el 12 de agosto con Grok 4.6. Si hoy buscas "Grok 4.6 vs Kimi K3", obtienes cobertura del lanzamiento de cada bando, más un montón de fichas técnicas, pero casi nadie ha puesto a los dos cara a cara desde la perspectiva de un desarrollador. Ese es el vacío que cubre este artículo. Esta es la versión corta, porque viniste por una decisión, no por un resumen. Grok 4.6 gana en eficiencia de turnos agénticos y hosting sin intervención. Termina tareas largas y de varios pasos en menos iteraciones y menos tokens, y nunca tocas la infraestructura. Kimi K3 gana en contexto, video nativo y control — una ventana de 1M de tokens, entrada de imágenes y video, y pesos abiertos descargables si necesitas autoalojamiento o aislamiento. En la única cifra que todos citan, casi empatan: Artificial Analysis sitúa el costo por tarea de ambos en aproximadamente $0.84 . Así que la diferencia de un solo punto en el índice de inteligencia no es tu factor decisivo. Los dos modelos toman caminos opuestos hacia el mismo costo, y eso es la encrucijada que realmente tienes que elegir. Si ejecutas flujos de trabajo de agentes de alto volumen y sensibles al costo, y quieres un endpoint gestionado, Grok 4.6. Si necesitas meter un repositorio completo o un video en una sola ventana de contexto — o tienes una razón de cumplimiento para conservar los pesos tú mismo — Kimi K3. El resto de este artículo muestra el trabajo detrás de esa decisión.

Schuyler Stacy | 2026-08-13

7 mejores LLM asequibles para programar en 2026: precio de la API frente al rendimiento

7 mejores LLM asequibles para programar en 2026: precio de la API frente al rendimiento

The cheapest coding model is not always the cheapest model to use. A model priced at $0.14 per million input tokens looks inexpensive—until it misunderstands the repository, edits the wrong file, and needs three retries. Meanwhile, a model with a higher token price may finish the same patch in one run. That is why this is not another list of models sorted by input price. We first looked for models with enough coding ability to handle terminal work, debugging, and multi-step development tasks. We then compared their input, cached-input, and output prices using the same two simulated workloads. This ranking covers API-accessible LLMs , not coding IDE subscriptions. It also excludes self-hosted models because GPUs, inference infrastructure, maintenance, and engineering time are not free. Prices and benchmark results were checked on August 12, 2026 . Treat them as a snapshot rather than a permanent rate card.

Michael Johnson | 2026-08-12

GLM 5.2 vs Claude Opus 5: ¿Qué modelo de programación es más rentable?

GLM 5.2 vs Claude Opus 5: ¿Qué modelo de programación es más rentable?

Un token barato no es necesariamente un resultado barato. Esa distinción importa en la comparación GLM 5.2 vs Opus 5 porque las cifras principales apuntan en direcciones opuestas: GLM-5.2 cuesta menos y responde más rápido, mientras que Claude Opus 5 lidera la comparación independiente de inteligencia actual y puede inspeccionar imágenes además de texto. Mi respuesta breve es sencilla. Elige GLM-5.2 para trabajo de programación de alto volumen y bien delimitado, donde un desarrollador o un modelo de revisión más fuerte compruebe el resultado. Elige Claude Opus 5 para cambios ambiguos en el repositorio, depuración visual de frontend y tareas en las que un primer intento fallido cuesta más que la llamada al modelo. Hay una razón para ser cuidadoso con afirmaciones más contundentes. Z.ai lanzó GLM-5.2 en junio de 2026, pero Anthropic lanzó Opus 5 el 24 de julio. La mayoría de las discusiones comunitarias y las comparaciones del «mundo real» todavía prueban GLM-5.2 contra Opus 4.8. Esos resultados son contexto útil. No son evidencia de que GLM-5.2 gane—o pierda—frente a Opus 5. Este artículo es una comparación basada en evidencia, no un benchmark de primera mano. Sus conclusiones se apoyan en la documentación actual de los modelos, los precios de GPTProto, datos independientes de benchmarks, divulgaciones de proveedores y métodos de evaluación comunitarios. Cuando aún no hay evidencia directa de GLM-5.2 vs Opus 5, la limitación se indica explícitamente.

Michael Johnson | 2026-08-04